---
title: "The Alignment Waltz: Jointly Training Agents to Collaborate for Safety"
title_zh: "The Alignment Waltz：通过多智能体协同训练提升LLM安全性"
arxiv_id: "2510.08240"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/10/2510.08240.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# The Alignment Waltz：通过多智能体协同训练提升LLM安全性

## 一句话定位

提出 WaltzRL 多智能体强化学习框架，联合训练对话智能体与反馈智能体，通过动态改进奖励（DIR）实现安全对齐与避免过度拒绝的协同优化。

## 小学生也能听懂

这篇论文像让两个小机器人跳舞一样合作：一个负责回答问题，另一个负责检查回答是否安全，它们通过互相学习和改进，既减少了危险回答，又避免了对正常问题的过度拒绝，让AI更安全又好用。

## 为什么值得记录

- 解决了当前安全对齐中‘有帮助性’与‘无害性’之间的根本矛盾：传统防护模型（如 Llama Guard）虽降低不安全响应，但显著加剧对良性敏感提示的过度拒绝（overrefusal）。
- 提出首个在推理时联合部署两个协同智能体的安全框架，相比仅部署单一防御模型的方法，攻击者需同时攻破两个智能体才能成功越狱，显著提升鲁棒性。
- 通过 Dynamic Improvement Reward（DIR）机制，使反馈智能体的奖励依赖于其建议对对话智能体的实际改进效果，实现真正的正向协同演化，而非零和博弈。
- 在五个多样化数据集上验证，WaltzRL 将不安全响应率从基线 39.0% 降至 4.6%（WildJailbreak），同时将过度拒绝率从 45.3% 降至 9.9%（OR-Bench），显著推进了有帮助性与无害性的帕累托前沿。

## 核心方法

- 构建双智能体协作协议：对话智能体负责生成初始及修订回复，反馈智能体负责分析回复并提供结构化反馈（JSON 格式，含 reasoning、unsafe/overrefuse 标签及 feedback 字段）。
- 设计 Dynamic Improvement Reward (DIR)：反馈智能体的核心奖励为其建议带来的对话智能体奖励变化（R_c(c_{t+1}) - R_c(c_t)），鼓励生成真正有效的改进建议。
- 采用两阶段强化学习训练：第一阶段冻结对话智能体，专注训练反馈智能体掌握标签预测与格式规范；第二阶段解冻并联合训练两智能体，同时关闭反馈智能体的附加标签奖励以防止过拟合。
- 引入混合轨迹采样策略：对话智能体的训练样本混合初始回复（τ_A）与最终修订回复（τ_B），使其既能学习生成满意初始回复，也能学习在必要时采纳反馈进行修订。
- 实现自适应推理机制：反馈智能体根据 unsafe 与 overrefuse 标签决定是否触发反馈，仅在必要时介入，从而在提升安全性的同时保持低延迟与高通用帮助性。
- 使用 REINFORCE++ 算法扩展至双智能体设置，分别计算各智能体的优势函数并进行交替策略梯度更新，支持并行训练以提升效率。

## 关键结果

- 在 WildJailbreak 数据集上，WaltzRL 将攻击成功率（ASR）从基线模型的 39.0% 显著降低至 4.6%。
- 在 OR-Bench-Hard-1K 数据集上，WaltzRL 将过度拒绝率（ORR）从基线模型的 45.3% 显著降低至 9.9%。
- 与仅使用推理时协作（无训练）相比，WaltzRL 训练后反馈触发率（FTR）在 WildJailbreak 上从 82.2% 降至 48.2%，在 OR-Bench 上从 75.5% 降至 43.1%，表明训练有效提升了反馈效率，避免了过度触发。
- 即使未在强化学习阶段加入任何通用帮助性数据，WaltzRL 训练后的对话智能体在 AlpacaEval 2.0、IF-Eval、GPQA、MMLU 和 TruthfulQA 等通用能力基准上表现几乎无损，证明其能有效平衡安全与帮助性。
- 消融实验表明，混合轨迹采样策略（结合 τ_A 与 τ_B）优于仅使用单一类型轨迹，其 F1 综合得分（平衡 ASR 与 ORR）达到 94.3，高于仅用 τ_A (93.8) 或 τ_B (92.4)。

## 局限与风险

- 实验仅在英文数据集上进行，未验证 WaltzRL 在其他语言（尤其是低资源语言）对抗攻击下的表现。
- 受限于计算资源，实验仅测试了最大一轮反馈（T_max=1），更多轮次的反馈可能带来进一步提升。
- 评估基于静态对抗提示，未考虑动态自适应攻击方法，后者可能构成更强威胁。
- 尽管显著降低，WaltzRL 未能完全消除不安全响应与过度拒绝，表明该问题仍需未来研究。

## 适合沉淀的概念

`multi-agent-reinforcement-learning`, `llm-safety-alignment`, `overrefusal-mitigation`, `dynamic-improvement-reward`, `collaborative-reasoning`, `adaptive-feedback`, `reinforce++`, `pareto-optimization`

## 阅读注意

- 重点关注 Dynamic Improvement Reward (DIR) 的设计逻辑及其在促进智能体协同中的核心作用。
- 理解两阶段训练策略的动机：第一阶段解决反馈智能体的冷启动与标签学习问题，第二阶段实现真正的协同演化。
- 注意混合轨迹采样（τ_A 与 τ_B）如何使对话智能体同时学习‘一次做对’与‘根据反馈修正’两种能力。
- 评估指标需综合看待：ASR 与 ORR 的降低是否以牺牲通用能力为代价，以及反馈触发率（FTR）所反映的推理效率。
- 附录中的系统提示（Appendix H）是理解初始协作框架设计的重要参考。

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/10/2510.08240.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、详尽的实验设置、多维度评估结果及消融分析，并公开了关键实现细节（如系统提示、训练数据构成、超参数），具备高度可复现性与学术严谨性。
