论文
arXiv2510.08240
时间2025-10
来源Markdown
页面质量中文卡片
阅读量级109 分钟

The Alignment Waltz: Jointly Training Agents to Collaborate for Safety

论文导读

提出 WaltzRL 多智能体强化学习框架,联合训练对话智能体与反馈智能体,通过动态改进奖励(DIR)实现安全对齐与避免过度拒绝的协同优化。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

The Alignment Waltz:通过多智能体协同训练提升LLM安全性

一句话定位

提出 WaltzRL 多智能体强化学习框架,联合训练对话智能体与反馈智能体,通过动态改进奖励(DIR)实现安全对齐与避免过度拒绝的协同优化。

小学生也能听懂

这篇论文像让两个小机器人跳舞一样合作:一个负责回答问题,另一个负责检查回答是否安全,它们通过互相学习和改进,既减少了危险回答,又避免了对正常问题的过度拒绝,让AI更安全又好用。

为什么值得记录

  • 解决了当前安全对齐中‘有帮助性’与‘无害性’之间的根本矛盾:传统防护模型(如 Llama Guard)虽降低不安全响应,但显著加剧对良性敏感提示的过度拒绝(overrefusal)。
  • 提出首个在推理时联合部署两个协同智能体的安全框架,相比仅部署单一防御模型的方法,攻击者需同时攻破两个智能体才能成功越狱,显著提升鲁棒性。
  • 通过 Dynamic Improvement Reward(DIR)机制,使反馈智能体的奖励依赖于其建议对对话智能体的实际改进效果,实现真正的正向协同演化,而非零和博弈。
  • 在五个多样化数据集上验证,WaltzRL 将不安全响应率从基线 39.0% 降至 4.6%(WildJailbreak),同时将过度拒绝率从 45.3% 降至 9.9%(OR-Bench),显著推进了有帮助性与无害性的帕累托前沿。

核心方法

  • 构建双智能体协作协议:对话智能体负责生成初始及修订回复,反馈智能体负责分析回复并提供结构化反馈(JSON 格式,含 reasoning、unsafe/overrefuse 标签及 feedback 字段)。
  • 设计 Dynamic Improvement Reward (DIR):反馈智能体的核心奖励为其建议带来的对话智能体奖励变化(R_c(c_{t+1}) - R_c(c_t)),鼓励生成真正有效的改进建议。
  • 采用两阶段强化学习训练:第一阶段冻结对话智能体,专注训练反馈智能体掌握标签预测与格式规范;第二阶段解冻并联合训练两智能体,同时关闭反馈智能体的附加标签奖励以防止过拟合。
  • 引入混合轨迹采样策略:对话智能体的训练样本混合初始回复(τ_A)与最终修订回复(τ_B),使其既能学习生成满意初始回复,也能学习在必要时采纳反馈进行修订。
  • 实现自适应推理机制:反馈智能体根据 unsafe 与 overrefuse 标签决定是否触发反馈,仅在必要时介入,从而在提升安全性的同时保持低延迟与高通用帮助性。
  • 使用 REINFORCE++ 算法扩展至双智能体设置,分别计算各智能体的优势函数并进行交替策略梯度更新,支持并行训练以提升效率。

关键结果

  • 在 WildJailbreak 数据集上,WaltzRL 将攻击成功率(ASR)从基线模型的 39.0% 显著降低至 4.6%。
  • 在 OR-Bench-Hard-1K 数据集上,WaltzRL 将过度拒绝率(ORR)从基线模型的 45.3% 显著降低至 9.9%。
  • 与仅使用推理时协作(无训练)相比,WaltzRL 训练后反馈触发率(FTR)在 WildJailbreak 上从 82.2% 降至 48.2%,在 OR-Bench 上从 75.5% 降至 43.1%,表明训练有效提升了反馈效率,避免了过度触发。
  • 即使未在强化学习阶段加入任何通用帮助性数据,WaltzRL 训练后的对话智能体在 AlpacaEval 2.0、IF-Eval、GPQA、MMLU 和 TruthfulQA 等通用能力基准上表现几乎无损,证明其能有效平衡安全与帮助性。
  • 消融实验表明,混合轨迹采样策略(结合 τ_A 与 τ_B)优于仅使用单一类型轨迹,其 F1 综合得分(平衡 ASR 与 ORR)达到 94.3,高于仅用 τ_A (93.8) 或 τ_B (92.4)。

局限与风险

  • 实验仅在英文数据集上进行,未验证 WaltzRL 在其他语言(尤其是低资源语言)对抗攻击下的表现。
  • 受限于计算资源,实验仅测试了最大一轮反馈(T_max=1),更多轮次的反馈可能带来进一步提升。
  • 评估基于静态对抗提示,未考虑动态自适应攻击方法,后者可能构成更强威胁。
  • 尽管显著降低,WaltzRL 未能完全消除不安全响应与过度拒绝,表明该问题仍需未来研究。

适合沉淀的概念

multi-agent-reinforcement-learning, llm-safety-alignment, overrefusal-mitigation, dynamic-improvement-reward, collaborative-reasoning, adaptive-feedback, reinforce++, pareto-optimization

阅读注意

  • 重点关注 Dynamic Improvement Reward (DIR) 的设计逻辑及其在促进智能体协同中的核心作用。
  • 理解两阶段训练策略的动机:第一阶段解决反馈智能体的冷启动与标签学习问题,第二阶段实现真正的协同演化。
  • 注意混合轨迹采样(τ_A 与 τ_B)如何使对话智能体同时学习‘一次做对’与‘根据反馈修正’两种能力。
  • 评估指标需综合看待:ASR 与 ORR 的降低是否以牺牲通用能力为代价,以及反馈触发率(FTR)所反映的推理效率。
  • 附录中的系统提示(Appendix H)是理解初始协作框架设计的重要参考。

质量说明

  • 采用来源:rawraw/papers/2025/10/2510.08240.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、详尽的实验设置、多维度评估结果及消融分析,并公开了关键实现细节(如系统提示、训练数据构成、超参数),具备高度可复现性与学术严谨性。