---
title: "2502.18439"
title_zh: "MAPoRL：基于强化学习的多智能体协同后训练方法"
arxiv_id: "2502.18439"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/02/2502.18439.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# MAPoRL：基于强化学习的多智能体协同后训练方法

## 一句话定位

提出一种名为 MAPoRL 的新范式，通过多智能体强化学习对多个大语言模型进行联合后训练，以显式激发其协作行为并提升多智能体框架下的任务性能。

## 小学生也能听懂

MAPoRL 像让几个不同的小机器人一起做数学题和推理题，它们边讨论边互相打分，通过不断练习学会更好地合作，还能互相纠正错误，最后比原来更聪明、更会配合。

## 为什么值得记录

- 传统多智能体 LLM 方法依赖预训练模型的提示工程，缺乏对协作行为的显式优化，难以实现真正有效的合作。
- 现有后训练范式（如 SFT）无法有效诱导协作策略，而 MAPoRL 利用多智能体 RL 实现了智能体间的策略协同演化。
- 理论分析与实验表明，单独训练单个智能体不足以产生协作行为，而联合训练可达成更优的协作均衡。
- 在数学推理（GSM8k）和自然语言推理（ANLI）等任务上验证了方法的有效性，并展现出跨领域泛化能力。
- 支持异构模型（如 Phi-3 与 Qwen2.5）的联合训练，增强了系统的灵活性和实用性。

## 核心方法

- MAPoRL 框架包含多个 LLM 智能体，在预设的多轮协作流程（如辩论框架）中独立生成响应并参与讨论。
- 引入验证器（verifier）对每轮回答及整体讨论质量打分，评分综合考虑答案正确性与讨论的纠正性与说服力。
- 设计‘影响感知验证奖励’（Influence-aware Verification Reward），将当前回答对未来所有智能体输出的影响纳入奖励计算，鼓励长期协作价值。
- 采用多智能体 PPO 算法进行策略优化，每个智能体的价值函数基于其历史输入和累积奖励定义，并使用 GAE 估计优势函数。
- 奖励函数包含 KL 正则项，防止策略偏离参考模型过多，确保训练稳定性。
- 支持任意具备可评分机制的多智能体系统，不限于特定协作架构。

## 关键结果

- 在 GSM8k 和 ANLI 数据集上，MAPoRL 训练后的多智能体系统显著优于基线方法（如仅使用提示或单智能体训练）。
- 跨域评估显示，在 NLI 上训练的智能体可在数学任务上表现良好，证明其具备泛化能力。
- 玩具实验（T=10,20 轮）表明，联合优化的多智能体策略比固定对手下的单智能体策略协作率更高。
- 在‘Helena 多肢血清’问题中，MAPoRL 智能体能通过协作发现并纠正初始错误（如误用减法），最终得出正确答案；而未训练的开源模型则持续犯错。
- 异构模型训练实验中，Phi-3 和 Qwen2.5 经 MAPoRL 训练后能相互借鉴推理路径，协同解决‘76星旗’问题，而原始模型反复出现相同错误。

## 局限与风险

- 依赖高质量的验证器来提供可靠的奖励信号，若验证器本身存在偏差或错误，可能影响训练效果。
- 多智能体 RL 训练复杂度高，需协调多个模型的更新过程，计算成本较高。
- 当前实验主要集中在数学和推理任务，其他类型任务（如创意生成、开放对话）的表现尚待验证。
- 奖励函数设计较为复杂，超参数（如折扣因子 γ、KL 权重 λ_KL）的选择可能影响收敛性和性能。

## 适合沉淀的概念

`multi-agent-reinforcement-learning`, `post-training-for-llms`, `collaborative-debate-systems`, `influence-aware-reward`, `nash-equilibrium-in-llm-training`, `heterogeneous-llm-collaboration`, `verifier-based-reward-modeling`, `generalization-across-domains`

## 阅读注意

- 关注第 2 节中的博弈论建模：协作阈值 C(q) 和协同奖励 R_syn(q) 的设计如何形式化‘协作困境’。
- 注意 Definition 1 中奖励函数的期望部分，它体现了当前动作对未来多轮交互的影响，是多智能体信用分配的关键。
- 图 5 的玩具实验对比了单智能体与多智能体策略的协作率，直观展示了联合训练的优势。
- G.9 和 G.10 节的案例分析揭示了 MAPoRL 如何促进错误纠正与知识共享，而未训练模型缺乏此能力。
- 附录 C 提供了 Observation 1 和 2 的正式证明，有助于理解为何单智能体训练无法达成协作均衡。

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/02/2502.18439.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的理论框架、算法设计、实验设置与结果分析，包含多个具体案例和跨任务验证，材料充分且逻辑清晰。
