---
title: "Learning to Orchestrate Agents in Natural Language with the Conductor"
title_zh: "基于自然语言与强化学习的多智能体协调模型 Conductor"
arxiv_id: "2512.04388"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/12/2512.04388.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 基于自然语言与强化学习的多智能体协调模型 Conductor

## 一句话定位

提出一种名为 Conductor 的 7B 参数语言模型，通过端到端强化学习自动设计多 LLM 智能体间的协作策略，在 LiveCodeBench 和 GPQA 等推理基准上实现 SOTA 性能。

## 小学生也能听懂

这篇论文造了一个叫Conductor的小助手，它能像乐队指挥一样，用自然语言指挥多个AI分工合作解题，通过强化学习自动学会怎么分配任务，让它们一起做数学、编程等难题时表现更好，甚至超过单个大模型。

## 为什么值得记录

- 首次展示仅用 7B 小模型即可通过 RL 协调多个大型专有/开源 LLM，显著超越单个 worker 模型及现有复杂多智能体系统
- 提出完全基于自然语言的智能体协调范式，支持灵活拓扑结构（链式、树状、递归），无需人工设计工作流模板
- 通过短时微调即可扩展至任意 agent 池和递归调用，为推理模型提供新的动态测试时计算扩展轴
- 在 GPQA Diamond 和 AIME25 等挑战性任务上取得 3% 以上性能提升，相当于一代模型进步幅度

## 核心方法

- Conductor 输出结构化自然语言指令：包含子任务列表、分配的智能体 ID 列表、各步骤可见的历史响应索引（access list）
- 使用 GRPO 算法进行端到端强化学习训练，奖励函数包含格式合规性（-1/0）和最终答案正确性（1/0.5）
- 训练数据来自 MATH500、MMLU、RLPR 和 LiveCodeBench V1 的 960 道难题，覆盖数学、编码与常识推理
- worker 池包含 7 个前沿模型：Gemini-2.5-Pro、Claude-Sonnet-4、GPT-5、DeepSeek-R1-Distill-Qwen-32B、Gemma3-27B-it、Qwen3-32B 等
- 支持两种扩展机制：随机子集微调实现自适应 agent 选择；允许 Conductor 自引用实现递归工作流
- 递归模式下限制最大调用深度防止无限循环，并可在推理时调节递归次数作为计算扩展参数

## 关键结果

- 在综合评估中平均得分 77.27%，超越 GPT-5（74.78%）、Gemini 2.5 Pro（70.97%）等所有 baseline
- 在 LiveCodeBench 上达到 83.93% 准确率，刷新在线排行榜记录，优于未参与训练的 OpenAI o-series 模型
- 相比 5 轮自反思策略和 MASRouter、MoA 等多智能体路由方法，性能提升显著且平均仅使用 3 步工作流（成本更低）
- 经随机 agent 池微调后，在纯开源模型子集上性能接近 Claude Sonnet 4，在闭源子集上保持原性能
- 递归版本在 BigCodeBench 上进一步提升至 40.0%，较基础版提升 2.2 个百分点，体现动态调整能力

## 局限与风险

- 当前实现依赖高质量 worker 模型 API 调用，实际部署成本仍较高（尽管低于同类多智能体系统）
- 递归机制虽有效但尚未充分探索最优调度策略，性能增益仍有提升空间
- few-shot 示例对性能影响显著，移除后性能下降明显，表明模型对 prompt 设计敏感
- 更细粒度上下文控制（如指定任意位置输出可见）未带来显著收益，可能需更大模型才能发挥潜力

## 适合沉淀的概念

`rl-conductor`, `multi-agent-coordination`, `natural-language-orchestration`, `reinforcement-learning-for-reasoning`, `test-time-scaling`, `recursive-workflow`, `adaptive-agent-selection`, `prompt-engineering-emergence`

## 阅读注意

- 重点关注 Conductor 输出格式设计：如何通过三个 Python 列表解析完整工作流，这是实现灵活协调的关键
- 注意训练效率：仅 200 次 GRPO 迭代、batch size 256、无 KL 正则即收敛，说明框架高效
- 递归机制细节：父输出与前一响应共同构成递归输入，体现在线适应能力
- ablation 实验显示 few-shot 示例和模型规模（3B vs 7B）均显著影响 prompt engineering 质量
- 附录 F 提供丰富工作流示例，包括 1-shot、树状、递归等模式，有助于理解 emergent behaviors

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/12/2512.04388.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法、实验、消融、扩展和详细附录，数据充分，结论有支撑。
