Learning to Orchestrate Agents in Natural Language with the Conductor
论文导读
提出一种名为 Conductor 的 7B 参数语言模型,通过端到端强化学习自动设计多 LLM 智能体间的协作策略,在 LiveCodeBench 和 GPQA 等推理基准上实现 SOTA 性能。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
基于自然语言与强化学习的多智能体协调模型 Conductor
一句话定位
提出一种名为 Conductor 的 7B 参数语言模型,通过端到端强化学习自动设计多 LLM 智能体间的协作策略,在 LiveCodeBench 和 GPQA 等推理基准上实现 SOTA 性能。
小学生也能听懂
这篇论文造了一个叫Conductor的小助手,它能像乐队指挥一样,用自然语言指挥多个AI分工合作解题,通过强化学习自动学会怎么分配任务,让它们一起做数学、编程等难题时表现更好,甚至超过单个大模型。
为什么值得记录
- 首次展示仅用 7B 小模型即可通过 RL 协调多个大型专有/开源 LLM,显著超越单个 worker 模型及现有复杂多智能体系统
- 提出完全基于自然语言的智能体协调范式,支持灵活拓扑结构(链式、树状、递归),无需人工设计工作流模板
- 通过短时微调即可扩展至任意 agent 池和递归调用,为推理模型提供新的动态测试时计算扩展轴
- 在 GPQA Diamond 和 AIME25 等挑战性任务上取得 3% 以上性能提升,相当于一代模型进步幅度
核心方法
- Conductor 输出结构化自然语言指令:包含子任务列表、分配的智能体 ID 列表、各步骤可见的历史响应索引(access list)
- 使用 GRPO 算法进行端到端强化学习训练,奖励函数包含格式合规性(-1/0)和最终答案正确性(1/0.5)
- 训练数据来自 MATH500、MMLU、RLPR 和 LiveCodeBench V1 的 960 道难题,覆盖数学、编码与常识推理
- worker 池包含 7 个前沿模型:Gemini-2.5-Pro、Claude-Sonnet-4、GPT-5、DeepSeek-R1-Distill-Qwen-32B、Gemma3-27B-it、Qwen3-32B 等
- 支持两种扩展机制:随机子集微调实现自适应 agent 选择;允许 Conductor 自引用实现递归工作流
- 递归模式下限制最大调用深度防止无限循环,并可在推理时调节递归次数作为计算扩展参数
关键结果
- 在综合评估中平均得分 77.27%,超越 GPT-5(74.78%)、Gemini 2.5 Pro(70.97%)等所有 baseline
- 在 LiveCodeBench 上达到 83.93% 准确率,刷新在线排行榜记录,优于未参与训练的 OpenAI o-series 模型
- 相比 5 轮自反思策略和 MASRouter、MoA 等多智能体路由方法,性能提升显著且平均仅使用 3 步工作流(成本更低)
- 经随机 agent 池微调后,在纯开源模型子集上性能接近 Claude Sonnet 4,在闭源子集上保持原性能
- 递归版本在 BigCodeBench 上进一步提升至 40.0%,较基础版提升 2.2 个百分点,体现动态调整能力
局限与风险
- 当前实现依赖高质量 worker 模型 API 调用,实际部署成本仍较高(尽管低于同类多智能体系统)
- 递归机制虽有效但尚未充分探索最优调度策略,性能增益仍有提升空间
- few-shot 示例对性能影响显著,移除后性能下降明显,表明模型对 prompt 设计敏感
- 更细粒度上下文控制(如指定任意位置输出可见)未带来显著收益,可能需更大模型才能发挥潜力
适合沉淀的概念
rl-conductor, multi-agent-coordination, natural-language-orchestration, reinforcement-learning-for-reasoning, test-time-scaling, recursive-workflow, adaptive-agent-selection, prompt-engineering-emergence
阅读注意
- 重点关注 Conductor 输出格式设计:如何通过三个 Python 列表解析完整工作流,这是实现灵活协调的关键
- 注意训练效率:仅 200 次 GRPO 迭代、batch size 256、无 KL 正则即收敛,说明框架高效
- 递归机制细节:父输出与前一响应共同构成递归输入,体现在线适应能力
- ablation 实验显示 few-shot 示例和模型规模(3B vs 7B)均显著影响 prompt engineering 质量
- 附录 F 提供丰富工作流示例,包括 1-shot、树状、递归等模式,有助于理解 emergent behaviors
质量说明
- 采用来源:
raw,raw/papers/2025/12/2512.04388.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法、实验、消融、扩展和详细附录,数据充分,结论有支撑。