论文
arXiv2512.04388
时间2025-12
来源Markdown
页面质量中文卡片
阅读量级130 分钟

Learning to Orchestrate Agents in Natural Language with the Conductor

论文导读

提出一种名为 Conductor 的 7B 参数语言模型,通过端到端强化学习自动设计多 LLM 智能体间的协作策略,在 LiveCodeBench 和 GPQA 等推理基准上实现 SOTA 性能。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

基于自然语言与强化学习的多智能体协调模型 Conductor

一句话定位

提出一种名为 Conductor 的 7B 参数语言模型,通过端到端强化学习自动设计多 LLM 智能体间的协作策略,在 LiveCodeBench 和 GPQA 等推理基准上实现 SOTA 性能。

小学生也能听懂

这篇论文造了一个叫Conductor的小助手,它能像乐队指挥一样,用自然语言指挥多个AI分工合作解题,通过强化学习自动学会怎么分配任务,让它们一起做数学、编程等难题时表现更好,甚至超过单个大模型。

为什么值得记录

  • 首次展示仅用 7B 小模型即可通过 RL 协调多个大型专有/开源 LLM,显著超越单个 worker 模型及现有复杂多智能体系统
  • 提出完全基于自然语言的智能体协调范式,支持灵活拓扑结构(链式、树状、递归),无需人工设计工作流模板
  • 通过短时微调即可扩展至任意 agent 池和递归调用,为推理模型提供新的动态测试时计算扩展轴
  • 在 GPQA Diamond 和 AIME25 等挑战性任务上取得 3% 以上性能提升,相当于一代模型进步幅度

核心方法

  • Conductor 输出结构化自然语言指令:包含子任务列表、分配的智能体 ID 列表、各步骤可见的历史响应索引(access list)
  • 使用 GRPO 算法进行端到端强化学习训练,奖励函数包含格式合规性(-1/0)和最终答案正确性(1/0.5)
  • 训练数据来自 MATH500、MMLU、RLPR 和 LiveCodeBench V1 的 960 道难题,覆盖数学、编码与常识推理
  • worker 池包含 7 个前沿模型:Gemini-2.5-Pro、Claude-Sonnet-4、GPT-5、DeepSeek-R1-Distill-Qwen-32B、Gemma3-27B-it、Qwen3-32B 等
  • 支持两种扩展机制:随机子集微调实现自适应 agent 选择;允许 Conductor 自引用实现递归工作流
  • 递归模式下限制最大调用深度防止无限循环,并可在推理时调节递归次数作为计算扩展参数

关键结果

  • 在综合评估中平均得分 77.27%,超越 GPT-5(74.78%)、Gemini 2.5 Pro(70.97%)等所有 baseline
  • 在 LiveCodeBench 上达到 83.93% 准确率,刷新在线排行榜记录,优于未参与训练的 OpenAI o-series 模型
  • 相比 5 轮自反思策略和 MASRouter、MoA 等多智能体路由方法,性能提升显著且平均仅使用 3 步工作流(成本更低)
  • 经随机 agent 池微调后,在纯开源模型子集上性能接近 Claude Sonnet 4,在闭源子集上保持原性能
  • 递归版本在 BigCodeBench 上进一步提升至 40.0%,较基础版提升 2.2 个百分点,体现动态调整能力

局限与风险

  • 当前实现依赖高质量 worker 模型 API 调用,实际部署成本仍较高(尽管低于同类多智能体系统)
  • 递归机制虽有效但尚未充分探索最优调度策略,性能增益仍有提升空间
  • few-shot 示例对性能影响显著,移除后性能下降明显,表明模型对 prompt 设计敏感
  • 更细粒度上下文控制(如指定任意位置输出可见)未带来显著收益,可能需更大模型才能发挥潜力

适合沉淀的概念

rl-conductor, multi-agent-coordination, natural-language-orchestration, reinforcement-learning-for-reasoning, test-time-scaling, recursive-workflow, adaptive-agent-selection, prompt-engineering-emergence

阅读注意

  • 重点关注 Conductor 输出格式设计:如何通过三个 Python 列表解析完整工作流,这是实现灵活协调的关键
  • 注意训练效率:仅 200 次 GRPO 迭代、batch size 256、无 KL 正则即收敛,说明框架高效
  • 递归机制细节:父输出与前一响应共同构成递归输入,体现在线适应能力
  • ablation 实验显示 few-shot 示例和模型规模(3B vs 7B)均显著影响 prompt engineering 质量
  • 附录 F 提供丰富工作流示例,包括 1-shot、树状、递归等模式,有助于理解 emergent behaviors

质量说明

  • 采用来源:rawraw/papers/2025/12/2512.04388.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法、实验、消融、扩展和详细附录,数据充分,结论有支撑。