论文
arXiv2503.06580
时间2025-03
来源Markdown
页面质量中文卡片
阅读量级95 分钟

2503.06580

论文导读

提出 AutoCoA 框架,通过监督微调与强化学习将 Chain-of-Action 生成能力内化至推理模型,实现自主工具调用与长程推理动作协同。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

将动作链生成内化至推理模型的大智能体模型

一句话定位

提出 AutoCoA 框架,通过监督微调与强化学习将 Chain-of-Action 生成能力内化至推理模型,实现自主工具调用与长程推理动作协同。

小学生也能听懂

这篇论文教AI像人一样边想边做:先学会在思考中决定何时查资料(比如搜网页),再通过反复练习(先模拟再实战)让AI自己安排多步行动,完成复杂问题,比老方法更聪明、更省力气。

为什么值得记录

  • 传统智能体工作流依赖外部提示控制工具调用,缺乏自主性;本文提出将动作决策内化为模型自身行为,提升任务完成率
  • 在开放域问答任务中,AutoCoA 训练的模型显著优于 ReAct 类工作流,尤其在需要多步动作与长期推理的场景
  • 提出 Large Agent Models (LAMs) 概念,类比 LRM 的发展路径,推动从‘被动执行’到‘主动决策’的范式转变
  • 引入内部世界模型模拟环境反馈,降低真实环境交互成本,提升训练效率与稳定性

核心方法

  • 定义 Agent Model 为基于推理模型、通过端到端任务导向训练增强的生成模型,输出 interleaved 的 Chain-of-Thought 与 Chain-of-Action
  • AutoCoA 框架包含两阶段:SFT 与 RL;SFT 阶段细分为 CoT+A(对比学习触发时机)、CoT+CoA(带/不带观测掩码)三个子阶段
  • CoT+A 阶段使用正负样本对进行对比学习,教会模型在关键推理节点何时触发 ⟨action⟩ 动作
  • SFT 后期训练模型预测环境响应(如搜索结果),构建隐式世界模型,用于 RL 阶段的模拟环境 rollout
  • RL 阶段先在模拟环境中大量探索,再接入真实环境微调,实现高效稳定训练
  • 使用 HotpotQA 数据集,基于 DeepSeek-R1-Distill-Qwen-32B 合成 CoT、CoA 与 CoT+A 三类训练数据

关键结果

  • 在 HotpotQA 开放域 QA 任务上,AutoCoA 训练的代理模型任务完成率显著高于 ReAct 工作流
  • 随着动作步数增加,传统工作流成功率下降,而 AutoCoA 模型在 5 步动作时仍保持较高准确率
  • 消融实验表明,混合 CoT 数据防止了模型遗忘纯推理能力,避免对工具的过度依赖
  • 内部世界模型使 RL 阶段收敛更快,减少真实工具调用次数,降低训练成本

局限与风险

  • 当前实验仅使用搜索工具与小型推理模型(如 Qwen-7B/32B 蒸馏版),未验证更大模型与更多工具类型
  • 环境模拟依赖模型自身预测观测结果,可能与真实环境存在偏差,影响策略泛化性
  • 未在真实动态环境(如操作系统控制)中测试,物理世界交互能力待验证
  • 训练数据合成依赖强模型(DeepSeek-R1-Distill-Qwen-32B),存在标注偏差风险

适合沉淀的概念

large-agent-models, chain-of-action, agent-model-inference, internal-world-model, contrastive-action-triggering, simulated-environment-rl, end-to-end-agent-training, reasoning-action-interleaving

阅读注意

  • 关注图 1 与图 2 对 Chatbot → Reasoner → Agent 演进路径的可视化解释
  • 注意 Algorithm 1 中 ⟨think⟩、⟨action⟩、⟨answer⟩ 三类 token 的生成逻辑与状态转移机制
  • SFT 三阶段的数据构造策略(CoT、CoA、CoT+A)是理解训练设计的关键
  • 附录 A 揭示了模型在已知 vs 未知知识上的表现差异,凸显工具调用的必要性

质量说明

  • 采用来源:rawraw/papers/2025/03/2503.06580.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法设计、实验设置与结果分析,包含算法伪代码、数据合成细节与消融实验,材料充分可信。