2503.06580
论文导读
提出 AutoCoA 框架,通过监督微调与强化学习将 Chain-of-Action 生成能力内化至推理模型,实现自主工具调用与长程推理动作协同。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
将动作链生成内化至推理模型的大智能体模型
一句话定位
提出 AutoCoA 框架,通过监督微调与强化学习将 Chain-of-Action 生成能力内化至推理模型,实现自主工具调用与长程推理动作协同。
小学生也能听懂
这篇论文教AI像人一样边想边做:先学会在思考中决定何时查资料(比如搜网页),再通过反复练习(先模拟再实战)让AI自己安排多步行动,完成复杂问题,比老方法更聪明、更省力气。
为什么值得记录
- 传统智能体工作流依赖外部提示控制工具调用,缺乏自主性;本文提出将动作决策内化为模型自身行为,提升任务完成率
- 在开放域问答任务中,AutoCoA 训练的模型显著优于 ReAct 类工作流,尤其在需要多步动作与长期推理的场景
- 提出 Large Agent Models (LAMs) 概念,类比 LRM 的发展路径,推动从‘被动执行’到‘主动决策’的范式转变
- 引入内部世界模型模拟环境反馈,降低真实环境交互成本,提升训练效率与稳定性
核心方法
- 定义 Agent Model 为基于推理模型、通过端到端任务导向训练增强的生成模型,输出 interleaved 的 Chain-of-Thought 与 Chain-of-Action
- AutoCoA 框架包含两阶段:SFT 与 RL;SFT 阶段细分为 CoT+A(对比学习触发时机)、CoT+CoA(带/不带观测掩码)三个子阶段
- CoT+A 阶段使用正负样本对进行对比学习,教会模型在关键推理节点何时触发 ⟨action⟩ 动作
- SFT 后期训练模型预测环境响应(如搜索结果),构建隐式世界模型,用于 RL 阶段的模拟环境 rollout
- RL 阶段先在模拟环境中大量探索,再接入真实环境微调,实现高效稳定训练
- 使用 HotpotQA 数据集,基于 DeepSeek-R1-Distill-Qwen-32B 合成 CoT、CoA 与 CoT+A 三类训练数据
关键结果
- 在 HotpotQA 开放域 QA 任务上,AutoCoA 训练的代理模型任务完成率显著高于 ReAct 工作流
- 随着动作步数增加,传统工作流成功率下降,而 AutoCoA 模型在 5 步动作时仍保持较高准确率
- 消融实验表明,混合 CoT 数据防止了模型遗忘纯推理能力,避免对工具的过度依赖
- 内部世界模型使 RL 阶段收敛更快,减少真实工具调用次数,降低训练成本
局限与风险
- 当前实验仅使用搜索工具与小型推理模型(如 Qwen-7B/32B 蒸馏版),未验证更大模型与更多工具类型
- 环境模拟依赖模型自身预测观测结果,可能与真实环境存在偏差,影响策略泛化性
- 未在真实动态环境(如操作系统控制)中测试,物理世界交互能力待验证
- 训练数据合成依赖强模型(DeepSeek-R1-Distill-Qwen-32B),存在标注偏差风险
适合沉淀的概念
large-agent-models, chain-of-action, agent-model-inference, internal-world-model, contrastive-action-triggering, simulated-environment-rl, end-to-end-agent-training, reasoning-action-interleaving
阅读注意
- 关注图 1 与图 2 对 Chatbot → Reasoner → Agent 演进路径的可视化解释
- 注意 Algorithm 1 中 ⟨think⟩、⟨action⟩、⟨answer⟩ 三类 token 的生成逻辑与状态转移机制
- SFT 三阶段的数据构造策略(CoT、CoA、CoT+A)是理解训练设计的关键
- 附录 A 揭示了模型在已知 vs 未知知识上的表现差异,凸显工具调用的必要性
质量说明
- 采用来源:
raw,raw/papers/2025/03/2503.06580.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的方法设计、实验设置与结果分析,包含算法伪代码、数据合成细节与消融实验,材料充分可信。