---
title: "2503.06580"
title_zh: "将动作链生成内化至推理模型的大智能体模型"
arxiv_id: "2503.06580"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/03/2503.06580.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 将动作链生成内化至推理模型的大智能体模型

## 一句话定位

提出 AutoCoA 框架，通过监督微调与强化学习将 Chain-of-Action 生成能力内化至推理模型，实现自主工具调用与长程推理动作协同。

## 小学生也能听懂

这篇论文教AI像人一样边想边做：先学会在思考中决定何时查资料（比如搜网页），再通过反复练习（先模拟再实战）让AI自己安排多步行动，完成复杂问题，比老方法更聪明、更省力气。

## 为什么值得记录

- 传统智能体工作流依赖外部提示控制工具调用，缺乏自主性；本文提出将动作决策内化为模型自身行为，提升任务完成率
- 在开放域问答任务中，AutoCoA 训练的模型显著优于 ReAct 类工作流，尤其在需要多步动作与长期推理的场景
- 提出 Large Agent Models (LAMs) 概念，类比 LRM 的发展路径，推动从‘被动执行’到‘主动决策’的范式转变
- 引入内部世界模型模拟环境反馈，降低真实环境交互成本，提升训练效率与稳定性

## 核心方法

- 定义 Agent Model 为基于推理模型、通过端到端任务导向训练增强的生成模型，输出 interleaved 的 Chain-of-Thought 与 Chain-of-Action
- AutoCoA 框架包含两阶段：SFT 与 RL；SFT 阶段细分为 CoT+A（对比学习触发时机）、CoT+CoA（带/不带观测掩码）三个子阶段
- CoT+A 阶段使用正负样本对进行对比学习，教会模型在关键推理节点何时触发 ⟨action⟩ 动作
- SFT 后期训练模型预测环境响应（如搜索结果），构建隐式世界模型，用于 RL 阶段的模拟环境 rollout
- RL 阶段先在模拟环境中大量探索，再接入真实环境微调，实现高效稳定训练
- 使用 HotpotQA 数据集，基于 DeepSeek-R1-Distill-Qwen-32B 合成 CoT、CoA 与 CoT+A 三类训练数据

## 关键结果

- 在 HotpotQA 开放域 QA 任务上，AutoCoA 训练的代理模型任务完成率显著高于 ReAct 工作流
- 随着动作步数增加，传统工作流成功率下降，而 AutoCoA 模型在 5 步动作时仍保持较高准确率
- 消融实验表明，混合 CoT 数据防止了模型遗忘纯推理能力，避免对工具的过度依赖
- 内部世界模型使 RL 阶段收敛更快，减少真实工具调用次数，降低训练成本

## 局限与风险

- 当前实验仅使用搜索工具与小型推理模型（如 Qwen-7B/32B 蒸馏版），未验证更大模型与更多工具类型
- 环境模拟依赖模型自身预测观测结果，可能与真实环境存在偏差，影响策略泛化性
- 未在真实动态环境（如操作系统控制）中测试，物理世界交互能力待验证
- 训练数据合成依赖强模型（DeepSeek-R1-Distill-Qwen-32B），存在标注偏差风险

## 适合沉淀的概念

`large-agent-models`, `chain-of-action`, `agent-model-inference`, `internal-world-model`, `contrastive-action-triggering`, `simulated-environment-rl`, `end-to-end-agent-training`, `reasoning-action-interleaving`

## 阅读注意

- 关注图 1 与图 2 对 Chatbot → Reasoner → Agent 演进路径的可视化解释
- 注意 Algorithm 1 中 ⟨think⟩、⟨action⟩、⟨answer⟩ 三类 token 的生成逻辑与状态转移机制
- SFT 三阶段的数据构造策略（CoT、CoA、CoT+A）是理解训练设计的关键
- 附录 A 揭示了模型在已知 vs 未知知识上的表现差异，凸显工具调用的必要性

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/03/2503.06580.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法设计、实验设置与结果分析，包含算法伪代码、数据合成细节与消融实验，材料充分可信。
