---
title: "CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution"
title_zh: "CoEvolve：基于智能体-数据互演化训练LLM智能体"
arxiv_id: "2604.15840"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.15840.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# CoEvolve：基于智能体-数据互演化训练LLM智能体

## 一句话定位

提出CoEvolve框架，通过提取训练轨迹中的遗忘、边界和稀有信号，引导LLM重新探索环境并合成新任务，实现智能体能力与训练数据的闭环协同演化。

## 小学生也能听懂

这篇论文像教机器人学骑自行车：它让AI一边试错（比如摔倒或快成功却失败），一边从错误中学习，自动生成新练习任务，越练越强，还能把经验教给其他AI，让它们也变得厉害。

## 为什么值得记录

- 解决了传统强化学习依赖静态数据集导致泛化能力差的问题
- 首次将训练过程中的行为信号（如遗忘）用于指导任务合成，实现自适应数据生成
- 在AppWorld和BFCL等复杂交互基准上显著提升中小模型性能，缩小与闭源大模型差距
- 框架无需人工标注，具备强可扩展性和跨环境迁移能力

## 核心方法

- 使用GRPO算法在合成任务集上训练LLM智能体
- 从rollout轨迹中提取三类反馈信号：遗忘信号（曾成功现失败）、边界信号（同任务结果不稳定）、稀有信号（低频但重复出现的动作模式）
- 将信号标注轨迹输入LLM，生成结构化探索上下文（含失败原因与行为约束）
- 基于上下文进行多轮次、多步骤的LLM引导环境重探索，收集动作-观察三元组
- 对三元组聚合并抽象为任务-解决方案对，经环境验证后加入训练集
- 迭代执行上述过程，形成智能体优化与数据分布更新的闭环

## 关键结果

- Qwen2.5-7B/3-4B/30B-A3B在AppWorld和BFCL上平均提升19.43%/15.58%/18.14%
- Qwen3-4B+CoEvolve在BFCL达63.00分，超越GPT-4(54.00)和Gemini-2.5-Flash(41.50)
- 反馈信号中边界信号占比最高（AppWorld 51.4%，BFCL 45.5%），移除任一类信号均导致性能下降
- 合成任务交互步数分布右移，覆盖更多长程依赖场景
- 仅增加约10%计算开销，相对性能增益达8.62%~22.92%

## 局限与风险

- 依赖外部LLM进行任务探索与抽象，其能力上限影响数据生成质量
- 信号提取基于启发式规则，可能遗漏未定义的错误模式
- 环境验证步骤增加训练延迟，极端参数设置下存在效率-效果权衡
- 未验证在具身智能等连续动作空间任务中的适用性

## 适合沉淀的概念

`agent-data-co-evolution`, `feedback-signal-extraction`, `forgetting-signal`, `boundary-signal`, `rare-signal`, `task-abstraction`, `environment-validation`, `closed-loop-training`

## 阅读注意

- 重点关注3.1节中三类信号的具体定义与触发条件
- 图3展示训练动态，体现信号数量下降与任务通过率上升的正向循环
- 表5证明三类信号具有互补性，不可简单替代
- 附录A.6通过案例对比揭示合成任务在组合复杂度上的优势
- 表10显示方法在ALFWorld和WebShop等非API环境同样有效

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.15840.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供完整方法描述、多维度实验验证及消融分析，数据充分且结论可靠，符合高质量研究标准。
