CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
论文导读
提出CoEvolve框架,通过提取训练轨迹中的遗忘、边界和稀有信号,引导LLM重新探索环境并合成新任务,实现智能体能力与训练数据的闭环协同演化。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
CoEvolve:基于智能体-数据互演化训练LLM智能体
一句话定位
提出CoEvolve框架,通过提取训练轨迹中的遗忘、边界和稀有信号,引导LLM重新探索环境并合成新任务,实现智能体能力与训练数据的闭环协同演化。
小学生也能听懂
这篇论文像教机器人学骑自行车:它让AI一边试错(比如摔倒或快成功却失败),一边从错误中学习,自动生成新练习任务,越练越强,还能把经验教给其他AI,让它们也变得厉害。
为什么值得记录
- 解决了传统强化学习依赖静态数据集导致泛化能力差的问题
- 首次将训练过程中的行为信号(如遗忘)用于指导任务合成,实现自适应数据生成
- 在AppWorld和BFCL等复杂交互基准上显著提升中小模型性能,缩小与闭源大模型差距
- 框架无需人工标注,具备强可扩展性和跨环境迁移能力
核心方法
- 使用GRPO算法在合成任务集上训练LLM智能体
- 从rollout轨迹中提取三类反馈信号:遗忘信号(曾成功现失败)、边界信号(同任务结果不稳定)、稀有信号(低频但重复出现的动作模式)
- 将信号标注轨迹输入LLM,生成结构化探索上下文(含失败原因与行为约束)
- 基于上下文进行多轮次、多步骤的LLM引导环境重探索,收集动作-观察三元组
- 对三元组聚合并抽象为任务-解决方案对,经环境验证后加入训练集
- 迭代执行上述过程,形成智能体优化与数据分布更新的闭环
关键结果
- Qwen2.5-7B/3-4B/30B-A3B在AppWorld和BFCL上平均提升19.43%/15.58%/18.14%
- Qwen3-4B+CoEvolve在BFCL达63.00分,超越GPT-4(54.00)和Gemini-2.5-Flash(41.50)
- 反馈信号中边界信号占比最高(AppWorld 51.4%,BFCL 45.5%),移除任一类信号均导致性能下降
- 合成任务交互步数分布右移,覆盖更多长程依赖场景
- 仅增加约10%计算开销,相对性能增益达8.62%~22.92%
局限与风险
- 依赖外部LLM进行任务探索与抽象,其能力上限影响数据生成质量
- 信号提取基于启发式规则,可能遗漏未定义的错误模式
- 环境验证步骤增加训练延迟,极端参数设置下存在效率-效果权衡
- 未验证在具身智能等连续动作空间任务中的适用性
适合沉淀的概念
agent-data-co-evolution, feedback-signal-extraction, forgetting-signal, boundary-signal, rare-signal, task-abstraction, environment-validation, closed-loop-training
阅读注意
- 重点关注3.1节中三类信号的具体定义与触发条件
- 图3展示训练动态,体现信号数量下降与任务通过率上升的正向循环
- 表5证明三类信号具有互补性,不可简单替代
- 附录A.6通过案例对比揭示合成任务在组合复杂度上的优势
- 表10显示方法在ALFWorld和WebShop等非API环境同样有效
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.15840.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供完整方法描述、多维度实验验证及消融分析,数据充分且结论可靠,符合高质量研究标准。