论文
arXiv2604.15840
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级92 分钟

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

论文导读

提出CoEvolve框架,通过提取训练轨迹中的遗忘、边界和稀有信号,引导LLM重新探索环境并合成新任务,实现智能体能力与训练数据的闭环协同演化。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

CoEvolve:基于智能体-数据互演化训练LLM智能体

一句话定位

提出CoEvolve框架,通过提取训练轨迹中的遗忘、边界和稀有信号,引导LLM重新探索环境并合成新任务,实现智能体能力与训练数据的闭环协同演化。

小学生也能听懂

这篇论文像教机器人学骑自行车:它让AI一边试错(比如摔倒或快成功却失败),一边从错误中学习,自动生成新练习任务,越练越强,还能把经验教给其他AI,让它们也变得厉害。

为什么值得记录

  • 解决了传统强化学习依赖静态数据集导致泛化能力差的问题
  • 首次将训练过程中的行为信号(如遗忘)用于指导任务合成,实现自适应数据生成
  • 在AppWorld和BFCL等复杂交互基准上显著提升中小模型性能,缩小与闭源大模型差距
  • 框架无需人工标注,具备强可扩展性和跨环境迁移能力

核心方法

  • 使用GRPO算法在合成任务集上训练LLM智能体
  • 从rollout轨迹中提取三类反馈信号:遗忘信号(曾成功现失败)、边界信号(同任务结果不稳定)、稀有信号(低频但重复出现的动作模式)
  • 将信号标注轨迹输入LLM,生成结构化探索上下文(含失败原因与行为约束)
  • 基于上下文进行多轮次、多步骤的LLM引导环境重探索,收集动作-观察三元组
  • 对三元组聚合并抽象为任务-解决方案对,经环境验证后加入训练集
  • 迭代执行上述过程,形成智能体优化与数据分布更新的闭环

关键结果

  • Qwen2.5-7B/3-4B/30B-A3B在AppWorld和BFCL上平均提升19.43%/15.58%/18.14%
  • Qwen3-4B+CoEvolve在BFCL达63.00分,超越GPT-4(54.00)和Gemini-2.5-Flash(41.50)
  • 反馈信号中边界信号占比最高(AppWorld 51.4%,BFCL 45.5%),移除任一类信号均导致性能下降
  • 合成任务交互步数分布右移,覆盖更多长程依赖场景
  • 仅增加约10%计算开销,相对性能增益达8.62%~22.92%

局限与风险

  • 依赖外部LLM进行任务探索与抽象,其能力上限影响数据生成质量
  • 信号提取基于启发式规则,可能遗漏未定义的错误模式
  • 环境验证步骤增加训练延迟,极端参数设置下存在效率-效果权衡
  • 未验证在具身智能等连续动作空间任务中的适用性

适合沉淀的概念

agent-data-co-evolution, feedback-signal-extraction, forgetting-signal, boundary-signal, rare-signal, task-abstraction, environment-validation, closed-loop-training

阅读注意

  • 重点关注3.1节中三类信号的具体定义与触发条件
  • 图3展示训练动态,体现信号数量下降与任务通过率上升的正向循环
  • 表5证明三类信号具有互补性,不可简单替代
  • 附录A.6通过案例对比揭示合成任务在组合复杂度上的优势
  • 表10显示方法在ALFWorld和WebShop等非API环境同样有效

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.15840.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供完整方法描述、多维度实验验证及消融分析,数据充分且结论可靠,符合高质量研究标准。