论文
arXiv2605.06130
时间2026-05
来源Markdown
页面质量中文卡片
阅读量级160 分钟

论文导读

提出 Skill1 框架,通过单一任务结果信号联合优化技能选择、利用与蒸馏三个能力,实现技能增强代理的协同演化。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Skill1:基于强化学习的技能增强代理统一演化框架

一句话定位

提出 Skill1 框架,通过单一任务结果信号联合优化技能选择、利用与蒸馏三个能力,实现技能增强代理的协同演化。

小学生也能听懂

就像一个机器人学习做家务:它先从‘技能书’里找方法(选择),照着做(利用),做完后总结新技巧加进书里(蒸馏)。Skill1 让这三个步骤一起进步,只用‘任务是否成功’这一个标准来指导学习。

为什么值得记录

  • 首次实现技能选择、利用与蒸馏三阶段的端到端联合优化,避免传统方法中各阶段目标不一致导致的性能瓶颈
  • 在 ALFWorld 上达到 97.5% 平均成功率,超越此前最优方法 RetroAgent 2.6 个百分点
  • 提出基于任务结果信号的低频趋势(用于选择)与高频变化(用于蒸馏)分解机制,为信用分配提供新思路
  • 验证了技能库显式复用策略相比纯参数化 RL(如 GiGPO)的优势,尤其在多子任务组合场景提升显著

核心方法

  • 使用单一策略 πθ 统一处理技能选择(生成查询 + 重排序)、技能利用(条件执行)和技能蒸馏(轨迹反思)
  • 技能选择:策略生成自然语言查询,通过冻结编码器检索 Top-K 候选技能,再由策略重排序选择最优技能
  • 信用分配机制:将任务结果 r(τ) 分解为低频趋势(技能长期效用 U(s),用于重排序奖励)与高频变化(当前结果与趋势之差,用于蒸馏奖励)
  • 联合优化目标:GRPO 优化利用与蒸馏,REINFORCE 优化重排序,三者共享同一任务结果信号
  • 技能库动态管理:仅当任务成功时添加新技能;容量满时按 U(s)·log(n(s)) 淘汰低效用低频使用技能

关键结果

  • ALFWorld:平均成功率 97.5%(6 类任务中 5 类第一),超越 RetroAgent(94.9%)和 GiGPO(90.8%)
  • WebShop:成功率 82.9%,优于所有基线方法
  • 消融实验显示:移除任一阶段信用信号(λ₁=0 或 λ₂=0)均导致整体性能下降,证明三能力相互依赖
  • 训练动态显示:选择精度、利用成功率与技能库质量同步提升,验证协同演化有效性

局限与风险

  • 依赖冻结编码器进行技能检索,可能限制检索灵活性;未来可探索可学习检索器
  • 技能表示为自然语言,缺乏结构化约束,可能导致蒸馏技能语义模糊或冗余
  • 实验仅涵盖两个环境(ALFWorld 与 WebShop),在更复杂或开放域任务中的泛化性待验证
  • 未与基于检索增强生成(RAG)的非 RL 方法对比,难以完全分离 RL 与技能库的贡献

适合沉淀的概念

skill-augmented-agents, reinforcement-learning-for-llm-agents, credit-assignment-in-rl, skill-library-evolution, joint-optimization-of-agent-capabilities, low-frequency-trend-and-high-frequency-variation, GRPO-algorithm, ALFWorld-benchmark, WebShop-environment

阅读注意

  • 关注图 2 的工作流设计:策略如何统一生成查询、重排序、执行与蒸馏
  • 重点理解公式 (5)-(7):如何将单一任务结果分解为不同时间尺度的信用信号
  • 注意消融实验设计:w/o Selection/Distillation/Library 分别对应移除哪个模块,λ₁/λ₂=0 对应关闭哪个奖励
  • 查看附录 B 的 GRPO 实现细节,了解多段生成如何共享策略参数
  • 思考技能淘汰策略 U(s)·log(n(s)) 的设计动机:平衡效用与使用频率

质量说明

  • 采用来源:rawraw/papers/2026/05/2605.06130.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、消融分析、统计显著性检验与代码链接,结果可信且可复现。