---
title: ""
title_zh: "Skill1：基于强化学习的技能增强代理统一演化框架"
arxiv_id: "2605.06130"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.06130.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Skill1：基于强化学习的技能增强代理统一演化框架

## 一句话定位

提出 Skill1 框架，通过单一任务结果信号联合优化技能选择、利用与蒸馏三个能力，实现技能增强代理的协同演化。

## 小学生也能听懂

就像一个机器人学习做家务：它先从‘技能书’里找方法（选择），照着做（利用），做完后总结新技巧加进书里（蒸馏）。Skill1 让这三个步骤一起进步，只用‘任务是否成功’这一个标准来指导学习。

## 为什么值得记录

- 首次实现技能选择、利用与蒸馏三阶段的端到端联合优化，避免传统方法中各阶段目标不一致导致的性能瓶颈
- 在 ALFWorld 上达到 97.5% 平均成功率，超越此前最优方法 RetroAgent 2.6 个百分点
- 提出基于任务结果信号的低频趋势（用于选择）与高频变化（用于蒸馏）分解机制，为信用分配提供新思路
- 验证了技能库显式复用策略相比纯参数化 RL（如 GiGPO）的优势，尤其在多子任务组合场景提升显著

## 核心方法

- 使用单一策略 πθ 统一处理技能选择（生成查询 + 重排序）、技能利用（条件执行）和技能蒸馏（轨迹反思）
- 技能选择：策略生成自然语言查询，通过冻结编码器检索 Top-K 候选技能，再由策略重排序选择最优技能
- 信用分配机制：将任务结果 r(τ) 分解为低频趋势（技能长期效用 U(s)，用于重排序奖励）与高频变化（当前结果与趋势之差，用于蒸馏奖励）
- 联合优化目标：GRPO 优化利用与蒸馏，REINFORCE 优化重排序，三者共享同一任务结果信号
- 技能库动态管理：仅当任务成功时添加新技能；容量满时按 U(s)·log(n(s)) 淘汰低效用低频使用技能

## 关键结果

- ALFWorld：平均成功率 97.5%（6 类任务中 5 类第一），超越 RetroAgent（94.9%）和 GiGPO（90.8%）
- WebShop：成功率 82.9%，优于所有基线方法
- 消融实验显示：移除任一阶段信用信号（λ₁=0 或 λ₂=0）均导致整体性能下降，证明三能力相互依赖
- 训练动态显示：选择精度、利用成功率与技能库质量同步提升，验证协同演化有效性

## 局限与风险

- 依赖冻结编码器进行技能检索，可能限制检索灵活性；未来可探索可学习检索器
- 技能表示为自然语言，缺乏结构化约束，可能导致蒸馏技能语义模糊或冗余
- 实验仅涵盖两个环境（ALFWorld 与 WebShop），在更复杂或开放域任务中的泛化性待验证
- 未与基于检索增强生成（RAG）的非 RL 方法对比，难以完全分离 RL 与技能库的贡献

## 适合沉淀的概念

`skill-augmented-agents`, `reinforcement-learning-for-llm-agents`, `credit-assignment-in-rl`, `skill-library-evolution`, `joint-optimization-of-agent-capabilities`, `low-frequency-trend-and-high-frequency-variation`, `GRPO-algorithm`, `ALFWorld-benchmark`, `WebShop-environment`

## 阅读注意

- 关注图 2 的工作流设计：策略如何统一生成查询、重排序、执行与蒸馏
- 重点理解公式 (5)-(7)：如何将单一任务结果分解为不同时间尺度的信用信号
- 注意消融实验设计：w/o Selection/Distillation/Library 分别对应移除哪个模块，λ₁/λ₂=0 对应关闭哪个奖励
- 查看附录 B 的 GRPO 实现细节，了解多段生成如何共享策略参数
- 思考技能淘汰策略 U(s)·log(n(s)) 的设计动机：平衡效用与使用频率

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.06130.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、消融分析、统计显著性检验与代码链接，结果可信且可复现。
