---
title: ""
title_zh: "SkillOS：面向自进化代理的技能策展学习框架"
arxiv_id: "2605.06614"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.06614.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# SkillOS：面向自进化代理的技能策展学习框架

## 一句话定位

提出 SkillOS，一种基于强化学习的经验驱动训练范式，用于让 LLM 代理学会从任务流中持续提取、更新和复用可重用技能，实现长期自我进化。

## 小学生也能听懂

就像一个学生不断整理错题本，SkillOS 让 AI 代理每完成一个任务后，自动总结出有用的‘解题技巧’（技能），存到‘技能库’里。后续遇到类似任务时，它能快速找到并应用这些技巧，越做越聪明。

## 为什么值得记录

- 解决了现有 LLM 代理在流式任务中无法有效积累和复用经验的根本问题，推动从‘一次性求解器’向‘持续进化体’转变
- 首次将技能策展建模为长视距强化学习问题，通过任务分组和复合奖励机制，使模型能学习复杂技能管理操作（如更新、删除）
- 在 ALFWorld 和数学推理任务上均显著优于无记忆和强记忆基线，最高提升 9.8% 成功率，减少 6.0% 交互步数
- 训练出的技能策展人展现出跨执行器和任务域的泛化能力，甚至优于直接使用 Gemini-2.5-Pro 作为策展人

## 核心方法

- 采用模块化多代理设计：冻结的 Agent Executor 负责执行任务，可训练的 Skill Curator 负责更新外部 SkillRepo
- 技能以 Markdown 格式存储（含 YAML 前置元数据和正文指令），通过文件 I/O 操作模拟操作系统式管理
- 构建任务组作为训练单元：每组包含多个相关任务，前序任务的技能更新直接影响后续任务表现，提供长视距反馈信号
- 设计四部分复合奖励函数：任务成功率、函数调用有效性、技能内容质量（由 Qwen3-32B 评判）、技能库压缩率（防冗余）
- 使用 GRPO 算法优化策展人策略，优势函数基于整组任务的复合奖励计算，鼓励探索性策略更新

## 关键结果

- 在 ALFWorld 基准测试中，SkillOS 平均成功率（Avg. SR）达 73.1%，显著高于最强基线 ReasoningBank 的 66.0%
- 交互效率更高：SkillOS 平均仅需 15.5 步，比 ReasoningBank 减少 2.1 步（-12%）
- 跨执行器泛化：当 Executor 从 Qwen3-8B 切换至 Gemini-2.5-Pro 时，SkillOS 策展人仍能提升性能
- 小模型优势：8B 参数的 SkillOS 策展人性能优于直接使用 2.5-Pro 模型作为策展人
- 技能演化分析显示：随时间推移，SkillRepo 中技能结构更丰富，出现高阶元技能（meta-skills）

## 局限与风险

- 依赖 BM25 关键词检索，未优化技能检索环节，可能限制高相关性技能的召回
- 技能表示简化为单文件 Markdown，不支持原始 SKILL.md 格式中的脚本、资源文件或层级组合能力
- 执行器全程冻结，策展人与执行器之间可能存在能力错配，需由策展人单独补偿

## 适合沉淀的概念

`self-evolving-agents`, `procedural-memory`, `skill-curation`, `reinforcement-learning-for-agents`, `experience-driven-learning`, `modular-agent-architecture`, `long-horizon-feedback`, `composite-reward-design`

## 阅读注意

- 重点关注 3.2.1 节的任务组构建逻辑：如何通过 Gemini-2.5-Pro 标注任务属性并聚类形成训练组
- 仔细分析公式 (1) 中四项奖励的权重设置（λ_f, λ_u, λ_c）及其对策略的影响
- 注意图 17 和图 18 的案例对比：SkillOS 生成的技能更具结构性、约束明确且包含示例，而非泛化描述
- 附录 D 中关于检索机制、技能表示和执行器冻结的三点局限是未来改进的关键方向

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.06614.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置、定量结果和定性分析，包含消融对比、跨域泛化验证和案例研究，材料充分可信。
