论文
arXiv2605.06614
时间2026-05
来源Markdown
页面质量中文卡片
阅读量级194 分钟

论文导读

提出 SkillOS,一种基于强化学习的经验驱动训练范式,用于让 LLM 代理学会从任务流中持续提取、更新和复用可重用技能,实现长期自我进化。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

SkillOS:面向自进化代理的技能策展学习框架

一句话定位

提出 SkillOS,一种基于强化学习的经验驱动训练范式,用于让 LLM 代理学会从任务流中持续提取、更新和复用可重用技能,实现长期自我进化。

小学生也能听懂

就像一个学生不断整理错题本,SkillOS 让 AI 代理每完成一个任务后,自动总结出有用的‘解题技巧’(技能),存到‘技能库’里。后续遇到类似任务时,它能快速找到并应用这些技巧,越做越聪明。

为什么值得记录

  • 解决了现有 LLM 代理在流式任务中无法有效积累和复用经验的根本问题,推动从‘一次性求解器’向‘持续进化体’转变
  • 首次将技能策展建模为长视距强化学习问题,通过任务分组和复合奖励机制,使模型能学习复杂技能管理操作(如更新、删除)
  • 在 ALFWorld 和数学推理任务上均显著优于无记忆和强记忆基线,最高提升 9.8% 成功率,减少 6.0% 交互步数
  • 训练出的技能策展人展现出跨执行器和任务域的泛化能力,甚至优于直接使用 Gemini-2.5-Pro 作为策展人

核心方法

  • 采用模块化多代理设计:冻结的 Agent Executor 负责执行任务,可训练的 Skill Curator 负责更新外部 SkillRepo
  • 技能以 Markdown 格式存储(含 YAML 前置元数据和正文指令),通过文件 I/O 操作模拟操作系统式管理
  • 构建任务组作为训练单元:每组包含多个相关任务,前序任务的技能更新直接影响后续任务表现,提供长视距反馈信号
  • 设计四部分复合奖励函数:任务成功率、函数调用有效性、技能内容质量(由 Qwen3-32B 评判)、技能库压缩率(防冗余)
  • 使用 GRPO 算法优化策展人策略,优势函数基于整组任务的复合奖励计算,鼓励探索性策略更新

关键结果

  • 在 ALFWorld 基准测试中,SkillOS 平均成功率(Avg. SR)达 73.1%,显著高于最强基线 ReasoningBank 的 66.0%
  • 交互效率更高:SkillOS 平均仅需 15.5 步,比 ReasoningBank 减少 2.1 步(-12%)
  • 跨执行器泛化:当 Executor 从 Qwen3-8B 切换至 Gemini-2.5-Pro 时,SkillOS 策展人仍能提升性能
  • 小模型优势:8B 参数的 SkillOS 策展人性能优于直接使用 2.5-Pro 模型作为策展人
  • 技能演化分析显示:随时间推移,SkillRepo 中技能结构更丰富,出现高阶元技能(meta-skills)

局限与风险

  • 依赖 BM25 关键词检索,未优化技能检索环节,可能限制高相关性技能的召回
  • 技能表示简化为单文件 Markdown,不支持原始 SKILL.md 格式中的脚本、资源文件或层级组合能力
  • 执行器全程冻结,策展人与执行器之间可能存在能力错配,需由策展人单独补偿

适合沉淀的概念

self-evolving-agents, procedural-memory, skill-curation, reinforcement-learning-for-agents, experience-driven-learning, modular-agent-architecture, long-horizon-feedback, composite-reward-design

阅读注意

  • 重点关注 3.2.1 节的任务组构建逻辑:如何通过 Gemini-2.5-Pro 标注任务属性并聚类形成训练组
  • 仔细分析公式 (1) 中四项奖励的权重设置(λ_f, λ_u, λ_c)及其对策略的影响
  • 注意图 17 和图 18 的案例对比:SkillOS 生成的技能更具结构性、约束明确且包含示例,而非泛化描述
  • 附录 D 中关于检索机制、技能表示和执行器冻结的三点局限是未来改进的关键方向

质量说明

  • 采用来源:rawraw/papers/2026/05/2605.06614.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、实验设置、定量结果和定性分析,包含消融对比、跨域泛化验证和案例研究,材料充分可信。