2511.16108
论文导读
提出 SkyRL-Agent 框架,通过细粒度异步调度与工具增强训练策略,实现高效、可扩展的多轮 LLM 智能体强化学习训练,并在 SWE 任务上显著提升效率与性能。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
SkyRL-Agent:面向多轮LLM智能体的高效强化学习训练框架
一句话定位
提出 SkyRL-Agent 框架,通过细粒度异步调度与工具增强训练策略,实现高效、可扩展的多轮 LLM 智能体强化学习训练,并在 SWE 任务上显著提升效率与性能。
小学生也能听懂
这篇论文发明了一个叫SkyRL-Agent的训练系统,就像给AI机器人装上了“多任务大脑”和“高效工具包”,让它一边查代码错误一边学得更快,还能在不同任务里灵活使用工具,最终让AI修bug又快又好还省钱。
为什么值得记录
- 解决了现有 LLM 智能体训练框架在异步调度、工具集成和训练后端兼容性方面的碎片化问题
- 提出的异步流水线调度器相比朴素异步批处理实现 1.55× 加速,显著提升 GPU 利用率
- 工具增强训练策略(如 AST 搜索工具)有效缓解长程任务中的稀疏奖励问题,提升样本效率
- 训练出的 SA-SWE-32B 模型在 SWE-Bench Verified 上达到 39.4% Pass@1,成本降低超 2 倍
- 框架支持跨任务泛化,SA-SWE-32B 在 Terminal-Bench、WebArena 等基准上表现良好
核心方法
- 设计工具中心化(tool-centric)智能体循环,统一管理工具调用、环境交互与智能体状态变更操作
- 引入细粒度异步调度器(dispatcher),将单次 rollout 分解为初始化、运行、奖励计算三阶段,支持数据并行与流水线并行混合调度
- 提供三种调度策略:Async Batch(轻量任务)、Async Batch (Bounded)(资源受限环境)、Async Pipeline(高吞吐场景)
- 采用基于 transition 的数据表示,记录每次 LLM 调用的输入/输出 token 及 log prob,支持灵活奖励分配与算法扩展
- 实现后端无关的中间数据格式,无缝对接 SkyRL-train、VeRL、Tinker 等 RL 训练系统
- 在 SWE 任务中集成 AST 搜索工具并提供上下文提示,引导智能体高效定位代码缺陷
- 训练中使用全在线策略(fully on-policy)、留一法优势估计,并引入结构化提示帮助智能体从失败中恢复
关键结果
- SA-SWE-32B 在 SWE-Bench Verified 上达到 39.4% Pass@1,优于同规模开源模型
- 异步流水线调度相比 Async Batch (Bounded) 实现 1.55× 训练速度提升,GPU 利用率稳定在 90%
- 训练成本较 DeepSWE 降低 50% 以上,且无需依赖强教师模型蒸馏
- 在仅使用 bash 和文件编辑器工具的简化 ReAct 设置下仍保持高性能,展现强泛化能力
- 模型在 Terminal-Bench、BrowseComp-Plus、WebArena 等跨域任务上表现良好,验证工具使用能力的迁移性
局限与风险
- 未报告不同调度策略在更多任务类型上的系统性对比结果
- 工具增强训练依赖特定领域工具设计(如 AST 搜索),通用性需进一步验证
- 错误恢复机制主要依赖人工设计提示,缺乏自适应策略
- 跨任务评估样本量较小,泛化结论需更大规模验证
适合沉淀的概念
multi-turn-llm-agent, reinforcement-learning-from-verifiable-rewards, asynchronous-pipeline-scheduling, tool-centric-agent-loop, transition-based-data-representation, ast-based-code-search, swe-bench-verified, backend-agnostic-training
阅读注意
- 重点关注第 3.2 节中异步流水线调度器的工作原理及其性能增益分析
- 第 4.2 节中 AST 搜索工具的设计与训练效率提升机制是理解工具增强策略的关键
- 表 2 提供了与同类模型的横向对比,需注意不同模型使用的训练配方与评估设置差异
- 图 1(a) 展示了训练过程中搜索调用次数上升与非解决率下降的趋势,反映智能体学习行为演化
- 第 5 节展示了框架在 Deep Research、Computer Use 等任务上的扩展能力,体现其模块化设计价值
质量说明
- 采用来源:
clean,papers/2025/11/2511.16108.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含系统架构、方法细节、实验结果与多任务验证,数据充分且结构清晰,具备可复现性与技术深度。