---
title: "SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent"
title_zh: "SkyRL-Agent：面向多轮LLM智能体的高效强化学习训练框架"
arxiv_id: "2511.16108"
paper_type: "system"
source_kind: "clean"
raw_path: "raw/papers/2025/11/2511.16108.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# SkyRL-Agent：面向多轮LLM智能体的高效强化学习训练框架

## 一句话定位

提出 SkyRL-Agent 框架，通过细粒度异步调度与工具增强训练策略，实现高效、可扩展的多轮 LLM 智能体强化学习训练，并在 SWE 任务上显著提升效率与性能。

## 小学生也能听懂

这篇论文发明了一个叫SkyRL-Agent的训练系统，就像给AI机器人装上了“多任务大脑”和“高效工具包”，让它一边查代码错误一边学得更快，还能在不同任务里灵活使用工具，最终让AI修bug又快又好还省钱。

## 为什么值得记录

- 解决了现有 LLM 智能体训练框架在异步调度、工具集成和训练后端兼容性方面的碎片化问题
- 提出的异步流水线调度器相比朴素异步批处理实现 1.55× 加速，显著提升 GPU 利用率
- 工具增强训练策略（如 AST 搜索工具）有效缓解长程任务中的稀疏奖励问题，提升样本效率
- 训练出的 SA-SWE-32B 模型在 SWE-Bench Verified 上达到 39.4% Pass@1，成本降低超 2 倍
- 框架支持跨任务泛化，SA-SWE-32B 在 Terminal-Bench、WebArena 等基准上表现良好

## 核心方法

- 设计工具中心化（tool-centric）智能体循环，统一管理工具调用、环境交互与智能体状态变更操作
- 引入细粒度异步调度器（dispatcher），将单次 rollout 分解为初始化、运行、奖励计算三阶段，支持数据并行与流水线并行混合调度
- 提供三种调度策略：Async Batch（轻量任务）、Async Batch (Bounded)（资源受限环境）、Async Pipeline（高吞吐场景）
- 采用基于 transition 的数据表示，记录每次 LLM 调用的输入/输出 token 及 log prob，支持灵活奖励分配与算法扩展
- 实现后端无关的中间数据格式，无缝对接 SkyRL-train、VeRL、Tinker 等 RL 训练系统
- 在 SWE 任务中集成 AST 搜索工具并提供上下文提示，引导智能体高效定位代码缺陷
- 训练中使用全在线策略（fully on-policy）、留一法优势估计，并引入结构化提示帮助智能体从失败中恢复

## 关键结果

- SA-SWE-32B 在 SWE-Bench Verified 上达到 39.4% Pass@1，优于同规模开源模型
- 异步流水线调度相比 Async Batch (Bounded) 实现 1.55× 训练速度提升，GPU 利用率稳定在 90%
- 训练成本较 DeepSWE 降低 50% 以上，且无需依赖强教师模型蒸馏
- 在仅使用 bash 和文件编辑器工具的简化 ReAct 设置下仍保持高性能，展现强泛化能力
- 模型在 Terminal-Bench、BrowseComp-Plus、WebArena 等跨域任务上表现良好，验证工具使用能力的迁移性

## 局限与风险

- 未报告不同调度策略在更多任务类型上的系统性对比结果
- 工具增强训练依赖特定领域工具设计（如 AST 搜索），通用性需进一步验证
- 错误恢复机制主要依赖人工设计提示，缺乏自适应策略
- 跨任务评估样本量较小，泛化结论需更大规模验证

## 适合沉淀的概念

`multi-turn-llm-agent`, `reinforcement-learning-from-verifiable-rewards`, `asynchronous-pipeline-scheduling`, `tool-centric-agent-loop`, `transition-based-data-representation`, `ast-based-code-search`, `swe-bench-verified`, `backend-agnostic-training`

## 阅读注意

- 重点关注第 3.2 节中异步流水线调度器的工作原理及其性能增益分析
- 第 4.2 节中 AST 搜索工具的设计与训练效率提升机制是理解工具增强策略的关键
- 表 2 提供了与同类模型的横向对比，需注意不同模型使用的训练配方与评估设置差异
- 图 1(a) 展示了训练过程中搜索调用次数上升与非解决率下降的趋势，反映智能体学习行为演化
- 第 5 节展示了框架在 Deep Research、Computer Use 等任务上的扩展能力，体现其模块化设计价值

## 质量说明

- 采用来源：`clean`，`papers/2025/11/2511.16108.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含系统架构、方法细节、实验结果与多任务验证，数据充分且结构清晰，具备可复现性与技术深度。
