论文
arXiv2512.22560
时间2025-12
来源Markdown
页面质量中文卡片
阅读量级85 分钟

2512.22560

论文导读

提出 RollArt 系统,通过硬件亲和性映射、细粒度异步执行和状态感知计算三大原则,在解耦基础设施上高效扩展多任务代理强化学习训练,实现端到端训练时间减少 1.35–2.05 倍。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

RollArt:基于解耦基础设施的代理强化学习训练扩展

一句话定位

提出 RollArt 系统,通过硬件亲和性映射、细粒度异步执行和状态感知计算三大原则,在解耦基础设施上高效扩展多任务代理强化学习训练,实现端到端训练时间减少 1.35–2.05 倍。

小学生也能听懂

这篇论文发明了一个叫RollArt的系统,就像把做作业的不同步骤(想题、写答案、检查)分给不同的“小帮手”(比如用最快的电脑算题,用省力的电脑检查),让它们同时工作,不用排队等,这样训练AI就快多了,时间能省一半左右。

为什么值得记录

  • 代理强化学习(Agentic RL)工作负载高度异构,包含计算密集型预填充、带宽受限解码和有状态环境模拟,传统单体架构难以高效支持。
  • 现有系统如 veRL、StreamRL 等仅实现部分解耦或粗粒度异步,无法充分利用专用硬件,导致资源利用率低和同步开销大。
  • RollArt 首次在解耦集群上实现轨迹级异步调度与硬件亲和性映射,显著提升吞吐量和容错能力,并在超过 3000 GPU 的生产集群中验证了其可扩展性。

核心方法

  • 采用解耦基础设施,将训练、推理、环境模拟和奖励计算分离到专用资源池(如 H800 用于训练,H20 用于解码,CPU 集群运行环境,Serverless 处理奖励)。
  • 引入硬件亲和性工作负载映射机制,允许用户按任务特性(如预填充主导或解码主导)将轨迹路由至最佳 GPU 类型(如 FrozenLake 任务分配至 H800,GEM-Math 分配至 H20)。
  • 实现细粒度异步执行:在轨迹级别交错进行 LLM 生成、环境交互和奖励计算,避免批处理导致的尾部延迟阻塞;同时支持可调异步边界以平衡梯度稳定性与吞吐量。
  • 实施状态感知计算:将无状态奖励模型卸载至阿里云函数计算(Function Compute),实现零开销弹性伸缩,提高 GPU 利用率(实验显示从 7.4% 提升至 88%)。
  • 系统基于声明式编程模型构建,使用 Python 装饰器定义硬件亲和性与 Serverless 接口,底层集成 vLLM、Megatron 等引擎,并通过 Mooncake 实现跨集群高效通信。

关键结果

  • 在 Qwen3 系列模型(8B–32B)上相比同步基线 veRL+ 实现 1.35–2.05 倍端到端训练时间加速,相比 StreamRL 提升 1.35 倍。
  • 吞吐量效率提升显著:RollArt 达到 veRL+ 的 2.65–4.58 倍,主要得益于轨迹级异步和资源优化。
  • 在 16-GPU 小规模实验中,使用 Reward-as-a-Service 后平均回滚时间从 158 秒降至 77 秒,GPU 利用率从 6% 提升至 88%。
  • 生产环境中训练数百亿参数 MoE 模型,持续运行一周,仅发生一次故障,验证了系统鲁棒性;通过缓存优化使 env.reset 成功率超过 99.99%。

局限与风险

  • 异步训练引入策略陈旧性(staleness),虽实验表明对收敛影响较小,但在某些高一致性要求的任务中仍需谨慎调参。
  • 系统依赖特定基础设施(如 InfiniBand、Mooncake 存储服务、Kubernetes 和 Serverless 平台),在通用环境中部署可能存在兼容性挑战。
  • 当前硬件亲和性需手动配置任务与 GPU 类型映射,尚未实现完全自动化感知与调度。

适合沉淀的概念

agentic-reinforcement-learning, disaggregated-infrastructure, hardware-affinity-mapping, trajectory-level-asynchrony, statefulness-aware-computation, reward-as-a-service, long-tail-environment-latency, asynchronous-rl-training

阅读注意

  • 重点关注第 3 节的工作负载特征分析,特别是环境初始化(env.reset)的长尾延迟问题及其对批处理模式的负面影响。
  • 注意表 2 中 H20 与 H800 的硬件规格对比,理解为何不同任务需匹配不同 GPU 类型。
  • 图 10 展示了端到端性能对比,需结合 bound=1 和 bound=2 的收敛差异理解异步边界的实际影响。
  • 生产部署部分(第 8 节)揭示了真实瓶颈:62% 的迭代时间消耗在等待足够轨迹填充 batch,提示未来可优化采样缓冲机制。

质量说明

  • 采用来源:rawraw/papers/2025/12/2512.22560.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的系统设计、实验验证和生产部署细节,数据充分,方法清晰,结论有支撑。