Paper: 2604.11554
论文导读
提出 Relax 系统,通过服务化架构、异步数据总线和全模态原生设计,解决大规模多模态 RL 训练中的异构性、鲁棒性与吞吐量-陈旧性权衡问题。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Relax:面向全模态大规模后训练的异步强化学习引擎
一句话定位
提出 Relax 系统,通过服务化架构、异步数据总线和全模态原生设计,解决大规模多模态 RL 训练中的异构性、鲁棒性与吞吐量-陈旧性权衡问题。
小学生也能听懂
这篇论文造了一个叫Relax的“超级训练引擎”,能同时处理图片、声音、视频和文字,让AI像搭积木一样分开训练不同部分,不怕出错,还能飞快学习,就像给AI开了多倍速外挂。
为什么值得记录
- 首次将全模态(图像、音频、视频、文本)支持作为 RL 训练系统的一等设计约束,而非后期适配
- 通过服务化解耦实现角色级容错与弹性扩缩容,显著提升大规模训练的操作鲁棒性
- 引入单一陈旧性参数统一控制从同步到完全异步的训练模式,简化工程部署
- 在 Qwen3-Omni-30B 上实现稳定收敛,验证了系统在多模态代理任务上的有效性
核心方法
- 采用三层正交架构:控制平面(Controller)、计算平面(独立 Ray Serve 服务)、数据平面(TransferQueue 数据总线)
- 每个 RL 角色(Actor/Critic/Rollout 等)作为独立服务部署,支持故障隔离与独立扩缩容
- 集成 TransferQueue 实现字段级异步数据流,支持微批次流式消费以消除长尾延迟阻塞
- 设计 Distributed Checkpoint Service (DCS) 实现低延迟权重同步,支持 NCCL 与 TCP 双后端
- 通过 max_staleness 参数统一调控策略陈旧性,实现 on-policy 到 off-policy 的无缝切换
- 构建全模态原生流水线:统一数据预处理、ViT 张量并行复制、Megatron Bridge 集成
- 提供代理 RL 扩展点:多轮 rollout、自定义奖励服务、工具/沙箱集成
关键结果
- 在 Qwen3-4B 上,完全异步模式相比 colocate 模式实现 1.76× 端到端加速;在 Qwen3-Omni-30B 上达 2.00× 加速
- on-policy 模式相比 veRL 实现 1.20× 加速,且所有模式收敛至相同奖励水平
- 支持 MoE 模型的 R3(Rollout Routing Replay)机制,仅引入 1.9% 开销(veRL 为 32% 性能下降)
- 在 Qwen3-Omni 上实现图像、文本、音频、视频全模态 RL 稳定收敛,持续超过 2000 步无退化
- FP16 精度相比 BF16 降低 train-rollout log-prob 差异 7.7×,加速早期收敛
局限与风险
- 服务化架构增加初始部署复杂度,小规模实验可能得不偿失
- 暂不支持生成式模态(如文生图)的 RL 训练,仅限理解任务
- 超大规模模型(>397B)验证尚未完成
- 弹性扩缩容功能已实现但未开源
适合沉淀的概念
service-oriented-rl-architecture, transferqueue-data-bus, staleness-controlled-training, omni-modal-rl-pipeline, distributed-checkpoint-service, field-level-data-decoupling, agentic-rl-extension, moe-rl-stability-r3
阅读注意
- 重点关注图 1 的系统架构图与图 3 的三种训练模式时序对比
- 理解 TransferQueue 的字段级存储如何支持异构模态的异步处理
- 注意 DCS 的双传输后端设计如何应对同集群与跨集群场景
- 分析 max_staleness 参数如何实现生产者自调节而非中心化协调
- 查看附录 B.2 中代理 RL 的 S 型收敛曲线验证多轮轨迹正确性
质量说明
- 采用来源:
clean,papers/2026/04/2604.11554.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含系统架构、实验验证、消融分析与局限性讨论,数据详实且开源代码可用。