---
title: "Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale"
title_zh: "Relax：面向全模态大规模后训练的异步强化学习引擎"
arxiv_id: "2604.11554"
paper_type: "system"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.11554.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Relax：面向全模态大规模后训练的异步强化学习引擎

## 一句话定位

提出 Relax 系统，通过服务化架构、异步数据总线和全模态原生设计，解决大规模多模态 RL 训练中的异构性、鲁棒性与吞吐量-陈旧性权衡问题。

## 小学生也能听懂

这篇论文造了一个叫Relax的“超级训练引擎”，能同时处理图片、声音、视频和文字，让AI像搭积木一样分开训练不同部分，不怕出错，还能飞快学习，就像给AI开了多倍速外挂。

## 为什么值得记录

- 首次将全模态（图像、音频、视频、文本）支持作为 RL 训练系统的一等设计约束，而非后期适配
- 通过服务化解耦实现角色级容错与弹性扩缩容，显著提升大规模训练的操作鲁棒性
- 引入单一陈旧性参数统一控制从同步到完全异步的训练模式，简化工程部署
- 在 Qwen3-Omni-30B 上实现稳定收敛，验证了系统在多模态代理任务上的有效性

## 核心方法

- 采用三层正交架构：控制平面（Controller）、计算平面（独立 Ray Serve 服务）、数据平面（TransferQueue 数据总线）
- 每个 RL 角色（Actor/Critic/Rollout 等）作为独立服务部署，支持故障隔离与独立扩缩容
- 集成 TransferQueue 实现字段级异步数据流，支持微批次流式消费以消除长尾延迟阻塞
- 设计 Distributed Checkpoint Service (DCS) 实现低延迟权重同步，支持 NCCL 与 TCP 双后端
- 通过 max_staleness 参数统一调控策略陈旧性，实现 on-policy 到 off-policy 的无缝切换
- 构建全模态原生流水线：统一数据预处理、ViT 张量并行复制、Megatron Bridge 集成
- 提供代理 RL 扩展点：多轮 rollout、自定义奖励服务、工具/沙箱集成

## 关键结果

- 在 Qwen3-4B 上，完全异步模式相比 colocate 模式实现 1.76× 端到端加速；在 Qwen3-Omni-30B 上达 2.00× 加速
- on-policy 模式相比 veRL 实现 1.20× 加速，且所有模式收敛至相同奖励水平
- 支持 MoE 模型的 R3（Rollout Routing Replay）机制，仅引入 1.9% 开销（veRL 为 32% 性能下降）
- 在 Qwen3-Omni 上实现图像、文本、音频、视频全模态 RL 稳定收敛，持续超过 2000 步无退化
- FP16 精度相比 BF16 降低 train-rollout log-prob 差异 7.7×，加速早期收敛

## 局限与风险

- 服务化架构增加初始部署复杂度，小规模实验可能得不偿失
- 暂不支持生成式模态（如文生图）的 RL 训练，仅限理解任务
- 超大规模模型（>397B）验证尚未完成
- 弹性扩缩容功能已实现但未开源

## 适合沉淀的概念

`service-oriented-rl-architecture`, `transferqueue-data-bus`, `staleness-controlled-training`, `omni-modal-rl-pipeline`, `distributed-checkpoint-service`, `field-level-data-decoupling`, `agentic-rl-extension`, `moe-rl-stability-r3`

## 阅读注意

- 重点关注图 1 的系统架构图与图 3 的三种训练模式时序对比
- 理解 TransferQueue 的字段级存储如何支持异构模态的异步处理
- 注意 DCS 的双传输后端设计如何应对同集群与跨集群场景
- 分析 max_staleness 参数如何实现生产者自调节而非中心化协调
- 查看附录 B.2 中代理 RL 的 S 型收敛曲线验证多轮轨迹正确性

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.11554.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含系统架构、实验验证、消融分析与局限性讨论，数据详实且开源代码可用。
