论文导读
提出 RLDX-1,一种基于多流动作变换器(MSAT)的通用机器人策略,通过整合运动感知、长期记忆和物理传感等超越通用智能的功能能力,在复杂现实世界灵巧操作任务中显著优于现有 VLA 模型。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
RLDX-1:面向灵巧操作的多功能通用机器人策略
一句话定位
提出 RLDX-1,一种基于多流动作变换器(MSAT)的通用机器人策略,通过整合运动感知、长期记忆和物理传感等超越通用智能的功能能力,在复杂现实世界灵巧操作任务中显著优于现有 VLA 模型。
小学生也能听懂
RLDX-1 是一个让机器人更聪明的“大脑”。它不仅像其他模型一样能看懂图像和听懂指令,还特别擅长处理动态场景(比如移动的传送带)、记住过去发生的事情(比如玩猜杯子游戏),以及感知触觉和力矩等物理信号。它通过一种叫 MSAT 的新架构把这些能力融合在一起,并在仿真和真实机器人上都取得了更好的表现。
为什么值得记录
- 解决了现有 VLA 模型在动态环境、长时记忆和接触感知等现实任务中的关键短板
- 提出了统一的多模态架构 MSAT,可扩展地集成异构输入(视觉、语言、物理信号)
- 设计了包含合成数据生成、三阶段训练和推理优化的完整系统级解决方案
- 在 ALLEX 人形机器人等平台上实现了显著更高的成功率(如 86.8% vs 40%)
核心方法
- 采用 Qwen3-VL 8B 作为基础 VLM,并通过机器人场景 VQA 微调增强 embodied grounding
- 引入认知 token(cognition tokens)从 VLM 中间层提取动作相关特征
- 构建 Multi-Stream Action Transformer (MSAT),为不同模态(认知、动作、物理)分配独立流并通过联合自注意力交互
- 增加三个功能模块:运动感知(STSS 时空自相似性)、长期记忆(缓存历史认知特征)、物理传感(预测未来触觉/力矩)
- 使用 flow-matching 扩散模型作为动作生成器,支持动作 chunk 预测
- 三阶段训练:多 embodiment 预训练 → embodiment 特定 mid-training → 任务特定 post-training
- 合成数据管道结合视频生成模型与 motion-consistency filtering 提升稀有场景覆盖率
关键结果
- 在 GR-1 Tabletop 仿真基准上达到 58.7% 成功率,优于 GR00T N1.6 的 47.6%
- 在 ALLEX 人形机器人 Object-in-Box Selection 任务中达 91.7% 成功率,远超 π₀.₅ 和 GR00T N1.6 的 ~30%
- 在 Conveyor Pick-and-Place 动态任务中达 87.5% 成功率,而 π₀.₅ 低于 29.2%
- 推理优化后延迟从 71.2ms 降至 43.7ms(1.63× 加速)
- 合成数据使 Pot-to-Cup Pouring 抓取任务成功率从 66.7% 提升至 83.3%
局限与风险
- 物理传感依赖特定硬件(如 AnySkin 触觉传感器),泛化性受限
- 长期记忆模块仅缓存有限步数(n_mem=3),可能不足以处理极长程任务
- 合成数据质量仍依赖过滤机制,存在错误标注风险
- 未公开完整训练代码与数据,复现难度较高
适合沉淀的概念
vision-language-action-model, multi-stream-action-transformer, motion-awareness, long-term-memory, physical-sensing, flow-matching, synthetic-data-generation, inference-optimization
阅读注意
- 重点关注 MSAT 如何扩展 MM-DiT 实现跨模态交互
- 注意三阶段训练中各阶段的数据构成与优化目标差异
- 理解 motion-consistency filtering 如何提升合成数据质量
- 对比 RLDX-1 与 π₀.₅、GR00T N1.6 在功能能力上的设计差异
- 关注附录中 batch size 对性能的影响(1024 vs 64)
质量说明
- 采用来源:
raw,raw/papers/2026/05/2605.03269.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了详细的架构设计、训练流程和实验结果,包含消融分析和完整 benchmark 数据。尽管部分实现细节(如 exact model size)未明确,但整体信息充分支持结论。