论文
arXiv2605.03269
时间2026-05
来源Markdown
页面质量中文卡片
阅读量级239 分钟

论文导读

提出 RLDX-1,一种基于多流动作变换器(MSAT)的通用机器人策略,通过整合运动感知、长期记忆和物理传感等超越通用智能的功能能力,在复杂现实世界灵巧操作任务中显著优于现有 VLA 模型。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

RLDX-1:面向灵巧操作的多功能通用机器人策略

一句话定位

提出 RLDX-1,一种基于多流动作变换器(MSAT)的通用机器人策略,通过整合运动感知、长期记忆和物理传感等超越通用智能的功能能力,在复杂现实世界灵巧操作任务中显著优于现有 VLA 模型。

小学生也能听懂

RLDX-1 是一个让机器人更聪明的“大脑”。它不仅像其他模型一样能看懂图像和听懂指令,还特别擅长处理动态场景(比如移动的传送带)、记住过去发生的事情(比如玩猜杯子游戏),以及感知触觉和力矩等物理信号。它通过一种叫 MSAT 的新架构把这些能力融合在一起,并在仿真和真实机器人上都取得了更好的表现。

为什么值得记录

  • 解决了现有 VLA 模型在动态环境、长时记忆和接触感知等现实任务中的关键短板
  • 提出了统一的多模态架构 MSAT,可扩展地集成异构输入(视觉、语言、物理信号)
  • 设计了包含合成数据生成、三阶段训练和推理优化的完整系统级解决方案
  • 在 ALLEX 人形机器人等平台上实现了显著更高的成功率(如 86.8% vs 40%)

核心方法

  • 采用 Qwen3-VL 8B 作为基础 VLM,并通过机器人场景 VQA 微调增强 embodied grounding
  • 引入认知 token(cognition tokens)从 VLM 中间层提取动作相关特征
  • 构建 Multi-Stream Action Transformer (MSAT),为不同模态(认知、动作、物理)分配独立流并通过联合自注意力交互
  • 增加三个功能模块:运动感知(STSS 时空自相似性)、长期记忆(缓存历史认知特征)、物理传感(预测未来触觉/力矩)
  • 使用 flow-matching 扩散模型作为动作生成器,支持动作 chunk 预测
  • 三阶段训练:多 embodiment 预训练 → embodiment 特定 mid-training → 任务特定 post-training
  • 合成数据管道结合视频生成模型与 motion-consistency filtering 提升稀有场景覆盖率

关键结果

  • 在 GR-1 Tabletop 仿真基准上达到 58.7% 成功率,优于 GR00T N1.6 的 47.6%
  • 在 ALLEX 人形机器人 Object-in-Box Selection 任务中达 91.7% 成功率,远超 π₀.₅ 和 GR00T N1.6 的 ~30%
  • 在 Conveyor Pick-and-Place 动态任务中达 87.5% 成功率,而 π₀.₅ 低于 29.2%
  • 推理优化后延迟从 71.2ms 降至 43.7ms(1.63× 加速)
  • 合成数据使 Pot-to-Cup Pouring 抓取任务成功率从 66.7% 提升至 83.3%

局限与风险

  • 物理传感依赖特定硬件(如 AnySkin 触觉传感器),泛化性受限
  • 长期记忆模块仅缓存有限步数(n_mem=3),可能不足以处理极长程任务
  • 合成数据质量仍依赖过滤机制,存在错误标注风险
  • 未公开完整训练代码与数据,复现难度较高

适合沉淀的概念

vision-language-action-model, multi-stream-action-transformer, motion-awareness, long-term-memory, physical-sensing, flow-matching, synthetic-data-generation, inference-optimization

阅读注意

  • 重点关注 MSAT 如何扩展 MM-DiT 实现跨模态交互
  • 注意三阶段训练中各阶段的数据构成与优化目标差异
  • 理解 motion-consistency filtering 如何提升合成数据质量
  • 对比 RLDX-1 与 π₀.₅、GR00T N1.6 在功能能力上的设计差异
  • 关注附录中 batch size 对性能的影响(1024 vs 64)

质量说明

  • 采用来源:rawraw/papers/2026/05/2605.03269.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了详细的架构设计、训练流程和实验结果,包含消融分析和完整 benchmark 数据。尽管部分实现细节(如 exact model size)未明确,但整体信息充分支持结论。