---
title: ""
title_zh: "RLDX-1：面向灵巧操作的多功能通用机器人策略"
arxiv_id: "2605.03269"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.03269.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# RLDX-1：面向灵巧操作的多功能通用机器人策略

## 一句话定位

提出 RLDX-1，一种基于多流动作变换器（MSAT）的通用机器人策略，通过整合运动感知、长期记忆和物理传感等超越通用智能的功能能力，在复杂现实世界灵巧操作任务中显著优于现有 VLA 模型。

## 小学生也能听懂

RLDX-1 是一个让机器人更聪明的“大脑”。它不仅像其他模型一样能看懂图像和听懂指令，还特别擅长处理动态场景（比如移动的传送带）、记住过去发生的事情（比如玩猜杯子游戏），以及感知触觉和力矩等物理信号。它通过一种叫 MSAT 的新架构把这些能力融合在一起，并在仿真和真实机器人上都取得了更好的表现。

## 为什么值得记录

- 解决了现有 VLA 模型在动态环境、长时记忆和接触感知等现实任务中的关键短板
- 提出了统一的多模态架构 MSAT，可扩展地集成异构输入（视觉、语言、物理信号）
- 设计了包含合成数据生成、三阶段训练和推理优化的完整系统级解决方案
- 在 ALLEX 人形机器人等平台上实现了显著更高的成功率（如 86.8% vs 40%）

## 核心方法

- 采用 Qwen3-VL 8B 作为基础 VLM，并通过机器人场景 VQA 微调增强 embodied grounding
- 引入认知 token（cognition tokens）从 VLM 中间层提取动作相关特征
- 构建 Multi-Stream Action Transformer (MSAT)，为不同模态（认知、动作、物理）分配独立流并通过联合自注意力交互
- 增加三个功能模块：运动感知（STSS 时空自相似性）、长期记忆（缓存历史认知特征）、物理传感（预测未来触觉/力矩）
- 使用 flow-matching 扩散模型作为动作生成器，支持动作 chunk 预测
- 三阶段训练：多 embodiment 预训练 → embodiment 特定 mid-training → 任务特定 post-training
- 合成数据管道结合视频生成模型与 motion-consistency filtering 提升稀有场景覆盖率

## 关键结果

- 在 GR-1 Tabletop 仿真基准上达到 58.7% 成功率，优于 GR00T N1.6 的 47.6%
- 在 ALLEX 人形机器人 Object-in-Box Selection 任务中达 91.7% 成功率，远超 π₀.₅ 和 GR00T N1.6 的 ~30%
- 在 Conveyor Pick-and-Place 动态任务中达 87.5% 成功率，而 π₀.₅ 低于 29.2%
- 推理优化后延迟从 71.2ms 降至 43.7ms（1.63× 加速）
- 合成数据使 Pot-to-Cup Pouring 抓取任务成功率从 66.7% 提升至 83.3%

## 局限与风险

- 物理传感依赖特定硬件（如 AnySkin 触觉传感器），泛化性受限
- 长期记忆模块仅缓存有限步数（n_mem=3），可能不足以处理极长程任务
- 合成数据质量仍依赖过滤机制，存在错误标注风险
- 未公开完整训练代码与数据，复现难度较高

## 适合沉淀的概念

`vision-language-action-model`, `multi-stream-action-transformer`, `motion-awareness`, `long-term-memory`, `physical-sensing`, `flow-matching`, `synthetic-data-generation`, `inference-optimization`

## 阅读注意

- 重点关注 MSAT 如何扩展 MM-DiT 实现跨模态交互
- 注意三阶段训练中各阶段的数据构成与优化目标差异
- 理解 motion-consistency filtering 如何提升合成数据质量
- 对比 RLDX-1 与 π₀.₅、GR00T N1.6 在功能能力上的设计差异
- 关注附录中 batch size 对性能的影响（1024 vs 64）

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.03269.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了详细的架构设计、训练流程和实验结果，包含消融分析和完整 benchmark 数据。尽管部分实现细节（如 exact model size）未明确，但整体信息充分支持结论。
