MolmoAct2 Action Reasoning Models for Real-World Deployment
论文导读
提出 MolmoAct2,一个完全开源、支持多平台部署的动作推理模型,通过专用 VLM 主干、高质量数据集、高效动作 tokenizer 和新架构设计,在真实机器人任务中显著优于现有基线。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
MolmoAct2:面向真实世界部署的动作推理模型
一句话定位
提出 MolmoAct2,一个完全开源、支持多平台部署的动作推理模型,通过专用 VLM 主干、高质量数据集、高效动作 tokenizer 和新架构设计,在真实机器人任务中显著优于现有基线。
小学生也能听懂
这篇论文造了一个能看懂图像、听懂指令并控制机器人手臂做家务的 AI 模型。它用了新的视觉理解模块、三个新收集的机器人数据集,还设计了一种更聪明的方式让模型只对变化的部分进行思考,从而更快地做出动作。最重要的是,所有代码、模型和数据都公开了,别人也能用。
为什么值得记录
- 首个完全开源(模型、代码、数据全公开)且可在多种真实机器人平台上开箱即用的 VLA 模型
- 提出 Molmo2-ER 专用视觉-语言主干,在 13 项具身推理基准上超越 GPT-5 和 Gemini Robotics ER-1.5
- 发布迄今最大的开源双臂操作数据集(720 小时,34.5k 轨迹),填补社区空白
- 设计 per-layer KV 条件化架构,有效连接离散推理与连续动作生成
- 引入自适应深度推理(MolmoAct2-Think),利用时序冗余降低延迟,同时保持几何 grounding
核心方法
- 构建 Molmo2-ER:基于 MOLMO2 微调,使用 3.3M 样本的专用具身推理语料库,采用‘专业化-再排练’两阶段训练策略
- 发布三个新机器人数据集:MolmoAct2-BimanualYAM(720 小时双臂操作)、MolmoAct2-SO100/101(过滤+重标注)、MolmoAct2-DROID(过滤 Franka 子集)
- 训练 MolmoAct2-FastTokenizer:开源多体现动作 tokenizer,将 32 维连续动作压缩为紧凑离散序列
- 设计新 VLA 架构:用 flow-matching 目标训练 DiT 风格连续动作专家,并通过 per-layer key-value 条件化与 VLM 连接
- 提出 MolmoAct2-Think:仅对帧间变化的场景区域重新预测深度 token,减少冗余计算
- 三阶段训练流程:预训练(离散自回归策略)、后训练(联合离散+连续监督)、部署(平台微调+推理优化)
关键结果
- 在 7 个仿真与真实世界基准测试中,MolmoAct2 全面超越 π₀.₅、xVLA、OpenVLA 等强基线
- Molmo2-ER 在 13 项具身推理基准上平均得分 63.8%,超越 GPT-5 和 Gemini Robotics ER-1.5
- 在 Bimanual YAM 真实评估中,8 项任务平均成功率 50.6%,显著高于 π₀.₅ 的 32.2%
- 在 SO-100 零样本测试中,平均成功率 56.7%,优于对比模型
- MolmoAct2-Think 在保持性能的同时提供额外可解释性,并降低推理延迟
局限与风险
- 动作以固定长度块(chunk)预测并开环执行,块间缺乏平滑性约束,可能导致速度/加速度不连续
- 当前零样本部署能力局限于训练数据覆盖的三种平台(YAM、SO-100/101、DROID Franka),迁移至其他机器人需目标平台微调
- 依赖高质量遥操作数据,未解决低质量或失败轨迹的鲁棒学习问题
- 自适应推理虽减少计算,但仍需完整前向传播,实时闭环响应能力有限
适合沉淀的概念
vision-language-action-model, embodied-reasoning, action-tokenizer, flow-matching, per-layer-kv-conditioning, adaptive-depth-reasoning, bimanual-manipulation, open-vla
阅读注意
- 关注 Molmo2-ER 的‘专业化-再排练’训练策略如何平衡通用视觉理解与具身推理能力
- 注意三个新数据集的质量控制方法:BimanualYAM 的采集协议、SO-100/101 的四阶段过滤、DROID 的 idle-frame 过滤与语言重标注
- 理解 per-layer KV 条件化与传统 hidden state 条件化的区别及其对模型性能的影响
- 分析 MolmoAct2-Think 如何利用轨迹级时序冗余实现高效推理
- 查看附录中的语言重标注 prompt 设计,了解如何提升指令多样性
质量说明
- 采用来源:
raw,raw/papers/2026/05/2605.02881.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的模型架构、训练流程、数据集统计和实验结果,包含消融研究和错误分析。所有核心组件(模型权重、代码、数据)均承诺开源,材料充分可信。