---
title: "MolmoAct2 Action Reasoning Models for Real-World Deployment"
title_zh: "MolmoAct2：面向真实世界部署的动作推理模型"
arxiv_id: "2605.02881"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.02881.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# MolmoAct2：面向真实世界部署的动作推理模型

## 一句话定位

提出 MolmoAct2，一个完全开源、支持多平台部署的动作推理模型，通过专用 VLM 主干、高质量数据集、高效动作 tokenizer 和新架构设计，在真实机器人任务中显著优于现有基线。

## 小学生也能听懂

这篇论文造了一个能看懂图像、听懂指令并控制机器人手臂做家务的 AI 模型。它用了新的视觉理解模块、三个新收集的机器人数据集，还设计了一种更聪明的方式让模型只对变化的部分进行思考，从而更快地做出动作。最重要的是，所有代码、模型和数据都公开了，别人也能用。

## 为什么值得记录

- 首个完全开源（模型、代码、数据全公开）且可在多种真实机器人平台上开箱即用的 VLA 模型
- 提出 Molmo2-ER 专用视觉-语言主干，在 13 项具身推理基准上超越 GPT-5 和 Gemini Robotics ER-1.5
- 发布迄今最大的开源双臂操作数据集（720 小时，34.5k 轨迹），填补社区空白
- 设计 per-layer KV 条件化架构，有效连接离散推理与连续动作生成
- 引入自适应深度推理（MolmoAct2-Think），利用时序冗余降低延迟，同时保持几何 grounding

## 核心方法

- 构建 Molmo2-ER：基于 MOLMO2 微调，使用 3.3M 样本的专用具身推理语料库，采用‘专业化-再排练’两阶段训练策略
- 发布三个新机器人数据集：MolmoAct2-BimanualYAM（720 小时双臂操作）、MolmoAct2-SO100/101（过滤+重标注）、MolmoAct2-DROID（过滤 Franka 子集）
- 训练 MolmoAct2-FastTokenizer：开源多体现动作 tokenizer，将 32 维连续动作压缩为紧凑离散序列
- 设计新 VLA 架构：用 flow-matching 目标训练 DiT 风格连续动作专家，并通过 per-layer key-value 条件化与 VLM 连接
- 提出 MolmoAct2-Think：仅对帧间变化的场景区域重新预测深度 token，减少冗余计算
- 三阶段训练流程：预训练（离散自回归策略）、后训练（联合离散+连续监督）、部署（平台微调+推理优化）

## 关键结果

- 在 7 个仿真与真实世界基准测试中，MolmoAct2 全面超越 π₀.₅、xVLA、OpenVLA 等强基线
- Molmo2-ER 在 13 项具身推理基准上平均得分 63.8%，超越 GPT-5 和 Gemini Robotics ER-1.5
- 在 Bimanual YAM 真实评估中，8 项任务平均成功率 50.6%，显著高于 π₀.₅ 的 32.2%
- 在 SO-100 零样本测试中，平均成功率 56.7%，优于对比模型
- MolmoAct2-Think 在保持性能的同时提供额外可解释性，并降低推理延迟

## 局限与风险

- 动作以固定长度块（chunk）预测并开环执行，块间缺乏平滑性约束，可能导致速度/加速度不连续
- 当前零样本部署能力局限于训练数据覆盖的三种平台（YAM、SO-100/101、DROID Franka），迁移至其他机器人需目标平台微调
- 依赖高质量遥操作数据，未解决低质量或失败轨迹的鲁棒学习问题
- 自适应推理虽减少计算，但仍需完整前向传播，实时闭环响应能力有限

## 适合沉淀的概念

`vision-language-action-model`, `embodied-reasoning`, `action-tokenizer`, `flow-matching`, `per-layer-kv-conditioning`, `adaptive-depth-reasoning`, `bimanual-manipulation`, `open-vla`

## 阅读注意

- 关注 Molmo2-ER 的‘专业化-再排练’训练策略如何平衡通用视觉理解与具身推理能力
- 注意三个新数据集的质量控制方法：BimanualYAM 的采集协议、SO-100/101 的四阶段过滤、DROID 的 idle-frame 过滤与语言重标注
- 理解 per-layer KV 条件化与传统 hidden state 条件化的区别及其对模型性能的影响
- 分析 MolmoAct2-Think 如何利用轨迹级时序冗余实现高效推理
- 查看附录中的语言重标注 prompt 设计，了解如何提升指令多样性

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.02881.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的模型架构、训练流程、数据集统计和实验结果，包含消融研究和错误分析。所有核心组件（模型权重、代码、数据）均承诺开源，材料充分可信。
