---
title: "Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning"
title_zh: "Omni-R1：面向多模态推理的统一生成范式"
arxiv_id: "2601.09536"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/01/2601.09536.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Omni-R1：面向多模态推理的统一生成范式

## 一句话定位

提出统一生成式多模态推理范式，通过中间图像生成整合多样化推理技能，并设计 Omni-R1 与 Omni-R1-Zero 框架实现功能图像生成与低标注依赖训练。

## 小学生也能听懂

这篇论文教AI像人一样边看图边思考，它让AI在解题时能自己画出圈圈、放大图或标线来帮助推理，就像你用草稿纸一样，而且不用老师教就能学会，还能在数学题和图片题上做得更好。

## 为什么值得记录

- 首次系统识别并归纳多模态任务所需的四大核心推理技能（Grounding、Auxiliary line drawing、Marking、Visual prediction），为构建通用多模态推理模型提供理论基础。
- 提出‘统一生成式多模态推理’新范式，将传统文本链式推理扩展为图文交错生成轨迹，使模型能动态生成功能性中间图像（如标注框、放大视图）辅助推理。
- 设计 Omni-R1 框架，结合感知对齐损失（PeSFT）与感知校准奖励（PeRPO），有效解决功能图像生成不稳定问题，提升多模态推理鲁棒性。
- 提出 Omni-R1-Zero，无需人工标注的交错模态数据，仅凭文本 CoT 数据通过自举可视化生成训练样本，在多项基准上达到或超越有监督方法，推动零标注多模态推理发展。

## 核心方法

- 构建 Omni-Bench 评估基准，涵盖自然场景感知、图表理解、图解数学与视觉操作四类任务，共 800 样本，系统性评测多模态推理能力。
- 定义原子视觉动作空间 A = {ZOOM-in, BBOX, MARK, LINE, PRED}，每个动作接收归一化坐标参数并输出处理后图像，构成可执行推理步骤。
- Omni-R1 采用两阶段训练：(1) PeSFT 阶段联合优化交叉熵损失与感知损失，后者通过冻结视觉码本对齐隐状态，稳定图像 token 生成；(2) PeRPO 阶段引入复合奖励函数 R = α·R_Acc + β·R_Fmt + γ·R_Pe，其中 R_Pe 基于 2D 总变差衡量生成图像感知一致性。
- Omni-R1-Zero 利用文本 CoT 数据自举合成交错模态轨迹：对每步推理生成对应图像，组装成模板化轨迹，再经相同 PeSFT+PeRPO 流程训练，消除对人工标注依赖。
- 采用组相对 PPO 算法进行策略优化，计算组内奖励均值与标准差归一化优势函数，结合 KL 正则防止策略漂移，支持长序列多模态轨迹学习。

## 关键结果

- 在 Omni-Bench 上，Omni-R1-M（Bagel 底座）平均准确率达 0.402，较基线提升 40.7%，在结构化图像与图解数学任务上表现突出。
- Omni-R1-Zero-M 在 Anole 底座上实现 0.159 平均准确率，较基线提升 95.4%，且优于多数有监督基线，证明无标注自举策略有效性。
- 在通用基准测试中，Omni-R1-L 在 MME-P（775.17）、POPE（61.84 F1）等感知与抗幻觉任务上显著领先，显示其增强的视觉证据利用能力。
- 消融实验表明，移除 PeRPO 导致 Vision-Op 任务性能下降 60%，移除感知奖励使 Natural 任务下降 19.5%，验证两组件关键作用。
- t-SNE 可视化显示 Omni-R1 生成模式更集中稳定，而 Omni-R1-Zero 分布更广但仍保持高正确率聚类，反映不同训练机制特性。

## 局限与风险

- 功能图像生成仍受限于底层多模态模型（如 Anole/Bagel）的生成能力，复杂绘图（如精确几何辅助线）可能失真。
- Omni-R1-Zero 依赖初始文本 CoT 质量，若种子推理错误可能导致错误视觉轨迹传播，影响最终性能。
- 当前感知奖励基于低级图像统计（总变差），未引入语义级评估，可能无法捕捉高级功能合理性。
- 训练成本较高，PeRPO 阶段需大量轨迹采样与奖励计算，尤其对长推理链效率较低。

## 适合沉淀的概念

`unified-generative-multimodal-reasoning`, `functional-image-generation`, `perception-aligned-supervised-fine-tuning`, `perception-calibrated-reward`, `bootstrapped-step-wise-visualization`, `interleaved-modal-reasoning`, `atomic-visual-actions`, `omni-bench-evaluation`

## 阅读注意

- 重点关注附录 A 中轨迹形式化定义与原子动作协议，理解模型如何建模多步可执行推理过程。
- 注意区分 Omni-R1（需少量标注）与 Omni-R1-Zero（零标注）的数据构造差异及各自适用场景。
- 图 4 的 t-SNE 可视化揭示了两种模型在生成分布上的本质区别：监督引导 vs 奖励探索。
- 表 6 超参设置显示极低学习率（1e-7）与强 KL 约束（0.003），反映对预训练模型稳定微调的谨慎策略。
- 规则验证器（附录 B）设计强调可靠性优先，避免 LLM judge 的主观偏差，确保奖励信号可信。

## 质量说明

- 采用来源：`clean`，`papers/2026/01/2601.09536.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，方法描述详尽，实验充分，包含消融、可视化与案例分析，数据与代码细节透明，结论有支撑。
