---
title: "Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap"
title_zh: "视觉语言模型是否真正进行视觉推理？模态差距的严格研究"
arxiv_id: "2604.16256"
paper_type: "benchmark"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.16256.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 视觉语言模型是否真正进行视觉推理？模态差距的严格研究

## 一句话定位

提出 CrossMath 基准，通过跨模态等价任务揭示当前 VLM 在视觉推理上依赖文本捷径，并验证后训练可缩小模态差距。

## 小学生也能听懂

这篇论文像做实验一样，给AI出了同一道数学题的三种形式（只看图、只看字、看图又看字），发现它其实靠文字猜答案，不会看图思考；后来用专门训练让它学会看图解题，成绩就变好了。

## 为什么值得记录

- 首次构建严格跨模态等价的视觉推理基准 CrossMath，支持图像、文本及多模态输入的公平比较
- 实证发现主流 VLM 在 text-only 输入下表现最佳，加入视觉信息反而降低性能，暴露其缺乏真正的视觉 grounding
- 提出基于图像-only 数据的 SFT + RLVR 后训练策略，显著提升视觉推理能力并实现跨任务泛化
- 为评估和提升 VLM 的视觉推理能力提供了方法论和可复现工具链

## 核心方法

- 设计 CrossMath 任务：2D 网格中交叉数学方程补全，要求顺序输出缺失值，天然依赖空间几何推理
- 构建三模态等价样本：每个问题生成 image-only、text-only（Markdown 表格）、image+text 三种格式，确保信息一致
- 自动化数据流水线：从网页抓取图像 → OCR 转 Markdown → 符号化解题路径提取 → 视觉风格增强（去边框、复杂背景、字体变化）
- 后训练策略：使用 5,000 个图像样本对 Qwen3.5-9B 进行 LoRA-SFT，再通过 GRPO 进行 RLVR，奖励函数采用位置加权准确率
- 评估指标：Micro Accuracy（单题正确率）、Macro Accuracy（全题正确率）、K-Hop Accuracy（按推理步数分层）

## 关键结果

- 在 250 个测试样本上，SOTA VLMs（如 Qwen3-VL）在 text-only 设置下 Macro Acc 达 ~60%，而 image-only 下仅 ~20%，存在显著模态差距
- 加入图像信息（image+text）相比纯文本输入性能下降 5–10%，表明视觉输入未被有效利用甚至干扰推理
- 对 Qwen3.5-9B 进行 CrossMath 后训练后，image-only 设置下 Macro Acc 提升至 48.6%，接近 text-only 水平
- 后训练模型在外部数学视觉任务（如 MathVerse）上保持原有能力并获得 3–5% 的稳定增益
- 风格增强测试显示，原始模型对视觉模板敏感，而后训练模型在去边框、复杂背景等变体上鲁棒性显著提升

## 局限与风险

- CrossMath 任务局限于结构化数学网格，可能无法完全代表开放域视觉推理（如自然场景理解）
- 后训练仅在一个模型（Qwen3.5-9B）上验证，未测试其他架构的通用性
- RLVR 的奖励依赖最终答案正确性，缺乏对中间推理步骤的细粒度监督
- 数据集规模较小（250 测试样本），尽管有人工校验，但仍可能影响统计显著性

## 适合沉淀的概念

`crossmath-benchmark`, `modality-gap-in-vlms`, `visual-reasoning-evaluation`, `cross-modal-equivalence`, `reinforcement-learning-with-verifiable-rewards`, `structured-reasoning-in-vlms`, `vision-first-tasks`, `post-training-for-visual-grounding`

## 阅读注意

- 重点关注第 3.1 节提出的三大评估原则：vision-first、难度分层、跨模态等价
- 图 1 和图 2 展示了 CrossMath 实例及风格增强效果，有助于理解任务设计
- 表 1 提供了测试集按难度和推理跳数的分布，是分析模型分层表现的关键
- 第 5.3 节主结果中 text-only > image+text > image-only 的性能排序是核心发现
- 附录 A 包含 CoT 指令模板，对复现 SFT 数据构造有参考价值

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.16256.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置、定量结果和开源链接，关键结论有数据支撑，虽部分细节需查阅代码，但整体信息充分可信。
