论文
arXiv2604.16256
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级94 分钟

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

论文导读

提出 CrossMath 基准,通过跨模态等价任务揭示当前 VLM 在视觉推理上依赖文本捷径,并验证后训练可缩小模态差距。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

视觉语言模型是否真正进行视觉推理?模态差距的严格研究

一句话定位

提出 CrossMath 基准,通过跨模态等价任务揭示当前 VLM 在视觉推理上依赖文本捷径,并验证后训练可缩小模态差距。

小学生也能听懂

这篇论文像做实验一样,给AI出了同一道数学题的三种形式(只看图、只看字、看图又看字),发现它其实靠文字猜答案,不会看图思考;后来用专门训练让它学会看图解题,成绩就变好了。

为什么值得记录

  • 首次构建严格跨模态等价的视觉推理基准 CrossMath,支持图像、文本及多模态输入的公平比较
  • 实证发现主流 VLM 在 text-only 输入下表现最佳,加入视觉信息反而降低性能,暴露其缺乏真正的视觉 grounding
  • 提出基于图像-only 数据的 SFT + RLVR 后训练策略,显著提升视觉推理能力并实现跨任务泛化
  • 为评估和提升 VLM 的视觉推理能力提供了方法论和可复现工具链

核心方法

  • 设计 CrossMath 任务:2D 网格中交叉数学方程补全,要求顺序输出缺失值,天然依赖空间几何推理
  • 构建三模态等价样本:每个问题生成 image-only、text-only(Markdown 表格)、image+text 三种格式,确保信息一致
  • 自动化数据流水线:从网页抓取图像 → OCR 转 Markdown → 符号化解题路径提取 → 视觉风格增强(去边框、复杂背景、字体变化)
  • 后训练策略:使用 5,000 个图像样本对 Qwen3.5-9B 进行 LoRA-SFT,再通过 GRPO 进行 RLVR,奖励函数采用位置加权准确率
  • 评估指标:Micro Accuracy(单题正确率)、Macro Accuracy(全题正确率)、K-Hop Accuracy(按推理步数分层)

关键结果

  • 在 250 个测试样本上,SOTA VLMs(如 Qwen3-VL)在 text-only 设置下 Macro Acc 达 ~60%,而 image-only 下仅 ~20%,存在显著模态差距
  • 加入图像信息(image+text)相比纯文本输入性能下降 5–10%,表明视觉输入未被有效利用甚至干扰推理
  • 对 Qwen3.5-9B 进行 CrossMath 后训练后,image-only 设置下 Macro Acc 提升至 48.6%,接近 text-only 水平
  • 后训练模型在外部数学视觉任务(如 MathVerse)上保持原有能力并获得 3–5% 的稳定增益
  • 风格增强测试显示,原始模型对视觉模板敏感,而后训练模型在去边框、复杂背景等变体上鲁棒性显著提升

局限与风险

  • CrossMath 任务局限于结构化数学网格,可能无法完全代表开放域视觉推理(如自然场景理解)
  • 后训练仅在一个模型(Qwen3.5-9B)上验证,未测试其他架构的通用性
  • RLVR 的奖励依赖最终答案正确性,缺乏对中间推理步骤的细粒度监督
  • 数据集规模较小(250 测试样本),尽管有人工校验,但仍可能影响统计显著性

适合沉淀的概念

crossmath-benchmark, modality-gap-in-vlms, visual-reasoning-evaluation, cross-modal-equivalence, reinforcement-learning-with-verifiable-rewards, structured-reasoning-in-vlms, vision-first-tasks, post-training-for-visual-grounding

阅读注意

  • 重点关注第 3.1 节提出的三大评估原则:vision-first、难度分层、跨模态等价
  • 图 1 和图 2 展示了 CrossMath 实例及风格增强效果,有助于理解任务设计
  • 表 1 提供了测试集按难度和推理跳数的分布,是分析模型分层表现的关键
  • 第 5.3 节主结果中 text-only > image+text > image-only 的性能排序是核心发现
  • 附录 A 包含 CoT 指令模板,对复现 SFT 数据构造有参考价值

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.16256.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、实验设置、定量结果和开源链接,关键结论有数据支撑,虽部分细节需查阅代码,但整体信息充分可信。