Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
论文导读
提出 CrossMath 基准,通过跨模态等价任务揭示当前 VLM 在视觉推理上依赖文本捷径,并验证后训练可缩小模态差距。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
视觉语言模型是否真正进行视觉推理?模态差距的严格研究
一句话定位
提出 CrossMath 基准,通过跨模态等价任务揭示当前 VLM 在视觉推理上依赖文本捷径,并验证后训练可缩小模态差距。
小学生也能听懂
这篇论文像做实验一样,给AI出了同一道数学题的三种形式(只看图、只看字、看图又看字),发现它其实靠文字猜答案,不会看图思考;后来用专门训练让它学会看图解题,成绩就变好了。
为什么值得记录
- 首次构建严格跨模态等价的视觉推理基准 CrossMath,支持图像、文本及多模态输入的公平比较
- 实证发现主流 VLM 在 text-only 输入下表现最佳,加入视觉信息反而降低性能,暴露其缺乏真正的视觉 grounding
- 提出基于图像-only 数据的 SFT + RLVR 后训练策略,显著提升视觉推理能力并实现跨任务泛化
- 为评估和提升 VLM 的视觉推理能力提供了方法论和可复现工具链
核心方法
- 设计 CrossMath 任务:2D 网格中交叉数学方程补全,要求顺序输出缺失值,天然依赖空间几何推理
- 构建三模态等价样本:每个问题生成 image-only、text-only(Markdown 表格)、image+text 三种格式,确保信息一致
- 自动化数据流水线:从网页抓取图像 → OCR 转 Markdown → 符号化解题路径提取 → 视觉风格增强(去边框、复杂背景、字体变化)
- 后训练策略:使用 5,000 个图像样本对 Qwen3.5-9B 进行 LoRA-SFT,再通过 GRPO 进行 RLVR,奖励函数采用位置加权准确率
- 评估指标:Micro Accuracy(单题正确率)、Macro Accuracy(全题正确率)、K-Hop Accuracy(按推理步数分层)
关键结果
- 在 250 个测试样本上,SOTA VLMs(如 Qwen3-VL)在 text-only 设置下 Macro Acc 达 ~60%,而 image-only 下仅 ~20%,存在显著模态差距
- 加入图像信息(image+text)相比纯文本输入性能下降 5–10%,表明视觉输入未被有效利用甚至干扰推理
- 对 Qwen3.5-9B 进行 CrossMath 后训练后,image-only 设置下 Macro Acc 提升至 48.6%,接近 text-only 水平
- 后训练模型在外部数学视觉任务(如 MathVerse)上保持原有能力并获得 3–5% 的稳定增益
- 风格增强测试显示,原始模型对视觉模板敏感,而后训练模型在去边框、复杂背景等变体上鲁棒性显著提升
局限与风险
- CrossMath 任务局限于结构化数学网格,可能无法完全代表开放域视觉推理(如自然场景理解)
- 后训练仅在一个模型(Qwen3.5-9B)上验证,未测试其他架构的通用性
- RLVR 的奖励依赖最终答案正确性,缺乏对中间推理步骤的细粒度监督
- 数据集规模较小(250 测试样本),尽管有人工校验,但仍可能影响统计显著性
适合沉淀的概念
crossmath-benchmark, modality-gap-in-vlms, visual-reasoning-evaluation, cross-modal-equivalence, reinforcement-learning-with-verifiable-rewards, structured-reasoning-in-vlms, vision-first-tasks, post-training-for-visual-grounding
阅读注意
- 重点关注第 3.1 节提出的三大评估原则:vision-first、难度分层、跨模态等价
- 图 1 和图 2 展示了 CrossMath 实例及风格增强效果,有助于理解任务设计
- 表 1 提供了测试集按难度和推理跳数的分布,是分析模型分层表现的关键
- 第 5.3 节主结果中 text-only > image+text > image-only 的性能排序是核心发现
- 附录 A 包含 CoT 指令模板,对复现 SFT 数据构造有参考价值
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.16256.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的方法描述、实验设置、定量结果和开源链接,关键结论有数据支撑,虽部分细节需查阅代码,但整体信息充分可信。