---
title: "The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm"
title_zh: "看见的代价：在单体范式中实现可信多模态推理"
arxiv_id: "2604.20665"
paper_type: "analysis"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.20665.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 看见的代价：在单体范式中实现可信多模态推理

## 一句话定位

该论文批判当前多模态评估方法存在根本缺陷，提出‘模态转换协议’与三项新指标（ToS、CoS、FoS），揭示视觉信息在现有VLM架构中反而成为性能瓶颈，并呼吁以‘语义充分性准则（SSC）’重构可信世界模型。

## 小学生也能听懂

这篇论文发现现在的AI看图片时反而拖后腿，就像眼睛很好但脑子不会用。它发明新方法测试AI是否真懂图，发现很多AI其实靠猜文字答案，而不是看懂图，呼吁大家重新设计更聪明的看图AI。

## 为什么值得记录

- 挑战主流多模态评估范式：指出数据消融法（如Multimodal Gain/Leakage）无法区分架构缺陷与数据集偏差，误导模型能力判断。
- 提出可量化诊断工具：通过ToS（看见的代价）、CoS（看见的诅咒）、FoS（看见的谬误）三项指标，精确定位视觉编码或跨模态融合失败。
- 揭示‘规模悖论’：随着LLM能力提升，视觉瓶颈反而加剧，导致模型更依赖文本先验而非真实视觉理解，形成‘能力幻觉’。
- 推动KDD社区转型：主张将SSC从被动诊断约束升级为主动训练目标，指导架构设计与损失函数优化。

## 核心方法

- 提出‘模态转换协议’（Modality Translation Protocol）：保留语义载荷不变，将视觉输入转为符号文本（SymT）或将文本转为图像内文字（SymV），构建三重评估场景（Full, SymT, SymV）。
- 定义三项核心指标：ToS = S_SymT - S_Full（衡量视觉处理带来的性能损失）；CoS = S_SymT - S_SymV（检测模态间语义不对称）；FoS = S_Full - S_SymV（区分编码失败与融合失败）。
- 建立语义充分性准则（SSC）：要求 max(ToS, CoS, |FoS|) = 0，作为可信多模态系统的数学必要条件。
- 提出‘多模态扩展发散定律’：论证随着模型规模扩大，LLM推理能力增长远超视觉投影带宽，导致ToS持续扩大。
- 设计SEE（语义等价工程）框架：构建同构多模态元组 (V, V_label, T, T_img)，确保跨模态信息严格等价。

## 关键结果

- 通过金融时序、医疗诊断、分子图挖掘三个高风险的KDD案例，展示SymT性能显著高于Full，暴露视觉编码器严重瓶颈。
- 实验表明当前SOTA VLMs在基础视觉任务上表现不如3岁儿童（引用BabyVision），且存在‘现代Clever Hans效应’——依赖文本先验而非视觉输入。
- 数学推导证明FoS符号可区分两种崩溃模式：FoS > 0 表示视觉编码能力不足；FoS < 0 表示跨模态投影头融合失败。
- 提出Divergence Law预测：随着参数规模增加，S_SymT（符号文本上限）增速远超S_Full，导致ToS不断扩大，形成‘越强越盲’悖论。

## 局限与风险

- SSC目前为理论诊断框架，尚未提供大规模实证验证结果，其实际训练应用效果待检验。
- SymT与SymV的构造依赖人工或外部符号提取器，可能引入构造偏差，影响指标普适性。
- 未解决如何自动从原始数据生成高质量同构元组的技术难题，SEE工程化路径尚不明确。
- 假设视觉与文本信息可完全等价转换，但在复杂推理任务中可能存在不可通约性。

## 适合沉淀的概念

`multimodal-gain-flaw`, `modality-translation-protocol`, `toll-of-seeing-tos`, `curse-of-seeing-cos`, `fallacy-of-seeing-fos`, `semantic-sufficiency-criterion-ssc`, `divergence-law-of-multimodal-scaling`, `information-compression-penalty`, `clever-hans-effect-in-vlms`, `faithful-world-models`

## 阅读注意

- 重点关注第4节三项指标的定义与解释，尤其是FoS正负号所对应的两种不同架构失败模式。
- 注意作者对‘数据消融法’的根本性质疑：删除信息不能揭示架构极限，只能暴露数据集偏差。
- 理解Divergence Law的数学逻辑：S_SymT增速 > S_Full → ToS扩大，说明单纯扩大模型规模会恶化视觉瓶颈。
- 思考SSC如何从评估指标转变为训练目标，特别是将其融入损失函数的具体机制。
- 评估案例中医疗诊断的‘跨模态覆盖’风险：文本先验导致模型无视图像真实内容，属高危失效模式。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.20665.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文逻辑严密，论证充分，提出的方法论具有创新性且数学基础扎实。虽缺乏大规模实验数据，但理论框架完整，对多模态评估领域有重大启发意义。
