Paper: 2604.16902
论文导读
通过构建三模态冲突基准与层间探测方法,系统量化并揭示了全模态大模型中普遍存在的视觉偏好现象及其在中间层逐步形成的机制,并验证其可用于跨模态幻觉诊断。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
超越文本主导:全模态大模型的模态偏好研究
一句话定位
通过构建三模态冲突基准与层间探测方法,系统量化并揭示了全模态大模型中普遍存在的视觉偏好现象及其在中间层逐步形成的机制,并验证其可用于跨模态幻觉诊断。
小学生也能听懂
这篇论文像做实验一样,给会看、听、读的AI模型出难题:让图片、声音和文字说不一样的话,然后看它更信哪个,发现它们大多更相信图片,而且这种“偏心”是从中间开始慢慢变强的,还能用来发现AI是不是在胡说八道。
为什么值得记录
- 首次系统性地在全模态(文本、图像、音频)设置下量化OLLMs的模态偏好,发现与传统VLMs的‘文本主导’不同,多数OLLMs表现出显著的视觉偏好
- 提出Modality Selection Rate(MSR)指标和三模态冲突数据集,为模态偏好研究提供可复用的评估框架
- 通过层间线性探测揭示模态偏好并非静态,而是在模型中层到深层逐步涌现,具有明确的四阶段演化模式
- 证明内部偏好信号可有效用于跨模态幻觉检测,在POPE等三个基准上平均AUROC达94%,无需任务特定训练数据
核心方法
- 构建三模态冲突数据集:基于XModBench的Perception子集,将语义一致的文本、图像、音频样本按类别重组为互斥三元组,确保每对模态语义矛盾
- 定义Modality Selection Rate(MSR):模型选择某一模态对应答案的比例,用于量化模态偏好强度
- 设计层间线性探测框架:在每层提取最后一个token的隐藏状态,训练单层MLP预测最终偏好分布,以探测偏好信息随深度的演化
- 使用软标签监督:利用模型最终输出的选项概率作为软标签,提升探针训练的稳定性与信号质量
- 幻觉诊断方法:选取偏好最强的中间层探针,将其对干扰模态的预测概率作为幻觉风险分数,用于二分类检测
关键结果
- 在10个代表性OLLMs中,8个表现出视觉偏好(图像MSR > 50%),Gemini 3 Flash视觉MSR高达82%,而音频普遍被忽视(MSR ≤ 21%)
- 层间探测显示所有模型的偏好探针准确率在浅层接近随机(~0.3–0.55),在40%–70%深度区间快速上升,Qwen2.5-Omni-7B从0.5跃升至0.9
- 偏好演化呈现四阶段:Absent(无偏好)、Emerging(快速上升)、Peak(峰值稳定)、Declining(末期衰减),大模型偏好出现更早且衰减更缓
- 在POPE、AVHBench、AHa-Bench三个幻觉基准上,所提探针方法平均AUROC达0.94,显著优于随机(0.50)和浅层探针(~0.51)
局限与风险
- 实验仅覆盖10个OLLMs,且部分为闭源API调用,结果可能受限于模型版本与接口稳定性
- 冲突数据集基于XModBench构建,类别数量有限(6类),可能影响偏好的泛化性评估
- 探针方法依赖模型内部表示,对架构差异敏感,跨模型比较需谨慎
- 幻觉检测仅针对‘是/否’类问题重构,未覆盖开放式生成场景
适合沉淀的概念
modality-preference, omni-modal-large-language-models, cross-modal-hallucination, layer-wise-probing, conflict-based-benchmark, visual-bias, audio-neglect, representation-evolution
阅读注意
- 重点关注三模态冲突数据集构建逻辑:如何确保语义互斥且选项不泄露
- 注意MSR指标定义与均匀基线(1/3)的比较,理解偏好强度的实际含义
- 层间探针使用L2归一化隐藏状态和软标签训练,避免尺度干扰并增强监督信号
- 幻觉检测实验限定‘正确答案为no’的样本,以明确‘yes’响应即为幻觉
- 四阶段划分基于统计阈值(如MAD和峰值下降2%),需结合具体数值理解其合理性
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.16902.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验设置、定量结果与可视化分析,数据充分支持结论,无明显信息缺失。