论文
arXiv2605.06460
时间2026-05
来源Markdown
页面质量中文卡片
阅读量级131 分钟

论文导读

提出 MINER 模块,通过探测和融合 Transformer 多层内部表征,在不修改主干模型的前提下提升单向量稠密检索质量,同时保持存储与推理效率。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

MINER:挖掘多模态内部表征实现高效检索

一句话定位

提出 MINER 模块,通过探测和融合 Transformer 多层内部表征,在不修改主干模型的前提下提升单向量稠密检索质量,同时保持存储与推理效率。

小学生也能听懂

这篇论文发现,视觉文档检索中,模型中间层的隐藏状态其实包含很多对检索有用的信息,但传统方法只用最后一层生成一个向量,导致信息丢失。于是作者设计了一个叫 MINER 的小插件,它能从多个中间层挑选出最有用的神经元,并按重要性融合成一个更好的向量,让检索更准,而且不增加太多计算开销。

为什么值得记录

  • 解决了单向量稠密检索因压缩信息导致的质量瓶颈问题
  • 首次系统性地分析并验证了多模态检索中内部表征的分布规律
  • 提出轻量级即插即用模块,无需重训主干模型即可提升性能
  • 在 ViDoRe V1/V2/V3 多个基准上显著优于现有单向量方法,并大幅缩小与晚交互方法的差距
  • 保持单向量检索的存储和延迟优势(索引成本仅为晚交互的 1/42.4)

核心方法

  • 进行层间诊断分析:使用归一化 CKA 和 alignment ratio 识别哪些中间层包含检索相关信号
  • Retrieval-Aligned Layer Probing 阶段:对候选层附加轻量探针,根据对齐程度分为 BaseProbe(元素重加权)和 NormProbe(行归一化线性投影)
  • 采用跨模态孪生训练目标,使每层表征对齐到另一模态的最终层锚点
  • Adaptive Sparse Multi-Layer Fusion 阶段:基于各层独立验证性能计算 utility score,动态决定每层保留的神经元比例(Top-P masking)
  • 通过可学习的跨层加权求和与全局偏置融合筛选后的信号,生成最终单向量嵌入
  • 整个过程不修改主干模型,兼容 EOS-token 或 pooling 等 readout 机制

关键结果

  • 在 ViDoRe V2 上,MINER-Jina 平均 nDCG@5 提升 1.9%,最高达 4.5% 提升
  • 相比晚交互方法 ColPali,MINER 将 nDCG@5 差距缩小至仅 0.2,同时索引大小减少 42.4 倍
  • 查询延迟仅增加 7%(1.07×),QPS 保持在 14.36,远优于晚交互的 2.75
  • 在 ViDoRe V3 上,MINER-Eager 在 8/11 数据集上取得最佳单向量结果,平均提升 2.5%
  • 神经元掩码分析显示,后期层保留更多维度,中间层需稀疏提取,揭示内部信息分布模式

局限与风险

  • 依赖主干模型提供内部隐藏状态,无法直接用于黑盒或闭源模型
  • 训练 MINER 需访问原始训练数据,限制了在训练数据未公开的强大开源模型(如 Qwen3-VL-Embedding)上的应用
  • 当前方法假设各层探针共享参数结构,未探索更复杂的层间依赖建模

适合沉淀的概念

visual-document-retrieval, dense-retrieval, late-interaction-retrieval, internal-representations, layerwise-analysis, centered-kernel-alignment, alignment-ratio, neuron-level-masking, multi-layer-fusion, plug-in-module

阅读注意

  • 重点关注第 3 节的层间诊断方法:normalized CKA 和 alignment ratio 如何共同指导层选择
  • 注意 MINER 的两阶段设计:先对齐探测,再稀疏融合,避免简单拼接带来的噪声
  • 效率分析中,存储 footprint 不变是关键优势,区别于多向量方法
  • 附录 G 的神经元保留比例图揭示了跨模型一致的信息分布模式,值得深入思考
  • 局限性部分指出评估约束而非方法缺陷,说明 MINER 具备通用潜力

质量说明

  • 采用来源:rawraw/papers/2026/05/2605.06460.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、消融分析、效率对比和可视化诊断,数据充分,方法描述清晰,结果可复现性强。