论文导读
提出 MINER 模块,通过探测和融合 Transformer 多层内部表征,在不修改主干模型的前提下提升单向量稠密检索质量,同时保持存储与推理效率。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
MINER:挖掘多模态内部表征实现高效检索
一句话定位
提出 MINER 模块,通过探测和融合 Transformer 多层内部表征,在不修改主干模型的前提下提升单向量稠密检索质量,同时保持存储与推理效率。
小学生也能听懂
这篇论文发现,视觉文档检索中,模型中间层的隐藏状态其实包含很多对检索有用的信息,但传统方法只用最后一层生成一个向量,导致信息丢失。于是作者设计了一个叫 MINER 的小插件,它能从多个中间层挑选出最有用的神经元,并按重要性融合成一个更好的向量,让检索更准,而且不增加太多计算开销。
为什么值得记录
- 解决了单向量稠密检索因压缩信息导致的质量瓶颈问题
- 首次系统性地分析并验证了多模态检索中内部表征的分布规律
- 提出轻量级即插即用模块,无需重训主干模型即可提升性能
- 在 ViDoRe V1/V2/V3 多个基准上显著优于现有单向量方法,并大幅缩小与晚交互方法的差距
- 保持单向量检索的存储和延迟优势(索引成本仅为晚交互的 1/42.4)
核心方法
- 进行层间诊断分析:使用归一化 CKA 和 alignment ratio 识别哪些中间层包含检索相关信号
- Retrieval-Aligned Layer Probing 阶段:对候选层附加轻量探针,根据对齐程度分为 BaseProbe(元素重加权)和 NormProbe(行归一化线性投影)
- 采用跨模态孪生训练目标,使每层表征对齐到另一模态的最终层锚点
- Adaptive Sparse Multi-Layer Fusion 阶段:基于各层独立验证性能计算 utility score,动态决定每层保留的神经元比例(Top-P masking)
- 通过可学习的跨层加权求和与全局偏置融合筛选后的信号,生成最终单向量嵌入
- 整个过程不修改主干模型,兼容 EOS-token 或 pooling 等 readout 机制
关键结果
- 在 ViDoRe V2 上,MINER-Jina 平均 nDCG@5 提升 1.9%,最高达 4.5% 提升
- 相比晚交互方法 ColPali,MINER 将 nDCG@5 差距缩小至仅 0.2,同时索引大小减少 42.4 倍
- 查询延迟仅增加 7%(1.07×),QPS 保持在 14.36,远优于晚交互的 2.75
- 在 ViDoRe V3 上,MINER-Eager 在 8/11 数据集上取得最佳单向量结果,平均提升 2.5%
- 神经元掩码分析显示,后期层保留更多维度,中间层需稀疏提取,揭示内部信息分布模式
局限与风险
- 依赖主干模型提供内部隐藏状态,无法直接用于黑盒或闭源模型
- 训练 MINER 需访问原始训练数据,限制了在训练数据未公开的强大开源模型(如 Qwen3-VL-Embedding)上的应用
- 当前方法假设各层探针共享参数结构,未探索更复杂的层间依赖建模
适合沉淀的概念
visual-document-retrieval, dense-retrieval, late-interaction-retrieval, internal-representations, layerwise-analysis, centered-kernel-alignment, alignment-ratio, neuron-level-masking, multi-layer-fusion, plug-in-module
阅读注意
- 重点关注第 3 节的层间诊断方法:normalized CKA 和 alignment ratio 如何共同指导层选择
- 注意 MINER 的两阶段设计:先对齐探测,再稀疏融合,避免简单拼接带来的噪声
- 效率分析中,存储 footprint 不变是关键优势,区别于多向量方法
- 附录 G 的神经元保留比例图揭示了跨模型一致的信息分布模式,值得深入思考
- 局限性部分指出评估约束而非方法缺陷,说明 MINER 具备通用潜力
质量说明
- 采用来源:
raw,raw/papers/2026/05/2605.06460.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、消融分析、效率对比和可视化诊断,数据充分,方法描述清晰,结果可复现性强。