---
title: ""
title_zh: "MINER：挖掘多模态内部表征实现高效检索"
arxiv_id: "2605.06460"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.06460.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# MINER：挖掘多模态内部表征实现高效检索

## 一句话定位

提出 MINER 模块，通过探测和融合 Transformer 多层内部表征，在不修改主干模型的前提下提升单向量稠密检索质量，同时保持存储与推理效率。

## 小学生也能听懂

这篇论文发现，视觉文档检索中，模型中间层的隐藏状态其实包含很多对检索有用的信息，但传统方法只用最后一层生成一个向量，导致信息丢失。于是作者设计了一个叫 MINER 的小插件，它能从多个中间层挑选出最有用的神经元，并按重要性融合成一个更好的向量，让检索更准，而且不增加太多计算开销。

## 为什么值得记录

- 解决了单向量稠密检索因压缩信息导致的质量瓶颈问题
- 首次系统性地分析并验证了多模态检索中内部表征的分布规律
- 提出轻量级即插即用模块，无需重训主干模型即可提升性能
- 在 ViDoRe V1/V2/V3 多个基准上显著优于现有单向量方法，并大幅缩小与晚交互方法的差距
- 保持单向量检索的存储和延迟优势（索引成本仅为晚交互的 1/42.4）

## 核心方法

- 进行层间诊断分析：使用归一化 CKA 和 alignment ratio 识别哪些中间层包含检索相关信号
- Retrieval-Aligned Layer Probing 阶段：对候选层附加轻量探针，根据对齐程度分为 BaseProbe（元素重加权）和 NormProbe（行归一化线性投影）
- 采用跨模态孪生训练目标，使每层表征对齐到另一模态的最终层锚点
- Adaptive Sparse Multi-Layer Fusion 阶段：基于各层独立验证性能计算 utility score，动态决定每层保留的神经元比例（Top-P masking）
- 通过可学习的跨层加权求和与全局偏置融合筛选后的信号，生成最终单向量嵌入
- 整个过程不修改主干模型，兼容 EOS-token 或 pooling 等 readout 机制

## 关键结果

- 在 ViDoRe V2 上，MINER-Jina 平均 nDCG@5 提升 1.9%，最高达 4.5% 提升
- 相比晚交互方法 ColPali，MINER 将 nDCG@5 差距缩小至仅 0.2，同时索引大小减少 42.4 倍
- 查询延迟仅增加 7%（1.07×），QPS 保持在 14.36，远优于晚交互的 2.75
- 在 ViDoRe V3 上，MINER-Eager 在 8/11 数据集上取得最佳单向量结果，平均提升 2.5%
- 神经元掩码分析显示，后期层保留更多维度，中间层需稀疏提取，揭示内部信息分布模式

## 局限与风险

- 依赖主干模型提供内部隐藏状态，无法直接用于黑盒或闭源模型
- 训练 MINER 需访问原始训练数据，限制了在训练数据未公开的强大开源模型（如 Qwen3-VL-Embedding）上的应用
- 当前方法假设各层探针共享参数结构，未探索更复杂的层间依赖建模

## 适合沉淀的概念

`visual-document-retrieval`, `dense-retrieval`, `late-interaction-retrieval`, `internal-representations`, `layerwise-analysis`, `centered-kernel-alignment`, `alignment-ratio`, `neuron-level-masking`, `multi-layer-fusion`, `plug-in-module`

## 阅读注意

- 重点关注第 3 节的层间诊断方法：normalized CKA 和 alignment ratio 如何共同指导层选择
- 注意 MINER 的两阶段设计：先对齐探测，再稀疏融合，避免简单拼接带来的噪声
- 效率分析中，存储 footprint 不变是关键优势，区别于多向量方法
- 附录 G 的神经元保留比例图揭示了跨模型一致的信息分布模式，值得深入思考
- 局限性部分指出评估约束而非方法缺陷，说明 MINER 具备通用潜力

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.06460.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、消融分析、效率对比和可视化诊断，数据充分，方法描述清晰，结果可复现性强。
