论文
arXiv2604.13073
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级78 分钟

Paper: 2604.13073

论文导读

提出 OmniTrace,一种轻量级、模型无关的生成时归因框架,将任意 token 级信号转化为跨模态、语义连贯的 span 级解释,无需重训练或监督。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

OmniTrace:面向全模态大模型生成时归因的统一框架

一句话定位

提出 OmniTrace,一种轻量级、模型无关的生成时归因框架,将任意 token 级信号转化为跨模态、语义连贯的 span 级解释,无需重训练或监督。

小学生也能听懂

这篇论文发明了一个叫 OmniTrace 的工具,就像给大模型装了个“记忆追踪器”,能实时找出它每说一句话时,到底参考了图片、声音或文字里的哪一块内容,而且不用重新训练模型,结果更准更清楚。

为什么值得记录

  • 现有归因方法主要面向分类任务或单模态架构,无法直接应用于自回归、解码器-only 的全模态生成场景。
  • 生成式归因需满足生成感知(generation-aware)、全模态(omni-modal)、语义可解释(semantically interpretable)和模型无关四大要求,OmniTrace 首次系统性地满足这些条件。
  • 在 Qwen2.5-Omni 和 MiniCPM-o-4.5 上的 759 个样本评估表明,该方法在视觉、音频、视频任务中均显著优于后验启发式基线(如自归因、嵌入相似度)。
  • 通过置信度加权与时间一致性聚合,有效抑制噪声,尤其在图像归因中表现关键作用。

核心方法

  • 将归因形式化为生成过程中的因果追踪问题:每个生成 token 映射到输入源单元(text span、image region、audio/video segment)。
  • 支持任意 token 级信号作为输入,包括注意力权重(AttMean、RawAtt)、梯度-based 分数(AttGrads),实现信号无关性。
  • 在线追踪:在自回归解码过程中实时计算每个 token 对输入源的归因质量,并记录置信度分数。
  • Span 级聚合:将输出按语义分块(如句子),对块内所有 token 的源映射进行聚合,提升稳定性与可解释性。
  • 置信度感知源筛选:结合词性加权(POS-aware weighting)、置信度塑形、运行级一致性(run-level coherence)和最小质量阈值过滤,生成简洁且高可信度的支持源集合。

关键结果

  • 在 Qwen2.5-Omni-7B 上,OT_AttMean 在文本摘要、图像 QA、音频 QA 和视频 QA 任务中分别达到 75.66、76.59、83.12 和 40.16 的 F1/Time-F1,全面优于后验基线。
  • 在 MiniCPM-o-4.5-9B 上,OT_RawAtt 在视觉和音频任务中表现最佳,表明不同模型对底层信号敏感度不同,但框架整体鲁棒。
  • 去除任一过滤组件(如置信度加权、POS 加权)均导致性能下降,其中图像 F1 从 76.59 降至约 20,说明过滤机制对跨模态 grounding 至关重要。
  • 高质量 ASR 分割(如 Paraformer)使音频归因 Time-F1 达 83.12,而无语义分割的原始 token 输入导致严重退化。
  • 多模态联合归因(视觉+音频)在视频 QA 中优于单模态,Qwen 上 Time-F1 为 35.80 vs. 29.61(仅视觉)和 21.33(仅音频)。

局限与风险

  • 梯度-based 信号(AttGrads)在长音频/视频输入上内存消耗大,难以扩展,部分结果未报告。
  • 依赖外部 ASR 系统进行音频分割,其质量直接影响归因性能;低质量分割会导致显著性能下降。
  • 图像归因对过滤机制高度敏感,反映视觉信号稀疏且脆弱,需精细调参以避免过选或漏选。
  • 当前评估依赖 LLM-as-judge 自动生成 ground truth,虽有人工验证(88.17% 对齐率),但仍存在潜在偏差。

适合沉淀的概念

generation-time-attribution, span-level-explanation, cross-modal-grounding, confidence-weighted-aggregation, run-level-coherence, token-to-source-mapping, multimodal-interpretability, attention-based-scoring

阅读注意

  • 重点关注 Algorithm 1 的整体流程:从 token 级信号获取 → 源单元映射 → span 聚合 → 置信度筛选。
  • 注意 Table 2 中不同信号(AttMean vs RawAtt vs AttGrads)在不同模型上的表现差异,理解框架的信号无关性。
  • Figure 2(a) 显示 ASR 分割质量对音频归因的关键影响,说明输入结构的重要性。
  • Table 3 的消融实验揭示图像归因极度依赖过滤机制,而文本相对稳健,反映模态特性差异。
  • Appendix B.3 的选项一致性测试(93.84%)证明 OmniTrace 能忠实反映模型自身决策路径,增强可信度。

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.13073.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、多模态实验设置、详细消融分析和人类验证,数据与代码将开源,材料充分可信。