Paper: 2604.13073
论文导读
提出 OmniTrace,一种轻量级、模型无关的生成时归因框架,将任意 token 级信号转化为跨模态、语义连贯的 span 级解释,无需重训练或监督。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
OmniTrace:面向全模态大模型生成时归因的统一框架
一句话定位
提出 OmniTrace,一种轻量级、模型无关的生成时归因框架,将任意 token 级信号转化为跨模态、语义连贯的 span 级解释,无需重训练或监督。
小学生也能听懂
这篇论文发明了一个叫 OmniTrace 的工具,就像给大模型装了个“记忆追踪器”,能实时找出它每说一句话时,到底参考了图片、声音或文字里的哪一块内容,而且不用重新训练模型,结果更准更清楚。
为什么值得记录
- 现有归因方法主要面向分类任务或单模态架构,无法直接应用于自回归、解码器-only 的全模态生成场景。
- 生成式归因需满足生成感知(generation-aware)、全模态(omni-modal)、语义可解释(semantically interpretable)和模型无关四大要求,OmniTrace 首次系统性地满足这些条件。
- 在 Qwen2.5-Omni 和 MiniCPM-o-4.5 上的 759 个样本评估表明,该方法在视觉、音频、视频任务中均显著优于后验启发式基线(如自归因、嵌入相似度)。
- 通过置信度加权与时间一致性聚合,有效抑制噪声,尤其在图像归因中表现关键作用。
核心方法
- 将归因形式化为生成过程中的因果追踪问题:每个生成 token 映射到输入源单元(text span、image region、audio/video segment)。
- 支持任意 token 级信号作为输入,包括注意力权重(AttMean、RawAtt)、梯度-based 分数(AttGrads),实现信号无关性。
- 在线追踪:在自回归解码过程中实时计算每个 token 对输入源的归因质量,并记录置信度分数。
- Span 级聚合:将输出按语义分块(如句子),对块内所有 token 的源映射进行聚合,提升稳定性与可解释性。
- 置信度感知源筛选:结合词性加权(POS-aware weighting)、置信度塑形、运行级一致性(run-level coherence)和最小质量阈值过滤,生成简洁且高可信度的支持源集合。
关键结果
- 在 Qwen2.5-Omni-7B 上,OT_AttMean 在文本摘要、图像 QA、音频 QA 和视频 QA 任务中分别达到 75.66、76.59、83.12 和 40.16 的 F1/Time-F1,全面优于后验基线。
- 在 MiniCPM-o-4.5-9B 上,OT_RawAtt 在视觉和音频任务中表现最佳,表明不同模型对底层信号敏感度不同,但框架整体鲁棒。
- 去除任一过滤组件(如置信度加权、POS 加权)均导致性能下降,其中图像 F1 从 76.59 降至约 20,说明过滤机制对跨模态 grounding 至关重要。
- 高质量 ASR 分割(如 Paraformer)使音频归因 Time-F1 达 83.12,而无语义分割的原始 token 输入导致严重退化。
- 多模态联合归因(视觉+音频)在视频 QA 中优于单模态,Qwen 上 Time-F1 为 35.80 vs. 29.61(仅视觉)和 21.33(仅音频)。
局限与风险
- 梯度-based 信号(AttGrads)在长音频/视频输入上内存消耗大,难以扩展,部分结果未报告。
- 依赖外部 ASR 系统进行音频分割,其质量直接影响归因性能;低质量分割会导致显著性能下降。
- 图像归因对过滤机制高度敏感,反映视觉信号稀疏且脆弱,需精细调参以避免过选或漏选。
- 当前评估依赖 LLM-as-judge 自动生成 ground truth,虽有人工验证(88.17% 对齐率),但仍存在潜在偏差。
适合沉淀的概念
generation-time-attribution, span-level-explanation, cross-modal-grounding, confidence-weighted-aggregation, run-level-coherence, token-to-source-mapping, multimodal-interpretability, attention-based-scoring
阅读注意
- 重点关注 Algorithm 1 的整体流程:从 token 级信号获取 → 源单元映射 → span 聚合 → 置信度筛选。
- 注意 Table 2 中不同信号(AttMean vs RawAtt vs AttGrads)在不同模型上的表现差异,理解框架的信号无关性。
- Figure 2(a) 显示 ASR 分割质量对音频归因的关键影响,说明输入结构的重要性。
- Table 3 的消融实验揭示图像归因极度依赖过滤机制,而文本相对稳健,反映模态特性差异。
- Appendix B.3 的选项一致性测试(93.84%)证明 OmniTrace 能忠实反映模型自身决策路径,增强可信度。
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.13073.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的方法描述、多模态实验设置、详细消融分析和人类验证,数据与代码将开源,材料充分可信。