---
title: "Paper: 2604.13073"
title_zh: "OmniTrace：面向全模态大模型生成时归因的统一框架"
arxiv_id: "2604.13073"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.13073.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# OmniTrace：面向全模态大模型生成时归因的统一框架

## 一句话定位

提出 OmniTrace，一种轻量级、模型无关的生成时归因框架，将任意 token 级信号转化为跨模态、语义连贯的 span 级解释，无需重训练或监督。

## 小学生也能听懂

这篇论文发明了一个叫 OmniTrace 的工具，就像给大模型装了个“记忆追踪器”，能实时找出它每说一句话时，到底参考了图片、声音或文字里的哪一块内容，而且不用重新训练模型，结果更准更清楚。

## 为什么值得记录

- 现有归因方法主要面向分类任务或单模态架构，无法直接应用于自回归、解码器-only 的全模态生成场景。
- 生成式归因需满足生成感知（generation-aware）、全模态（omni-modal）、语义可解释（semantically interpretable）和模型无关四大要求，OmniTrace 首次系统性地满足这些条件。
- 在 Qwen2.5-Omni 和 MiniCPM-o-4.5 上的 759 个样本评估表明，该方法在视觉、音频、视频任务中均显著优于后验启发式基线（如自归因、嵌入相似度）。
- 通过置信度加权与时间一致性聚合，有效抑制噪声，尤其在图像归因中表现关键作用。

## 核心方法

- 将归因形式化为生成过程中的因果追踪问题：每个生成 token 映射到输入源单元（text span、image region、audio/video segment）。
- 支持任意 token 级信号作为输入，包括注意力权重（AttMean、RawAtt）、梯度-based 分数（AttGrads），实现信号无关性。
- 在线追踪：在自回归解码过程中实时计算每个 token 对输入源的归因质量，并记录置信度分数。
- Span 级聚合：将输出按语义分块（如句子），对块内所有 token 的源映射进行聚合，提升稳定性与可解释性。
- 置信度感知源筛选：结合词性加权（POS-aware weighting）、置信度塑形、运行级一致性（run-level coherence）和最小质量阈值过滤，生成简洁且高可信度的支持源集合。

## 关键结果

- 在 Qwen2.5-Omni-7B 上，OT_AttMean 在文本摘要、图像 QA、音频 QA 和视频 QA 任务中分别达到 75.66、76.59、83.12 和 40.16 的 F1/Time-F1，全面优于后验基线。
- 在 MiniCPM-o-4.5-9B 上，OT_RawAtt 在视觉和音频任务中表现最佳，表明不同模型对底层信号敏感度不同，但框架整体鲁棒。
- 去除任一过滤组件（如置信度加权、POS 加权）均导致性能下降，其中图像 F1 从 76.59 降至约 20，说明过滤机制对跨模态 grounding 至关重要。
- 高质量 ASR 分割（如 Paraformer）使音频归因 Time-F1 达 83.12，而无语义分割的原始 token 输入导致严重退化。
- 多模态联合归因（视觉+音频）在视频 QA 中优于单模态，Qwen 上 Time-F1 为 35.80 vs. 29.61（仅视觉）和 21.33（仅音频）。

## 局限与风险

- 梯度-based 信号（AttGrads）在长音频/视频输入上内存消耗大，难以扩展，部分结果未报告。
- 依赖外部 ASR 系统进行音频分割，其质量直接影响归因性能；低质量分割会导致显著性能下降。
- 图像归因对过滤机制高度敏感，反映视觉信号稀疏且脆弱，需精细调参以避免过选或漏选。
- 当前评估依赖 LLM-as-judge 自动生成 ground truth，虽有人工验证（88.17% 对齐率），但仍存在潜在偏差。

## 适合沉淀的概念

`generation-time-attribution`, `span-level-explanation`, `cross-modal-grounding`, `confidence-weighted-aggregation`, `run-level-coherence`, `token-to-source-mapping`, `multimodal-interpretability`, `attention-based-scoring`

## 阅读注意

- 重点关注 Algorithm 1 的整体流程：从 token 级信号获取 → 源单元映射 → span 聚合 → 置信度筛选。
- 注意 Table 2 中不同信号（AttMean vs RawAtt vs AttGrads）在不同模型上的表现差异，理解框架的信号无关性。
- Figure 2(a) 显示 ASR 分割质量对音频归因的关键影响，说明输入结构的重要性。
- Table 3 的消融实验揭示图像归因极度依赖过滤机制，而文本相对稳健，反映模态特性差异。
- Appendix B.3 的选项一致性测试（93.84%）证明 OmniTrace 能忠实反映模型自身决策路径，增强可信度。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.13073.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、多模态实验设置、详细消融分析和人类验证，数据与代码将开源，材料充分可信。
