---
title: "Paper: 2604.13593"
title_zh: "AVID：基于智能体驱动构建的全模态视听不一致理解基准"
arxiv_id: "2604.13593"
paper_type: "benchmark"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.13593.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# AVID：基于智能体驱动构建的全模态视听不一致理解基准

## 一句话定位

提出首个大规模视听不一致理解基准 AVID，通过智能体驱动的数据构建流程生成 11.2K 长视频与 78.7K 片段，支持检测、定位、分类与推理评估，并揭示现有全模态模型在跨模态冲突感知上的显著缺陷。

## 小学生也能听懂

这篇论文像做实验一样，把视频里的声音和画面故意改得不一致（比如画面是人说话但声音是动物叫），然后让AI去发现哪里不对，结果发现现在的AI都不太擅长这个，于是他们做了一个新工具包来帮助AI学习，效果变好了。

## 为什么值得记录

- 填补现有基准空白：主流视听基准仅关注对齐事件或依赖单模态伪影的深度伪造检测，缺乏对语义级跨模态不一致的系统性评估。
- 推动可信 AI 发展：识别视听不一致是检测幻觉、深度伪造和提升多模态鲁棒性的关键能力，对人类认知建模至关重要。
- 支持细粒度评估：提供 8 类不一致类别、精确时间边界与因果解释，支持从片段到全视频的多层次任务（检测、定位、分类、推理）。
- 验证学习有效性：微调基线模型 AVID-Qwen 在 mIoU（36.1% vs 26.2%）和 SODA-m（7.47 vs 6.15）上显著优于所有对比模型，证明 AVID 可作为有效训练与测试平台。

## 核心方法

- 数据源：基于 LongVALE 的长视频集合（源自 YouTube），确保原始内容语义一致。
- 时序分割：使用 Silero VAD 检测语音活动，MediaPipe 检测画面中说话人，将视频划分为 Active Speaker、Voiceover、Scenic 三类语义片段。
- 策略规划：由 Gemini 3.1 Pro 驱动的智能体分析每段内容，筛选可行片段并推荐合适的不一致类型（共 8 类），避免随机注入。
- 不一致注入：采用五个专用注入器（Temporal、Semantic、Identity、Spatial、Background）在保留原视频画面的前提下修改音频，生成可控冲突。
- 质量控制：两阶段人工介入——策略生成后审核（95% 准确率）与构造后视频级验证（Cohen’s Kappa > 0.75）。
- 数据集构建：最终包含 11.2K 全视频（avg. 235.5s）、39.4K 不一致事件、78.7K 平衡片段（1:1 正负样本），支持分段与全视频两级评估。

## 关键结果

- AVID 包含 11,200 个视频（训练/测试：9,639/1,561）和 78,722 个片段（68,088/10,634），平均视频时长 235.5 秒，片段 14.8 秒。
- 78% 的视频包含 3–6 个不一致事件，18% 超过 7 个，确保密集标注与长程推理挑战。
- 在 AVID 上评估 7 个主流全模态模型（如 Gemini 3.1 Pro、Qwen3-Omni、MiMo-V2-Omni），发现其在时间定位（mIoU 最高仅 26.2%）和推理（BLEU-4 < 3.0）方面表现薄弱。
- AVID-Qwen（基于 Qwen3-Omni 微调）将时间定位 mIoU 提升至 36.1%，推理 BLEU-4 提升 2.8 倍，SODA-m 达 7.47，全面超越基线。

## 局限与风险

- 依赖自动注入与 LLM 策略规划，虽经人工校验，仍可能存在语义不合理或边界模糊的样本。
- 不一致类型限于预定义的 8 类，未覆盖所有现实世界中的复杂跨模态冲突（如文化语境冲突）。
- 音频修改仅作用于选定窗口，未考虑全局声学连贯性变化对感知的影响。
- 测试模型中 Video-SALMONN 系列表现出强烈‘无不一致’偏置，可能反映训练数据分布问题，非 AVID 本身缺陷。

## 适合沉淀的概念

`audio-visual-inconsistency`, `multimodal-benchmark`, `temporal-grounding`, `omni-modal-understanding`, `inconsistency-injection`, `agent-driven-data-construction`, `SODA-m-metric`, `cross-modal-reasoning`

## 阅读注意

- 重点关注图 2 的构建流程与表 1 的基准对比，理解 AVID 如何区别于传统 grounding 与 deepfake 数据集。
- 注意三类片段（Active Speaker/Voiceover/Scenic）与八类不一致的映射关系（附录表 6）。
- 评估提示模板（图 7 和图 9）强制结构化输出，便于自动化解析，体现工程严谨性。
- SODA-m 指标结合定位 IoU 与文本相似度，适合评估密集事件预测质量。
- Video-SALMONN 的异常行为提示：模型可能因训练偏差而回避不一致判断，需谨慎解读其低分。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.13593.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、统计数据、评估协议与人工校验结果，包含可复现的细节（如提示模板、模型版本、解码参数），并公开了数据集构建逻辑与局限性，信息充分可靠。
