论文
arXiv2604.13593
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级122 分钟

Paper: 2604.13593

论文导读

提出首个大规模视听不一致理解基准 AVID,通过智能体驱动的数据构建流程生成 11.2K 长视频与 78.7K 片段,支持检测、定位、分类与推理评估,并揭示现有全模态模型在跨模态冲突感知上的显著缺陷。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

AVID:基于智能体驱动构建的全模态视听不一致理解基准

一句话定位

提出首个大规模视听不一致理解基准 AVID,通过智能体驱动的数据构建流程生成 11.2K 长视频与 78.7K 片段,支持检测、定位、分类与推理评估,并揭示现有全模态模型在跨模态冲突感知上的显著缺陷。

小学生也能听懂

这篇论文像做实验一样,把视频里的声音和画面故意改得不一致(比如画面是人说话但声音是动物叫),然后让AI去发现哪里不对,结果发现现在的AI都不太擅长这个,于是他们做了一个新工具包来帮助AI学习,效果变好了。

为什么值得记录

  • 填补现有基准空白:主流视听基准仅关注对齐事件或依赖单模态伪影的深度伪造检测,缺乏对语义级跨模态不一致的系统性评估。
  • 推动可信 AI 发展:识别视听不一致是检测幻觉、深度伪造和提升多模态鲁棒性的关键能力,对人类认知建模至关重要。
  • 支持细粒度评估:提供 8 类不一致类别、精确时间边界与因果解释,支持从片段到全视频的多层次任务(检测、定位、分类、推理)。
  • 验证学习有效性:微调基线模型 AVID-Qwen 在 mIoU(36.1% vs 26.2%)和 SODA-m(7.47 vs 6.15)上显著优于所有对比模型,证明 AVID 可作为有效训练与测试平台。

核心方法

  • 数据源:基于 LongVALE 的长视频集合(源自 YouTube),确保原始内容语义一致。
  • 时序分割:使用 Silero VAD 检测语音活动,MediaPipe 检测画面中说话人,将视频划分为 Active Speaker、Voiceover、Scenic 三类语义片段。
  • 策略规划:由 Gemini 3.1 Pro 驱动的智能体分析每段内容,筛选可行片段并推荐合适的不一致类型(共 8 类),避免随机注入。
  • 不一致注入:采用五个专用注入器(Temporal、Semantic、Identity、Spatial、Background)在保留原视频画面的前提下修改音频,生成可控冲突。
  • 质量控制:两阶段人工介入——策略生成后审核(95% 准确率)与构造后视频级验证(Cohen’s Kappa > 0.75)。
  • 数据集构建:最终包含 11.2K 全视频(avg. 235.5s)、39.4K 不一致事件、78.7K 平衡片段(1:1 正负样本),支持分段与全视频两级评估。

关键结果

  • AVID 包含 11,200 个视频(训练/测试:9,639/1,561)和 78,722 个片段(68,088/10,634),平均视频时长 235.5 秒,片段 14.8 秒。
  • 78% 的视频包含 3–6 个不一致事件,18% 超过 7 个,确保密集标注与长程推理挑战。
  • 在 AVID 上评估 7 个主流全模态模型(如 Gemini 3.1 Pro、Qwen3-Omni、MiMo-V2-Omni),发现其在时间定位(mIoU 最高仅 26.2%)和推理(BLEU-4 < 3.0)方面表现薄弱。
  • AVID-Qwen(基于 Qwen3-Omni 微调)将时间定位 mIoU 提升至 36.1%,推理 BLEU-4 提升 2.8 倍,SODA-m 达 7.47,全面超越基线。

局限与风险

  • 依赖自动注入与 LLM 策略规划,虽经人工校验,仍可能存在语义不合理或边界模糊的样本。
  • 不一致类型限于预定义的 8 类,未覆盖所有现实世界中的复杂跨模态冲突(如文化语境冲突)。
  • 音频修改仅作用于选定窗口,未考虑全局声学连贯性变化对感知的影响。
  • 测试模型中 Video-SALMONN 系列表现出强烈‘无不一致’偏置,可能反映训练数据分布问题,非 AVID 本身缺陷。

适合沉淀的概念

audio-visual-inconsistency, multimodal-benchmark, temporal-grounding, omni-modal-understanding, inconsistency-injection, agent-driven-data-construction, SODA-m-metric, cross-modal-reasoning

阅读注意

  • 重点关注图 2 的构建流程与表 1 的基准对比,理解 AVID 如何区别于传统 grounding 与 deepfake 数据集。
  • 注意三类片段(Active Speaker/Voiceover/Scenic)与八类不一致的映射关系(附录表 6)。
  • 评估提示模板(图 7 和图 9)强制结构化输出,便于自动化解析,体现工程严谨性。
  • SODA-m 指标结合定位 IoU 与文本相似度,适合评估密集事件预测质量。
  • Video-SALMONN 的异常行为提示:模型可能因训练偏差而回避不一致判断,需谨慎解读其低分。

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.13593.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、统计数据、评估协议与人工校验结果,包含可复现的细节(如提示模板、模型版本、解码参数),并公开了数据集构建逻辑与局限性,信息充分可靠。