Paper: 2604.13593
论文导读
提出首个大规模视听不一致理解基准 AVID,通过智能体驱动的数据构建流程生成 11.2K 长视频与 78.7K 片段,支持检测、定位、分类与推理评估,并揭示现有全模态模型在跨模态冲突感知上的显著缺陷。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
AVID:基于智能体驱动构建的全模态视听不一致理解基准
一句话定位
提出首个大规模视听不一致理解基准 AVID,通过智能体驱动的数据构建流程生成 11.2K 长视频与 78.7K 片段,支持检测、定位、分类与推理评估,并揭示现有全模态模型在跨模态冲突感知上的显著缺陷。
小学生也能听懂
这篇论文像做实验一样,把视频里的声音和画面故意改得不一致(比如画面是人说话但声音是动物叫),然后让AI去发现哪里不对,结果发现现在的AI都不太擅长这个,于是他们做了一个新工具包来帮助AI学习,效果变好了。
为什么值得记录
- 填补现有基准空白:主流视听基准仅关注对齐事件或依赖单模态伪影的深度伪造检测,缺乏对语义级跨模态不一致的系统性评估。
- 推动可信 AI 发展:识别视听不一致是检测幻觉、深度伪造和提升多模态鲁棒性的关键能力,对人类认知建模至关重要。
- 支持细粒度评估:提供 8 类不一致类别、精确时间边界与因果解释,支持从片段到全视频的多层次任务(检测、定位、分类、推理)。
- 验证学习有效性:微调基线模型 AVID-Qwen 在 mIoU(36.1% vs 26.2%)和 SODA-m(7.47 vs 6.15)上显著优于所有对比模型,证明 AVID 可作为有效训练与测试平台。
核心方法
- 数据源:基于 LongVALE 的长视频集合(源自 YouTube),确保原始内容语义一致。
- 时序分割:使用 Silero VAD 检测语音活动,MediaPipe 检测画面中说话人,将视频划分为 Active Speaker、Voiceover、Scenic 三类语义片段。
- 策略规划:由 Gemini 3.1 Pro 驱动的智能体分析每段内容,筛选可行片段并推荐合适的不一致类型(共 8 类),避免随机注入。
- 不一致注入:采用五个专用注入器(Temporal、Semantic、Identity、Spatial、Background)在保留原视频画面的前提下修改音频,生成可控冲突。
- 质量控制:两阶段人工介入——策略生成后审核(95% 准确率)与构造后视频级验证(Cohen’s Kappa > 0.75)。
- 数据集构建:最终包含 11.2K 全视频(avg. 235.5s)、39.4K 不一致事件、78.7K 平衡片段(1:1 正负样本),支持分段与全视频两级评估。
关键结果
- AVID 包含 11,200 个视频(训练/测试:9,639/1,561)和 78,722 个片段(68,088/10,634),平均视频时长 235.5 秒,片段 14.8 秒。
- 78% 的视频包含 3–6 个不一致事件,18% 超过 7 个,确保密集标注与长程推理挑战。
- 在 AVID 上评估 7 个主流全模态模型(如 Gemini 3.1 Pro、Qwen3-Omni、MiMo-V2-Omni),发现其在时间定位(mIoU 最高仅 26.2%)和推理(BLEU-4 < 3.0)方面表现薄弱。
- AVID-Qwen(基于 Qwen3-Omni 微调)将时间定位 mIoU 提升至 36.1%,推理 BLEU-4 提升 2.8 倍,SODA-m 达 7.47,全面超越基线。
局限与风险
- 依赖自动注入与 LLM 策略规划,虽经人工校验,仍可能存在语义不合理或边界模糊的样本。
- 不一致类型限于预定义的 8 类,未覆盖所有现实世界中的复杂跨模态冲突(如文化语境冲突)。
- 音频修改仅作用于选定窗口,未考虑全局声学连贯性变化对感知的影响。
- 测试模型中 Video-SALMONN 系列表现出强烈‘无不一致’偏置,可能反映训练数据分布问题,非 AVID 本身缺陷。
适合沉淀的概念
audio-visual-inconsistency, multimodal-benchmark, temporal-grounding, omni-modal-understanding, inconsistency-injection, agent-driven-data-construction, SODA-m-metric, cross-modal-reasoning
阅读注意
- 重点关注图 2 的构建流程与表 1 的基准对比,理解 AVID 如何区别于传统 grounding 与 deepfake 数据集。
- 注意三类片段(Active Speaker/Voiceover/Scenic)与八类不一致的映射关系(附录表 6)。
- 评估提示模板(图 7 和图 9)强制结构化输出,便于自动化解析,体现工程严谨性。
- SODA-m 指标结合定位 IoU 与文本相似度,适合评估密集事件预测质量。
- Video-SALMONN 的异常行为提示:模型可能因训练偏差而回避不一致判断,需谨慎解读其低分。
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.13593.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的方法描述、统计数据、评估协议与人工校验结果,包含可复现的细节(如提示模板、模型版本、解码参数),并公开了数据集构建逻辑与局限性,信息充分可靠。