论文
arXiv2604.08209
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级115 分钟

2604.08209

论文导读

提出 OmniJigsaw,一种基于时序重排序代理任务的自监督框架,通过三种模态协同策略(JMI、SMS、CMM)提升视频-音频联合推理能力,并设计两阶段数据过滤管道与复合奖励机制以支持大规模无标注数据训练。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

OmniJigsaw:通过模态协同重排序增强全模态推理

一句话定位

提出 OmniJigsaw,一种基于时序重排序代理任务的自监督框架,通过三种模态协同策略(JMI、SMS、CMM)提升视频-音频联合推理能力,并设计两阶段数据过滤管道与复合奖励机制以支持大规模无标注数据训练。

小学生也能听懂

这篇论文教电脑像玩拼图一样,把打乱顺序的视频和声音重新排好,通过三种合作方法让它们互相帮助,还用自动筛选和奖励机制提升学习效果,最终在多个测试中表现更好。

为什么值得记录

  • 首次将拼图式强化学习后训练范式扩展至全模态(视频+音频)领域,解决跨模态协同推理难题
  • 发现并分析‘双模态捷径现象’,提出细粒度模态掩码(CMM)策略有效缓解该问题
  • 构建轻量级两阶段数据过滤流程,实现无需人工标注的大规模全模态数据适配
  • 在15个基准测试中显著提升单模态与协同推理性能,验证框架可扩展性与有效性

核心方法

  • 定义全模态拼图任务:将视频均匀切分为N个片段并随机打乱,要求模型恢复原始时序顺序
  • 提出三种模态协同策略:联合模态集成(JMI)、样本级模态选择(SMS)、片段级模态掩码(CMM)
  • 设计两阶段数据过滤管道:信号级启发式过滤(MAD、RMS、VAD) + 语义级CoT筛选(使用Qwen2.5-VL-7B判断时序不可逆性)
  • 构建复合奖励函数:包含位置准确率、邻接准确率、格式奖励、重复惩罚及准确率依赖的折扣因子(完美匹配为1.0,否则0.2)
  • 采用GRPO算法对Qwen3-Omni-30B-A3B-Instruct进行后训练,冻结视觉/音频塔与路由器以提升效率

关键结果

  • CMM策略在MLVU-Test上相对基线Qwen3-Omni-30B提升+4.38,MMAR提升+2.50,OmniVideoBench提升+1.70
  • 在AoTBench(+4.02)和Video-TT(+2.70)等时序敏感任务上表现突出,表明增强了时间感知与线索关联能力
  • 子能力分析显示CMM在动作识别(+4.8)、对象推理(+4.6)等任务上均有提升,验证跨模态协同效应

局限与风险

  • 当前拼图设计基于固定长度非重叠片段,更丰富的拼图形式(如变长、重叠、时空混合)有待探索
  • 奖励机制主要关注位置与邻接正确性,缺乏对推理结构或逻辑深度的监督
  • 模态选择依赖模型自身判断,可能存在误判风险,尤其在低质量或模糊内容上

适合沉淀的概念

全模态推理, 时序重排序, 自监督学习, 模态协同, 拼图代理任务, 强化学习后训练, 双模态捷径现象, 片段级模态掩码

阅读注意

  • 重点关注CMM如何通过动态掩码构建信息瓶颈以强制跨模态整合
  • 注意数据过滤管道中CoT筛选的具体标准(如排除循环、静态内容)
  • 分析奖励函数中折扣因子对避免局部最优的作用机制
  • 对比JMI、SMS、CMM在子任务上的表现差异,理解不同策略的适用场景

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.08209.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、实验设置、消融分析与提示模板,数据与结论一致,具备可复现性基础。