论文
arXiv2604.00007
时间2026-03
来源Markdown
页面质量中文卡片
阅读量级152 分钟

Paper: 2604.00007

论文导读

提出首个基于掩码扩散的8B规模开源全模态统一模型,支持文本、图像、语音的理解与生成以及视频理解,在共享离散词元空间内实现端到端迭代 refinement。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Dynin-Omni:全模态统一大扩散语言模型

一句话定位

提出首个基于掩码扩散的8B规模开源全模态统一模型,支持文本、图像、语音的理解与生成以及视频理解,在共享离散词元空间内实现端到端迭代 refinement。

小学生也能听懂

这篇论文造了一个像“万能积木盒”一样的AI模型,能同时看懂文字、图片、声音和视频,还能自己生成它们。它用一个聪明的方法(叫掩码扩散)把不同内容变成统一的小积木,让AI像拼图一样学习,最终在19个测试中都打败了其他开源模型。

为什么值得记录

  • 首次将掩码扩散范式扩展至真正全模态(text, image, speech, video)统一建模,摆脱对外部生成器或多阶段 handoff 的依赖
  • 在19个多模态基准上全面超越现有开源统一模型(如 Show-o2、HyperCLOVAX-8B-Omni、NExT-OMNI),并在部分任务上接近专用专家系统性能
  • 提出 modality-disentangled 多阶段训练策略与 scheduled padding learning,有效解决异构数据联合训练稳定性问题

核心方法

  • 采用 masked diffusion 框架,所有模态映射到共享离散词元空间(text: 12,680;vision: 8,192;speech: 4,096),通过单一 Transformer 主干进行双向上下文建模
  • 训练目标为统一掩码预测损失:随机 masking 输入序列中的词元,模型基于可见上下文重构被 mask 位置的真实词元
  • 推理时使用置信度重 masking 策略,并结合模态特异性解码模式(文本/语音:block-wise 顺序解码;图像:全并行解码)
  • 三阶段训练流程:(1) 新模态适配(视频、语音)→ (2) 全模态对齐 SFT → (3) 高级能力强化(推理、高分辨率生成等)
  • 引入 modality-disentangled model merging 技术,在扩展语音词表时保留原始 backbone 语义一致性
  • 使用预训练且冻结的模态 tokenizer/detokenizer(图像:MAGVIT-v2;语音:EMOVA S2U/U2S),确保表示稳定性

关键结果

  • GSM8K 数学推理:87.6 分,优于同类统一模型
  • MME-P 多模态理解:1733.6 分
  • VideoMME 视频理解:61.4 分,较基线提升 +10.1%
  • GenEval 图像生成评估:0.87 分,接近专用生成模型水平
  • LibriSpeech test-clean 语音识别 WER:2.1%,具备强语音理解能力

局限与风险

  • 未开源完整训练代码与数据 pipeline,仅提供模型权重与 demo
  • 视频生成能力尚未实现,目前仅支持视频理解
  • detokenizer 仍为轻量级固定模块,可能限制高保真生成上限
  • 长语音合成(>20秒)质量与连贯性有待进一步验证

适合沉淀的概念

masked-diffusion-language-model, omnimodal-foundation-model, discrete-tokenization, modality-disentangled-merging, scheduled-padding-learning, confidence-based-remasking, block-wise-decoding, shared-vocabulary-space

阅读注意

  • 重点关注其如何在不引入任务特定头或异构目标的情况下,仅通过 masking 配置实现理解与生成的统一
  • 注意三阶段训练中各阶段的数据构成与分辨率/帧数变化(见附录 Table 10 和 11)
  • 对比其与 NExT-OMNI 在训练目标上的差异:后者混合 flow-matching 与重建损失,而 Dynin-Omni 使用纯离散扩散目标

质量说明

  • 采用来源:rawraw/papers/2026/03/2604.00007.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了详细的架构设计、训练策略、实验结果及消融分析,包含充分的技术细节与 benchmark 数据,来源可靠。