Paper: 2604.00007
论文导读
提出首个基于掩码扩散的8B规模开源全模态统一模型,支持文本、图像、语音的理解与生成以及视频理解,在共享离散词元空间内实现端到端迭代 refinement。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Dynin-Omni:全模态统一大扩散语言模型
一句话定位
提出首个基于掩码扩散的8B规模开源全模态统一模型,支持文本、图像、语音的理解与生成以及视频理解,在共享离散词元空间内实现端到端迭代 refinement。
小学生也能听懂
这篇论文造了一个像“万能积木盒”一样的AI模型,能同时看懂文字、图片、声音和视频,还能自己生成它们。它用一个聪明的方法(叫掩码扩散)把不同内容变成统一的小积木,让AI像拼图一样学习,最终在19个测试中都打败了其他开源模型。
为什么值得记录
- 首次将掩码扩散范式扩展至真正全模态(text, image, speech, video)统一建模,摆脱对外部生成器或多阶段 handoff 的依赖
- 在19个多模态基准上全面超越现有开源统一模型(如 Show-o2、HyperCLOVAX-8B-Omni、NExT-OMNI),并在部分任务上接近专用专家系统性能
- 提出 modality-disentangled 多阶段训练策略与 scheduled padding learning,有效解决异构数据联合训练稳定性问题
核心方法
- 采用 masked diffusion 框架,所有模态映射到共享离散词元空间(text: 12,680;vision: 8,192;speech: 4,096),通过单一 Transformer 主干进行双向上下文建模
- 训练目标为统一掩码预测损失:随机 masking 输入序列中的词元,模型基于可见上下文重构被 mask 位置的真实词元
- 推理时使用置信度重 masking 策略,并结合模态特异性解码模式(文本/语音:block-wise 顺序解码;图像:全并行解码)
- 三阶段训练流程:(1) 新模态适配(视频、语音)→ (2) 全模态对齐 SFT → (3) 高级能力强化(推理、高分辨率生成等)
- 引入 modality-disentangled model merging 技术,在扩展语音词表时保留原始 backbone 语义一致性
- 使用预训练且冻结的模态 tokenizer/detokenizer(图像:MAGVIT-v2;语音:EMOVA S2U/U2S),确保表示稳定性
关键结果
- GSM8K 数学推理:87.6 分,优于同类统一模型
- MME-P 多模态理解:1733.6 分
- VideoMME 视频理解:61.4 分,较基线提升 +10.1%
- GenEval 图像生成评估:0.87 分,接近专用生成模型水平
- LibriSpeech test-clean 语音识别 WER:2.1%,具备强语音理解能力
局限与风险
- 未开源完整训练代码与数据 pipeline,仅提供模型权重与 demo
- 视频生成能力尚未实现,目前仅支持视频理解
- detokenizer 仍为轻量级固定模块,可能限制高保真生成上限
- 长语音合成(>20秒)质量与连贯性有待进一步验证
适合沉淀的概念
masked-diffusion-language-model, omnimodal-foundation-model, discrete-tokenization, modality-disentangled-merging, scheduled-padding-learning, confidence-based-remasking, block-wise-decoding, shared-vocabulary-space
阅读注意
- 重点关注其如何在不引入任务特定头或异构目标的情况下,仅通过 masking 配置实现理解与生成的统一
- 注意三阶段训练中各阶段的数据构成与分辨率/帧数变化(见附录 Table 10 和 11)
- 对比其与 NExT-OMNI 在训练目标上的差异:后者混合 flow-matching 与重建损失,而 Dynin-Omni 使用纯离散扩散目标
质量说明
- 采用来源:
raw,raw/papers/2026/03/2604.00007.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了详细的架构设计、训练策略、实验结果及消融分析,包含充分的技术细节与 benchmark 数据,来源可靠。