---
title: "Paper: 2604.00007"
title_zh: "Dynin-Omni：全模态统一大扩散语言模型"
arxiv_id: "2604.00007"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2026/03/2604.00007.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Dynin-Omni：全模态统一大扩散语言模型

## 一句话定位

提出首个基于掩码扩散的8B规模开源全模态统一模型，支持文本、图像、语音的理解与生成以及视频理解，在共享离散词元空间内实现端到端迭代 refinement。

## 小学生也能听懂

这篇论文造了一个像“万能积木盒”一样的AI模型，能同时看懂文字、图片、声音和视频，还能自己生成它们。它用一个聪明的方法（叫掩码扩散）把不同内容变成统一的小积木，让AI像拼图一样学习，最终在19个测试中都打败了其他开源模型。

## 为什么值得记录

- 首次将掩码扩散范式扩展至真正全模态（text, image, speech, video）统一建模，摆脱对外部生成器或多阶段 handoff 的依赖
- 在19个多模态基准上全面超越现有开源统一模型（如 Show-o2、HyperCLOVAX-8B-Omni、NExT-OMNI），并在部分任务上接近专用专家系统性能
- 提出 modality-disentangled 多阶段训练策略与 scheduled padding learning，有效解决异构数据联合训练稳定性问题

## 核心方法

- 采用 masked diffusion 框架，所有模态映射到共享离散词元空间（text: 12,680；vision: 8,192；speech: 4,096），通过单一 Transformer 主干进行双向上下文建模
- 训练目标为统一掩码预测损失：随机 masking 输入序列中的词元，模型基于可见上下文重构被 mask 位置的真实词元
- 推理时使用置信度重 masking 策略，并结合模态特异性解码模式（文本/语音：block-wise 顺序解码；图像：全并行解码）
- 三阶段训练流程：(1) 新模态适配（视频、语音）→ (2) 全模态对齐 SFT → (3) 高级能力强化（推理、高分辨率生成等）
- 引入 modality-disentangled model merging 技术，在扩展语音词表时保留原始 backbone 语义一致性
- 使用预训练且冻结的模态 tokenizer/detokenizer（图像：MAGVIT-v2；语音：EMOVA S2U/U2S），确保表示稳定性

## 关键结果

- GSM8K 数学推理：87.6 分，优于同类统一模型
- MME-P 多模态理解：1733.6 分
- VideoMME 视频理解：61.4 分，较基线提升 +10.1%
- GenEval 图像生成评估：0.87 分，接近专用生成模型水平
- LibriSpeech test-clean 语音识别 WER：2.1%，具备强语音理解能力

## 局限与风险

- 未开源完整训练代码与数据 pipeline，仅提供模型权重与 demo
- 视频生成能力尚未实现，目前仅支持视频理解
- detokenizer 仍为轻量级固定模块，可能限制高保真生成上限
- 长语音合成（>20秒）质量与连贯性有待进一步验证

## 适合沉淀的概念

`masked-diffusion-language-model`, `omnimodal-foundation-model`, `discrete-tokenization`, `modality-disentangled-merging`, `scheduled-padding-learning`, `confidence-based-remasking`, `block-wise-decoding`, `shared-vocabulary-space`

## 阅读注意

- 重点关注其如何在不引入任务特定头或异构目标的情况下，仅通过 masking 配置实现理解与生成的统一
- 注意三阶段训练中各阶段的数据构成与分辨率/帧数变化（见附录 Table 10 和 11）
- 对比其与 NExT-OMNI 在训练目标上的差异：后者混合 flow-matching 与重建损失，而 Dynin-Omni 使用纯离散扩散目标

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/03/2604.00007.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了详细的架构设计、训练策略、实验结果及消融分析，包含充分的技术细节与 benchmark 数据，来源可靠。
