---
title: "MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech"
title_zh: "MGM-Omni：面向个性化长时语音的 Omni LLM 扩展"
arxiv_id: "2509.25131"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2025/09/2509.25131.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# MGM-Omni：面向个性化长时语音的 Omni LLM 扩展

## 一句话定位

提出 MGM-Omni，一种双轨架构的 Omni LLM，通过解耦多模态理解与语音生成，实现高效长时语音理解与个性化语音合成。

## 小学生也能听懂

这篇论文造了一个会听、会说还能记住你声音的“AI大脑”，它把“听懂”和“说话”分开处理，像两个人合作：一个负责理解你说的话，另一个专门模仿你的声音说话，还能一口气说10分钟不停，又快又像真人。

## 为什么值得记录

- 首次实现端到端的长时（>10分钟）个性化语音生成，支持零样本音色克隆
- 提出 Chunk-Based Parallel Decoding 机制，缓解文本-语音 token 速率不匹配问题，提升长语音生成质量与推理速度
- 构建 Long-TTS-Eval 基准，填补长时语音生成系统评估空白
- 在仅使用约40万小时音频数据下，性能优于使用百万小时级数据的同期模型，体现数据高效性

## 核心方法

- 采用双轨架构：MLLM（‘大脑’）负责多模态理解与文本生成，SpeechLM（‘嘴巴’）专责实时语音合成
- 音频理解：双编码器（Qwen2-Audio + Belle-Whisper）融合声学/语义特征，结合信息挖掘模块增强表示
- 训练策略：两阶段训练（音频-文本对齐预训练 + 统一多模态训练），支持长短音频统一处理
- 语音生成：基于 Qwen3 初始化 SpeechLM，引入 TTS-Adapter 实现文本到语音表示转换
- Chunk-Based Decoding：将文本分块处理，延迟生成语音 token，增强跨模态对齐，减少长序列错误累积
- Parallel Decoding：扩展词表，单步并行预测多个语音 token，提升推理效率达3倍
- 数据构建：收集30万小时真实语音与10万小时合成语音，支持中英文零样本音色克隆

## 关键结果

- 长音频理解：在长达4500秒的‘大海捞针’测试中显著优于 Qwen2.5-Omni
- 短语音生成：在 Seed-TTS-Eval 上，MGM-Omni-TTS-4B 实现英文 WER 2.22、中文 CER 1.18，优于 CosyVoice2 与 Qwen2.5-Omni
- 长语音生成：在 Long-TTS-Eval 上错误率最低，RTF 推理延迟最优，支持超10分钟连续语音合成
- 多模态理解：在 TextVQA-Speech 等语音指令 VQA 任务上准确率领先（如 ChartVQA-Speech 达72.1%）
- 消融实验：移除 Chunk-Based Decoding 导致错误率上升超30%，验证其对长语音生成的关键作用

## 局限与风险

- 未开源完整训练代码与大规模数据集，仅提供模型权重与推理接口
- Parallel Decoding 在并行度增大时轻微影响语音质量，需权衡效率与保真度
- Long-TTS-Eval 依赖 ASR 转录评估，对同义表达鲁棒性仍受限于归一化策略

## 适合沉淀的概念

`omni-llm`, `dual-track-architecture`, `chunk-based-decoding`, `parallel-decoding`, `long-form-speech-generation`, `zero-shot-voice-cloning`, `long-tts-eval`, `speech-tokenizer-fsq`

## 阅读注意

- 重点关注双轨设计如何解耦理解与生成，避免级联系统延迟与误差累积
- 注意 Chunk-Based Decoding 与 Parallel Decoding 的协同机制：前者对齐模态，后者提升效率
- Long-TTS-Eval 的归一化评估策略（式5）可缓解 ASR 转录偏差问题，值得借鉴
- 附录 A.3 提供长语音生成定性对比，直观展示 MGM-Omni 在复杂文本（如古诗、代码切换）上的优势

## 质量说明

- 采用来源：`clean`，`papers/2025/09/2509.25131.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，方法描述清晰，实验充分，包含消融研究与新基准构建。数据量、模型规模、性能指标均明确，结论有支撑。
