实体
model multimodal speech-model architecture streaming codec
创建2026-04-15
更新2026-04-15
阅读量级1 分钟
实体导读

CUHK/JiaLiab 发布的 "Brain-Mouth" 双轨 Omni LLM,专注长音频理解和个性化语音生成。

  1. 核心架构
  2. 关键创新
  3. 性能
  4. 关联

MGM-Omni

CUHK/JiaLiab 发布的 "Brain-Mouth" 双轨 Omni LLM,专注长音频理解和个性化语音生成。

核心架构

  • Brain (MLLM): 多模态推理(文本+音频)
  • Mouth (SpeechLM): 实时语音合成
  • Dual Audio Encoder: 通用音频 + 语音编码器

关键创新

  • Chunk-based Parallel Decoding: 缓解文本-语音 token rate 差异,推理加速 3x
  • Zero-shot Voice Cloning: 流式场景下长时间保持 timbre 一致
  • 长音频理解: 支持 60+ 分钟音频输入
  • 数据高效: 训练数据量显著少于同类

性能

  • AISHELL CER: 1.8
  • DocVQA-Speech: 87.4%
  • 长音频处理: 4500s 成功率高
  • timbre 稳定性优于开源竞品

关联