实体
model multimodal speech-model architecture open-source codec
创建2026-04-15
更新2026-04-15
阅读量级1 分钟
实体导读

CVPR 2025,HKUST/SenseTime 联合发布的端到端 Omni-modal LLM,首个同时在视觉-语言和语音基准上达到 SOTA 的模型。

  1. 核心创新
  2. 关键结果
  3. 局限
  4. 关联

EMOVA (EMotionally Omni-present Voice Assistant)

CVPR 2025,HKUST/SenseTime 联合发布的端到端 Omni-modal LLM,首个同时在视觉-语言和语音基准上达到 SOTA 的模型。

核心创新

  1. Semantic-Acoustic 分离 tokenizer (S2U):
  2. 将语音分离为语义单元(内容)和声学风格(情绪/音调)
  3. 共享 codebook,在无标注 + 语音-文本对数据上训练
  4. 最少数据即可将语音集成到 LLM

  5. Text-centric 对齐:

  6. 以文本为桥梁对齐视觉和语音
  7. 无需三模态训练数据
  8. 惊人发现: omni-modal 对齐反而增强了视觉-语言和语音能力

  9. Lightweight Style Module: 轻量级情绪/音调控制模块

关键结果

  • 同时在 VLM 和 Speech 基准 SOTA(首次)
  • WER/CER: 2.9-5.8(显著优于同期 omni 模型)
  • 支持情绪丰富的实时语音对话
  • 7B 参数

局限

  • 无全双工建模
  • 无直接 unit-to-unit 语音生成
  • 视觉生成能力有限

关联