---
title: "EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions"
title_zh: "EMOVA：赋予语言模型以生动情感看、听、说的能力"
arxiv_id: "2409.18042"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2024/09/2409.18042.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# EMOVA：赋予语言模型以生动情感看、听、说的能力

## 一句话定位

提出首个端到端全模态大语言模型 EMOVA，通过语义-声学解耦语音 tokenizer 和轻量级风格模块，在保持领先视觉-语言性能的同时，实现富有情感的语音对话生成。

## 小学生也能听懂

这篇论文造了一个会看图片、听懂说话、还能用有感情的声音回答的AI，就像给机器人装上了眼睛、耳朵和会表达情绪的嘴巴，它通过分步学习和特殊的声音处理技术，既能准确理解图文，又能说出开心、难过等不同情绪的话。

## 为什么值得记录

- 首次实现同时具备 state-of-the-art 视觉-语言与语音能力的端到端全模态 LLM
- 提出语义-声学解耦的语音 tokenizer，提升跨模态对齐效果并支持灵活情感控制
- 验证双模态数据（图像-文本、语音-文本）联合对齐优于顺序训练，且互不干扰
- 引入链式模态生成策略，将语音响应分解为文本识别→文本生成→风格与语音单元生成三步
- 在 15 项视觉-语言基准和 ASR/TTS 任务上均取得最优或可比结果

## 核心方法

- 采用 Qwen-2.5 系列作为基础 LLM，QwenViT 作为连续视觉编码器
- 设计 Speech-to-Unit (S2U) tokenizer，基于 SPIRAL 架构 + FSQ 量化，将语音波形转为离散单元（4096 词表，25 tokens/s）
- 实现语义-声学解耦：仅语义嵌入被量化用于 LLM 对齐，声学风格嵌入独立保留用于后续控制
- 构建 Unit-to-Speech (U2S) detokenizer，基于条件 VAE（VITS 架构），接收语义单元与风格原型生成带情感语音
- 三阶段训练：1）视觉-语言预对齐（仅训练 projector）；2）全模态文本中心联合对齐（图像-文本 + 语音-文本）；3）全模态指令微调（含情感标签合成数据）
- 情感控制机制：LLM 显式预测风格标签（性别、音高、情绪），映射为风格原型输入 U2S 模块
- 数据合成：利用 GPT-4o 推断对话上下文的情感/音高标签，配合 CosyVoice/Azure TTS 合成多样化语音指令数据

## 关键结果

- EMOVA-72B 在 15 个视觉-语言基准中 11 项超越 GPT-4V/Gemini Pro 1.5，如 MME (2402), MMBench (86.4), OCRBench (843)
- LibriSpeech test-clean WER 达 2.9%（72B），优于 Whisper-Large (3.0%) 及所有对比全模态模型
- TTS 质量显著提升：英文 TTS-WER 低至 2.90%，中文 TTS-CER 为 12.00%
- 情感可控性测试：U2S 在四种情绪（中性、高兴、悲伤、愤怒）上的 SER 准确率达 82.50%–97.70%
- 端到端语音对话评分（Speech-Image-EN）达 7.45/10，文本响应与风格分类均表现优异

## 局限与风险

- 当前仅支持单向输入输出（非全双工），无法实时交互中同时处理用户语音与生成响应
- 语音生成仍依赖文本中间表示，未实现纯 unit-to-unit 直接生成，影响生成速度
- 视觉模块仅使用单一预训练 ViT，未融合多架构或多范式编码器（如 MoE 或自监督模型）
- 缺乏对噪声视觉输入的鲁棒性分析与优化

## 适合沉淀的概念

`全模态大语言模型`, `语义-声学解耦`, `语音 tokenization`, `情感可控语音合成`, `文本中心跨模态对齐`, `链式模态生成`, `端到端语音对话`, `三阶段训练范式`

## 阅读注意

- 重点关注第 3.2 节语音 tokenizer 的解耦机制及其如何促进模态对齐
- 第 4.1 节实验对比了多种对齐策略，证明联合训练优于顺序训练
- 附录 A 提供了 S2U/U2S 的详细架构与训练细节，对复现至关重要
- 情感控制依赖于 LLM 显式预测风格标签，而非隐式学习，需关注其数据合成流程（附录 B.2）
- 评估指标设计复杂，包含端到端评分、风格分类准确率、TTS-WER 等多维度（附录 D）

## 质量说明

- 采用来源：`clean`，`papers/2024/09/2409.18042.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含详细架构、训练策略、实验结果与消融分析，数据与代码暂未开源但方法描述充分可复现。
