---
title: "2412.10117"
title_zh: "CosyVoice 2：基于大语言模型的可扩展流式语音合成"
arxiv_id: "2412.10117"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2024/12/2412.10117.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# CosyVoice 2：基于大语言模型的可扩展流式语音合成

## 一句话定位

提出 CosyVoice 2，通过有限标量量化、统一文本-语音语言模型和分块因果流匹配，实现低延迟、高质量、支持流式与非流式统一框架的零样本语音合成。

## 小学生也能听懂

这篇论文发明了一个叫 CosyVoice 2 的“语音魔法盒”，它能像真人一样边听边说话（流式），也能一口气说完（非流式），还能模仿不同人的声音和情绪，而且又快又清楚，就像手机里的智能语音助手变得更聪明了。

## 为什么值得记录

- 首次在一个统一模型中同时支持流式与非流式语音合成，降低部署复杂度
- 采用预训练 LLM（Qwen2.5-0.5B）作为文本-语音语言模型主干，提升上下文理解能力
- 引入有限标量量化（FSQ）替代 VQ，显著提高语音 token 的码本利用率
- 提出分块感知因果流匹配机制，使扩散模型支持流式生成，填补 NAR 模型流式化空白
- 集成自然语言与细粒度指令控制，支持情感、口音、角色风格等多样化语音生成

## 核心方法

- 使用 SenseVoice-Large ASR 编码器插入 FSQ 模块构建监督式语义语音 tokenizer，输出 25Hz 离散语音 token
- 采用 Qwen2.5-0.5B 作为文本-语音语言模型，移除文本编码器和说话人嵌入，直接以原始文本为输入进行自回归 token 预测
- 设计混合序列构造策略：非流式模式下拼接完整文本与语音 token；流式模式下按 N:M 比例交错排列文本与语音 token，并引入填充 token 处理未输入文本
- 构建分块因果流匹配模型，通过四种掩码（非因果、全因果、Chunk-M、Chunk-2M）支持不同延迟-质量权衡场景，训练时随机采样掩码实现多场景兼容
- 使用最优传输（OT）流匹配 ODE 建模 Mel 频谱生成过程，结合分类器无关引导（CFG）提升生成质量
- 引入可微 ASR 奖励（LASR）和 DPO 强化学习优化 SFT 阶段，联合优化发音准确性与说话人相似度

## 关键结果

- 在 SEED 测试集上，CosyVoice 2 达到人类水平自然度（NMOS 0.721），流式模式下合成质量几乎无损
- 第一包延迟低至 M·(d_lm + d_fm + d_voc)，适用于实时语音交互场景（如 GPT-4o 语音聊天）
- 多说话人微调（mSFT）后，说话人相似度（SS）从 0.697 提升至 0.795，WER 保持稳定
- ASR 奖励优化在跨域测试中表现优于 DPO，尤其在重复文本等困难样本上更具泛化能力
- 支持中、英、日、韩等多语言零样本合成，语音 tokenizer 具备跨语言泛化能力

## 局限与风险

- 仅支持有限语言，字符集重叠的语言（如中日韩混用）合成性能可能下降
- 无法通过文本指令直接控制音色（timbre）等声学特征，限制角色扮演应用
- 不具备歌唱合成能力，音乐相关生成效果不佳
- 流式模式下仍需预设 N:M 比例，灵活性受限于分块策略

## 适合沉淀的概念

`finite-scalar-quantization`, `chunk-aware-causal-flow-matching`, `unified-streaming-nonstreaming-tts`, `text-speech-language-model`, `classifier-free-guidance`, `differentiable-asr-reward`, `multi-speaker-fine-tuning`, `low-latency-speech-synthesis`

## 阅读注意

- 关注 FSQ 如何替代传统 VQ 并提升码本利用率（公式 1-2）
- 理解流式与非流式序列构造差异（图 2 及 2.3 节）
- 分析四种因果掩码的设计动机与适用场景（2.4 节）
- 注意 LASR 与 DPO 在强化学习中的对比实验结果（表 11）
- 查看开源地址 https://github.com/FunAudioLLM/CosyVoice 获取模型与演示

## 质量说明

- 采用来源：`raw`，`raw/papers/2024/12/2412.10117.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置与结果分析，包含消融实验与多维度评估，技术细节充分，复现路径清晰。
