---
title: "2407.05407"
title_zh: "CosyVoice：基于监督语义令牌的可扩展多语言零样本语音合成器"
arxiv_id: "2407.05407"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2024/07/2407.05407.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# CosyVoice：基于监督语义令牌的可扩展多语言零样本语音合成器

## 一句话定位

提出 CosyVoice，首个使用监督语义令牌（S³ tokenizer）的零样本多语言语音合成系统，结合 LLM 与条件流匹配模型，显著提升内容一致性与说话人相似度。

## 小学生也能听懂

这篇论文发明了一个叫CosyVoice的“声音复印机”，它能用一句话模仿任何人的声音说话，还能说不同语言、带情绪，而且说得特别清楚、像真人一样，连电脑都很难听出错。

## 为什么值得记录

- 首次将监督语义令牌引入 TTS 模型，解决无监督令牌缺乏文本对齐和语义信息的问题
- 提出 CosyVoice 架构，融合 LLM 文本到令牌生成与条件流匹配令牌到语音合成，无需音素时长预测或强制对齐器
- 在零样本语音克隆中实现人类水平的内容一致性和更高的说话人相似度
- 支持跨语言语音克隆、情感控制和指令生成，具备强可扩展性
- 开源模型与代码，推动社区对监督离散语音表示的研究

## 核心方法

- 使用微调的多语言 ASR 模型（SenseVoice）构建监督语义令牌器（S³ tokenizer），在编码器中插入向量量化层（VQ），通过 ASR 损失优化码本
- 将 TTS 建模为自回归序列生成任务：输入序列包含 [S, v, text encodings, T, speech tokens, E]，其中 v 为 x-vector 说话人嵌入
- 采用 LLM 学习文本编码与语音令牌之间的映射关系，仅对语音令牌和结束符计算交叉熵损失
- 使用最优传输条件流匹配（OT-CFM）模型将令牌转换为梅尔频谱，替代传统扩散模型以加速训练与推理
- 引入分类器无关引导（CFG）、余弦时间调度器和掩码条件机制优化流匹配过程
- 支持零样本上下文学习：通过构造提示语音与目标文本的混合序列实现任意语音克隆
- 支持跨语言场景：当提示语音与目标文本语言不同时，省略提示文本部分以避免韵律干扰

## 关键结果

- 在 LibriTTS 英文测试集上，CosyVoice 的 WER 为 2.89%，接近原始语音的 2.66%，且说话人相似度（SS）达 74.30%，高于原始语音的 69.67%
- 在 AISHELL-3 中文测试集上，CER 为 3.82%，与原始语音的 2.52% 相当，SS 达 81.58%，显著优于原始语音
- ASR 重排序后，英文 WER 降至 1.51%，中文 CER 降至 1.84%，显示后处理潜力
- 情感控制实验表明，CosyVoice-instruct 在六种情绪上的平均准确率显著高于基础版本（如 Sad 情绪从 0.45 提升至 0.98）
- 作为数据生成器使用时，合成数据与真实数据混合训练可使 ASR 模型在 LibriSpeech 测试集上的 WER 降低至 1.93%（dev_clean）

## 局限与风险

- 依赖高质量的多语言 ASR 模型（如 SenseVoice）来构建监督令牌器，可能限制其在低资源语言上的泛化能力
- 未公开具体训练数据规模和模型参数量，仅提及使用“内部大规模数据集”，影响复现透明度
- 流匹配模型虽快于扩散模型，但仍需多步 ODE 求解，实时性不如非自回归模型
- 跨语言克隆性能未在更多语言对上验证，目前仅展示中英双语结果

## 适合沉淀的概念

`supervised-semantic-tokens`, `s3-tokenizer`, `conditional-flow-matching`, `zero-shot-voice-cloning`, `multilingual-tts`, `classifier-free-guidance`, `optimal-transport-cfm`, `x-vector-speaker-embedding`

## 阅读注意

- 重点关注 S³ tokenizer 如何结合 ASR 模型与 VQ 实现监督式离散表示
- 注意 LLM 输入序列的设计：为何插入 T 分隔符？为何只对语音令牌计算损失？
- OT-CFM 相比传统扩散模型的优势在于更简单的梯度与更快的生成速度
- 实验部分需区分 CosyVoice-base 与 CosyVoice-instruct 的差异，后者支持风格指令输入
- 数据生成实验表明 CosyVoice 可用于增强 ASR 训练，体现其高质量合成能力

## 质量说明

- 采用来源：`raw`，`raw/papers/2024/07/2407.05407.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的模型架构、训练策略与多维度实验结果，包括客观指标、消融分析和应用场景验证。尽管部分细节（如数据规模、模型大小）未完全公开，但核心方法描述清晰，实验设计合理，结论可信。
