---
title: "2505.17589"
title_zh: "CosyVoice 3：面向真实场景的语音生成模型"
arxiv_id: "2505.17589"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2025/05/2505.17589.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# CosyVoice 3：面向真实场景的语音生成模型

## 一句话定位

提出 CosyVoice 3，通过数据与模型规模扩展、新型语音 tokenizer 和差分奖励优化，实现高质量零样本多语言语音合成。

## 小学生也能听懂

这篇论文造了一个叫 CosyVoice 3 的“声音复印机”，它能用很少的录音模仿任何人说话，支持多种语言和方言。它用了更多数据和更大的模型，还改进了声音编码方法，让合成语音更自然、更像真人，还能听懂指令控制语气和情感。

## 为什么值得记录

- 首次将训练数据从万小时级扩展至百万小时级，覆盖9种语言和18种中文方言，显著提升语言与领域多样性
- 提出基于 MinMo 模型的多任务监督训练语音 tokenizer，增强韵律自然度和副语言信息建模能力
- 设计可微奖励优化（DiffRO）方法，避免传统 RL 在语音生成中的高计算成本与反馈模糊问题
- 模型参数量从 0.5B 增至 1.5B，验证了模型规模扩展对语音合成性能的持续提升作用
- 发布 CV3-Eval 基准，支持真实场景下的零样本语音合成评估

## 核心方法

- 语音 tokenizer 基于 MinMo 语音理解大模型，插入 FSQ 量化模块，并通过 ASR、LID、SER、AED、SA 等多任务联合训练
- 采用 Differentiable Reward Optimization (DiffRO) 进行后训练：使用 ASR-like Token2Text 模型计算 token 级奖励，结合 Gumbel-Softmax 采样与 KL 散度约束进行端到端优化
- 支持多任务奖励（MTR），整合情感、MOS、事件检测等下游任务，实现细粒度语音属性控制
- 引入发音修复机制，扩展 tokenizer 词表以支持汉字-拼音、英文-音素混合输入，提升发音可控性
- 利用 LLM（Qwen-Max）构建文本归一化自训练数据，增强对原始文本（含数字、符号）的鲁棒性
- 通过自然语言指令实现多语言说话人转换与风格控制，支持超100种情感、角色、口音等表达类型
- 训练流程包含大规模预训练、DiffRO 后训练、持续预训练与多说话人微调四阶段

## 关键结果

- 在 SEED-TTS-Eval 上，CosyVoice 3 的 WER/CER 显著低于 CosyVoice 2，尤其在 test-en 和 test-hard 集上错误率降低明显
- 多语言合成任务中，中、英、德、西、法、意、俄语的内容一致性（CER/WER）均低于 4%
- 日语合成 CER 为 9%，韩语为 6%，受限于数据质量与字符转换复杂度
- 说话人相似度与韵律自然度在主观评测中达到 SOTA 水平（具体 MOS 未给出数值）
- 百万小时训练数据 + 1.5B 参数模型组合在跨语言语音克隆任务中表现最优

## 局限与风险

- 无法通过文本指令直接控制音色（timbre），限制了角色扮演类应用
- 歌唱语音生成效果不佳，需额外加入歌唱数据训练 tokenizer 与 LM
- DiffRO 依赖高质量的 ASR 与下游任务模型，存在误差传播风险
- 日语合成性能受限，因汉字转假名引入额外错误及多音字问题

## 适合沉淀的概念

`cosyvoice-3`, `speech-tokenizer`, `differentiable-reward-optimization`, `diffro`, `multilingual-tts`, `zero-shot-speech-synthesis`, `scaling-laws`, `post-training`, `minmo-model`, `fsq-quantization`

## 阅读注意

- 重点关注 DiffRO 如何绕过音频生成直接优化离散 token，以及其与 RLHF 的区别
- 注意语音 tokenizer 的训练数据来源与多任务设计细节（表3）
- 图1展示了与主流模型在内容一致性与说话人相似度上的对比，是核心结果
- 第2.6节提出的‘单语说话人转多语’机制依赖自然语言指令，值得复现参考
- CV3-Eval 基准构建方法见第5节，基于 Common Voice、FLUERS 等真实数据

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/05/2505.17589.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置与结果分析，关键创新点清晰，数据与模型规模有具体数字支撑，但未提供主观评分（如 MOS）的具体数值。
