Qwen3-TTS Technical Report
论文导读
Qwen3-TTS 是一个支持多语言、可控、鲁棒且流式生成的大规模语音合成模型系列,采用双轨架构与两种新型语音 tokenizer 实现高质量低延迟语音生成。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Qwen3-TTS 技术报告
一句话定位
Qwen3-TTS 是一个支持多语言、可控、鲁棒且流式生成的大规模语音合成模型系列,采用双轨架构与两种新型语音 tokenizer 实现高质量低延迟语音生成。
小学生也能听懂
这篇论文造了一个会说话的AI,像魔法话筒一样,只要给它3秒声音或一句话,就能用你的声音说出任何话,支持10种语言,说话又快又自然,还能模仿不同语气,而且说得再长也不会出错。
为什么值得记录
- 首次在大规模 TTS 模型中实现 97ms 超低首包延迟,支持实时流式语音合成
- 在零样本语音克隆、跨语言生成和可控语音设计等多个任务上达到 SOTA 性能
- 提出两种新型语音 tokenizer:语义-声学融合的 25Hz 单码本 tokenizer 和面向低延迟的 12.5Hz 多码本 tokenizer
- 支持 10 种语言的语音克隆与跨语言迁移,并在长语音生成(>10 分钟)中表现稳定
- 开源完整模型与 tokenizer,采用 Apache 2.0 许可,推动社区研究
核心方法
- 采用基于 Qwen3 语言模型的双轨自回归架构,文本与语音 token 在通道维度拼接,实现流式输入输出
- 引入 Qwen-TTS-Tokenizer-25Hz:基于 Qwen2-Audio 的两阶段训练,融合语义与声学信息,使用块级 Flow Matching DiT 实现流式波形重建
- 引入 Qwen-TTS-Tokenizer-12Hz:12.5Hz 多码本结构,首层编码语义,后续 15 层 RVQ 编码声学细节,配合轻量因果 ConvNet 实现即时解码
- 训练分三阶段:通用预训练(500 万小时多语言数据)、高质量数据持续预训练、长上下文扩展(最大 32k token)
- 后训练包含 DPO 偏好对齐、GSPO 规则奖励优化和轻量说话人微调,提升自然度与可控性
- 支持语音克隆(3 秒参考音频或文本-语音对)、语音设计(自然语言描述)和细粒度风格控制
- 通过 Multi-Token Prediction (MTP) 模块高效建模多码本序列,实现首帧即时生成
关键结果
- 零样本语音克隆在 Seed-TTS 测试集上达到最低 WER:Qwen3-TTS-12Hz-1.7B 在 test-en 上为 1.24,优于 CosyVoice3 和 MiniMax
- 跨语言生成中,中文到韩语错误率降低 66%(4.82 vs 14.4),显著优于 CosyVoice 系列
- 可控语音生成在 InstructTTSEval 上超越 GPT-4o-mini-tts,中文目标说话人编辑 APS 提升 28%
- 长语音生成(>10 分钟)WER 低至 1.533(中文)和 1.571(英文),无重复或断点问题
- 流式效率:Qwen3-TTS-12Hz-0.6B 首包延迟仅 97ms,RTF 低至 0.288(并发 1),优于 25Hz 变体
- Tokenizer-12Hz 在 LibriSpeech 上实现 SOTA 重建质量:PESQ_WB=3.21, UTMOS=4.16, SIM=0.95
局限与风险
- 25Hz tokenizer 因 DiT 需 lookahead,首包延迟较高(>150ms),不适合超低延迟场景
- 12Hz 模型在长语音生成中稳定性略逊于 25Hz 变体,表明语义 token 对长程一致性更有利
- 多码本设计增加建模复杂度,MTP 模块需额外训练以协调各码本预测
- 语音设计能力依赖文本指令质量,复杂描述可能引发不一致输出
- 未公开训练数据细节与具体超参数,复现存在一定门槛
适合沉淀的概念
text-to-speech, speech-tokenizer, streaming-tts, voice-cloning, multilingual-speech-synthesis, cross-lingual-voice-transfer, controllable-speech-generation, low-latency-audio-generation, autoregressive-speech-model, dual-track-architecture, multi-codebook-quantization, flow-matching-dit, direct-preference-optimization, speaker-encoder
阅读注意
- 关注双 tokenizer 设计动机:25Hz 侧重语义表达与 LLM 集成,12Hz 侧重低延迟与声学细节
- 注意训练阶段划分:S1 通用映射 → S2 高质量去噪 → S3 长上下文增强,体现数据质量与长度的重要性
- 首包延迟由 LM TTFP 和 tokenizer 解码时间共同决定,12Hz tokenizer 解码仅需 4ms,是关键优势
- 长语音生成评估使用内部数据集,需注意与公开基准的可比性
- 可控生成采用 ChatML 格式,将语音控制视为语言建模任务,是统一框架的核心思想
质量说明
- 采用来源:
clean,papers/2026/01/2601.15621.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含详细架构、训练策略、实验设置与结果,数据充分,结论有支撑。