---
title: "Qwen3-TTS Technical Report"
title_zh: "Qwen3-TTS 技术报告"
arxiv_id: "2601.15621"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2026/01/2601.15621.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Qwen3-TTS 技术报告

## 一句话定位

Qwen3-TTS 是一个支持多语言、可控、鲁棒且流式生成的大规模语音合成模型系列，采用双轨架构与两种新型语音 tokenizer 实现高质量低延迟语音生成。

## 小学生也能听懂

这篇论文造了一个会说话的AI，像魔法话筒一样，只要给它3秒声音或一句话，就能用你的声音说出任何话，支持10种语言，说话又快又自然，还能模仿不同语气，而且说得再长也不会出错。

## 为什么值得记录

- 首次在大规模 TTS 模型中实现 97ms 超低首包延迟，支持实时流式语音合成
- 在零样本语音克隆、跨语言生成和可控语音设计等多个任务上达到 SOTA 性能
- 提出两种新型语音 tokenizer：语义-声学融合的 25Hz 单码本 tokenizer 和面向低延迟的 12.5Hz 多码本 tokenizer
- 支持 10 种语言的语音克隆与跨语言迁移，并在长语音生成（>10 分钟）中表现稳定
- 开源完整模型与 tokenizer，采用 Apache 2.0 许可，推动社区研究

## 核心方法

- 采用基于 Qwen3 语言模型的双轨自回归架构，文本与语音 token 在通道维度拼接，实现流式输入输出
- 引入 Qwen-TTS-Tokenizer-25Hz：基于 Qwen2-Audio 的两阶段训练，融合语义与声学信息，使用块级 Flow Matching DiT 实现流式波形重建
- 引入 Qwen-TTS-Tokenizer-12Hz：12.5Hz 多码本结构，首层编码语义，后续 15 层 RVQ 编码声学细节，配合轻量因果 ConvNet 实现即时解码
- 训练分三阶段：通用预训练（500 万小时多语言数据）、高质量数据持续预训练、长上下文扩展（最大 32k token）
- 后训练包含 DPO 偏好对齐、GSPO 规则奖励优化和轻量说话人微调，提升自然度与可控性
- 支持语音克隆（3 秒参考音频或文本-语音对）、语音设计（自然语言描述）和细粒度风格控制
- 通过 Multi-Token Prediction (MTP) 模块高效建模多码本序列，实现首帧即时生成

## 关键结果

- 零样本语音克隆在 Seed-TTS 测试集上达到最低 WER：Qwen3-TTS-12Hz-1.7B 在 test-en 上为 1.24，优于 CosyVoice3 和 MiniMax
- 跨语言生成中，中文到韩语错误率降低 66%（4.82 vs 14.4），显著优于 CosyVoice 系列
- 可控语音生成在 InstructTTSEval 上超越 GPT-4o-mini-tts，中文目标说话人编辑 APS 提升 28%
- 长语音生成（>10 分钟）WER 低至 1.533（中文）和 1.571（英文），无重复或断点问题
- 流式效率：Qwen3-TTS-12Hz-0.6B 首包延迟仅 97ms，RTF 低至 0.288（并发 1），优于 25Hz 变体
- Tokenizer-12Hz 在 LibriSpeech 上实现 SOTA 重建质量：PESQ_WB=3.21, UTMOS=4.16, SIM=0.95

## 局限与风险

- 25Hz tokenizer 因 DiT 需 lookahead，首包延迟较高（>150ms），不适合超低延迟场景
- 12Hz 模型在长语音生成中稳定性略逊于 25Hz 变体，表明语义 token 对长程一致性更有利
- 多码本设计增加建模复杂度，MTP 模块需额外训练以协调各码本预测
- 语音设计能力依赖文本指令质量，复杂描述可能引发不一致输出
- 未公开训练数据细节与具体超参数，复现存在一定门槛

## 适合沉淀的概念

`text-to-speech`, `speech-tokenizer`, `streaming-tts`, `voice-cloning`, `multilingual-speech-synthesis`, `cross-lingual-voice-transfer`, `controllable-speech-generation`, `low-latency-audio-generation`, `autoregressive-speech-model`, `dual-track-architecture`, `multi-codebook-quantization`, `flow-matching-dit`, `direct-preference-optimization`, `speaker-encoder`

## 阅读注意

- 关注双 tokenizer 设计动机：25Hz 侧重语义表达与 LLM 集成，12Hz 侧重低延迟与声学细节
- 注意训练阶段划分：S1 通用映射 → S2 高质量去噪 → S3 长上下文增强，体现数据质量与长度的重要性
- 首包延迟由 LM TTFP 和 tokenizer 解码时间共同决定，12Hz tokenizer 解码仅需 4ms，是关键优势
- 长语音生成评估使用内部数据集，需注意与公开基准的可比性
- 可控生成采用 ChatML 格式，将语音控制视为语言建模任务，是统一框架的核心思想

## 质量说明

- 采用来源：`clean`，`papers/2026/01/2601.15621.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含详细架构、训练策略、实验设置与结果，数据充分，结论有支撑。
