论文
arXiv2601.15621
时间2026-01
来源Markdown
页面质量中文卡片
阅读量级69 分钟

Qwen3-TTS Technical Report

论文导读

Qwen3-TTS 是一个支持多语言、可控、鲁棒且流式生成的大规模语音合成模型系列,采用双轨架构与两种新型语音 tokenizer 实现高质量低延迟语音生成。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Qwen3-TTS 技术报告

一句话定位

Qwen3-TTS 是一个支持多语言、可控、鲁棒且流式生成的大规模语音合成模型系列,采用双轨架构与两种新型语音 tokenizer 实现高质量低延迟语音生成。

小学生也能听懂

这篇论文造了一个会说话的AI,像魔法话筒一样,只要给它3秒声音或一句话,就能用你的声音说出任何话,支持10种语言,说话又快又自然,还能模仿不同语气,而且说得再长也不会出错。

为什么值得记录

  • 首次在大规模 TTS 模型中实现 97ms 超低首包延迟,支持实时流式语音合成
  • 在零样本语音克隆、跨语言生成和可控语音设计等多个任务上达到 SOTA 性能
  • 提出两种新型语音 tokenizer:语义-声学融合的 25Hz 单码本 tokenizer 和面向低延迟的 12.5Hz 多码本 tokenizer
  • 支持 10 种语言的语音克隆与跨语言迁移,并在长语音生成(>10 分钟)中表现稳定
  • 开源完整模型与 tokenizer,采用 Apache 2.0 许可,推动社区研究

核心方法

  • 采用基于 Qwen3 语言模型的双轨自回归架构,文本与语音 token 在通道维度拼接,实现流式输入输出
  • 引入 Qwen-TTS-Tokenizer-25Hz:基于 Qwen2-Audio 的两阶段训练,融合语义与声学信息,使用块级 Flow Matching DiT 实现流式波形重建
  • 引入 Qwen-TTS-Tokenizer-12Hz:12.5Hz 多码本结构,首层编码语义,后续 15 层 RVQ 编码声学细节,配合轻量因果 ConvNet 实现即时解码
  • 训练分三阶段:通用预训练(500 万小时多语言数据)、高质量数据持续预训练、长上下文扩展(最大 32k token)
  • 后训练包含 DPO 偏好对齐、GSPO 规则奖励优化和轻量说话人微调,提升自然度与可控性
  • 支持语音克隆(3 秒参考音频或文本-语音对)、语音设计(自然语言描述)和细粒度风格控制
  • 通过 Multi-Token Prediction (MTP) 模块高效建模多码本序列,实现首帧即时生成

关键结果

  • 零样本语音克隆在 Seed-TTS 测试集上达到最低 WER:Qwen3-TTS-12Hz-1.7B 在 test-en 上为 1.24,优于 CosyVoice3 和 MiniMax
  • 跨语言生成中,中文到韩语错误率降低 66%(4.82 vs 14.4),显著优于 CosyVoice 系列
  • 可控语音生成在 InstructTTSEval 上超越 GPT-4o-mini-tts,中文目标说话人编辑 APS 提升 28%
  • 长语音生成(>10 分钟)WER 低至 1.533(中文)和 1.571(英文),无重复或断点问题
  • 流式效率:Qwen3-TTS-12Hz-0.6B 首包延迟仅 97ms,RTF 低至 0.288(并发 1),优于 25Hz 变体
  • Tokenizer-12Hz 在 LibriSpeech 上实现 SOTA 重建质量:PESQ_WB=3.21, UTMOS=4.16, SIM=0.95

局限与风险

  • 25Hz tokenizer 因 DiT 需 lookahead,首包延迟较高(>150ms),不适合超低延迟场景
  • 12Hz 模型在长语音生成中稳定性略逊于 25Hz 变体,表明语义 token 对长程一致性更有利
  • 多码本设计增加建模复杂度,MTP 模块需额外训练以协调各码本预测
  • 语音设计能力依赖文本指令质量,复杂描述可能引发不一致输出
  • 未公开训练数据细节与具体超参数,复现存在一定门槛

适合沉淀的概念

text-to-speech, speech-tokenizer, streaming-tts, voice-cloning, multilingual-speech-synthesis, cross-lingual-voice-transfer, controllable-speech-generation, low-latency-audio-generation, autoregressive-speech-model, dual-track-architecture, multi-codebook-quantization, flow-matching-dit, direct-preference-optimization, speaker-encoder

阅读注意

  • 关注双 tokenizer 设计动机:25Hz 侧重语义表达与 LLM 集成,12Hz 侧重低延迟与声学细节
  • 注意训练阶段划分:S1 通用映射 → S2 高质量去噪 → S3 长上下文增强,体现数据质量与长度的重要性
  • 首包延迟由 LM TTFP 和 tokenizer 解码时间共同决定,12Hz tokenizer 解码仅需 4ms,是关键优势
  • 长语音生成评估使用内部数据集,需注意与公开基准的可比性
  • 可控生成采用 ChatML 格式,将语音控制视为语言建模任务,是统一框架的核心思想

质量说明

  • 采用来源:cleanpapers/2026/01/2601.15621.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含详细架构、训练策略、实验设置与结果,数据充分,结论有支撑。