Qwen3-ASR Technical Report
论文导读
提出 Qwen3-ASR 系列模型,包括两个支持 52 种语言和方言的端到端语音识别模型(1.7B 和 0.6B 参数)以及一个基于 LLM 的非自回归多语言强制对齐模型,在识别精度、推理效率和复杂场景鲁棒性方面达到开源领先水平。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Qwen3-ASR 技术报告
一句话定位
提出 Qwen3-ASR 系列模型,包括两个支持 52 种语言和方言的端到端语音识别模型(1.7B 和 0.6B 参数)以及一个基于 LLM 的非自回归多语言强制对齐模型,在识别精度、推理效率和复杂场景鲁棒性方面达到开源领先水平。
小学生也能听懂
这篇论文造了两个很厉害的语音识别模型,就像耳朵特别灵的机器人,能听懂52种语言和方言,包括唱歌、带口音或很吵的声音,还能快速准确地给每个字打上时间戳,而且代码全公开,让大家都能用。
为什么值得记录
- Qwen3-ASR-1.7B 在多个公开和内部基准测试中实现开源 ASR 模型的最优性能,并可媲美最强商业 API
- Qwen3-ASR-0.6B 在小于 10 亿参数模型中实现最佳精度-效率权衡,适用于设备端部署
- Qwen3-ForcedAligner-0.6B 是首个基于 LLM 的多语言非自回归强制对齐模型,显著提升时间戳预测准确性和推理速度
- 模型支持歌唱语音、背景音歌曲、方言、口音及长语音等复杂声学场景,具备强泛化能力
- 提供完整开源代码库与微调框架,推动社区研究
核心方法
- 基于 Qwen3-Omni 多模态基础模型进行后训练,采用 AuT(Attention-Encoder-Decoder)编码器处理音频特征
- 训练流程分为四个阶段:AuT 预训练(4000 万小时伪标签数据)、Omni 多模态预训练(3 万亿 token)、ASR 有监督微调(SFT)、ASR 强化学习(GSPO 算法)
- Qwen3-ForcedAligner 采用槽填充范式,将时间戳预测重构为非自回归任务,使用离散化时间索引和交叉熵损失进行训练
- 引入动态注意力窗口机制(1s–8s),支持流式与离线推理的统一架构
- 强制对齐模型使用 MFA 生成的伪标签进行训练,并通过因果训练和动态槽插入提升泛化能力
关键结果
- Qwen3-ASR-1.7B 在 WenetSpeech、AISHELL-2、Fleurs 等中英文基准上 WER/CER 显著低于 Whisper-large-v3 和 FunASR-MLT-Nano
- Qwen3-ASR-0.6B 在并发 128 时 RTF 低至 0.064,吞吐量达 2000 秒音频/秒,TTFT 平均 92ms
- Qwen3-ForcedAligner-0.6B 在人类标注测试集上 AAS 为 27.8ms,相比 NFA 和 WhisperX 降低 67%~77% 时间偏移
- 在内部鲁棒性测试中,Qwen3-ASR 在老年人/儿童语音、极低 SNR、绕口令、多说话人等挑战场景下表现最优
- 支持 30 种语言和 22 种汉语方言识别,以及 11 种语言的强制对齐,涵盖跨语言和代码切换场景
局限与风险
- Qwen3-ForcedAligner 目前仅支持 PyTorch 推理,尚未集成 vLLM 加速
- 强制对齐模型依赖 MFA 伪标签,虽经蒸馏优化但仍可能存在系统性偏差
- 未报告模型在低资源语言上的细粒度性能分布
- 流式推理相比离线模式存在约 0.5%~1% 的 WER 上升
适合沉淀的概念
large-audio-language-model, non-autoregressive-inference, speech-forced-alignment, multilingual-asr, timestamp-prediction, end-to-end-speech-recognition, qwen3-omni, dynamic-attention-window
阅读注意
- 关注 AuT 编码器与 Qwen3-Omni 的协同设计如何实现高效音频表征
- 注意 SFT 阶段风格迁移策略对指令注入问题的缓解机制
- 对比 Qwen3-ASR 与 Whisper、FunASR 在长语音和噪声环境下的性能差异
- 分析 GSPO 强化学习对转录稳定性和噪声鲁棒性的具体贡献
- 评估强制对齐模型在 300 秒长语音上的时间戳一致性表现
质量说明
- 采用来源:
clean,papers/2026/01/2601.21337.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的模型架构、训练策略、实验设置和量化结果,包含公开与内部基准测试,数据充分且可复现性强。