---
title: "Qwen3-ASR Technical Report"
title_zh: "Qwen3-ASR 技术报告"
arxiv_id: "2601.21337"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2026/01/2601.21337.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Qwen3-ASR 技术报告

## 一句话定位

提出 Qwen3-ASR 系列模型，包括两个支持 52 种语言和方言的端到端语音识别模型（1.7B 和 0.6B 参数）以及一个基于 LLM 的非自回归多语言强制对齐模型，在识别精度、推理效率和复杂场景鲁棒性方面达到开源领先水平。

## 小学生也能听懂

这篇论文造了两个很厉害的语音识别模型，就像耳朵特别灵的机器人，能听懂52种语言和方言，包括唱歌、带口音或很吵的声音，还能快速准确地给每个字打上时间戳，而且代码全公开，让大家都能用。

## 为什么值得记录

- Qwen3-ASR-1.7B 在多个公开和内部基准测试中实现开源 ASR 模型的最优性能，并可媲美最强商业 API
- Qwen3-ASR-0.6B 在小于 10 亿参数模型中实现最佳精度-效率权衡，适用于设备端部署
- Qwen3-ForcedAligner-0.6B 是首个基于 LLM 的多语言非自回归强制对齐模型，显著提升时间戳预测准确性和推理速度
- 模型支持歌唱语音、背景音歌曲、方言、口音及长语音等复杂声学场景，具备强泛化能力
- 提供完整开源代码库与微调框架，推动社区研究

## 核心方法

- 基于 Qwen3-Omni 多模态基础模型进行后训练，采用 AuT（Attention-Encoder-Decoder）编码器处理音频特征
- 训练流程分为四个阶段：AuT 预训练（4000 万小时伪标签数据）、Omni 多模态预训练（3 万亿 token）、ASR 有监督微调（SFT）、ASR 强化学习（GSPO 算法）
- Qwen3-ForcedAligner 采用槽填充范式，将时间戳预测重构为非自回归任务，使用离散化时间索引和交叉熵损失进行训练
- 引入动态注意力窗口机制（1s–8s），支持流式与离线推理的统一架构
- 强制对齐模型使用 MFA 生成的伪标签进行训练，并通过因果训练和动态槽插入提升泛化能力

## 关键结果

- Qwen3-ASR-1.7B 在 WenetSpeech、AISHELL-2、Fleurs 等中英文基准上 WER/CER 显著低于 Whisper-large-v3 和 FunASR-MLT-Nano
- Qwen3-ASR-0.6B 在并发 128 时 RTF 低至 0.064，吞吐量达 2000 秒音频/秒，TTFT 平均 92ms
- Qwen3-ForcedAligner-0.6B 在人类标注测试集上 AAS 为 27.8ms，相比 NFA 和 WhisperX 降低 67%~77% 时间偏移
- 在内部鲁棒性测试中，Qwen3-ASR 在老年人/儿童语音、极低 SNR、绕口令、多说话人等挑战场景下表现最优
- 支持 30 种语言和 22 种汉语方言识别，以及 11 种语言的强制对齐，涵盖跨语言和代码切换场景

## 局限与风险

- Qwen3-ForcedAligner 目前仅支持 PyTorch 推理，尚未集成 vLLM 加速
- 强制对齐模型依赖 MFA 伪标签，虽经蒸馏优化但仍可能存在系统性偏差
- 未报告模型在低资源语言上的细粒度性能分布
- 流式推理相比离线模式存在约 0.5%~1% 的 WER 上升

## 适合沉淀的概念

`large-audio-language-model`, `non-autoregressive-inference`, `speech-forced-alignment`, `multilingual-asr`, `timestamp-prediction`, `end-to-end-speech-recognition`, `qwen3-omni`, `dynamic-attention-window`

## 阅读注意

- 关注 AuT 编码器与 Qwen3-Omni 的协同设计如何实现高效音频表征
- 注意 SFT 阶段风格迁移策略对指令注入问题的缓解机制
- 对比 Qwen3-ASR 与 Whisper、FunASR 在长语音和噪声环境下的性能差异
- 分析 GSPO 强化学习对转录稳定性和噪声鲁棒性的具体贡献
- 评估强制对齐模型在 300 秒长语音上的时间戳一致性表现

## 质量说明

- 采用来源：`clean`，`papers/2026/01/2601.21337.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的模型架构、训练策略、实验设置和量化结果，包含公开与内部基准测试，数据充分且可复现性强。
