论文
arXiv2601.21337
时间2026-01
来源Markdown
页面质量中文卡片
阅读量级71 分钟

Qwen3-ASR Technical Report

论文导读

提出 Qwen3-ASR 系列模型,包括两个支持 52 种语言和方言的端到端语音识别模型(1.7B 和 0.6B 参数)以及一个基于 LLM 的非自回归多语言强制对齐模型,在识别精度、推理效率和复杂场景鲁棒性方面达到开源领先水平。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Qwen3-ASR 技术报告

一句话定位

提出 Qwen3-ASR 系列模型,包括两个支持 52 种语言和方言的端到端语音识别模型(1.7B 和 0.6B 参数)以及一个基于 LLM 的非自回归多语言强制对齐模型,在识别精度、推理效率和复杂场景鲁棒性方面达到开源领先水平。

小学生也能听懂

这篇论文造了两个很厉害的语音识别模型,就像耳朵特别灵的机器人,能听懂52种语言和方言,包括唱歌、带口音或很吵的声音,还能快速准确地给每个字打上时间戳,而且代码全公开,让大家都能用。

为什么值得记录

  • Qwen3-ASR-1.7B 在多个公开和内部基准测试中实现开源 ASR 模型的最优性能,并可媲美最强商业 API
  • Qwen3-ASR-0.6B 在小于 10 亿参数模型中实现最佳精度-效率权衡,适用于设备端部署
  • Qwen3-ForcedAligner-0.6B 是首个基于 LLM 的多语言非自回归强制对齐模型,显著提升时间戳预测准确性和推理速度
  • 模型支持歌唱语音、背景音歌曲、方言、口音及长语音等复杂声学场景,具备强泛化能力
  • 提供完整开源代码库与微调框架,推动社区研究

核心方法

  • 基于 Qwen3-Omni 多模态基础模型进行后训练,采用 AuT(Attention-Encoder-Decoder)编码器处理音频特征
  • 训练流程分为四个阶段:AuT 预训练(4000 万小时伪标签数据)、Omni 多模态预训练(3 万亿 token)、ASR 有监督微调(SFT)、ASR 强化学习(GSPO 算法)
  • Qwen3-ForcedAligner 采用槽填充范式,将时间戳预测重构为非自回归任务,使用离散化时间索引和交叉熵损失进行训练
  • 引入动态注意力窗口机制(1s–8s),支持流式与离线推理的统一架构
  • 强制对齐模型使用 MFA 生成的伪标签进行训练,并通过因果训练和动态槽插入提升泛化能力

关键结果

  • Qwen3-ASR-1.7B 在 WenetSpeech、AISHELL-2、Fleurs 等中英文基准上 WER/CER 显著低于 Whisper-large-v3 和 FunASR-MLT-Nano
  • Qwen3-ASR-0.6B 在并发 128 时 RTF 低至 0.064,吞吐量达 2000 秒音频/秒,TTFT 平均 92ms
  • Qwen3-ForcedAligner-0.6B 在人类标注测试集上 AAS 为 27.8ms,相比 NFA 和 WhisperX 降低 67%~77% 时间偏移
  • 在内部鲁棒性测试中,Qwen3-ASR 在老年人/儿童语音、极低 SNR、绕口令、多说话人等挑战场景下表现最优
  • 支持 30 种语言和 22 种汉语方言识别,以及 11 种语言的强制对齐,涵盖跨语言和代码切换场景

局限与风险

  • Qwen3-ForcedAligner 目前仅支持 PyTorch 推理,尚未集成 vLLM 加速
  • 强制对齐模型依赖 MFA 伪标签,虽经蒸馏优化但仍可能存在系统性偏差
  • 未报告模型在低资源语言上的细粒度性能分布
  • 流式推理相比离线模式存在约 0.5%~1% 的 WER 上升

适合沉淀的概念

large-audio-language-model, non-autoregressive-inference, speech-forced-alignment, multilingual-asr, timestamp-prediction, end-to-end-speech-recognition, qwen3-omni, dynamic-attention-window

阅读注意

  • 关注 AuT 编码器与 Qwen3-Omni 的协同设计如何实现高效音频表征
  • 注意 SFT 阶段风格迁移策略对指令注入问题的缓解机制
  • 对比 Qwen3-ASR 与 Whisper、FunASR 在长语音和噪声环境下的性能差异
  • 分析 GSPO 强化学习对转录稳定性和噪声鲁棒性的具体贡献
  • 评估强制对齐模型在 300 秒长语音上的时间戳一致性表现

质量说明

  • 采用来源:cleanpapers/2026/01/2601.21337.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的模型架构、训练策略、实验设置和量化结果,包含公开与内部基准测试,数据充分且可复现性强。