---
title: "2409.17746"
title_zh: "Paraformer-v2：一种改进的噪声鲁棒非自回归语音识别模型"
arxiv_id: "2409.17746"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2024/09/2409.17746.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Paraformer-v2：一种改进的噪声鲁棒非自回归语音识别模型

## 一句话定位

提出 Paraformer-v2，用 CTC 模块替代 CIF 模块生成 token 嵌入，提升非自回归语音识别在英语和噪声环境下的准确率与鲁棒性。

## 小学生也能听懂

这篇论文改进了一个叫Paraformer的语音识别模型，就像给机器人换了个更聪明的“耳朵”，让它即使在吵闹环境下也能更准更快地听懂英语和中文，错误更少，速度还快20多倍。

## 为什么值得记录

- 解决了原 Paraformer 在英语等非音节语言上因 BPE 分词导致 token 数量估计不准的问题
- 显著提升模型在嘈杂环境下的鲁棒性，噪声输入下无输出比例从 54.5% 提升至 77.7%
- 在多个 benchmark 上超越其他非自回归模型，且推理速度比自回归模型快 20 倍以上
- 在 50,000 小时大规模英语数据集上 WER 相对降低超 14%，接近自回归模型性能

## 核心方法

- 使用 CTC 模块替代 CIF 模块：通过帧级 CTC 后验概率提取 token 嵌入，替代原有的连续积分-触发机制
- 训练阶段采用 Viterbi 算法对齐 CTC 路径，确保压缩后的 CTC 后验长度与目标序列一致，解决长度不匹配问题
- 推理阶段使用非空白（non-blank）CTC 预测结果作为解码器输入，实现单步并行生成
- 总损失函数由交叉熵损失（CE）和 CTC 损失联合构成，增强对齐稳定性
- 编码器采用 Conformer 或 SAN-M 结构，解码器为双向 Transformer，支持端到端训练

## 关键结果

- 在 AISHELL-1（中文）测试集上，Paraformer-v2 (L) 达到 4.3/4.7 CER，优于所有对比的 NAR 模型
- 在 LibriSpeech（英文）测试集上，Paraformer-v2 (L) 达到 3.0/6.9 WER，显著优于原 Paraformer（6.5/10.7）
- 在 50,000 小时内部英文数据集上，Conformer Paraformer-v2 实现 19.08% WER，优于 SAN-M Paraformer-v2（19.44%）和原 Paraformer（22.73%）
- 推理速度 RTF 为 0.010，与 Paraformer 相当，比 Conformer AED（0.254）快约 25 倍
- 噪声鲁棒性测试中，Paraformer-v2 在 314 个真实噪声样本上正确输出空结果的比例达 77.7%，远高于 Paraformer 的 54.5%

## 局限与风险

- 未报告在不同信噪比（SNR）下的详细噪声实验，仅提供整体无输出比例
- CTC 模块依赖强对齐假设，在极端噪声或重叠语音场景下可能失效
- 模型参数量较大（最大 240M），对部署资源有一定要求

## 适合沉淀的概念

`non-autoregressive-transformer`, `connectionist-temporal-classification`, `speech-recognition`, `noise-robustness`, `viterbi-alignment`, `conformer-encoder`, `token-embedding-extraction`, `end-to-end-asr`

## 阅读注意

- 关注 CTC 如何替代 CIF 实现更稳定的 token 长度预测，尤其是在 BPE 分词语言中
- 注意训练时使用 Viterbi 对齐解决长度不匹配问题的具体实现方式
- 对比不同模型在 clean 与 noisy 条件下的表现差异，理解噪声鲁棒性提升机制
- 观察模型大小与性能之间的权衡，特别是大模型（L）在多个任务上的优势

## 质量说明

- 采用来源：`raw`，`raw/papers/2024/09/2409.17746.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、多数据集结果和消融分析，数据充分，方法描述清晰，具备可复现性。
