2409.17746
论文导读
提出 Paraformer-v2,用 CTC 模块替代 CIF 模块生成 token 嵌入,提升非自回归语音识别在英语和噪声环境下的准确率与鲁棒性。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Paraformer-v2:一种改进的噪声鲁棒非自回归语音识别模型
一句话定位
提出 Paraformer-v2,用 CTC 模块替代 CIF 模块生成 token 嵌入,提升非自回归语音识别在英语和噪声环境下的准确率与鲁棒性。
小学生也能听懂
这篇论文改进了一个叫Paraformer的语音识别模型,就像给机器人换了个更聪明的“耳朵”,让它即使在吵闹环境下也能更准更快地听懂英语和中文,错误更少,速度还快20多倍。
为什么值得记录
- 解决了原 Paraformer 在英语等非音节语言上因 BPE 分词导致 token 数量估计不准的问题
- 显著提升模型在嘈杂环境下的鲁棒性,噪声输入下无输出比例从 54.5% 提升至 77.7%
- 在多个 benchmark 上超越其他非自回归模型,且推理速度比自回归模型快 20 倍以上
- 在 50,000 小时大规模英语数据集上 WER 相对降低超 14%,接近自回归模型性能
核心方法
- 使用 CTC 模块替代 CIF 模块:通过帧级 CTC 后验概率提取 token 嵌入,替代原有的连续积分-触发机制
- 训练阶段采用 Viterbi 算法对齐 CTC 路径,确保压缩后的 CTC 后验长度与目标序列一致,解决长度不匹配问题
- 推理阶段使用非空白(non-blank)CTC 预测结果作为解码器输入,实现单步并行生成
- 总损失函数由交叉熵损失(CE)和 CTC 损失联合构成,增强对齐稳定性
- 编码器采用 Conformer 或 SAN-M 结构,解码器为双向 Transformer,支持端到端训练
关键结果
- 在 AISHELL-1(中文)测试集上,Paraformer-v2 (L) 达到 4.3/4.7 CER,优于所有对比的 NAR 模型
- 在 LibriSpeech(英文)测试集上,Paraformer-v2 (L) 达到 3.0/6.9 WER,显著优于原 Paraformer(6.5/10.7)
- 在 50,000 小时内部英文数据集上,Conformer Paraformer-v2 实现 19.08% WER,优于 SAN-M Paraformer-v2(19.44%)和原 Paraformer(22.73%)
- 推理速度 RTF 为 0.010,与 Paraformer 相当,比 Conformer AED(0.254)快约 25 倍
- 噪声鲁棒性测试中,Paraformer-v2 在 314 个真实噪声样本上正确输出空结果的比例达 77.7%,远高于 Paraformer 的 54.5%
局限与风险
- 未报告在不同信噪比(SNR)下的详细噪声实验,仅提供整体无输出比例
- CTC 模块依赖强对齐假设,在极端噪声或重叠语音场景下可能失效
- 模型参数量较大(最大 240M),对部署资源有一定要求
适合沉淀的概念
non-autoregressive-transformer, connectionist-temporal-classification, speech-recognition, noise-robustness, viterbi-alignment, conformer-encoder, token-embedding-extraction, end-to-end-asr
阅读注意
- 关注 CTC 如何替代 CIF 实现更稳定的 token 长度预测,尤其是在 BPE 分词语言中
- 注意训练时使用 Viterbi 对齐解决长度不匹配问题的具体实现方式
- 对比不同模型在 clean 与 noisy 条件下的表现差异,理解噪声鲁棒性提升机制
- 观察模型大小与性能之间的权衡,特别是大模型(L)在多个任务上的优势
质量说明
- 采用来源:
raw,raw/papers/2024/09/2409.17746.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、多数据集结果和消融分析,数据充分,方法描述清晰,具备可复现性。