FireRedASR: Open-Source Industrial-Grade Mandarin ASR
论文导读
提出 FireRedASR 系列中文 ASR 模型,包含基于 Encoder-Adapter-LLM 的高性能 FireRedASR-LLM(8.3B 参数,CER 3.05%)和基于 AED 的高效 FireRedASR-AED(1.1B 参数,CER 3.18%),在多个基准测试和实际场景中显著优于现有开源与商业模型。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
FireRedASR:开源工业级中文语音识别模型
一句话定位
提出 FireRedASR 系列中文 ASR 模型,包含基于 Encoder-Adapter-LLM 的高性能 FireRedASR-LLM(8.3B 参数,CER 3.05%)和基于 AED 的高效 FireRedASR-AED(1.1B 参数,CER 3.18%),在多个基准测试和实际场景中显著优于现有开源与商业模型。
小学生也能听懂
这篇论文造了两个能听懂中文说话的电脑模型,一个叫FireRedASR-LLM,一个叫FireRedASR-AED,它们像超级耳朵一样,把人说的话变成文字,准确率很高,还能听懂方言和唱歌,比之前很多模型都厉害。
为什么值得记录
- 首个开源的工业级中文 ASR 模型家族,填补了高质量、可复现中文语音识别系统的空白
- FireRedASR-LLM 在公共中文基准上实现 SOTA 性能(平均 CER 3.05%),相对 CER 降低 8.4%
- FireRedASR-AED 以更小的模型尺寸(1.1B 参数)超越超过 12B 参数的 Seed-ASR,展示架构效率优势
- 在真实多源场景(短视频、直播、智能助手等)和歌唱歌词识别任务中表现突出,CER 相对降低达 24%-67%
- 支持中文方言与英语识别,具备良好的跨语言和跨领域泛化能力
核心方法
- FireRedASR-AED 采用 Conformer 编码器 + Transformer 解码器的 AED 架构,输入为 80 维 log Mel-filterbank 特征,经两层卷积下采样至 40ms 帧率
- FireRedASR-LLM 采用 Encoder-Adapter-LLM 框架:Conformer 编码器提取声学特征,轻量级 Linear-ReLU-Linear 适配器对齐 LLM 语义空间,LLM 使用 Qwen2-7B-Instruct 并仅通过 LoRA 微调
- 训练数据约 70,000 小时高质量人工标注中文语音 + 11,000 小时英文语音,强调真实场景多样性
- 混合分词策略:中文用字符级,英文用 BPE,总词表大小 7,832
- FireRedASR-AED 使用渐进式正则化训练策略:初期无 dropout/SpecAugment 快速收敛,后期逐步增强正则化防止过拟合
- FireRedASR-LLM 训练时输入三元组 (prompt, speech, transcript),仅对 transcript 部分计算交叉熵损失
- 适配器前端加入帧拼接操作,将时间分辨率从 40ms 降至 80ms,降低 LLM 输入序列长度
关键结果
- 在 AISHELL-1/2、WenetSpeech 四个公共中文测试集上,FireRedASR-LLM 平均 CER 为 3.05%,优于 Seed-ASR 的 3.33%(8.4% 相对降低)
- FireRedASR-AED(1.1B 参数)平均 CER 3.18%,优于 Whisper-Large-v3(1.6B)、SenseVoice-L(1.6B)和 Qwen-Audio(8.4B)
- 在多源真实场景测试中,FireRedASR-LLM CER 3.48%,相对 ProviderA-Large 降低 23.7%,相对 Paraformer-Large 降低 38.6%
- 歌唱歌词识别任务中,FireRedASR-LLM CER 7.05%,相对商业基线 ProviderA-Large(14.16%)降低 50.2%,相对 Paraformer-Large(21.19%)降低 66.7%
- 中文方言(KeSpeech)上,FireRedASR-LLM CER 3.56%,显著优于 Baichuan-omni(6.7%)等模型
- 英语识别(LibriSpeech)上,FireRedASR-LLM WER 为 1.73%(test-clean)和 3.67%(test-other),与 Whisper-Large-v3 相当
局限与风险
- FireRedASR-LLM 依赖外部 LLM(Qwen2-7B),推理延迟和计算资源需求较高,不适合低延迟边缘设备部署
- 训练数据虽强调高质量人工标注,但未公开具体数据来源与清洗细节,影响可复现性
- 未报告模型在噪声鲁棒性、远场识别、说话人分离等挑战性条件下的详细性能
- 适配器设计较简单(Linear-ReLU-Linear),可能限制复杂声学-语言对齐能力
适合沉淀的概念
encoder-adapter-llm, attention-based-encoder-decoder, character-error-rate, conformer-encoder, lora-fine-tuning, mixed-tokenization, progressive-regularization, singing-lyrics-recognition, mandarin-asr, scaling-law
阅读注意
- 重点关注 FireRedASR-LLM 如何通过 LoRA 微调实现 LLM 与语音编码器的有效融合
- 注意 FireRedASR-AED 的渐进式正则化策略对大模型训练的稳定性作用
- 对比 FireRedASR-AED 与 FireRedASR-LLM 在不同任务上的性能-效率权衡
- 观察模型在歌唱歌词识别上的优异表现,推测其训练数据可能包含大量音乐内容
- 留意开源地址 https://github.com/FireRedTeam/FireRedASR 是否包含完整训练代码与数据预处理流程
质量说明
- 采用来源:
raw,raw/papers/2025/01/2501.14350.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的架构细节、训练策略、多维度实验结果和开源计划,数据充分,结论可信。虽部分训练细节未完全公开,但作为技术报告已具备较高完整性。