---
title: "FireRedASR: Open-Source Industrial-Grade Mandarin ASR"
title_zh: "FireRedASR：开源工业级中文语音识别模型"
arxiv_id: "2501.14350"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2025/01/2501.14350.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# FireRedASR：开源工业级中文语音识别模型

## 一句话定位

提出 FireRedASR 系列中文 ASR 模型，包含基于 Encoder-Adapter-LLM 的高性能 FireRedASR-LLM（8.3B 参数，CER 3.05%）和基于 AED 的高效 FireRedASR-AED（1.1B 参数，CER 3.18%），在多个基准测试和实际场景中显著优于现有开源与商业模型。

## 小学生也能听懂

这篇论文造了两个能听懂中文说话的电脑模型，一个叫FireRedASR-LLM，一个叫FireRedASR-AED，它们像超级耳朵一样，把人说的话变成文字，准确率很高，还能听懂方言和唱歌，比之前很多模型都厉害。

## 为什么值得记录

- 首个开源的工业级中文 ASR 模型家族，填补了高质量、可复现中文语音识别系统的空白
- FireRedASR-LLM 在公共中文基准上实现 SOTA 性能（平均 CER 3.05%），相对 CER 降低 8.4%
- FireRedASR-AED 以更小的模型尺寸（1.1B 参数）超越超过 12B 参数的 Seed-ASR，展示架构效率优势
- 在真实多源场景（短视频、直播、智能助手等）和歌唱歌词识别任务中表现突出，CER 相对降低达 24%-67%
- 支持中文方言与英语识别，具备良好的跨语言和跨领域泛化能力

## 核心方法

- FireRedASR-AED 采用 Conformer 编码器 + Transformer 解码器的 AED 架构，输入为 80 维 log Mel-filterbank 特征，经两层卷积下采样至 40ms 帧率
- FireRedASR-LLM 采用 Encoder-Adapter-LLM 框架：Conformer 编码器提取声学特征，轻量级 Linear-ReLU-Linear 适配器对齐 LLM 语义空间，LLM 使用 Qwen2-7B-Instruct 并仅通过 LoRA 微调
- 训练数据约 70,000 小时高质量人工标注中文语音 + 11,000 小时英文语音，强调真实场景多样性
- 混合分词策略：中文用字符级，英文用 BPE，总词表大小 7,832
- FireRedASR-AED 使用渐进式正则化训练策略：初期无 dropout/SpecAugment 快速收敛，后期逐步增强正则化防止过拟合
- FireRedASR-LLM 训练时输入三元组 (prompt, speech, transcript)，仅对 transcript 部分计算交叉熵损失
- 适配器前端加入帧拼接操作，将时间分辨率从 40ms 降至 80ms，降低 LLM 输入序列长度

## 关键结果

- 在 AISHELL-1/2、WenetSpeech 四个公共中文测试集上，FireRedASR-LLM 平均 CER 为 3.05%，优于 Seed-ASR 的 3.33%（8.4% 相对降低）
- FireRedASR-AED（1.1B 参数）平均 CER 3.18%，优于 Whisper-Large-v3（1.6B）、SenseVoice-L（1.6B）和 Qwen-Audio（8.4B）
- 在多源真实场景测试中，FireRedASR-LLM CER 3.48%，相对 ProviderA-Large 降低 23.7%，相对 Paraformer-Large 降低 38.6%
- 歌唱歌词识别任务中，FireRedASR-LLM CER 7.05%，相对商业基线 ProviderA-Large（14.16%）降低 50.2%，相对 Paraformer-Large（21.19%）降低 66.7%
- 中文方言（KeSpeech）上，FireRedASR-LLM CER 3.56%，显著优于 Baichuan-omni（6.7%）等模型
- 英语识别（LibriSpeech）上，FireRedASR-LLM WER 为 1.73%（test-clean）和 3.67%（test-other），与 Whisper-Large-v3 相当

## 局限与风险

- FireRedASR-LLM 依赖外部 LLM（Qwen2-7B），推理延迟和计算资源需求较高，不适合低延迟边缘设备部署
- 训练数据虽强调高质量人工标注，但未公开具体数据来源与清洗细节，影响可复现性
- 未报告模型在噪声鲁棒性、远场识别、说话人分离等挑战性条件下的详细性能
- 适配器设计较简单（Linear-ReLU-Linear），可能限制复杂声学-语言对齐能力

## 适合沉淀的概念

`encoder-adapter-llm`, `attention-based-encoder-decoder`, `character-error-rate`, `conformer-encoder`, `lora-fine-tuning`, `mixed-tokenization`, `progressive-regularization`, `singing-lyrics-recognition`, `mandarin-asr`, `scaling-law`

## 阅读注意

- 重点关注 FireRedASR-LLM 如何通过 LoRA 微调实现 LLM 与语音编码器的有效融合
- 注意 FireRedASR-AED 的渐进式正则化策略对大模型训练的稳定性作用
- 对比 FireRedASR-AED 与 FireRedASR-LLM 在不同任务上的性能-效率权衡
- 观察模型在歌唱歌词识别上的优异表现，推测其训练数据可能包含大量音乐内容
- 留意开源地址 https://github.com/FireRedTeam/FireRedASR 是否包含完整训练代码与数据预处理流程

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/01/2501.14350.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的架构细节、训练策略、多维度实验结果和开源计划，数据充分，结论可信。虽部分训练细节未完全公开，但作为技术报告已具备较高完整性。
