---
title: "FunASR: A Fundamental End-to-End Speech Recognition Toolkit"
title_zh: "FunASR：端到端语音识别基础工具包"
arxiv_id: "2305.11013"
paper_type: "system"
source_kind: "clean"
raw_path: "raw/papers/2023/05/2305.11013.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# FunASR：端到端语音识别基础工具包

## 一句话定位

FunASR 是一个开源的端到端语音识别工具包，旨在弥合学术研究与工业应用之间的差距，提供基于大规模工业语料训练的模型（如 Paraformer）及部署能力，支持非自回归建模、时间戳预测、热词定制、语音活动检测和文本后处理等功能。

## 小学生也能听懂

FunASR 就像一个聪明的语音小助手，能快速把人说的话变成文字，还能标出说话时间、识别关键词、加标点，而且特别快又准，适合用在电话、会议等地方。

## 为什么值得记录

- 提供基于 6 万小时人工标注普通话数据训练的旗舰模型 Paraformer，性能优于多数开源模型
- 支持非自回归（NAR）架构，实现低延迟推理（RTF 低至 0.0168），比自回归模型快 12 倍
- 集成时间戳预测、热词定制、VAD 和标点恢复等模块，适合构建高精度长音频识别服务
- 提供工业级部署支持（ONNX、Libtorch、TensorRT）和量化加速（AMP），RTF 提升 40% 且 CER 不变
- 支持模型微调，在物流等领域实现关键词召回率从 76.7% 提升至 96.8%

## 核心方法

- 采用 Paraformer 作为核心 ASR 模型，为非自回归结构，包含预测器（predictor）和采样器（sampler）模块
- 通过引入转置卷积和 LSTM 层重构预测器，实现端到端时间戳预测（Paraformer-TP），替代传统强制对齐（FA）
- 在解码器末端添加热词嵌入器和多头注意力机制，实现上下文感知的热词定制（Contextual Paraformer）
- 使用 FSMN-VAD 模型进行语音活动检测，基于单音素建模提升判别能力
- 采用 CT-Transformer 进行实时文本后处理，联合预测标点与去除不流畅表达，支持可控延迟解码
- 提供两种训练流水线：学术版（run.sh，支持从零训练）和工业版（infer.sh/finetune.sh，支持推理与微调）
- 支持多后端推理（Libtorch、ONNX、TensorRT）和自动混合精度（AMP）量化，优化 CPU/GPU 部署性能

## 关键结果

- Paraformer-large（220M 参数）在 AISHELL、AISHELL-2 和 WenetSpeech 上 CER 分别为 1.95%、2.85%、6.97%
- 时间戳预测在工业数据上 AAS 为 65.3ms，接近 FA 系统（60.3ms），但为单步高效方案
- 热词定制在 AISHELL 子集上 F1 分数提升 58%（从 27% 到 85%），工业任务平均提升 10%
- VAD 在会议和视频数据上分别降低 CER 0.11% 和 2.53%，并减少无效语音输入
- CT-Transformer 在标点预测 F1 达 58.8%，不流畅检测 F1 达 70.5%，推理速度比 BLSTM 快 1.9 倍
- AMP 量化使 RTF 从 0.1026 降至 0.0597（Libtorch），加速 40% 且 CER 保持 1.95%

## 局限与风险

- 实验主要基于普通话语料，其他语言性能未在本文详述（尽管工具包支持多语言）
- 热词定制依赖外部提供的命名实体列表，未实现自动热词发现
- 时间戳预测精度仍略低于传统 FA 系统（差距约 5ms）
- 未提供完整端到端长音频处理流水线的端到端延迟指标

## 适合沉淀的概念

`paraformer`, `non-autoregressive-asr`, `timestamp-prediction`, `hotword-customization`, `voice-activity-detection`, `text-postprocessing`, `ct-transformer`, `fsms-vad`, `end-to-end-speech-recognition`, `model-finetuning`

## 阅读注意

- 关注 Paraformer 如何通过 glancing language model 采样器缓解非自回归模型的 token 依赖问题
- 注意时间戳预测模块如何利用 CIF 权重 α₂ 进行后处理以确定词边界和静音段
- 热词定制部分需理解公式 (1) 中多注意力机制如何融合声学特征与热词上下文
- 对比不同工具包时注意是否使用语言模型（LM）和解码策略（如 joint-CTC）
- 部署优化部分重点看 AMP 量化在不同后端（Libtorch/ONNX）的效果一致性

## 质量说明

- 采用来源：`clean`，`papers/2023/05/2305.11013.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含系统架构、模块设计、实验数据和部署细节，所有关键结果均有表格支持，方法描述清晰，可复现性强。
