---
title: "SA-Paraformer: Non-autoregressive End-to-End Speaker-Attributed ASR"
title_zh: "SA-Paraformer：非自回归端到端说话人属性语音识别"
arxiv_id: "2310.04863"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2023/10/2310.04863.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# SA-Paraformer：非自回归端到端说话人属性语音识别

## 一句话定位

提出基于非自回归模型 Paraformer 的端到端说话人属性语音识别系统 SA-Paraformer，通过并行解码显著降低推理延迟，同时引入说话人填充、干扰说话人和 inter-CTC 策略提升性能。

## 小学生也能听懂

这篇论文发明了一个叫SA-Paraformer的“语音听写小助手”，它能一边听多人说话，一边快速认出谁在说话并写出他们的话，比以前的系统快10倍，还更准，就像给录音笔装上了聪明大脑。

## 为什么值得记录

- 首次将非自回归模型 Paraformer 引入 SA-ASR 任务，实现并行解码，大幅降低实时因子（RTF）
- 在 AliMeeting 数据集上相比级联 SA-ASR 模型实现 6.1% 相对 SD-CER 下降，且 RTF 仅为 SOTA 自回归模型的 1/10
- 提出 f-speaker 策略增强模型对不同说话人数量的鲁棒性，有效缓解因缺乏上下文信息导致的说话人识别困难
- 验证了 inter-CTC 和 t-SOT 在 NAR 架构中的有效性，为低延迟多说话人识别提供新思路

## 核心方法

- 采用 Paraformer 作为声学模型，其包含 Predictor（基于 CIF 机制预测 token 数量与声学边界）和 Sampler（通过替换声学嵌入为字符嵌入增强语义建模）
- 模型由 ASREncoder、ASRDecoder、SpeakerEncoder、SpeakerDecoder、Predictor 和 Sampler 六部分组成，支持端到端联合训练
- SpeakerDecoder 使用余弦距离注意力机制，从输入的说话人清单中加权生成每个 token 对应的说话人 profile
- 引入 inter-CTC 损失函数于编码器中间层，增强声学表示能力
- 提出 f-speaker 策略：训练时扩展说话人数量至 batch 内最大值，并用 [-0.5, 0.5] 随机值填充冗余说话人的余弦距离，提升泛化性
- 采用 t-SOT（token-level serialized output training）策略，按 token 结束时间序列化多说话人输出，避免帧级对齐误差
- 最终损失函数为 MAE + CTC + CE + speaker loss + inter-CTC 的加权和，权重 λ₁=0.3, λ₂=0.3

## 关键结果

- 在 AliMeeting Test 集上，SA-Paraformer + f&i-speaker 达到 34.8% SD-CER，相比级联 WD-SOT 模型（37.1%）实现 6.1% 相对提升
- 相比 SOTA 自回归联合模型（34.7% SD-CER），性能相当但 GPU RTF 仅为 0.032 vs 0.315，提速近 10 倍
- f-speaker 策略带来 3.2–3.4% 相对 SD-CER 下降，i-speaker 策略效果相近，二者结合进一步提升鲁棒性
- 去除训练中的 <cc> 分隔符后，Test 集 CER 从 43.1% 降至 38.6%，删除错误（Del）从 26.4% 降至 6.8%
- 采样因子 λ=1.1 时性能最优，过大（>1.3）会导致训练与推理不匹配，性能下降

## 局限与风险

- 仍依赖外部 d-vector 提取器生成说话人清单，未实现完全端到端说话人建模
- f-speaker 策略引入随机扰动，可能影响训练稳定性，需调参控制填充范围
- 实验仅在单通道远场数据上进行，未验证多通道融合效果
- t-SOT 要求按 token 时间排序，对长时重叠语音的边界预测仍具挑战

## 适合沉淀的概念

`speaker-attributed-asr`, `non-autoregressive-asr`, `paraformer`, `t-sot`, `inter-ctc`, `f-speaker-strategy`, `cif-predictor`, `cosine-distance-attention`

## 阅读注意

- 关注 Predictor 如何利用 CIF 机制实现声学边界检测与 token 数量预测
- 注意 SpeakerDecoder 中两层 Transformer 的设计差异：第一层融合 ASR 与 speaker 信息，第二层仅处理 speaker 表示
- 理解 f-speaker 与 i-speaker 的区别：前者填充距离值，后者添加干扰说话人 profile
- 分析去除 <cc> 分隔符为何能显著减少删除错误——因 NAR 模型难以估计无声学信息的分隔符边界
- 对比 inter-CTC 在 AR 与 NAR 模型中的作用机制差异

## 质量说明

- 采用来源：`clean`，`papers/2023/10/2310.04863.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、消融实验、对比实验与可视化分析，数据充分支持结论。
