---
title: "2407.04051"
title_zh: "FunAudioLLM：面向自然人机语音交互的语音理解与生成基础模型"
arxiv_id: "2407.04051"
paper_type: "system"
source_kind: "raw"
raw_path: "raw/papers/2024/07/2407.04051.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# FunAudioLLM：面向自然人机语音交互的语音理解与生成基础模型

## 一句话定位

提出 FunAudioLLM 框架，整合 SenseVoice（多语言语音理解）和 CosyVoice（可控语音生成）两大模型，实现低延迟、高保真、支持多语言和情感控制的端到端语音交互系统。

## 小学生也能听懂

这篇论文造了一个叫FunAudioLLM的“语音小助理”，它有两个超能力：一个叫SenseVoice，能快速听懂不同语言的说话内容、情绪和背景声音；另一个叫CosyVoice，能模仿任何人的声音说话，还能按指令加入笑声、强调等感情。它们一起工作，让机器人和人聊天又快又自然。

## 为什么值得记录

- 首次将非自回归编码器架构用于多任务语音理解（ASR、情感识别、音频事件检测），SenseVoice-Small 推理延迟低于 80ms，比 Whisper 快 5–15 倍
- CosyVoice 支持零样本跨语言音色克隆、指令驱动语音风格控制（如笑声、呼吸、强调），并开源三个变体模型，功能覆盖最全面
- 提出监督式语义语音 tokenizer 𝒮³，基于 SenseVoice-Large 预训练，提升语音 token 的语义一致性，降低对干净数据的依赖
- 完整开源模型、训练/推理代码及数据集处理工具，推动语音交互技术落地应用

## 核心方法

- SenseVoice-Small 采用非自回归 SAN-M 编码器，通过任务嵌入（LID/SER/AEC/ITN）实现多任务联合建模，使用 CTC 损失优化 ASR 任务
- SenseVoice-Large 为自回归编码器-解码器结构，支持 50+ 语言高精度识别，通过解码器前缀 token 控制输出任务类型
- CosyVoice 使用自回归 Transformer 生成 𝒮³ 语音 token，结合 ODE-based 流匹配模型重建梅尔谱，HiFTNet 声码器合成波形
- 零样本上下文学习：将提示语音的 token 与文本拼接输入 LM，跨语言时仅保留语音 token 避免风格干扰
- 指令微调：CosyVoice-instruct 支持自然语言指令控制说话人身份、情感、语速、笑声等细粒度副语言特征
- 训练数据：SenseVoice 使用 300k+ 小时语音，CosyVoice 使用 170k+ 小时，均通过伪标签自动生成丰富转录信息

## 关键结果

- SenseVoice-Small 在 5 种语言上平均 CER/WER 为 10.56%，优于 Whisper-Small（20.68%）和 Whisper-Large（9.66%）
- SenseVoice-Large 在粤语（Yue）、加泰罗尼亚语（CA）、马拉地语（MR）等语言上显著优于 Whisper-Large-V3
- CosyVoice 生成语音 WER < 2%，说话人相似度 > 75%，达到人类水平
- SenseVoice-Small 在 A800 上 10s 音频延迟仅 70ms，RTF 为 0.007，效率远超 Whisper 系列
- CosyVoice 支持 5 种语言（中、英、日、粤、韩），在零样本克隆、跨语言克隆、指令控制等方面功能最全（见 Table 2）

## 局限与风险

- SenseVoice-Large 为自回归模型，推理延迟较高（1623ms/10s），不适合实时场景
- CosyVoice 的指令控制依赖文本描述质量，复杂指令（如多角色对话）生成效果未充分验证
- 𝒮³ tokenizer 依赖 SenseVoice 预训练，若 SenseVoice 在特定领域表现差，则影响生成质量
- 未公开完整训练数据集，仅提供伪标签生成流程，复现需自行构建数据 pipeline

## 适合沉淀的概念

`sensevoice`, `cosyvoice`, `supervised-semantic-speech-tokenizer`, `non-autoregressive-asr`, `zero-shot-voice-cloning`, `instruction-controlled-tts`, `flow-matching-tts`, `multilingual-speech-recognition`

## 阅读注意

- 关注 SenseVoice 如何通过任务嵌入实现多任务统一建模（公式 1 和 2）
- 理解 𝒮³ tokenizer 如何利用 SenseVoice 编码器实现监督式语义 token 提取（图 3）
- 对比 CosyVoice 三种开源模型（base/instruct/sft）的适用场景差异
- 注意零样本克隆中跨语言处理的序列构造策略（图 5）
- 查看附录 Table 14 了解 SenseVoice-Large 在不同语言上是否提供 LID 的性能差异

## 质量说明

- 采用来源：`raw`，`raw/papers/2024/07/2407.04051.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的模型架构、训练细节、实验对比和开源信息，数据充分，方法可复现性强。
