2407.04051
论文导读
提出 FunAudioLLM 框架,整合 SenseVoice(多语言语音理解)和 CosyVoice(可控语音生成)两大模型,实现低延迟、高保真、支持多语言和情感控制的端到端语音交互系统。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
FunAudioLLM:面向自然人机语音交互的语音理解与生成基础模型
一句话定位
提出 FunAudioLLM 框架,整合 SenseVoice(多语言语音理解)和 CosyVoice(可控语音生成)两大模型,实现低延迟、高保真、支持多语言和情感控制的端到端语音交互系统。
小学生也能听懂
这篇论文造了一个叫FunAudioLLM的“语音小助理”,它有两个超能力:一个叫SenseVoice,能快速听懂不同语言的说话内容、情绪和背景声音;另一个叫CosyVoice,能模仿任何人的声音说话,还能按指令加入笑声、强调等感情。它们一起工作,让机器人和人聊天又快又自然。
为什么值得记录
- 首次将非自回归编码器架构用于多任务语音理解(ASR、情感识别、音频事件检测),SenseVoice-Small 推理延迟低于 80ms,比 Whisper 快 5–15 倍
- CosyVoice 支持零样本跨语言音色克隆、指令驱动语音风格控制(如笑声、呼吸、强调),并开源三个变体模型,功能覆盖最全面
- 提出监督式语义语音 tokenizer 𝒮³,基于 SenseVoice-Large 预训练,提升语音 token 的语义一致性,降低对干净数据的依赖
- 完整开源模型、训练/推理代码及数据集处理工具,推动语音交互技术落地应用
核心方法
- SenseVoice-Small 采用非自回归 SAN-M 编码器,通过任务嵌入(LID/SER/AEC/ITN)实现多任务联合建模,使用 CTC 损失优化 ASR 任务
- SenseVoice-Large 为自回归编码器-解码器结构,支持 50+ 语言高精度识别,通过解码器前缀 token 控制输出任务类型
- CosyVoice 使用自回归 Transformer 生成 𝒮³ 语音 token,结合 ODE-based 流匹配模型重建梅尔谱,HiFTNet 声码器合成波形
- 零样本上下文学习:将提示语音的 token 与文本拼接输入 LM,跨语言时仅保留语音 token 避免风格干扰
- 指令微调:CosyVoice-instruct 支持自然语言指令控制说话人身份、情感、语速、笑声等细粒度副语言特征
- 训练数据:SenseVoice 使用 300k+ 小时语音,CosyVoice 使用 170k+ 小时,均通过伪标签自动生成丰富转录信息
关键结果
- SenseVoice-Small 在 5 种语言上平均 CER/WER 为 10.56%,优于 Whisper-Small(20.68%)和 Whisper-Large(9.66%)
- SenseVoice-Large 在粤语(Yue)、加泰罗尼亚语(CA)、马拉地语(MR)等语言上显著优于 Whisper-Large-V3
- CosyVoice 生成语音 WER < 2%,说话人相似度 > 75%,达到人类水平
- SenseVoice-Small 在 A800 上 10s 音频延迟仅 70ms,RTF 为 0.007,效率远超 Whisper 系列
- CosyVoice 支持 5 种语言(中、英、日、粤、韩),在零样本克隆、跨语言克隆、指令控制等方面功能最全(见 Table 2)
局限与风险
- SenseVoice-Large 为自回归模型,推理延迟较高(1623ms/10s),不适合实时场景
- CosyVoice 的指令控制依赖文本描述质量,复杂指令(如多角色对话)生成效果未充分验证
- 𝒮³ tokenizer 依赖 SenseVoice 预训练,若 SenseVoice 在特定领域表现差,则影响生成质量
- 未公开完整训练数据集,仅提供伪标签生成流程,复现需自行构建数据 pipeline
适合沉淀的概念
sensevoice, cosyvoice, supervised-semantic-speech-tokenizer, non-autoregressive-asr, zero-shot-voice-cloning, instruction-controlled-tts, flow-matching-tts, multilingual-speech-recognition
阅读注意
- 关注 SenseVoice 如何通过任务嵌入实现多任务统一建模(公式 1 和 2)
- 理解 𝒮³ tokenizer 如何利用 SenseVoice 编码器实现监督式语义 token 提取(图 3)
- 对比 CosyVoice 三种开源模型(base/instruct/sft)的适用场景差异
- 注意零样本克隆中跨语言处理的序列构造策略(图 5)
- 查看附录 Table 14 了解 SenseVoice-Large 在不同语言上是否提供 LID 的性能差异
质量说明
- 采用来源:
raw,raw/papers/2024/07/2407.04051.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的模型架构、训练细节、实验对比和开源信息,数据充分,方法可复现性强。