论文
arXiv2407.04051
时间2024-07
来源Markdown
页面质量中文卡片
阅读量级87 分钟

2407.04051

论文导读

提出 FunAudioLLM 框架,整合 SenseVoice(多语言语音理解)和 CosyVoice(可控语音生成)两大模型,实现低延迟、高保真、支持多语言和情感控制的端到端语音交互系统。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

FunAudioLLM:面向自然人机语音交互的语音理解与生成基础模型

一句话定位

提出 FunAudioLLM 框架,整合 SenseVoice(多语言语音理解)和 CosyVoice(可控语音生成)两大模型,实现低延迟、高保真、支持多语言和情感控制的端到端语音交互系统。

小学生也能听懂

这篇论文造了一个叫FunAudioLLM的“语音小助理”,它有两个超能力:一个叫SenseVoice,能快速听懂不同语言的说话内容、情绪和背景声音;另一个叫CosyVoice,能模仿任何人的声音说话,还能按指令加入笑声、强调等感情。它们一起工作,让机器人和人聊天又快又自然。

为什么值得记录

  • 首次将非自回归编码器架构用于多任务语音理解(ASR、情感识别、音频事件检测),SenseVoice-Small 推理延迟低于 80ms,比 Whisper 快 5–15 倍
  • CosyVoice 支持零样本跨语言音色克隆、指令驱动语音风格控制(如笑声、呼吸、强调),并开源三个变体模型,功能覆盖最全面
  • 提出监督式语义语音 tokenizer 𝒮³,基于 SenseVoice-Large 预训练,提升语音 token 的语义一致性,降低对干净数据的依赖
  • 完整开源模型、训练/推理代码及数据集处理工具,推动语音交互技术落地应用

核心方法

  • SenseVoice-Small 采用非自回归 SAN-M 编码器,通过任务嵌入(LID/SER/AEC/ITN)实现多任务联合建模,使用 CTC 损失优化 ASR 任务
  • SenseVoice-Large 为自回归编码器-解码器结构,支持 50+ 语言高精度识别,通过解码器前缀 token 控制输出任务类型
  • CosyVoice 使用自回归 Transformer 生成 𝒮³ 语音 token,结合 ODE-based 流匹配模型重建梅尔谱,HiFTNet 声码器合成波形
  • 零样本上下文学习:将提示语音的 token 与文本拼接输入 LM,跨语言时仅保留语音 token 避免风格干扰
  • 指令微调:CosyVoice-instruct 支持自然语言指令控制说话人身份、情感、语速、笑声等细粒度副语言特征
  • 训练数据:SenseVoice 使用 300k+ 小时语音,CosyVoice 使用 170k+ 小时,均通过伪标签自动生成丰富转录信息

关键结果

  • SenseVoice-Small 在 5 种语言上平均 CER/WER 为 10.56%,优于 Whisper-Small(20.68%)和 Whisper-Large(9.66%)
  • SenseVoice-Large 在粤语(Yue)、加泰罗尼亚语(CA)、马拉地语(MR)等语言上显著优于 Whisper-Large-V3
  • CosyVoice 生成语音 WER < 2%,说话人相似度 > 75%,达到人类水平
  • SenseVoice-Small 在 A800 上 10s 音频延迟仅 70ms,RTF 为 0.007,效率远超 Whisper 系列
  • CosyVoice 支持 5 种语言(中、英、日、粤、韩),在零样本克隆、跨语言克隆、指令控制等方面功能最全(见 Table 2)

局限与风险

  • SenseVoice-Large 为自回归模型,推理延迟较高(1623ms/10s),不适合实时场景
  • CosyVoice 的指令控制依赖文本描述质量,复杂指令(如多角色对话)生成效果未充分验证
  • 𝒮³ tokenizer 依赖 SenseVoice 预训练,若 SenseVoice 在特定领域表现差,则影响生成质量
  • 未公开完整训练数据集,仅提供伪标签生成流程,复现需自行构建数据 pipeline

适合沉淀的概念

sensevoice, cosyvoice, supervised-semantic-speech-tokenizer, non-autoregressive-asr, zero-shot-voice-cloning, instruction-controlled-tts, flow-matching-tts, multilingual-speech-recognition

阅读注意

  • 关注 SenseVoice 如何通过任务嵌入实现多任务统一建模(公式 1 和 2)
  • 理解 𝒮³ tokenizer 如何利用 SenseVoice 编码器实现监督式语义 token 提取(图 3)
  • 对比 CosyVoice 三种开源模型(base/instruct/sft)的适用场景差异
  • 注意零样本克隆中跨语言处理的序列构造策略(图 5)
  • 查看附录 Table 14 了解 SenseVoice-Large 在不同语言上是否提供 LID 的性能差异

质量说明

  • 采用来源:rawraw/papers/2024/07/2407.04051.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的模型架构、训练细节、实验对比和开源信息,数据充分,方法可复现性强。