论文
arXiv2409.06666
时间2024-09
来源Markdown
页面质量中文卡片
阅读量级13 分钟

LLaMA-Omni: Seamless Speech Interaction with Large Language Models

论文导读

提出 LLaMA-Omni,一种基于 Llama-3.1-8B 的端到端语音交互模型,支持语音输入直接生成同步文本与语音输出,延迟低至 236ms,训练仅需 4 块 GPU 三天。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

LLaMA-Omni:基于开源大模型的端到端低延迟语音交互系统

一句话定位

提出 LLaMA-Omni,一种基于 Llama-3.1-8B 的端到端语音交互模型,支持语音输入直接生成同步文本与语音输出,延迟低至 236ms,训练仅需 4 块 GPU 三天。

小学生也能听懂

这个研究造了一个叫LLaMA-Omni的机器人,你说话它能马上用自然的声音回答,就像和朋友聊天一样快,只要0.2秒,而且只用4块显卡训练3天就能学会,比别的方法快得多、省得多。

为什么值得记录

  • 填补了开源社区在构建类 GPT-4o 实时语音交互模型方面的空白
  • 实现了极低延迟(236ms)的语音到语音响应,优于 GPT-4o 平均 320ms 延迟
  • 采用非自回归流式语音解码器,支持边生成文本边合成语音,提升用户体验
  • 仅需 200K 指令微调数据和 4 块 GPU 即可完成训练,大幅降低开发门槛
  • 在内容质量、语音自然度和人类偏好评估中均优于现有级联系统

核心方法

  • 模型架构包含四部分:Whisper-large-v3 编码器、可训练语音适配器、Llama-3.1-8B-Instruct 大模型、非自回归流式 Transformer 语音解码器
  • 语音通过 HuBERT + K-means 离散化为单元序列,使用 CTC 损失对齐 LLM 输出与语音单元
  • 采用两阶段训练:第一阶段训练语音适配器与 LLM 实现语音到文本生成;第二阶段冻结前述模块,仅训练语音解码器
  • 推理时 LLM 自回归生成文本,同时语音解码器基于 LLM 隐藏状态并行生成离散单元,实现文本与语音同步输出
  • 构建 InstructS2S-200K 数据集:基于 Alpaca 和 UltraChat 文本指令,经 Llama-3-70B 改写为口语化指令并生成简洁响应,再通过 CosyVoice 和 VITS 合成语音
  • 流式合成通过设定单元块大小 Ω 控制延迟,最小 Ω=10 时延迟为 236ms

关键结果

  • 在 InstructS2S-Eval 测试集上,LLaMA-Omni 的 ChatGPT Score 达 3.99(S2TIF)和 3.47(S2SIF),显著高于 SpeechGPT、SALMONN+Orca 和 Qwen2-Audio+Orca
  • 流式场景下最低延迟为 236ms(Ω=10),远低于 SpeechGPT 的 >4500ms 和级联系统的 ~300ms
  • ASR-WER 为 10.82,虽略高于级联系统(3.78–6.77),但语音质量 UTMOS 达 3.93,优于多数基线
  • 人类评估显示 LLaMA-Omni 在 helpfulness 和 naturalness 上 win rate 更高,尤其在语音连贯性方面表现突出
  • 训练总耗时约 65 小时(4×L40 GPU),数据量仅 200K 条,资源需求远低于同类模型

局限与风险

  • 语音-文本对齐精度(ASR-WER)仍低于工业级 TTS 级联系统,主因是训练数据量较少(约 1K 小时语音)
  • 当前仅支持英语,未验证多语言能力
  • 语音风格固定(使用 LJSpeech 训练的 VITS),缺乏个性化语音控制
  • 未在真实对话或多轮交互场景中充分测试长期一致性

适合沉淀的概念

speech-to-speech-generation, non-autoregressive-decoding, connectionist-temporal-classification, streaming-speech-synthesis, end-to-end-speech-llm, instructs2s-200k-dataset, low-latency-interaction, llama-3-1-fine-tuning

阅读注意

  • 重点关注两阶段训练策略如何解耦语音理解与语音生成任务,提升训练稳定性
  • 注意语音适配器中的 5× 下采样设计对降低序列长度和计算开销的作用
  • CTC 对齐机制允许变长映射,但需配合空白 token 和 collapsing function 处理重复单元
  • 流式合成性能受 Ω 参数影响:小 Ω 降低延迟但增加语音不连续性,大 Ω 提升质量但增加延迟
  • InstructS2S-200K 的构建流程体现了从文本指令到语音交互数据的领域适配思想

质量说明

  • 采用来源:cleanpapers/2024/09/2409.06666.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的模型架构、训练细节、数据集构建方法和详尽的实验结果,包含离线与流式场景、多基线对比、人类评估和消融分析,数据充分且可复现性强。