---
title: "LLaMA-Omni: Seamless Speech Interaction with Large Language Models"
title_zh: "LLaMA-Omni：基于开源大模型的端到端低延迟语音交互系统"
arxiv_id: "2409.06666"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2024/09/2409.06666.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LLaMA-Omni：基于开源大模型的端到端低延迟语音交互系统

## 一句话定位

提出 LLaMA-Omni，一种基于 Llama-3.1-8B 的端到端语音交互模型，支持语音输入直接生成同步文本与语音输出，延迟低至 236ms，训练仅需 4 块 GPU 三天。

## 小学生也能听懂

这个研究造了一个叫LLaMA-Omni的机器人，你说话它能马上用自然的声音回答，就像和朋友聊天一样快，只要0.2秒，而且只用4块显卡训练3天就能学会，比别的方法快得多、省得多。

## 为什么值得记录

- 填补了开源社区在构建类 GPT-4o 实时语音交互模型方面的空白
- 实现了极低延迟（236ms）的语音到语音响应，优于 GPT-4o 平均 320ms 延迟
- 采用非自回归流式语音解码器，支持边生成文本边合成语音，提升用户体验
- 仅需 200K 指令微调数据和 4 块 GPU 即可完成训练，大幅降低开发门槛
- 在内容质量、语音自然度和人类偏好评估中均优于现有级联系统

## 核心方法

- 模型架构包含四部分：Whisper-large-v3 编码器、可训练语音适配器、Llama-3.1-8B-Instruct 大模型、非自回归流式 Transformer 语音解码器
- 语音通过 HuBERT + K-means 离散化为单元序列，使用 CTC 损失对齐 LLM 输出与语音单元
- 采用两阶段训练：第一阶段训练语音适配器与 LLM 实现语音到文本生成；第二阶段冻结前述模块，仅训练语音解码器
- 推理时 LLM 自回归生成文本，同时语音解码器基于 LLM 隐藏状态并行生成离散单元，实现文本与语音同步输出
- 构建 InstructS2S-200K 数据集：基于 Alpaca 和 UltraChat 文本指令，经 Llama-3-70B 改写为口语化指令并生成简洁响应，再通过 CosyVoice 和 VITS 合成语音
- 流式合成通过设定单元块大小 Ω 控制延迟，最小 Ω=10 时延迟为 236ms

## 关键结果

- 在 InstructS2S-Eval 测试集上，LLaMA-Omni 的 ChatGPT Score 达 3.99（S2TIF）和 3.47（S2SIF），显著高于 SpeechGPT、SALMONN+Orca 和 Qwen2-Audio+Orca
- 流式场景下最低延迟为 236ms（Ω=10），远低于 SpeechGPT 的 >4500ms 和级联系统的 ~300ms
- ASR-WER 为 10.82，虽略高于级联系统（3.78–6.77），但语音质量 UTMOS 达 3.93，优于多数基线
- 人类评估显示 LLaMA-Omni 在 helpfulness 和 naturalness 上 win rate 更高，尤其在语音连贯性方面表现突出
- 训练总耗时约 65 小时（4×L40 GPU），数据量仅 200K 条，资源需求远低于同类模型

## 局限与风险

- 语音-文本对齐精度（ASR-WER）仍低于工业级 TTS 级联系统，主因是训练数据量较少（约 1K 小时语音）
- 当前仅支持英语，未验证多语言能力
- 语音风格固定（使用 LJSpeech 训练的 VITS），缺乏个性化语音控制
- 未在真实对话或多轮交互场景中充分测试长期一致性

## 适合沉淀的概念

`speech-to-speech-generation`, `non-autoregressive-decoding`, `connectionist-temporal-classification`, `streaming-speech-synthesis`, `end-to-end-speech-llm`, `instructs2s-200k-dataset`, `low-latency-interaction`, `llama-3-1-fine-tuning`

## 阅读注意

- 重点关注两阶段训练策略如何解耦语音理解与语音生成任务，提升训练稳定性
- 注意语音适配器中的 5× 下采样设计对降低序列长度和计算开销的作用
- CTC 对齐机制允许变长映射，但需配合空白 token 和 collapsing function 处理重复单元
- 流式合成性能受 Ω 参数影响：小 Ω 降低延迟但增加语音不连续性，大 Ω 提升质量但增加延迟
- InstructS2S-200K 的构建流程体现了从文本指令到语音交互数据的领域适配思想

## 质量说明

- 采用来源：`clean`，`papers/2024/09/2409.06666.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的模型架构、训练细节、数据集构建方法和详尽的实验结果，包含离线与流式场景、多基线对比、人类评估和消融分析，数据充分且可复现性强。
