---
title: "Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM"
title_zh: "Freeze-Omni：基于冻结 LLM 的低延迟语音对话模型"
arxiv_id: "2411.00774"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2024/11/2411.00774.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Freeze-Omni：基于冻结 LLM 的低延迟语音对话模型

## 一句话定位

提出一种名为 Freeze-Omni 的语音-语音对话模型，通过完全冻结 LLM 参数实现语音输入输出对齐，在保持原始 LLM 智能水平的同时实现低延迟端到端语音交互。

## 小学生也能听懂

这篇论文发明了一个叫Freeze-Omni的语音对话模型，它像给大模型“穿衣服”一样，不改变大模型本身，只加新部件，让大模型能直接用语音对话，又快又聪明，延迟只有1.2秒。

## 为什么值得记录

- 解决了现有语音-文本多模态 LLM 在微调过程中导致 LLM 智能退化（灾难性遗忘）的问题
- 仅需 6 万轮文本问答数据和少量 ASR/TTS 数据即可实现高质量语音对话能力
- 支持任意文本模态 LLM 作为骨干网络，具备良好的可扩展性和迁移性
- 实现了约 1.2 秒的平均端到端延迟，接近实时交互体验

## 核心方法

- 采用三阶段训练策略：第一阶段用 CTC 损失训练语音编码器；第二阶段连接适配器与 LLM，以转录文本为标签进行对齐；第三阶段引入可训练 prompt embedding，使用多轮问答数据实现语音输入到文本输出的映射
- 语音输出建模采用 NAR + AR 解码器结构：NAR 前缀解码器接收 LLM 隐藏状态，NAR 解码器处理文本 token，AR 解码器生成语音 token，最终由单码本 codec（TiCodec）还原为波形
- 通过 prefix kv-cache 微调策略将 LLM 输出空间与语音解码器对齐，避免直接微调 LLM
- 设计分块级状态预测机制（0：继续接收语音；1：用户打断需响应；2：无需打断），结合 VAD 实现双工对话
- 使用“模型即服务”架构，分离 kv-cache 与 CNN 缓存，支持多用户并发流式处理

## 关键结果

- 在语音理解任务中，Freeze-Omni 在 AISHELL-1 上 CER 为 2.15%，LibriSpeech test-clean 上 WER 为 3.24%，优于 Mini-Omni2 等对比模型
- 语音合成质量显著提升：引入 NAR 前缀解码器后，CER 从 5.27% 降至 3.9%（top-k=1）；增加预网络后进一步降至 2.19%
- 在口语问答任务中，Freeze-Omni 在 Web Questions、LlaMA Questions 和 Audio Trivia QA 上的准确率分别为 44.73%、72% 和 53.88%，与骨干模型 Qwen2-7B-Instruct 的差距小于 Moshi 与 Helium 的差距，证明其智能水平未受损
- 端到端统计延迟为 745ms（中位数 753ms），非统计延迟约 160–320ms，综合网络延迟后总延迟控制在约 1.2 秒

## 局限与风险

- 实验基于单说话人设定，未验证多说话人场景下的鲁棒性
- 语音输出依赖外部 TTS 系统生成训练数据，可能引入合成偏差
- 未公开代码与模型权重，复现存在一定门槛
- 双工对话中的状态预测仅在特定数据集上验证，泛化能力有待进一步测试

## 适合沉淀的概念

`speech-to-speech-dialogue`, `frozen-llm`, `low-latency-speech-processing`, `chunk-wise-streaming-encoder`, `nar-ar-speech-decoder`, `prefix-kv-cache-finetuning`, `duplex-dialogue-state-prediction`, `multimodal-llm-alignment`

## 阅读注意

- 重点关注三阶段训练中各模块参数冻结策略及其对模型性能的影响
- 注意语音编码器采用 4 倍下采样以降低帧率（12.5Hz），从而减少 LLM prefilling 时间
- NAR 前缀解码器的作用是桥接 LLM 隐藏状态与语音 token 空间，是保持 LLM 不微调的关键设计
- 状态预测分类层仅作用于每个语音块的最后帧，训练时采用多任务损失联合优化
- 实验使用 Qwen2-7B-Instruct 作为骨干模型，但方法理论上适用于任何文本 LLM

## 质量说明

- 采用来源：`clean`，`papers/2024/11/2411.00774.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，实验设计合理，数据详实，包含 ASR、TTS、口语问答和延迟分析等多个维度评估，方法描述清晰，具备可复现性基础。
