Freeze-Omni
论文导读
提出一种名为 Freeze-Omni 的语音-语音对话模型,通过完全冻结 LLM 参数实现语音输入输出对齐,在保持原始 LLM 智能水平的同时实现低延迟端到端语音交互。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Freeze-Omni:基于冻结 LLM 的低延迟语音对话模型
一句话定位
提出一种名为 Freeze-Omni 的语音-语音对话模型,通过完全冻结 LLM 参数实现语音输入输出对齐,在保持原始 LLM 智能水平的同时实现低延迟端到端语音交互。
小学生也能听懂
这篇论文发明了一个叫Freeze-Omni的语音对话模型,它像给大模型“穿衣服”一样,不改变大模型本身,只加新部件,让大模型能直接用语音对话,又快又聪明,延迟只有1.2秒。
为什么值得记录
- 解决了现有语音-文本多模态 LLM 在微调过程中导致 LLM 智能退化(灾难性遗忘)的问题
- 仅需 6 万轮文本问答数据和少量 ASR/TTS 数据即可实现高质量语音对话能力
- 支持任意文本模态 LLM 作为骨干网络,具备良好的可扩展性和迁移性
- 实现了约 1.2 秒的平均端到端延迟,接近实时交互体验
核心方法
- 采用三阶段训练策略:第一阶段用 CTC 损失训练语音编码器;第二阶段连接适配器与 LLM,以转录文本为标签进行对齐;第三阶段引入可训练 prompt embedding,使用多轮问答数据实现语音输入到文本输出的映射
- 语音输出建模采用 NAR + AR 解码器结构:NAR 前缀解码器接收 LLM 隐藏状态,NAR 解码器处理文本 token,AR 解码器生成语音 token,最终由单码本 codec(TiCodec)还原为波形
- 通过 prefix kv-cache 微调策略将 LLM 输出空间与语音解码器对齐,避免直接微调 LLM
- 设计分块级状态预测机制(0:继续接收语音;1:用户打断需响应;2:无需打断),结合 VAD 实现双工对话
- 使用“模型即服务”架构,分离 kv-cache 与 CNN 缓存,支持多用户并发流式处理
关键结果
- 在语音理解任务中,Freeze-Omni 在 AISHELL-1 上 CER 为 2.15%,LibriSpeech test-clean 上 WER 为 3.24%,优于 Mini-Omni2 等对比模型
- 语音合成质量显著提升:引入 NAR 前缀解码器后,CER 从 5.27% 降至 3.9%(top-k=1);增加预网络后进一步降至 2.19%
- 在口语问答任务中,Freeze-Omni 在 Web Questions、LlaMA Questions 和 Audio Trivia QA 上的准确率分别为 44.73%、72% 和 53.88%,与骨干模型 Qwen2-7B-Instruct 的差距小于 Moshi 与 Helium 的差距,证明其智能水平未受损
- 端到端统计延迟为 745ms(中位数 753ms),非统计延迟约 160–320ms,综合网络延迟后总延迟控制在约 1.2 秒
局限与风险
- 实验基于单说话人设定,未验证多说话人场景下的鲁棒性
- 语音输出依赖外部 TTS 系统生成训练数据,可能引入合成偏差
- 未公开代码与模型权重,复现存在一定门槛
- 双工对话中的状态预测仅在特定数据集上验证,泛化能力有待进一步测试
适合沉淀的概念
speech-to-speech-dialogue, frozen-llm, low-latency-speech-processing, chunk-wise-streaming-encoder, nar-ar-speech-decoder, prefix-kv-cache-finetuning, duplex-dialogue-state-prediction, multimodal-llm-alignment
阅读注意
- 重点关注三阶段训练中各模块参数冻结策略及其对模型性能的影响
- 注意语音编码器采用 4 倍下采样以降低帧率(12.5Hz),从而减少 LLM prefilling 时间
- NAR 前缀解码器的作用是桥接 LLM 隐藏状态与语音 token 空间,是保持 LLM 不微调的关键设计
- 状态预测分类层仅作用于每个语音块的最后帧,训练时采用多任务损失联合优化
- 实验使用 Qwen2-7B-Instruct 作为骨干模型,但方法理论上适用于任何文本 LLM
质量说明
- 采用来源:
clean,papers/2024/11/2411.00774.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文结构完整,实验设计合理,数据详实,包含 ASR、TTS、口语问答和延迟分析等多个维度评估,方法描述清晰,具备可复现性基础。