---
title: "2411.18138"
title_zh: "SALMONN-omni：一种无编解码器的全双工语音理解与生成模型"
arxiv_id: "2411.18138"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2024/11/2411.18138.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# SALMONN-omni：一种无编解码器的全双工语音理解与生成模型

## 一句话定位

提出首个无编解码器（codec-free）的全双工端到端语音大模型 SALMONN-omni，支持实时语音理解与生成，并通过“思考”机制处理对话中的动态交互如抢话、回声消除等。

## 小学生也能听懂

这篇论文发明了一个叫SALMONN-omni的“聪明耳朵”，它能一边听人说话一边马上回应，不用先转成文字再说话，还能在别人插话时立刻停下，像真人聊天一样自然。

## 为什么值得记录

- 首次实现无需语音编解码器的全双工语音理解与生成一体化架构，避免传统模块化系统的误差累积问题
- 支持流式输入输出，可实时处理用户语音和环境声音，同时生成语音响应，适用于自然对话场景
- 引入“思考”机制和状态转移标记（<start_speak>/<end_speak>），有效建模说话/非说话状态切换，提升对话灵活性
- 在语音识别、增强、问答、抢话处理、回声抑制等多个任务上验证了统一模型的泛化能力
- 为下一代低延迟、高自然度人机语音交互系统提供了可复现的技术原型

## 核心方法

- 采用端到端架构，集成流式语音编码器、大语言模型（LLM）和流式语音合成器，三者通过嵌入向量直接连接，避免中间文本或离散 token 的使用
- 设计周期性同步机制，将对话划分为固定时长的时间块（Δt），每个块内处理一段输入语音并生成固定数量文本嵌入
- 引入“思考”机制，使用 <think> 特殊 token 作为 LLM 输入，在不强制输出的情况下维持模型对输入流的持续感知
- 定义两种状态：说话态与非说话态，通过 <start_speak> 和 <end_speak> 标记控制状态转换，实现动态响应控制
- 训练时采用三部分损失函数：文本生成损失、语音生成损失和“思考”损失，其中“思考”损失权重 λ_think < 0，鼓励模型在静默期保持内部处理
- 使用 LibriHeavy（6万小时）和 GigaSpeech（1万小时）数据进行多任务联合训练，涵盖语音识别、增强、问答等任务
- 合成数据用于模拟抢话（barge-in）、轮次切换等自然对话行为，增强模型对交互动态的适应能力

## 关键结果

- 在流式语音识别任务中，SALMONN-omni 能够实时将输入语音转换为文本，无需额外 ASR 模块
- 在语音增强任务中，模型可听 noisy 语音并输出清晰重述内容，实现去噪与去混响
- 在口语问答场景中，模型能正确处理轮次切换，在适当时机开始或停止说话
- 在上下文无关抢话实验中，当用户说“Yes”时，模型能立即停止生成语音；对其他输入或无输入则继续说话
- 在带回声消除的抢话实验中，模型能区分自身输出语音与用户输入，不受回声干扰，准确响应抢话指令
- 在上下文相关抢话场景中，模型可根据语义判断是否中断：若用户提前回答正确则停止，若输入无关则忽略并继续

## 局限与风险

- 目前实验基于模拟环境，真实世界复杂声学条件下的鲁棒性仍需进一步验证
- “思考”机制依赖负权重损失设计，可能影响训练稳定性，需谨慎调参
- 模型未公开具体架构细节（如 LLM 规模、编码器/合成器结构），限制了复现与深入分析
- 缺乏与传统模块化系统或 codec-based 全双工模型（如 Moshi、SyncLLM）的定量对比结果
- 实时性指标（如端到端延迟、吞吐量）未明确报告，影响实际部署评估

## 适合沉淀的概念

`full-duplex-speech-model`, `codec-free-speech-generation`, `streaming-speech-processing`, `thinking-mechanism-in-llm`, `barge-in-handling`, `echo-cancellation-in-conversational-ai`, `end-to-end-speech-understanding`, `multimodal-llm-for-speech`

## 阅读注意

- 关注‘thinking’机制如何通过负损失权重实现内部状态维持，而不显式输出思考内容
- 注意时间块（time block）同步机制如何协调听觉与语言模态的对齐
- 观察模型在抢话场景中如何结合上下文判断是否中断，体现语义理解与交互策略的融合
- 思考为何选择嵌入而非离散 token（如 SoundStream 或 EnCodec 输出）作为中间表示，及其对训练和推理的影响
- 留意合成数据在训练动态对话行为中的作用，以及其对泛化能力的贡献

## 质量说明

- 采用来源：`raw`，`raw/papers/2024/11/2411.18138.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了清晰的方法描述、实验案例和架构图，虽缺少部分技术细节（如模型规模、训练配置）和定量指标，但核心思想与创新点表达完整，具备可理解性和参考价值。
