---
title: "SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model"
title_zh: "SALM-Duplex：高效直接的语音到语音双向建模模型"
arxiv_id: "2505.15670"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2025/05/2505.15670.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# SALM-Duplex：高效直接的语音到语音双向建模模型

## 一句话定位

提出一种无需语音预训练的双向语音到语音（S2S）架构，通过分离用户与代理建模、使用流式编码器和个性化编解码器，实现低延迟、高交互性的实时对话能力。

## 小学生也能听懂

这个模型像两个会说话的小机器人，一个听你说话，一个马上用你的声音回话，不用提前学很多课文，插话也能快速回应，声音更像真人，还能边说边改，让聊天更自然流畅。

## 为什么值得记录

- 首次实现无需大规模语音-文本预训练的双向S2S模型，显著降低构建门槛和资源消耗
- 采用分离式用户（预训练编码器）与代理（可微调编解码器）建模，支持代理音色个性化并提升生成质量
- 在 barge-in（插话）成功率、响应延迟和语音质量等关键交互指标上优于现有模型如Moshi
- 开源训练与推理代码，推动双向语音对话模型的可复现性和社区发展
- 提出系统化的评估指标（如插话成功率、误触发率、首响延迟），为领域建立评测基准

## 核心方法

- 模型由三部分组成：100M参数的流式CTC语音编码器（处理用户输入）、TinyLlama-1.1B作为主干LLM、NanoCodec编解码器（生成代理语音）
- 用户语音经编码器生成连续嵌入，代理语音通过4码本NanoCodec以12.5Hz生成离散token，文本与语音通道在轮次级别对齐后送入LLM
- 引入通道融合机制，允许模型同时预测文本和语音输出，并通过小延迟（1 token）优化语音对文本上下文的依赖
- 训练数据包含合成与真实口语问答、多轮对话及插话增强数据，总时长约26.5k小时，涵盖角色扮演、日常话题等场景
- 损失函数中文本权重为3，语音权重为1；使用FusedAdam优化器与逆平方根退火学习率调度
- 编解码器支持个性化微调：在21k目标说话人语料上微调NanoCodec，显著提升音色相似度（SECS从0.57→0.94）和语音质量（MOS从4.54→4.75）
- 模型完全流式处理，支持实时双向交互，用户可随时插话，代理能在0.69秒内响应中断

## 关键结果

- 在UltraChat和Impatient测试集上，插话成功率分别达83.0%和94.5%，高于Moshi的56.0%和55.1%
- 插话响应延迟为0.69秒，优于Moshi的0.81秒；首响延迟为0.72秒（受数据中0.64秒静音间隔影响）
- 语音质量UTMOS达4.3，优于Moshi的3.9；个性化编解码器在0.6kbps下MOS达4.75，超过1.2kbps NanoCodec和1.1kbps Mimi
- 推理能力（GPT评分）在多数数据集上优于Moshi，尤其在Topic（6.1 vs 2.8）和ASR-QA（7.8 vs 1.9）表现突出
- ASR-BLEU指标显示个性化编解码器使生成语音的文本匹配度提升至18.7，高于基础版本的16.2

## 局限与风险

- 首响延迟受训练数据中固定0.64秒静音间隔影响，可能不适用于极低延迟场景
- 未与完整级联系统（含VAD、流式ASR、TTS）进行端到端对比，推理性能差距可能部分源于前端误差
- 模型规模较小（1.1B LLM），复杂推理任务表现仍落后于最优级联系统（GT+LLM）
- 依赖高质量TTS合成训练数据，真实场景泛化能力需进一步验证

## 适合沉淀的概念

`speech-to-speech-modeling`, `duplex-conversation`, `barge-in-handling`, `streaming-speech-encoder`, `neural-audio-codec`, `codec-personalization`, `turn-taking-modeling`, `end-to-end-speech-dialogue`

## 阅读注意

- 关注模型如何实现‘无语音预训练’——关键在于使用预训练流式编码器处理用户输入，避免从头训练语音理解模块
- 注意数据构造细节：通过插入静音和截断代理语音模拟插话行为，是模型学会实时响应的关键
- 编解码器个性化部分展示了如何通过少量目标说话人数据微调，显著提升生成语音的自然度和音色一致性
- 评估指标设计全面，尤其‘插话成功率’和‘误触发率’对实际产品落地具有重要参考价值
- 开源代码位于NeMo框架下，便于复现和二次开发

## 质量说明

- 采用来源：`clean`，`papers/2025/05/2505.15670.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含架构图、数据表、实验结果和开源链接，方法描述清晰，实验设计合理，结果可验证。
