# Seeduplex: 原生全双工语音大模型

**来源:** https://seed.bytedance.com/zh/seeduplex
**日期:** 2026-04-09
**团队:** 字节跳动 Seed

---

## 概述

此前，业内大多数语音系统仍受限于半双工范式：必须严格遵循"你讲我听、我讲你听"的轮流发言机制。这种模式较难应对人类真实交流中复杂多变的物理环境和碎片化特征。

为此，我们正式推出原生全双工语音大模型 Seeduplex。相比于上一代豆包端到端语音模型，Seeduplex 实现了真正意义上的"边听边说"。结合海量语音数据预训练与强化学习（RL），我们在保持模型快速响应能力的同时，利用语音语义联合建模的优势，让模型可以做到精准抗干扰、动态判停，使交互体验的自然感与顺畅度大幅提升。

目前，Seeduplex 已在豆包 App 全量上线，这意味着全双工技术正式走出实验室，在业界率先实现了规模化落地，可为上亿用户提供连续高质量的实时语音交互体验。

## 技术实现

为了支撑这一落地，团队打造了业界领先的实时语音全双工交互框架，突破数据构建、超低时延与模型效果协同优化等核心技术瓶颈。

在不牺牲模型智能水平的前提下，实现了"边听边说"的实时交互能力，并将对话节奏控制、强抗干扰、精准轮次切换与指向性理解等关键能力原生融入模型训练体系，让模型具备更自然的对话流控制能力。

同时，团队在工程架构上重点攻克了高并发下的卡顿与稳定性等挑战，确保了模型在大流量环境下的平稳运行。

### 精准抗干扰

复杂的声学环境一直是语音交互的挑战。背景噪音、人声干扰常会"污染"用户的语音输入，导致系统响应迟钝、回复中断或被误触发。过去，用户常需提高音量或寻找安静角落，才能完成一次稳妥的交互。

Seeduplex 模型能持续接收并理解用户侧音频，感知用户所在的全局声学环境，从而精准判断哪些是真正和模型交互的声音，哪些是干扰声。抗干扰力的提升，使得 Seeduplex 的误回复率与误打断率大幅下降。

能力举例：
- **声场理解，主动联动信息：** 模型能解析环境音并将其纳入推理上下文。听到背景音中的杭州介绍后，能主动结合用户的旅游计划给予贴心回应。
- **剥离干扰，精准识别用户声音：** 在播报频频、导航声混杂的车内，模型能稳定过滤背景干扰声，精准锁定主用户的声音并快速响应需求。
- **理解意图，忽略非交互声音：** 在咖啡厅偶遇朋友道别时，模型能根据语义识别交互意图，自动忽略旁人的插话，让主线对话保持自然连贯。
- **居家场景：** 随口应答门外的外卖员，模型能精准识别哪些话是针对自己发出的指令，避免错误抢答。
- **多人重叠场景：** 即便面对多人声音重叠的复杂场景，模型也能精准甄别对话对象。

### 动态判停

真正的自然交互，核心在于准确判断用户何时在思考、何时已说完。Seeduplex 通过深度融合语音与语义理解，在对话节奏把控上具有更强的灵活性。

能力举例：
- **耐心倾听，包容思考留白：** 点单时若想法不确定，用户可随时边想边修正。面对反复调整的复杂表达，模型会始终保持倾听、准确捕捉用户的真实意图。

## 模型评测

我们对 Seeduplex 进行了一系列主客观评测，结果显示，Seeduplex 在打断与判停表现上均显著优于半双工模型，并在多项关键指标上处于行业领先水平。

相比豆包 App 之前使用的半双工对话框架，Seeduplex 的整体交互体验进一步提升，其判停 MOS 分提高了 8%，对话流畅度 MOS 分提升了 12%。

具体来说：
- Seeduplex 将判停延迟降低约 **250ms** 的同时，复杂场景下的 AI 抢话比例相对减少 **40%**
- 针对用户的打断需求，在响应准确率更高的前提下，Seeduplex 将打断响应的延迟进一步缩短了约 **300ms**
- 在复杂声学干扰场景下，Seeduplex 将误回复率和误打断率降低了一半

### 横向对比评测

通过与原半双工模型以及行业主流 App 语音通话功能的横向对比，Seeduplex 在判停、打断响应任务上展现出明显优势，并显著提升了评测用户对整体交互节奏是否合理的对话流畅度评价。

### 人人对比评测

我们还通过组织真人对话测试，初步摸底了目前人机对话相对真实人人对话（普通人群）的水位。结果显示，以"人人对话"为基准，Seeduplex 在判停表现上相比半双工方案显著提升了 8%。而在响应打断的表现上，真实人人对话有时在响应上相对滞后，Seeduplex 则表现更稳定，略好于人人对话的平均水平。但在整体对话流畅度上，Seeduplex 和真实人人对话仍有不小差距，有待进一步提升。

## 展望

未来，团队将在以下几个方面继续突破：
1. 继续提升模型的音频理解能力，深度优化在多人对话、智能硬件等复杂交互场景中的表现。
2. 通过数据 Scaling 和算法优化，持续提升模型的对话节奏多样性和控制能力。
3. 在"边听边说"的基础上，引入模型主动能力，如在倾听的过程中附和用户、结合声学环境和对话语境主动交互。
4. 实现更深度的多模态融合，在现有语音、文本模态的基础上引入视觉模态，实现"边听、边看、边说"的多维协同。
5. 实现感知、思考、输出一体化，进一步探索"边听边想"、"边听边搜"等方案，让模型具备更深度的思考和执行能力，继续提升语音交互的流畅度。

以全双工为起点，期望未来 AI 能不断进化，在感知、交互与行动的闭环中，真正实现听、看、想、说、做的协同。

## 升级关系

Seeduplex 升级自 Seed Realtime Voice（豆包上一代端到端语音模型），从半双工范式升级为全双工范式。
