---
title: "Seeduplex"
created: 2026-04-09
updated: 2026-04-09
type: entity
tags: [model, speech-model, full-duplex, end-to-end, company]
sources: [raw/articles/bytedance-seeduplex-2026-04-09.md]
---

# Seeduplex

字节跳动 Seed 团队于 2026 年 4 月 9 日发布的**原生全双工端到端语音大模型**，已在中国大陆豆包 App 全量上线，服务上亿用户。

## 基本信息

| 属性 | 值 |
|------|-----|
| 发布日期 | 2026-04-09 |
| 团队 | 字节跳动 Seed |
| 前代模型 | Seed Realtime Voice（豆包端到端语音模型，半双工） |
| 底座 | 字节自研 LLM |
| 部署 | 豆包 App "打电话"功能 |
| 范式 | 全双工（listen while speaking） |

## 核心技术突破

### 1. 精准抗干扰（Precision Interference Suppression）

模型持续接收用户侧音频，感知全局声学环境，区分交互声音与干扰声：
- **声场理解 + 主动联动：** 解析环境音并纳入推理上下文（如背景播放杭州介绍 → 主动关联用户旅游计划）
- **剥离干扰，锁定主用户：** 车内播报 + 导航声混杂场景下稳定过滤干扰
- **意图识别，忽略非交互声：** 咖啡厅旁人插话、门口外卖员等场景自动忽略
- **多人重叠场景处理**

**效果：** 复杂声学场景下误回复率和误打断率降低 **50%**

### 2. 动态判停（Dynamic Endpoint Detection）

语音 + 语义联合建模判断用户意图：
- 用户思考犹豫时耐心倾听（包容留白）
- 用户说完后快速响应
- 反复调整的复杂表达中准确捕捉真实意图

**效果：** AI 抢话比例相对减少 **40%**，判停延迟降低约 **250ms**

### 3. 打断响应

**效果：** 打断响应延迟缩短约 **300ms**，响应准确率更高

## 训练方法

- 海量语音数据预训练
- 强化学习（RL）优化
- 语音语义联合建模
- 关键能力（对话节奏控制、抗干扰、轮次切换、指向性理解）原生融入模型训练体系
- 工程优化：攻克高并发下卡顿与稳定性，支持亿级用户

## 评测数据

| 指标 | 提升幅度 |
|------|---------|
| 判停 MOS 分 | +8% |
| 对话流畅度 MOS 分 | +12% |
| 整体通话满意度 | +8.34% |
| 判停延迟 | -250ms |
| AI 抢话比例 | -40%（相对） |
| 打断响应延迟 | -300ms |
| 误回复率 / 误打断率 | -50% |

### 人人对比

以真人对话为基准：
- 判停表现显著优于半双工方案
- 打断响应略优于真人对话平均水平
- 整体对话流畅度与真人对话仍有差距

## 未来路线图

1. 提升音频理解，优化多人对话、智能硬件等复杂场景
2. 数据 Scaling + 算法优化 → 更丰富的对话节奏
3. 引入主动能力（附和、主动交互）
4. 多模态融合 → "边听、边看、边说"
5. 感知-思考-输出一体化 → "边听边想"、"边听边搜"

## 相关实体

- [[byte-seed]] - 字节跳动 Seed 团队
- [[doubao-app]] - 豆包 App
- [[seed-realtime-voice]] - 前代半双工语音模型
- [[full-duplex-speech-model]] - 全双工语音模型概念
- [[x-opd]] - 跨模态在线蒸馏
- [[speech-llm]] - 语音大语言模型

## 相关论文

- [[seed-tts]] - Seed-TTS（字节跳动语音生成模型家族）
