实体导读
字节跳动 Seed 团队于 2026 年 4 月 9 日发布的原生全双工端到端语音大模型,已在中国大陆豆包 App 全量上线,服务上亿用户。
- 基本信息
- 核心技术突破
- 精准抗干扰(Precision Interference Suppression)
- 动态判停(Dynamic Endpoint Detection)
- 打断响应
- 训练方法
- 评测数据
- 人人对比
Seeduplex
字节跳动 Seed 团队于 2026 年 4 月 9 日发布的原生全双工端到端语音大模型,已在中国大陆豆包 App 全量上线,服务上亿用户。
基本信息
| 属性 | 值 |
|---|---|
| 发布日期 | 2026-04-09 |
| 团队 | 字节跳动 Seed |
| 前代模型 | Seed Realtime Voice(豆包端到端语音模型,半双工) |
| 底座 | 字节自研 LLM |
| 部署 | 豆包 App "打电话"功能 |
| 范式 | 全双工(listen while speaking) |
核心技术突破
1. 精准抗干扰(Precision Interference Suppression)
模型持续接收用户侧音频,感知全局声学环境,区分交互声音与干扰声: - 声场理解 + 主动联动: 解析环境音并纳入推理上下文(如背景播放杭州介绍 → 主动关联用户旅游计划) - 剥离干扰,锁定主用户: 车内播报 + 导航声混杂场景下稳定过滤干扰 - 意图识别,忽略非交互声: 咖啡厅旁人插话、门口外卖员等场景自动忽略 - 多人重叠场景处理
效果: 复杂声学场景下误回复率和误打断率降低 50%
2. 动态判停(Dynamic Endpoint Detection)
语音 + 语义联合建模判断用户意图: - 用户思考犹豫时耐心倾听(包容留白) - 用户说完后快速响应 - 反复调整的复杂表达中准确捕捉真实意图
效果: AI 抢话比例相对减少 40%,判停延迟降低约 250ms
3. 打断响应
效果: 打断响应延迟缩短约 300ms,响应准确率更高
训练方法
- 海量语音数据预训练
- 强化学习(RL)优化
- 语音语义联合建模
- 关键能力(对话节奏控制、抗干扰、轮次切换、指向性理解)原生融入模型训练体系
- 工程优化:攻克高并发下卡顿与稳定性,支持亿级用户
评测数据
| 指标 | 提升幅度 |
|---|---|
| 判停 MOS 分 | +8% |
| 对话流畅度 MOS 分 | +12% |
| 整体通话满意度 | +8.34% |
| 判停延迟 | -250ms |
| AI 抢话比例 | -40%(相对) |
| 打断响应延迟 | -300ms |
| 误回复率 / 误打断率 | -50% |
人人对比
以真人对话为基准: - 判停表现显著优于半双工方案 - 打断响应略优于真人对话平均水平 - 整体对话流畅度与真人对话仍有差距
未来路线图
- 提升音频理解,优化多人对话、智能硬件等复杂场景
- 数据 Scaling + 算法优化 → 更丰富的对话节奏
- 引入主动能力(附和、主动交互)
- 多模态融合 → "边听、边看、边说"
- 感知-思考-输出一体化 → "边听边想"、"边听边搜"
相关实体
- byte-seed - 字节跳动 Seed 团队
- doubao-app - 豆包 App
- seed-realtime-voice - 前代半双工语音模型
- full-duplex-speech-model - 全双工语音模型概念
- x-opd - 跨模态在线蒸馏
- speech-llm - 语音大语言模型
相关论文
- seed-tts - Seed-TTS(字节跳动语音生成模型家族)