实体
model speech-model full-duplex end-to-end company
创建2026-04-09
更新2026-04-09
阅读量级2 分钟
实体导读

字节跳动 Seed 团队于 2026 年 4 月 9 日发布的原生全双工端到端语音大模型,已在中国大陆豆包 App 全量上线,服务上亿用户。

  1. 基本信息
  2. 核心技术突破
  3. 精准抗干扰(Precision Interference Suppression)
  4. 动态判停(Dynamic Endpoint Detection)
  5. 打断响应
  6. 训练方法
  7. 评测数据
  8. 人人对比

Seeduplex

字节跳动 Seed 团队于 2026 年 4 月 9 日发布的原生全双工端到端语音大模型,已在中国大陆豆包 App 全量上线,服务上亿用户。

基本信息

属性
发布日期 2026-04-09
团队 字节跳动 Seed
前代模型 Seed Realtime Voice(豆包端到端语音模型,半双工)
底座 字节自研 LLM
部署 豆包 App "打电话"功能
范式 全双工(listen while speaking)

核心技术突破

1. 精准抗干扰(Precision Interference Suppression)

模型持续接收用户侧音频,感知全局声学环境,区分交互声音与干扰声: - 声场理解 + 主动联动: 解析环境音并纳入推理上下文(如背景播放杭州介绍 → 主动关联用户旅游计划) - 剥离干扰,锁定主用户: 车内播报 + 导航声混杂场景下稳定过滤干扰 - 意图识别,忽略非交互声: 咖啡厅旁人插话、门口外卖员等场景自动忽略 - 多人重叠场景处理

效果: 复杂声学场景下误回复率和误打断率降低 50%

2. 动态判停(Dynamic Endpoint Detection)

语音 + 语义联合建模判断用户意图: - 用户思考犹豫时耐心倾听(包容留白) - 用户说完后快速响应 - 反复调整的复杂表达中准确捕捉真实意图

效果: AI 抢话比例相对减少 40%,判停延迟降低约 250ms

3. 打断响应

效果: 打断响应延迟缩短约 300ms,响应准确率更高

训练方法

  • 海量语音数据预训练
  • 强化学习(RL)优化
  • 语音语义联合建模
  • 关键能力(对话节奏控制、抗干扰、轮次切换、指向性理解)原生融入模型训练体系
  • 工程优化:攻克高并发下卡顿与稳定性,支持亿级用户

评测数据

指标 提升幅度
判停 MOS 分 +8%
对话流畅度 MOS 分 +12%
整体通话满意度 +8.34%
判停延迟 -250ms
AI 抢话比例 -40%(相对)
打断响应延迟 -300ms
误回复率 / 误打断率 -50%

人人对比

以真人对话为基准: - 判停表现显著优于半双工方案 - 打断响应略优于真人对话平均水平 - 整体对话流畅度与真人对话仍有差距

未来路线图

  1. 提升音频理解,优化多人对话、智能硬件等复杂场景
  2. 数据 Scaling + 算法优化 → 更丰富的对话节奏
  3. 引入主动能力(附和、主动交互)
  4. 多模态融合 → "边听、边看、边说"
  5. 感知-思考-输出一体化 → "边听边想"、"边听边搜"

相关实体

相关论文

  • seed-tts - Seed-TTS(字节跳动语音生成模型家族)