---
title: "Full-Duplex-Bench-v3"
title_zh: "Full-Duplex-Bench-v3：面向真实语音中断的全双工语音代理工具使用基准"
arxiv_id: "2604.04847"
paper_type: "benchmark"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.04847.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Full-Duplex-Bench-v3：面向真实语音中断的全双工语音代理工具使用基准

## 一句话定位

提出首个基于真实人类语音、包含多步工具调用与五类中断标注的全双工语音代理评估基准 FDB-v3，系统评测六类模型在准确性、延迟与对话轮转上的权衡。

## 小学生也能听懂

这篇论文做了一个像“语音助手考试”的测试，用真实人说话的录音，包括说错话、结巴等情况，让不同AI助手完成订票、查账等任务，发现它们虽然快慢不同，但都容易在别人改口时出错，因为不会“反悔”重来。

## 为什么值得记录

- 填补现有语音代理基准的空白：首次将真实人类语音、自然中断（如自我修正）、多步工具链与确定性 API 调用结合，支持可复现的端到端评估。
- 揭示关键设计权衡：量化了响应速度、对话流畅性（轮转/打断）与推理可靠性之间的冲突，例如 Gemini Live 3.1 虽快但存在‘沉默工作者’问题。
- 暴露核心挑战：所有模型在中断意图修正（self-correction）场景下表现差，最高仅 58.8% 成功率，凸显状态回滚机制的缺失。
- 提供细粒度分析框架：支持按难度、领域、中断类型分解性能，并定义工具选择 F1、参数准确率、任务完成率（Pass@1）等可自动评分指标。

## 核心方法

- 构建 100 条真实人类语音场景，涵盖 Travel & Identity、Finance & Billing、Housing & Location、E-Commerce Support 四个领域，每条需调用 1–3 个模拟 API。
- 语音数据来自 12 名母语与非母语者，在真实环境中录制，标注五类中断：填充词（fillers）、停顿（pauses）、犹豫（hesitations）、错误起始（false starts）、自我修正（self-corrections）。
- 设计三级难度：Easy（单步）、Medium（两步含歧义）、Hard（多步含冲突约束），其中 21 个场景专门测试自我修正下的状态回滚能力。
- 使用本地零延迟模拟 API 确保评分确定性，隔离网络波动影响，所有输出可自动验证。
- 评估六类系统：GPT-Realtime、Gemini Live 2.5/3.1、Grok、Ultravox v0.7 及级联管道（Whisper → GPT-4o → TTS），统一通过 LiveKit 框架部署。
- 定义多维指标：工具选择 F1、参数语义准确率、响应质量、Pass@1（全对才成功）、轮转率、打断率、延迟分解（首词/工具调用/任务完成）。

## 关键结果

- GPT-Realtime 综合最优：Pass@1 达 0.600，工具选择 F1 0.876，打断率最低（13.5%），自我修正处理最强（0.588）。
- Gemini Live 3.1 最快但沉默：任务完成延迟仅 4.25 秒，但 22% 场景无响应（‘silent worker’），且自我修正表现下降至 0.353。
- 级联管道可靠但慢：100% 轮转率，但延迟高达 10.12 秒，Pass@1 仅 0.450，自我修正得分最低（0.176），因 ASR 提前固化错误转录。
- Ultravox 高频打断：打断率达 47.9%，88% 响应含填充句，工具调用延迟（6.01s）远高于首词延迟（3.88s），表明其‘先说话后思考’策略。
- 所有模型在 Hard 场景下性能显著下降，Finance 域最易（平均 Pass@1 > 0.8），Housing 域最难（最高仅 0.308）。
- 自我修正仍是最大难点：即使最优模型 GPT-Realtime 也有超 40% 失败率，因模型过早提交中间参数而无法回滚。

## 局限与风险

- 云模型延迟包含不可控网络开销，虽在固定高带宽区域测试，仍存在服务器负载波动影响。
- 本地模拟 API 无网络异常（如超时、拒绝访问），未测试模型对真实服务故障的鲁棒性。
- 仅 100 条语音样本，虽经质量控制，统计显著性有限，尤其细分到中断类型时样本更少。
- 未涵盖重叠语音（overlap）场景，尽管 FDB 系列前作已覆盖，本版本聚焦中断而非并发说话。

## 适合沉淀的概念

`full-duplex-voice-agents`, `tool-use-benchmark`, `self-correction-handling`, `turn-taking-dynamics`, `latency-breakdown`, `disfluency-robustness`, `cascaded-pipeline`, `silent-worker-phenomenon`

## 阅读注意

- 关注 Table 2 与 Table 3：前者展示整体性能权衡，后者揭示各模型对不同类型中断的敏感性差异。
- 对比 Case 1 与 Case 2：清晰展示 Gemini Live 3.1 在无障碍时极快，但在自我修正时因预调用而失败，体现架构设计取舍。
- 注意‘pre-emptive tool call’与‘interruption’的区别：Grok 高预调用率但低打断率，说明其静默处理；Ultravox 则因过早发声导致高打断。
- Appendix A 中的评估提示（如 Argument Accuracy Judge）展示了如何自动化语义级参数正确性判断，值得复现参考。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.04847.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含基准设计、实验设置、详细结果与案例分析，数据充分支持结论。虽为 arXiv 预印本，但结构清晰，方法可复现，适合作为权威基准记录。
