论文
arXiv2604.04847
时间2026-04
来源https://arxiv.org/html/2604.04847v1
页面质量中文卡片
阅读量级56 分钟

Full-Duplex-Bench-v3

论文导读

提出首个基于真实人类语音、包含多步工具调用与五类中断标注的全双工语音代理评估基准 FDB-v3,系统评测六类模型在准确性、延迟与对话轮转上的权衡。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Full-Duplex-Bench-v3:面向真实语音中断的全双工语音代理工具使用基准

一句话定位

提出首个基于真实人类语音、包含多步工具调用与五类中断标注的全双工语音代理评估基准 FDB-v3,系统评测六类模型在准确性、延迟与对话轮转上的权衡。

小学生也能听懂

这篇论文做了一个像“语音助手考试”的测试,用真实人说话的录音,包括说错话、结巴等情况,让不同AI助手完成订票、查账等任务,发现它们虽然快慢不同,但都容易在别人改口时出错,因为不会“反悔”重来。

为什么值得记录

  • 填补现有语音代理基准的空白:首次将真实人类语音、自然中断(如自我修正)、多步工具链与确定性 API 调用结合,支持可复现的端到端评估。
  • 揭示关键设计权衡:量化了响应速度、对话流畅性(轮转/打断)与推理可靠性之间的冲突,例如 Gemini Live 3.1 虽快但存在‘沉默工作者’问题。
  • 暴露核心挑战:所有模型在中断意图修正(self-correction)场景下表现差,最高仅 58.8% 成功率,凸显状态回滚机制的缺失。
  • 提供细粒度分析框架:支持按难度、领域、中断类型分解性能,并定义工具选择 F1、参数准确率、任务完成率(Pass@1)等可自动评分指标。

核心方法

  • 构建 100 条真实人类语音场景,涵盖 Travel & Identity、Finance & Billing、Housing & Location、E-Commerce Support 四个领域,每条需调用 1–3 个模拟 API。
  • 语音数据来自 12 名母语与非母语者,在真实环境中录制,标注五类中断:填充词(fillers)、停顿(pauses)、犹豫(hesitations)、错误起始(false starts)、自我修正(self-corrections)。
  • 设计三级难度:Easy(单步)、Medium(两步含歧义)、Hard(多步含冲突约束),其中 21 个场景专门测试自我修正下的状态回滚能力。
  • 使用本地零延迟模拟 API 确保评分确定性,隔离网络波动影响,所有输出可自动验证。
  • 评估六类系统:GPT-Realtime、Gemini Live 2.5/3.1、Grok、Ultravox v0.7 及级联管道(Whisper → GPT-4o → TTS),统一通过 LiveKit 框架部署。
  • 定义多维指标:工具选择 F1、参数语义准确率、响应质量、Pass@1(全对才成功)、轮转率、打断率、延迟分解(首词/工具调用/任务完成)。

关键结果

  • GPT-Realtime 综合最优:Pass@1 达 0.600,工具选择 F1 0.876,打断率最低(13.5%),自我修正处理最强(0.588)。
  • Gemini Live 3.1 最快但沉默:任务完成延迟仅 4.25 秒,但 22% 场景无响应(‘silent worker’),且自我修正表现下降至 0.353。
  • 级联管道可靠但慢:100% 轮转率,但延迟高达 10.12 秒,Pass@1 仅 0.450,自我修正得分最低(0.176),因 ASR 提前固化错误转录。
  • Ultravox 高频打断:打断率达 47.9%,88% 响应含填充句,工具调用延迟(6.01s)远高于首词延迟(3.88s),表明其‘先说话后思考’策略。
  • 所有模型在 Hard 场景下性能显著下降,Finance 域最易(平均 Pass@1 > 0.8),Housing 域最难(最高仅 0.308)。
  • 自我修正仍是最大难点:即使最优模型 GPT-Realtime 也有超 40% 失败率,因模型过早提交中间参数而无法回滚。

局限与风险

  • 云模型延迟包含不可控网络开销,虽在固定高带宽区域测试,仍存在服务器负载波动影响。
  • 本地模拟 API 无网络异常(如超时、拒绝访问),未测试模型对真实服务故障的鲁棒性。
  • 仅 100 条语音样本,虽经质量控制,统计显著性有限,尤其细分到中断类型时样本更少。
  • 未涵盖重叠语音(overlap)场景,尽管 FDB 系列前作已覆盖,本版本聚焦中断而非并发说话。

适合沉淀的概念

full-duplex-voice-agents, tool-use-benchmark, self-correction-handling, turn-taking-dynamics, latency-breakdown, disfluency-robustness, cascaded-pipeline, silent-worker-phenomenon

阅读注意

  • 关注 Table 2 与 Table 3:前者展示整体性能权衡,后者揭示各模型对不同类型中断的敏感性差异。
  • 对比 Case 1 与 Case 2:清晰展示 Gemini Live 3.1 在无障碍时极快,但在自我修正时因预调用而失败,体现架构设计取舍。
  • 注意‘pre-emptive tool call’与‘interruption’的区别:Grok 高预调用率但低打断率,说明其静默处理;Ultravox 则因过早发声导致高打断。
  • Appendix A 中的评估提示(如 Argument Accuracy Judge)展示了如何自动化语义级参数正确性判断,值得复现参考。

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.04847.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含基准设计、实验设置、详细结果与案例分析,数据充分支持结论。虽为 arXiv 预印本,但结构清晰,方法可复现,适合作为权威基准记录。