---
title: "VoiceBench: Benchmarking LLM-Based Voice Assistants"
title_zh: "VoiceBench：面向 LLM 语音助手的多维度评测基准"
arxiv_id: "2410.17196"
paper_type: "benchmark"
source_kind: "clean"
raw_path: "raw/papers/2024/10/2410.17196.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# VoiceBench：面向 LLM 语音助手的多维度评测基准

## 一句话定位

提出首个综合评测 LLM 语音助手在真实场景下表现能力的基准 VoiceBench，涵盖通用知识、指令遵循、安全性，并系统评估说话人、环境和内容变异对性能的影响。

## 小学生也能听懂

这篇论文造了一个叫VoiceBench的测试，像给语音助手“考试”，看它们在真实世界里（比如有噪音、口音或说话结巴时）能不能听懂问题、安全回答，结果发现现在的语音助手在真实情况下表现差很多，尤其是开源模型，还容易出安全问题。

## 为什么值得记录

- 填补了现有语音助手评测仅关注 ASR 或合成干净语音的空白，首次引入真实世界变异因素（如口音、噪声、语法错误）进行鲁棒性评估
- 揭示了端到端语音助手与传统 pipeline 模型之间存在显著性能差距（>20 分），挑战了当前以 ASR 指标为主的评估范式
- 发现部分开源端到端模型在语音输入下存在安全隐患（如无法拒绝恶意指令），暴露了语音交互模式下的安全漏洞
- 验证了合成数据与真实数据在模型排序上具有一致性，但真实数据普遍更困难，强调构建贴近实际应用场景评测集的重要性

## 核心方法

- 构建包含 8 个任务的评测数据集：通用知识（AlpacaEval、CommonEval、SD-QA、OpenBookQA、MMSU）、指令遵循（IFEval）、安全性（AdvBench）
- 采用 GPT-4o 对文本指令进行语音友好化归一化处理，再通过 Google TTS 生成合成语音，并限制音频长度 ≤30 秒以适配模型输入限制
- 引入三类真实世界变异：说话人（年龄、口音、语速、音高、音量）、环境（远场、失真、混响、丢包、背景噪声）、内容（重复、停顿、插入语、错误发音、语法错误）
- 评估 9 种语音助手：7 个开源端到端模型（Qwen2-Audio、LLaMA-Omni、Mini-Omni 系列、VITA、Moshi、DiVA）、2 个 pipeline 基线（Whisper + LLM）、1 个闭源模型（GPT-4o-Audio）
- 统一使用文本响应质量作为评估对象，避免因输出模态不同带来的偏差；采用 GPT-4o-mini 进行自动评分，结合规则提取和拒绝率计算

## 关键结果

- Pipeline 模型显著优于所有开源端到端模型（平均差距 >20 分），GPT-4o-Audio 接近其 pipeline 版本，显示闭源模型优势
- 端到端模型在文本与语音输入间存在巨大性能鸿沟（如 VITA 差距达 35+ 分），尤其在多项选择题上接近随机猜测水平
- 说话人变异中，语速对端到端模型影响最大（<0.5x 或 >1.5x 时性能骤降），而 pipeline 模型在 0.25x–2.0x 范围内稳定
- 低资源口音（如印度、菲律宾英语）导致所有模型性能下降，真实口音数据比合成数据更具挑战性；VITA 对口音最敏感，推测与其新型语音编码器有关
- 内容噪声中，发音错误对性能影响最大（平均下降 14.47%），而重复和错误启动对某些模型反而有轻微正面影响

## 局限与风险

- 合成语音虽与真实数据排序一致，但仍无法完全模拟真实录音中的复杂噪声和发音变异，可能高估模型实际表现
- 未涵盖多轮对话、情感理解、个性化响应等高级语音助手能力，评测维度仍有扩展空间
- 部分模型（如 Moshi、GPT-4o-Audio）仅支持语音输入，导致无法直接比较其文本处理能力，影响端到端能力分析完整性

## 适合沉淀的概念

`voice-assistant-benchmark`, `end-to-end-vs-pipeline-speech-models`, `speech-robustness-evaluation`, `real-world-speech-variations`, `llm-safety-in-voice-interaction`, `synthetic-vs-real-speech-data`, `accent-robustness`, `content-disfluency-impact`

## 阅读注意

- 重点关注 Table 3 中 T.（文本）与 S.（语音）列的对比，可直观看出各模型在语音理解上的退化程度
- Fig. 2 和 Fig. 3 展示了不同变异因素下的性能趋势，注意 VITA 在儿童语音和高音调下的异常下降
- Appendix C 提供了不同 TTS 模型生成数据上的结果，证明 Google TTS 的可靠性，支持主实验选择的合理性
- 安全评估采用拒绝率指标，需注意 Mini-Omni 在语音输入下拒绝率骤降，存在潜在风险
- CommonEval 使用真实用户录音，与合成数据对比见 Table 4，体现真实场景难度

## 质量说明

- 采用来源：`clean`，`papers/2024/10/2410.17196.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的数据构建流程、详细的实验设置、多维度结果分析和消融研究，代码和数据已开源，材料充分可信。
