---
title: "Moshi R A G : Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models"
title_zh: "Moshi RAG：面向全双工语音语言模型的异步知识检索"
arxiv_id: "2604.12928"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.12928.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Moshi RAG：面向全双工语音语言模型的异步知识检索

## 一句话定位

提出 Moshi RAG，首个支持检索增强生成（RAG）的全双工语音模型，通过异步检索机制在保持实时交互性的同时显著提升事实准确性。

## 小学生也能听懂

这篇论文发明了一个会边听边查资料说话的语音助手，它能在你说话时悄悄上网找答案，等轮到它回答时，就把刚查到的正确答案说出来，既快又准，就像有个小助手在后台偷偷帮忙。

## 为什么值得记录

- 首次将 RAG 成功集成到全双工语音语言模型中，解决了实时语音交互中知识准确性与低延迟之间的矛盾
- 利用语音响应中‘关键词延迟’的自然时间窗口，实现检索过程与语音生成的并行执行，避免打断对话流
- 模块化设计支持即插即用的检索后端（如 LLM 或搜索引擎），无需重新训练主模型即可升级检索能力
- 在多个语音问答基准上达到与大型非双工模型相当的事实准确性，同时维持毫秒级响应延迟
- 展示了全双工模型调用外部工具（如数学推理 LLM）的潜力，为语音 AI 助手的功能扩展提供新范式

## 核心方法

- 基于 Moshi 全双工语音模型构建，引入特殊检索触发 token ⟨ret⟩ 和参考文本编码器
- 设计三阶段响应结构：前置引导语（lead）、依赖检索的主体内容（body）、可选结尾（tail），确保关键信息在检索完成后输出
- 使用流式 ASR 实时转录用户语音，触发异步检索流程，目标检索延迟 ≤2 秒以适配语音响应节奏
- 采用 ARC-Encoder 对长检索文档进行序列压缩，减少嵌入长度以适应语音帧率（12.5 Hz）
- 构建包含 190 万对话实例的合成数据集，涵盖 QA 数据集主题与专家领域话题，模拟真实人机对话场景
- 训练时随机采样检索延迟（0~2 秒），增强模型对实际推理时延波动的鲁棒性
- 支持 LLM 生成式检索与 Tavily 搜索工具两种后端，实现开放域知识获取

## 关键结果

- 在 Llama Questions、Web Questions、TriviaQA 和 HaluEval 四个语音 QA 数据集上，Moshi RAG 的响应准确率分别达 88.4%、81.0%、90.6% 和 68.7%，显著优于其他全双工语音模型
- 端到端关键词延迟（E2EKD）控制在 2.9~4.3 秒，满足实时交互要求，且始终大于实际检索延迟，确保信息及时注入
- 在未见过的数学推理任务上表现优异，验证其泛化能力与工具使用潜力
- 切换至更强检索后端（如更大 LLM）可进一步提升性能，无需模型重训

## 局限与风险

- 依赖合成数据进行训练，真实场景下的鲁棒性仍需进一步验证
- 当前评估主要基于单轮问答，多轮对话中的长期一致性尚未充分测试
- 检索延迟假设为固定值，实际中可能因网络或后端负载产生波动
- 未探索与其他增强技术（如思维链）的结合效果

## 适合沉淀的概念

`full-duplex-speech-model`, `retrieval-augmented-generation`, `asynchronous-information-retrieval`, `keyword-delay`, `end-to-end-keyword-delay`, `streaming-asr`, `reference-encoder`, `moshi-model`

## 阅读注意

- 重点关注图 2 和图 3，理解‘关键词延迟’与‘检索延迟’的时间关系以及前后端异步协作机制
- 注意训练数据构造中三阶段响应结构（lead-body-tail）的设计逻辑及其对模型行为的影响
- 查看附录 B.1 中关于参考编码器的选择依据，特别是 ARC-Encoder 的作用
- 实验部分应对比不同模型在相同检索后端下的表现，以隔离 RAG 效果
- 数学推理实验展示了模型调用外部 LLM 的能力，是理解其工具使用机制的关键

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.12928.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含系统架构、数据构建、训练细节和全面实验，关键图表和公式清晰，附录提供了充分的实现与评估细节。
