---
title: "When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models"
title_zh: "推理过程中何时检索：面向大型推理模型的自适应检索"
arxiv_id: "2604.26649"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.26649.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 推理过程中何时检索：面向大型推理模型的自适应检索

## 一句话定位

提出 ReaLM-Retrieve 框架，通过推理步级不确定性检测与学习式干预策略，在大型推理模型中实现高效、精准的自适应检索。

## 小学生也能听懂

这篇论文教大模型在思考难题时，像侦探一样自己判断什么时候需要查资料：它学会把问题拆成小步骤，每步检查是否“不确定”，只在真正需要时才去搜索，既更聪明又省时间。

## 为什么值得记录

- 解决了传统 RAG 与大型推理模型（如 DeepSeek-R1、o1）在时序上的根本错位：前者单次前置检索，后者需多步推理中动态注入证据
- 首次将检索决策粒度从 token/句子级提升至推理步级，匹配推理模型的实际运作单元
- 在 MuSiQue 等复杂多跳 QA 任务上实现 10.1% 平均 F1 提升，同时减少 47% 检索调用，显著优于 IRCoT 等固定间隔方法
- 提出轻量级不确定性量化方法 RSUS，兼容闭源 API 模型（如 o1），无需 token 级 logits 或模型微调

## 核心方法

- 推理步分割：训练轻量级分类器识别逻辑推理单元边界（基于话语标记、逻辑连接词、主题偏移等），平均步长 127 词 vs 句子级 23 词
- 推理步级不确定性评分（RSUS）：融合三类信号——语言化置信度（U_verb）、实体覆盖熵（U_ent）、推理一致性（U_cons），加权组合判断是否需要外部知识
- 学习式干预策略 π：建模为上下文老虎机问题，输入当前推理状态与 RSUS，输出是否检索、查询 formulation 及上下文整合方式，通过 REINFORCE 联合训练
- 高效检索集成：采用分段生成+上下文重喂机制，在推理步边界暂停并注入压缩后的相关证据；引入 speculative caching 与 KV-cache 保留，降低单次检索延迟至 0.66s（较 naive 方法快 3.2×）

## 关键结果

- 在 MuSiQue 上，ReaLM-Retrieve 达到 71.2% F1（R1-32B）和 77.8% F1（R1-671B），分别比 IRCoT 高 5.8% 和 6.0%，且检索调用数仅为 1.8 vs 3.4
- 平均检索调用减少 47%，端到端延迟降低 1.33×，准确率-效率比（F1/调用）提升 2.1×
- 检索质量本身提升：Recall@5 达 81.3%，MRR 与精度均优于固定间隔基线
- 在 HotpotQA 和 2WikiMultiHopQA 上分别取得 71.8% 和 69.7% F1，跨基准泛化稳定
- RSUS 与下游检索收益的相关系数达 0.72，三组件（U_verb, U_ent, U_cons）贡献正交

## 局限与风险

- 推理步分割器在跨域（如从 NaturalQuestions 到 MuSiQue）时 F1 下降 1.5–3.0 点，存在轻微泛化 gap
- 多次检索（≥3 次）后，RSUS 与检索收益的相关性下降（r: 0.72 → 0.68），长链推理中不确定性估计可能退化
- 语言化置信度代理模型（用于 o1 类闭源模型）AUROC 为 0.71，低于开源模型直接 verbalize 的 0.83，存在性能折损
- 未与自适应检索深度方法（如 Dynamic Search-R1）结合，未来可探索‘何时检索’+‘检索多少’的联合优化

## 适合沉淀的概念

`reasoning-step-uncertainty-score`, `adaptive-retrieval-policy`, `retrieval-intervention-during-reasoning`, `kv-cache-aware-integration`, `speculative-caching-for-rag`, `implicit-compression-of-retrieved-evidence`, `black-box-uncertainty-quantification`, `multi-hop-question-answering`

## 阅读注意

- 重点关注 RSUS 的三种不确定性信号设计及其互补性，尤其是为何选择 verbalized confidence 而非语义熵
- 注意推理步分割器的训练数据来源（NaturalQuestions）与评估基准（MuSiQue 等）的领域差异及其影响
- 分析检索集成协议如何避免打断正在进行的推理（仅在步边界插入），以及 KV-cache 保留对延迟的优化效果
- 对比 ReaLM-Retrieve 与 Search-R1、Self-RAG 等方法的本质区别：前者是系统级集成框架，后者依赖模型内部训练或特殊 token
- 留意实验中对闭源模型（o1）的兼容性处理，如使用 MLP 代理 verbalized confidence

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.26649.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、消融分析与跨模型/跨基准验证。所有关键主张均有数据支持，统计显著性经 paired bootstrap 检验。唯一局限是部分组件（如分割器）训练数据未完全公开，但已提供充分性能评估。
