论文
arXiv2604.26649
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级98 分钟

When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models

论文导读

提出 ReaLM-Retrieve 框架,通过推理步级不确定性检测与学习式干预策略,在大型推理模型中实现高效、精准的自适应检索。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

推理过程中何时检索:面向大型推理模型的自适应检索

一句话定位

提出 ReaLM-Retrieve 框架,通过推理步级不确定性检测与学习式干预策略,在大型推理模型中实现高效、精准的自适应检索。

小学生也能听懂

这篇论文教大模型在思考难题时,像侦探一样自己判断什么时候需要查资料:它学会把问题拆成小步骤,每步检查是否“不确定”,只在真正需要时才去搜索,既更聪明又省时间。

为什么值得记录

  • 解决了传统 RAG 与大型推理模型(如 DeepSeek-R1、o1)在时序上的根本错位:前者单次前置检索,后者需多步推理中动态注入证据
  • 首次将检索决策粒度从 token/句子级提升至推理步级,匹配推理模型的实际运作单元
  • 在 MuSiQue 等复杂多跳 QA 任务上实现 10.1% 平均 F1 提升,同时减少 47% 检索调用,显著优于 IRCoT 等固定间隔方法
  • 提出轻量级不确定性量化方法 RSUS,兼容闭源 API 模型(如 o1),无需 token 级 logits 或模型微调

核心方法

  • 推理步分割:训练轻量级分类器识别逻辑推理单元边界(基于话语标记、逻辑连接词、主题偏移等),平均步长 127 词 vs 句子级 23 词
  • 推理步级不确定性评分(RSUS):融合三类信号——语言化置信度(U_verb)、实体覆盖熵(U_ent)、推理一致性(U_cons),加权组合判断是否需要外部知识
  • 学习式干预策略 π:建模为上下文老虎机问题,输入当前推理状态与 RSUS,输出是否检索、查询 formulation 及上下文整合方式,通过 REINFORCE 联合训练
  • 高效检索集成:采用分段生成+上下文重喂机制,在推理步边界暂停并注入压缩后的相关证据;引入 speculative caching 与 KV-cache 保留,降低单次检索延迟至 0.66s(较 naive 方法快 3.2×)

关键结果

  • 在 MuSiQue 上,ReaLM-Retrieve 达到 71.2% F1(R1-32B)和 77.8% F1(R1-671B),分别比 IRCoT 高 5.8% 和 6.0%,且检索调用数仅为 1.8 vs 3.4
  • 平均检索调用减少 47%,端到端延迟降低 1.33×,准确率-效率比(F1/调用)提升 2.1×
  • 检索质量本身提升:Recall@5 达 81.3%,MRR 与精度均优于固定间隔基线
  • 在 HotpotQA 和 2WikiMultiHopQA 上分别取得 71.8% 和 69.7% F1,跨基准泛化稳定
  • RSUS 与下游检索收益的相关系数达 0.72,三组件(U_verb, U_ent, U_cons)贡献正交

局限与风险

  • 推理步分割器在跨域(如从 NaturalQuestions 到 MuSiQue)时 F1 下降 1.5–3.0 点,存在轻微泛化 gap
  • 多次检索(≥3 次)后,RSUS 与检索收益的相关性下降(r: 0.72 → 0.68),长链推理中不确定性估计可能退化
  • 语言化置信度代理模型(用于 o1 类闭源模型)AUROC 为 0.71,低于开源模型直接 verbalize 的 0.83,存在性能折损
  • 未与自适应检索深度方法(如 Dynamic Search-R1)结合,未来可探索‘何时检索’+‘检索多少’的联合优化

适合沉淀的概念

reasoning-step-uncertainty-score, adaptive-retrieval-policy, retrieval-intervention-during-reasoning, kv-cache-aware-integration, speculative-caching-for-rag, implicit-compression-of-retrieved-evidence, black-box-uncertainty-quantification, multi-hop-question-answering

阅读注意

  • 重点关注 RSUS 的三种不确定性信号设计及其互补性,尤其是为何选择 verbalized confidence 而非语义熵
  • 注意推理步分割器的训练数据来源(NaturalQuestions)与评估基准(MuSiQue 等)的领域差异及其影响
  • 分析检索集成协议如何避免打断正在进行的推理(仅在步边界插入),以及 KV-cache 保留对延迟的优化效果
  • 对比 ReaLM-Retrieve 与 Search-R1、Self-RAG 等方法的本质区别:前者是系统级集成框架,后者依赖模型内部训练或特殊 token
  • 留意实验中对闭源模型(o1)的兼容性处理,如使用 MLP 代理 verbalized confidence

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.26649.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、实验设置、消融分析与跨模型/跨基准验证。所有关键主张均有数据支持,统计显著性经 paired bootstrap 检验。唯一局限是部分组件(如分割器)训练数据未完全公开,但已提供充分性能评估。