When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models
论文导读
提出 ReaLM-Retrieve 框架,通过推理步级不确定性检测与学习式干预策略,在大型推理模型中实现高效、精准的自适应检索。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
推理过程中何时检索:面向大型推理模型的自适应检索
一句话定位
提出 ReaLM-Retrieve 框架,通过推理步级不确定性检测与学习式干预策略,在大型推理模型中实现高效、精准的自适应检索。
小学生也能听懂
这篇论文教大模型在思考难题时,像侦探一样自己判断什么时候需要查资料:它学会把问题拆成小步骤,每步检查是否“不确定”,只在真正需要时才去搜索,既更聪明又省时间。
为什么值得记录
- 解决了传统 RAG 与大型推理模型(如 DeepSeek-R1、o1)在时序上的根本错位:前者单次前置检索,后者需多步推理中动态注入证据
- 首次将检索决策粒度从 token/句子级提升至推理步级,匹配推理模型的实际运作单元
- 在 MuSiQue 等复杂多跳 QA 任务上实现 10.1% 平均 F1 提升,同时减少 47% 检索调用,显著优于 IRCoT 等固定间隔方法
- 提出轻量级不确定性量化方法 RSUS,兼容闭源 API 模型(如 o1),无需 token 级 logits 或模型微调
核心方法
- 推理步分割:训练轻量级分类器识别逻辑推理单元边界(基于话语标记、逻辑连接词、主题偏移等),平均步长 127 词 vs 句子级 23 词
- 推理步级不确定性评分(RSUS):融合三类信号——语言化置信度(U_verb)、实体覆盖熵(U_ent)、推理一致性(U_cons),加权组合判断是否需要外部知识
- 学习式干预策略 π:建模为上下文老虎机问题,输入当前推理状态与 RSUS,输出是否检索、查询 formulation 及上下文整合方式,通过 REINFORCE 联合训练
- 高效检索集成:采用分段生成+上下文重喂机制,在推理步边界暂停并注入压缩后的相关证据;引入 speculative caching 与 KV-cache 保留,降低单次检索延迟至 0.66s(较 naive 方法快 3.2×)
关键结果
- 在 MuSiQue 上,ReaLM-Retrieve 达到 71.2% F1(R1-32B)和 77.8% F1(R1-671B),分别比 IRCoT 高 5.8% 和 6.0%,且检索调用数仅为 1.8 vs 3.4
- 平均检索调用减少 47%,端到端延迟降低 1.33×,准确率-效率比(F1/调用)提升 2.1×
- 检索质量本身提升:Recall@5 达 81.3%,MRR 与精度均优于固定间隔基线
- 在 HotpotQA 和 2WikiMultiHopQA 上分别取得 71.8% 和 69.7% F1,跨基准泛化稳定
- RSUS 与下游检索收益的相关系数达 0.72,三组件(U_verb, U_ent, U_cons)贡献正交
局限与风险
- 推理步分割器在跨域(如从 NaturalQuestions 到 MuSiQue)时 F1 下降 1.5–3.0 点,存在轻微泛化 gap
- 多次检索(≥3 次)后,RSUS 与检索收益的相关性下降(r: 0.72 → 0.68),长链推理中不确定性估计可能退化
- 语言化置信度代理模型(用于 o1 类闭源模型)AUROC 为 0.71,低于开源模型直接 verbalize 的 0.83,存在性能折损
- 未与自适应检索深度方法(如 Dynamic Search-R1)结合,未来可探索‘何时检索’+‘检索多少’的联合优化
适合沉淀的概念
reasoning-step-uncertainty-score, adaptive-retrieval-policy, retrieval-intervention-during-reasoning, kv-cache-aware-integration, speculative-caching-for-rag, implicit-compression-of-retrieved-evidence, black-box-uncertainty-quantification, multi-hop-question-answering
阅读注意
- 重点关注 RSUS 的三种不确定性信号设计及其互补性,尤其是为何选择 verbalized confidence 而非语义熵
- 注意推理步分割器的训练数据来源(NaturalQuestions)与评估基准(MuSiQue 等)的领域差异及其影响
- 分析检索集成协议如何避免打断正在进行的推理(仅在步边界插入),以及 KV-cache 保留对延迟的优化效果
- 对比 ReaLM-Retrieve 与 Search-R1、Self-RAG 等方法的本质区别:前者是系统级集成框架,后者依赖模型内部训练或特殊 token
- 留意实验中对闭源模型(o1)的兼容性处理,如使用 MLP 代理 verbalized confidence
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.26649.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验设置、消融分析与跨模型/跨基准验证。所有关键主张均有数据支持,统计显著性经 paired bootstrap 检验。唯一局限是部分组件(如分割器)训练数据未完全公开,但已提供充分性能评估。