论文
arXiv2605.05701
时间2026-05
来源Markdown
页面质量中文卡片
阅读量级215 分钟

论文导读

提出一种两阶段推理时预算控制方法,通过任务级信息价值(VOI)评分在搜索过程中分配工具调用和输出token预算,并在最终答案生成时进行风险可控的改写,以在硬性双预算约束下提升多跳问答性能。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

LLM搜索代理的推理时预算控制

一句话定位

提出一种两阶段推理时预算控制方法,通过任务级信息价值(VOI)评分在搜索过程中分配工具调用和输出token预算,并在最终答案生成时进行风险可控的改写,以在硬性双预算约束下提升多跳问答性能。

小学生也能听懂

这篇论文教AI系统在回答复杂问题时聪明地花钱:它用‘每单位预算能带来多少进步’来打分,决定下一步是查资料、拆解问题还是直接回答;最后只在不破坏原有逻辑的前提下,修正像‘是/否’这种小错误。

为什么值得记录

  • 首次将LLM搜索代理的推理时控制建模为两个耦合决策:搜索时的动作分配与搜索后的答案提交
  • 提出任务级VOI评分机制,显式考虑剩余双预算(工具调用+输出token)对动作选择的影响
  • 设计保守的最终答案改写策略,避免因过度修正而破坏正确推理路径
  • 在四个多跳QA基准、三个LLM backbone和四种预算水平下验证有效性,尤其在中低预算下提升显著

核心方法

  • 采用基于BAVT的树搜索框架作为底层搜索骨架
  • 搜索阶段:为每个可行动作(检索、分解、回答)计算任务级VOI得分,综合考虑进展信号、结构特征、预算依赖惩罚和防护机制
  • VOI得分 = max(0, 效用) / (动作成本尺度 + ε),其中效用包含评论家评估的进展、结构信号和预算惩罚项
  • 防护机制包括:弱证据时抑制过早回答、低组合性问题抑制分解、停滞时降低重复分解权重、组合状态下强制最小搜索
  • 答案阶段:构建精炼候选答案,仅当预期收益超过干预风险且属于安全类型(如极性修正、槽位补全)时才替换原答案
  • 最终化规则为确定性特征判断,不引入额外LLM调用或工具使用

关键结果

  • 在Qwen3-32B上,VOI在16个数据集-预算组合中有7个F1第一,14个优于AFlow,10个优于BATS,16个优于Search-o1,15个优于BAVT
  • 在低和中等预算下提升最显著,例如Bamboogle低预算F1从0.4382提升至0.4628
  • 最终答案控制在轨迹证据充分但存在形式错误时有效,如Bamboogle上多个预算点F1提升0.02–0.05
  • 消融实验显示预算依赖惩罚是主要增益来源,而答案控制在检索路径良好时贡献最大
  • 跨模型聚合结果显示VOI相比AFlow、BATS、Search-o1、BAVT平均F1分别提升0.3021、0.1219、0.2993、0.0530

局限与风险

  • 方法依赖于底层搜索骨架(如BAVT)的能力,无法解决根本性的检索失败问题
  • 最终答案改写仅限于局部形式错误,无法修复深层推理缺陷
  • 预算惩罚系数等参数为固定值,未针对不同任务或模型进行自适应调整
  • 在最强模型(Qwen3.5-122B)上优势减弱,表明其价值随模型能力提升而递减

适合沉淀的概念

inference-time-budget-control, task-level-voi, dual-budget-constraint, search-agent, multi-hop-qa, answer-finalization, budget-aware-action-selection, conservative-answer-revision

阅读注意

  • 关注VOI评分如何融合进展信号、结构特征和预算压力,特别是预算依赖惩罚项的设计
  • 注意两阶段控制的分工:搜索时控制‘怎么花预算’,答案时控制‘是否改写’
  • 实验部分重点看中低预算下的提升,这反映了预算控制的核心价值场景
  • 消融实验揭示了各组件贡献,尤其是预算惩罚的主导作用
  • 最终化规则的具体条件可在附录C.5中找到,体现其保守性设计

质量说明

  • 采用来源:rawraw/papers/2026/05/2605.05701.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、理论分析、多维度实验和消融研究,数据充分,结论有支撑。虽部分细节需查阅附录,但主干信息完整可复现。