---
title: ""
title_zh: "LLM搜索代理的推理时预算控制"
arxiv_id: "2605.05701"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.05701.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LLM搜索代理的推理时预算控制

## 一句话定位

提出一种两阶段推理时预算控制方法，通过任务级信息价值（VOI）评分在搜索过程中分配工具调用和输出token预算，并在最终答案生成时进行风险可控的改写，以在硬性双预算约束下提升多跳问答性能。

## 小学生也能听懂

这篇论文教AI系统在回答复杂问题时聪明地花钱：它用‘每单位预算能带来多少进步’来打分，决定下一步是查资料、拆解问题还是直接回答；最后只在不破坏原有逻辑的前提下，修正像‘是/否’这种小错误。

## 为什么值得记录

- 首次将LLM搜索代理的推理时控制建模为两个耦合决策：搜索时的动作分配与搜索后的答案提交
- 提出任务级VOI评分机制，显式考虑剩余双预算（工具调用+输出token）对动作选择的影响
- 设计保守的最终答案改写策略，避免因过度修正而破坏正确推理路径
- 在四个多跳QA基准、三个LLM backbone和四种预算水平下验证有效性，尤其在中低预算下提升显著

## 核心方法

- 采用基于BAVT的树搜索框架作为底层搜索骨架
- 搜索阶段：为每个可行动作（检索、分解、回答）计算任务级VOI得分，综合考虑进展信号、结构特征、预算依赖惩罚和防护机制
- VOI得分 = max(0, 效用) / (动作成本尺度 + ε)，其中效用包含评论家评估的进展、结构信号和预算惩罚项
- 防护机制包括：弱证据时抑制过早回答、低组合性问题抑制分解、停滞时降低重复分解权重、组合状态下强制最小搜索
- 答案阶段：构建精炼候选答案，仅当预期收益超过干预风险且属于安全类型（如极性修正、槽位补全）时才替换原答案
- 最终化规则为确定性特征判断，不引入额外LLM调用或工具使用

## 关键结果

- 在Qwen3-32B上，VOI在16个数据集-预算组合中有7个F1第一，14个优于AFlow，10个优于BATS，16个优于Search-o1，15个优于BAVT
- 在低和中等预算下提升最显著，例如Bamboogle低预算F1从0.4382提升至0.4628
- 最终答案控制在轨迹证据充分但存在形式错误时有效，如Bamboogle上多个预算点F1提升0.02–0.05
- 消融实验显示预算依赖惩罚是主要增益来源，而答案控制在检索路径良好时贡献最大
- 跨模型聚合结果显示VOI相比AFlow、BATS、Search-o1、BAVT平均F1分别提升0.3021、0.1219、0.2993、0.0530

## 局限与风险

- 方法依赖于底层搜索骨架（如BAVT）的能力，无法解决根本性的检索失败问题
- 最终答案改写仅限于局部形式错误，无法修复深层推理缺陷
- 预算惩罚系数等参数为固定值，未针对不同任务或模型进行自适应调整
- 在最强模型（Qwen3.5-122B）上优势减弱，表明其价值随模型能力提升而递减

## 适合沉淀的概念

`inference-time-budget-control`, `task-level-voi`, `dual-budget-constraint`, `search-agent`, `multi-hop-qa`, `answer-finalization`, `budget-aware-action-selection`, `conservative-answer-revision`

## 阅读注意

- 关注VOI评分如何融合进展信号、结构特征和预算压力，特别是预算依赖惩罚项的设计
- 注意两阶段控制的分工：搜索时控制‘怎么花预算’，答案时控制‘是否改写’
- 实验部分重点看中低预算下的提升，这反映了预算控制的核心价值场景
- 消融实验揭示了各组件贡献，尤其是预算惩罚的主导作用
- 最终化规则的具体条件可在附录C.5中找到，体现其保守性设计

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.05701.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、理论分析、多维度实验和消融研究，数据充分，结论有支撑。虽部分细节需查阅附录，但主干信息完整可复现。
