---
title: "2604.05164"
title_zh: "多轮推理中的自适应思考预算分配"
arxiv_id: "2604.05164"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.05164.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 多轮推理中的自适应思考预算分配

## 一句话定位

提出TAB策略，将多轮推理建模为多目标MDP，通过GRPO训练预算分配策略，在数学推理任务上实现更高精度-令牌效率权衡，节省最多35%令牌。

## 小学生也能听懂

这篇论文像给AI做数学题时安排“思考时间”：它学会根据题目难度动态分配计算资源，难的题多花时间，简单的少花，从而在保证正确率的同时，最多省下40%的计算量。

## 为什么值得记录

- 首次将多轮推理中的计算分配建模为序列决策问题，区别于单轮静态预算分配
- 提出TAB和TAB All-SubQ两种策略，分别适用于在线和离线子问题已知场景
- 在5个数学推理基准上验证有效性，TAB All-SubQ相比基线节省最多40%令牌且保持准确率
- 揭示了未来子问题信息对预算规划的重要性，强化了多轮推理作为规划问题的本质

## 核心方法

- 将多轮推理形式化为标量化多目标马尔可夫决策过程（MDP），状态包含历史对话和当前子问题，动作为分配的令牌预算
- 设计奖励函数：r = acc(x) - λ·max(0, ∑b_t - B)，联合优化准确率与全局令牌约束
- 采用GRPO算法训练预算分配策略π_ϕ，避免使用难以训练的价值函数，适合长程稀疏奖励场景
- 定义TAB策略：仅基于当前对话历史和当前子问题分配预算；TAB All-SubQ策略额外利用全部子问题序列信息
- 使用LoRA微调Qwen3-1.7B作为Budgeter，在MATH Level-5训练集上训练125步，学习率1e-5，批大小64

## 关键结果

- TAB (B=5k) 在宏观平均上达到与Static(2048)、LLM-Judge基线相当的准确率，但节省40%总令牌
- TAB (B=8k) 比基线高4.4个百分点的准确率，同时节省8.5%总令牌
- TAB All-SubQ (B=10k) 比TAB节省额外12%令牌，比基线最多节省40%令牌且准确率不降
- 在TheoremQA、BIG-Bench Extra Hard、GPQA等分布外任务上，TAB仍保持优于基线的精度-令牌权衡
- Qwen3-4B Budgeter版本比1.7B版本表现更优，验证模型能力对难度估计的影响

## 局限与风险

- 实验仅基于数学推理任务，未验证在其他类型多轮推理（如代码生成、科学问答）上的泛化性
- 依赖特定Solver模型（L1-Qwen3-8B-Exact）的长度控制能力，通用性受限
- 训练数据仅来自MATH Level-5，可能影响在更复杂问题上的表现
- 未探索连续预算空间，当前仅支持离散预算桶{256,512,1024,2048,4096}

## 适合沉淀的概念

`multi-turn-reasoning`, `adaptive-compute-allocation`, `markov-decision-process`, `group-relative-policy-optimization`, `token-budget-allocation`, `sequential-decision-making`, `credit-assignment-problem`, `test-time-scaling`

## 阅读注意

- 注意区分TAB与TAB All-SubQ的输入差异：后者可访问未来子问题，性能更优
- 奖励函数采用hinge penalty而非additive penalty，避免病理性的低估倾向
- GRPO的优势在于无需价值函数，适合长轨迹稀疏奖励设置
- 静态基线在高预算下表现尚可，但在中等预算下易因早期分配不足导致错误累积
- 附录B中的定性示例直观展示了TAB如何避免过度思考和早期预算不足问题

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.05164.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、消融分析和分布外评估，数据充分，方法描述清晰，结果可信。
