2604.05164
论文导读
提出TAB策略,将多轮推理建模为多目标MDP,通过GRPO训练预算分配策略,在数学推理任务上实现更高精度-令牌效率权衡,节省最多35%令牌。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
多轮推理中的自适应思考预算分配
一句话定位
提出TAB策略,将多轮推理建模为多目标MDP,通过GRPO训练预算分配策略,在数学推理任务上实现更高精度-令牌效率权衡,节省最多35%令牌。
小学生也能听懂
这篇论文像给AI做数学题时安排“思考时间”:它学会根据题目难度动态分配计算资源,难的题多花时间,简单的少花,从而在保证正确率的同时,最多省下40%的计算量。
为什么值得记录
- 首次将多轮推理中的计算分配建模为序列决策问题,区别于单轮静态预算分配
- 提出TAB和TAB All-SubQ两种策略,分别适用于在线和离线子问题已知场景
- 在5个数学推理基准上验证有效性,TAB All-SubQ相比基线节省最多40%令牌且保持准确率
- 揭示了未来子问题信息对预算规划的重要性,强化了多轮推理作为规划问题的本质
核心方法
- 将多轮推理形式化为标量化多目标马尔可夫决策过程(MDP),状态包含历史对话和当前子问题,动作为分配的令牌预算
- 设计奖励函数:r = acc(x) - λ·max(0, ∑b_t - B),联合优化准确率与全局令牌约束
- 采用GRPO算法训练预算分配策略π_ϕ,避免使用难以训练的价值函数,适合长程稀疏奖励场景
- 定义TAB策略:仅基于当前对话历史和当前子问题分配预算;TAB All-SubQ策略额外利用全部子问题序列信息
- 使用LoRA微调Qwen3-1.7B作为Budgeter,在MATH Level-5训练集上训练125步,学习率1e-5,批大小64
关键结果
- TAB (B=5k) 在宏观平均上达到与Static(2048)、LLM-Judge基线相当的准确率,但节省40%总令牌
- TAB (B=8k) 比基线高4.4个百分点的准确率,同时节省8.5%总令牌
- TAB All-SubQ (B=10k) 比TAB节省额外12%令牌,比基线最多节省40%令牌且准确率不降
- 在TheoremQA、BIG-Bench Extra Hard、GPQA等分布外任务上,TAB仍保持优于基线的精度-令牌权衡
- Qwen3-4B Budgeter版本比1.7B版本表现更优,验证模型能力对难度估计的影响
局限与风险
- 实验仅基于数学推理任务,未验证在其他类型多轮推理(如代码生成、科学问答)上的泛化性
- 依赖特定Solver模型(L1-Qwen3-8B-Exact)的长度控制能力,通用性受限
- 训练数据仅来自MATH Level-5,可能影响在更复杂问题上的表现
- 未探索连续预算空间,当前仅支持离散预算桶{256,512,1024,2048,4096}
适合沉淀的概念
multi-turn-reasoning, adaptive-compute-allocation, markov-decision-process, group-relative-policy-optimization, token-budget-allocation, sequential-decision-making, credit-assignment-problem, test-time-scaling
阅读注意
- 注意区分TAB与TAB All-SubQ的输入差异:后者可访问未来子问题,性能更优
- 奖励函数采用hinge penalty而非additive penalty,避免病理性的低估倾向
- GRPO的优势在于无需价值函数,适合长轨迹稀疏奖励设置
- 静态基线在高预算下表现尚可,但在中等预算下易因早期分配不足导致错误累积
- 附录B中的定性示例直观展示了TAB如何避免过度思考和早期预算不足问题
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.05164.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、消融分析和分布外评估,数据充分,方法描述清晰,结果可信。