论文
arXiv2604.05164
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级78 分钟

2604.05164

论文导读

提出TAB策略,将多轮推理建模为多目标MDP,通过GRPO训练预算分配策略,在数学推理任务上实现更高精度-令牌效率权衡,节省最多35%令牌。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

多轮推理中的自适应思考预算分配

一句话定位

提出TAB策略,将多轮推理建模为多目标MDP,通过GRPO训练预算分配策略,在数学推理任务上实现更高精度-令牌效率权衡,节省最多35%令牌。

小学生也能听懂

这篇论文像给AI做数学题时安排“思考时间”:它学会根据题目难度动态分配计算资源,难的题多花时间,简单的少花,从而在保证正确率的同时,最多省下40%的计算量。

为什么值得记录

  • 首次将多轮推理中的计算分配建模为序列决策问题,区别于单轮静态预算分配
  • 提出TAB和TAB All-SubQ两种策略,分别适用于在线和离线子问题已知场景
  • 在5个数学推理基准上验证有效性,TAB All-SubQ相比基线节省最多40%令牌且保持准确率
  • 揭示了未来子问题信息对预算规划的重要性,强化了多轮推理作为规划问题的本质

核心方法

  • 将多轮推理形式化为标量化多目标马尔可夫决策过程(MDP),状态包含历史对话和当前子问题,动作为分配的令牌预算
  • 设计奖励函数:r = acc(x) - λ·max(0, ∑b_t - B),联合优化准确率与全局令牌约束
  • 采用GRPO算法训练预算分配策略π_ϕ,避免使用难以训练的价值函数,适合长程稀疏奖励场景
  • 定义TAB策略:仅基于当前对话历史和当前子问题分配预算;TAB All-SubQ策略额外利用全部子问题序列信息
  • 使用LoRA微调Qwen3-1.7B作为Budgeter,在MATH Level-5训练集上训练125步,学习率1e-5,批大小64

关键结果

  • TAB (B=5k) 在宏观平均上达到与Static(2048)、LLM-Judge基线相当的准确率,但节省40%总令牌
  • TAB (B=8k) 比基线高4.4个百分点的准确率,同时节省8.5%总令牌
  • TAB All-SubQ (B=10k) 比TAB节省额外12%令牌,比基线最多节省40%令牌且准确率不降
  • 在TheoremQA、BIG-Bench Extra Hard、GPQA等分布外任务上,TAB仍保持优于基线的精度-令牌权衡
  • Qwen3-4B Budgeter版本比1.7B版本表现更优,验证模型能力对难度估计的影响

局限与风险

  • 实验仅基于数学推理任务,未验证在其他类型多轮推理(如代码生成、科学问答)上的泛化性
  • 依赖特定Solver模型(L1-Qwen3-8B-Exact)的长度控制能力,通用性受限
  • 训练数据仅来自MATH Level-5,可能影响在更复杂问题上的表现
  • 未探索连续预算空间,当前仅支持离散预算桶{256,512,1024,2048,4096}

适合沉淀的概念

multi-turn-reasoning, adaptive-compute-allocation, markov-decision-process, group-relative-policy-optimization, token-budget-allocation, sequential-decision-making, credit-assignment-problem, test-time-scaling

阅读注意

  • 注意区分TAB与TAB All-SubQ的输入差异:后者可访问未来子问题,性能更优
  • 奖励函数采用hinge penalty而非additive penalty,避免病理性的低估倾向
  • GRPO的优势在于无需价值函数,适合长轨迹稀疏奖励设置
  • 静态基线在高预算下表现尚可,但在中等预算下易因早期分配不足导致错误累积
  • 附录B中的定性示例直观展示了TAB如何避免过度思考和早期预算不足问题

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.05164.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、消融分析和分布外评估,数据充分,方法描述清晰,结果可信。