论文
arXiv2505.13438
时间2025-05
来源Markdown
页面质量中文卡片
阅读量级53 分钟

2505.13438

论文导读

提出 AnytimeReasoner 框架,通过预算采样、可验证密集奖励和 BRPO 方差缩减技术,优化大语言模型在不同思考预算下的推理性能。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

基于预算相对策略优化的任意时推理优化

一句话定位

提出 AnytimeReasoner 框架,通过预算采样、可验证密集奖励和 BRPO 方差缩减技术,优化大语言模型在不同思考预算下的推理性能。

小学生也能听懂

这篇论文教大模型像聪明学生一样,在不同考试时间(预算)下都能答好题:它用新方法让模型边想边检查答案,并在思考时减少“猜错”,从而在任意时间点都能给出更准的答案。

为什么值得记录

  • 现有方法通常使用固定大预算进行强化学习训练,导致训练和部署效率低下,且无法支持在线服务中的动态资源分配。
  • 引入可验证密集奖励机制,显著改善了信用分配问题,提升了训练稳定性和样本效率。
  • 提出的 BRPO 方法在长思考序列上比 GRPO 更有效降低方差,增强训练鲁棒性。
  • 解耦思考与总结策略优化,使模型在任意中断点都能生成高质量答案,提升实际部署灵活性。
  • 实验表明该方法在标准推理和任意时推理任务上均显著优于 GRPO,具备强泛化能力。

核心方法

  • 采用预算采样机制:从先验分布 p_B 中采样思考预算 b,强制模型在每个预算点生成可验证的答案摘要。
  • 引入可验证密集奖励:通过在多个预算点计算奖励,将稀疏奖励转化为密集奖励,改善 RL 训练中的信用分配。
  • 设计 Budget Relative Policy Optimization (BRPO):结合当前进度奖励 V1 和组内平均回报 V2 构建插值基线,有效降低优势估计方差。
  • 解耦思考与总结策略优化:使用不同预算分布分别优化思考策略 π_θ 和总结策略 π_ϕ,提升总结质量。
  • 训练流程基于 PPO 框架,在 Verl 上实现,支持树状生成结构和 FlexAttention 掩码以高效处理多预算轨迹。
  • 在 DeepSeek-R1-Distill-Qwen-1.5B 和 7B 模型上微调,使用 DeepScaleR 数据集,设置 4 个思考预算 {2000, 4000, 6000, 8000}。

关键结果

  • 在 AIME2024 上,AnytimeReasoner 最终准确率达 32.7%,显著高于 GRPO 的 28.9%。
  • 在 AMC2022 上,AnytimeReasoner 的任意时准确率(平均)达 58.8%,优于 GRPO 的 53.4%。
  • 即使仅优化最大预算(AR-base),其任意时性能仍全面超越 GRPO,说明方法具备内在鲁棒性。
  • BRPO 在长思考长度下表现出更低的归一化方差,验证其在高方差场景下的有效性。
  • 解耦优化使总结策略在短预算下表现更优,提升整体 anytime 性能。

局限与风险

  • 实验主要基于数学推理任务,未验证在其他领域(如代码、常识推理)的有效性。
  • 预算支持集大小限制为 m ≤ 8,可能无法覆盖所有实际部署场景的细粒度预算需求。
  • BRPO 的实现依赖于预定义预算点,对连续预算空间的适应性有待进一步研究。
  • 训练开销略高于 GRPO(约 10%),尽管绝对值可控,但在资源受限环境中仍需权衡。

适合沉淀的概念

anytime-reasoning, verifiable-dense-rewards, budget-relative-policy-optimization-brpo, decoupled-policy-optimization, test-time-compute-scaling, reinforcement-learning-for-llm-reasoning, variance-reduction-in-rl, chain-of-thought-truncation

阅读注意

  • 关注图 1 和图 2 对密集奖励和 BRPO 优势的可视化解释,有助于理解方法动机。
  • 注意附录 C 中关于标准推理与任意时推理目标之间关系的数学证明,理解其理论边界。
  • 实验部分应重点比较 AR-base 与 GRPO 的差异,以评估非预算采样组件的贡献。
  • 附录 B 描述了树状生成与训练的工程实现细节,对复现至关重要。
  • 注意作者将 MRT 工作作为对比,强调其方法在原则性和可处理性上的优势。

质量说明

  • 采用来源:rawraw/papers/2025/05/2505.13438.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的理论推导、算法设计、实验验证和消融分析,代码已开源,实验设置清晰,结果可信。