2505.13438
论文导读
提出 AnytimeReasoner 框架,通过预算采样、可验证密集奖励和 BRPO 方差缩减技术,优化大语言模型在不同思考预算下的推理性能。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
基于预算相对策略优化的任意时推理优化
一句话定位
提出 AnytimeReasoner 框架,通过预算采样、可验证密集奖励和 BRPO 方差缩减技术,优化大语言模型在不同思考预算下的推理性能。
小学生也能听懂
这篇论文教大模型像聪明学生一样,在不同考试时间(预算)下都能答好题:它用新方法让模型边想边检查答案,并在思考时减少“猜错”,从而在任意时间点都能给出更准的答案。
为什么值得记录
- 现有方法通常使用固定大预算进行强化学习训练,导致训练和部署效率低下,且无法支持在线服务中的动态资源分配。
- 引入可验证密集奖励机制,显著改善了信用分配问题,提升了训练稳定性和样本效率。
- 提出的 BRPO 方法在长思考序列上比 GRPO 更有效降低方差,增强训练鲁棒性。
- 解耦思考与总结策略优化,使模型在任意中断点都能生成高质量答案,提升实际部署灵活性。
- 实验表明该方法在标准推理和任意时推理任务上均显著优于 GRPO,具备强泛化能力。
核心方法
- 采用预算采样机制:从先验分布 p_B 中采样思考预算 b,强制模型在每个预算点生成可验证的答案摘要。
- 引入可验证密集奖励:通过在多个预算点计算奖励,将稀疏奖励转化为密集奖励,改善 RL 训练中的信用分配。
- 设计 Budget Relative Policy Optimization (BRPO):结合当前进度奖励 V1 和组内平均回报 V2 构建插值基线,有效降低优势估计方差。
- 解耦思考与总结策略优化:使用不同预算分布分别优化思考策略 π_θ 和总结策略 π_ϕ,提升总结质量。
- 训练流程基于 PPO 框架,在 Verl 上实现,支持树状生成结构和 FlexAttention 掩码以高效处理多预算轨迹。
- 在 DeepSeek-R1-Distill-Qwen-1.5B 和 7B 模型上微调,使用 DeepScaleR 数据集,设置 4 个思考预算 {2000, 4000, 6000, 8000}。
关键结果
- 在 AIME2024 上,AnytimeReasoner 最终准确率达 32.7%,显著高于 GRPO 的 28.9%。
- 在 AMC2022 上,AnytimeReasoner 的任意时准确率(平均)达 58.8%,优于 GRPO 的 53.4%。
- 即使仅优化最大预算(AR-base),其任意时性能仍全面超越 GRPO,说明方法具备内在鲁棒性。
- BRPO 在长思考长度下表现出更低的归一化方差,验证其在高方差场景下的有效性。
- 解耦优化使总结策略在短预算下表现更优,提升整体 anytime 性能。
局限与风险
- 实验主要基于数学推理任务,未验证在其他领域(如代码、常识推理)的有效性。
- 预算支持集大小限制为 m ≤ 8,可能无法覆盖所有实际部署场景的细粒度预算需求。
- BRPO 的实现依赖于预定义预算点,对连续预算空间的适应性有待进一步研究。
- 训练开销略高于 GRPO(约 10%),尽管绝对值可控,但在资源受限环境中仍需权衡。
适合沉淀的概念
anytime-reasoning, verifiable-dense-rewards, budget-relative-policy-optimization-brpo, decoupled-policy-optimization, test-time-compute-scaling, reinforcement-learning-for-llm-reasoning, variance-reduction-in-rl, chain-of-thought-truncation
阅读注意
- 关注图 1 和图 2 对密集奖励和 BRPO 优势的可视化解释,有助于理解方法动机。
- 注意附录 C 中关于标准推理与任意时推理目标之间关系的数学证明,理解其理论边界。
- 实验部分应重点比较 AR-base 与 GRPO 的差异,以评估非预算采样组件的贡献。
- 附录 B 描述了树状生成与训练的工程实现细节,对复现至关重要。
- 注意作者将 MRT 工作作为对比,强调其方法在原则性和可处理性上的优势。
质量说明
- 采用来源:
raw,raw/papers/2025/05/2505.13438.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的理论推导、算法设计、实验验证和消融分析,代码已开源,实验设置清晰,结果可信。