---
title: "2505.13438"
title_zh: "基于预算相对策略优化的任意时推理优化"
arxiv_id: "2505.13438"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/05/2505.13438.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 基于预算相对策略优化的任意时推理优化

## 一句话定位

提出 AnytimeReasoner 框架，通过预算采样、可验证密集奖励和 BRPO 方差缩减技术，优化大语言模型在不同思考预算下的推理性能。

## 小学生也能听懂

这篇论文教大模型像聪明学生一样，在不同考试时间（预算）下都能答好题：它用新方法让模型边想边检查答案，并在思考时减少“猜错”，从而在任意时间点都能给出更准的答案。

## 为什么值得记录

- 现有方法通常使用固定大预算进行强化学习训练，导致训练和部署效率低下，且无法支持在线服务中的动态资源分配。
- 引入可验证密集奖励机制，显著改善了信用分配问题，提升了训练稳定性和样本效率。
- 提出的 BRPO 方法在长思考序列上比 GRPO 更有效降低方差，增强训练鲁棒性。
- 解耦思考与总结策略优化，使模型在任意中断点都能生成高质量答案，提升实际部署灵活性。
- 实验表明该方法在标准推理和任意时推理任务上均显著优于 GRPO，具备强泛化能力。

## 核心方法

- 采用预算采样机制：从先验分布 p_B 中采样思考预算 b，强制模型在每个预算点生成可验证的答案摘要。
- 引入可验证密集奖励：通过在多个预算点计算奖励，将稀疏奖励转化为密集奖励，改善 RL 训练中的信用分配。
- 设计 Budget Relative Policy Optimization (BRPO)：结合当前进度奖励 V1 和组内平均回报 V2 构建插值基线，有效降低优势估计方差。
- 解耦思考与总结策略优化：使用不同预算分布分别优化思考策略 π_θ 和总结策略 π_ϕ，提升总结质量。
- 训练流程基于 PPO 框架，在 Verl 上实现，支持树状生成结构和 FlexAttention 掩码以高效处理多预算轨迹。
- 在 DeepSeek-R1-Distill-Qwen-1.5B 和 7B 模型上微调，使用 DeepScaleR 数据集，设置 4 个思考预算 {2000, 4000, 6000, 8000}。

## 关键结果

- 在 AIME2024 上，AnytimeReasoner 最终准确率达 32.7%，显著高于 GRPO 的 28.9%。
- 在 AMC2022 上，AnytimeReasoner 的任意时准确率（平均）达 58.8%，优于 GRPO 的 53.4%。
- 即使仅优化最大预算（AR-base），其任意时性能仍全面超越 GRPO，说明方法具备内在鲁棒性。
- BRPO 在长思考长度下表现出更低的归一化方差，验证其在高方差场景下的有效性。
- 解耦优化使总结策略在短预算下表现更优，提升整体 anytime 性能。

## 局限与风险

- 实验主要基于数学推理任务，未验证在其他领域（如代码、常识推理）的有效性。
- 预算支持集大小限制为 m ≤ 8，可能无法覆盖所有实际部署场景的细粒度预算需求。
- BRPO 的实现依赖于预定义预算点，对连续预算空间的适应性有待进一步研究。
- 训练开销略高于 GRPO（约 10%），尽管绝对值可控，但在资源受限环境中仍需权衡。

## 适合沉淀的概念

`anytime-reasoning`, `verifiable-dense-rewards`, `budget-relative-policy-optimization-brpo`, `decoupled-policy-optimization`, `test-time-compute-scaling`, `reinforcement-learning-for-llm-reasoning`, `variance-reduction-in-rl`, `chain-of-thought-truncation`

## 阅读注意

- 关注图 1 和图 2 对密集奖励和 BRPO 优势的可视化解释，有助于理解方法动机。
- 注意附录 C 中关于标准推理与任意时推理目标之间关系的数学证明，理解其理论边界。
- 实验部分应重点比较 AR-base 与 GRPO 的差异，以评估非预算采样组件的贡献。
- 附录 B 描述了树状生成与训练的工程实现细节，对复现至关重要。
- 注意作者将 MRT 工作作为对比，强调其方法在原则性和可处理性上的优势。

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/05/2505.13438.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的理论推导、算法设计、实验验证和消融分析，代码已开源，实验设置清晰，结果可信。
