Scaling Reasoning Efficiently via Relaxed On-Policy Distillation
论文导读
提出 Reopold 框架,通过奖励裁剪、熵引导采样和多阶段训练,稳定同策略蒸馏并提升小模型推理效率。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
通过松弛同策略蒸馏高效扩展推理能力
一句话定位
提出 Reopold 框架,通过奖励裁剪、熵引导采样和多阶段训练,稳定同策略蒸馏并提升小模型推理效率。
小学生也能听懂
这篇论文像教小徒弟学解题:大老师教小徒弟时,用奖励裁剪稳住学习节奏,挑难题重点练,分两步学,让小徒弟又快又好,甚至超过大老师还更省时间。
为什么值得记录
- 同策略蒸馏是迁移大模型推理能力至小模型的关键技术,但存在训练不稳定和负迁移问题。
- Reopold 首次将蒸馏与强化学习理论统一,识别出重尾负奖励和信号稀疏性为根本瓶颈。
- 在数学、视觉和工具使用任务上,Reopold 实现 6.7~12 倍训练样本效率提升,7B 学生模型匹配 32B 教师性能且推理快 3.32 倍。
核心方法
- 理论分析:证明带 stop-gradient 的同策略蒸馏等价于策略梯度,将教师-学生对数似然比视为固定奖励信号。
- 奖励裁剪:基于混合分布理论推导下界 (\frac{\log\lambda}{1-\lambda}),截断重尾负奖励,防止梯度爆炸。
- 熵引导采样:仅在高熵 token 上计算梯度,过滤低信息量区域,提升信号密度和样本效率。
- 两阶段训练:探索阶段屏蔽强负奖励以维持多样性;精炼阶段启用熵采样以聚焦关键分歧点。
关键结果
- 数学推理:在 AIME、MATH-500 等基准上,Reopold 比 RKL 平均提升 4.96%,训练步数减少至 1/6.7。
- 视觉推理:Qwen2.5-VL-3B 经 Reopold 蒸馏后,在 Geo3K、MathVerse 等任务上平均准确率达 52.18%,优于 RKL 4.27%。
- 测试时扩展:7B 学生模型在 Geometry3K 上 Pass@64 超越 32B 教师,延迟降低 3.32 倍。
- 鲁棒性:在不同教师模型(7B/32B)下表现一致,而 RKL 在 7B 教师上几乎无提升。
局限与风险
- 仍需依赖高质量教师模型生成监督信号,未解决教师偏差问题。
- 多阶段切换阈值 (T_{\text{switch}}) 目前设为总步数 1/3,缺乏自适应机制。
- 实验未涵盖代码生成等长序列推理任务,泛化性待验证。
适合沉淀的概念
on-policy-distillation, reward-clipping, entropy-guided-sampling, exploration-to-refinement, policy-gradient-equivalence, test-time-scaling, compact-reasoning-models
阅读注意
- 重点理解 Section 3.1 中 stop-gradient 如何作为控制变量降低方差。
- Figure 4 展示的重尾负奖励分布是理解裁剪必要性的关键。
- Table 1 和 2 显示 Reopold 在跨模型尺寸和任务上的稳定增益。
- Appendix A.2 提供了裁剪阈值的理论推导,区别于传统 PPO 的 (\rho(\theta)) 裁剪。
质量说明
- 采用来源:
clean,papers/2026/03/2603.11137.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文结构完整,理论推导清晰,实验覆盖数学、视觉、工具使用三类推理任务,数据充分,消融分析到位。