论文
arXiv2603.11137
时间2026-03
来源Markdown
页面质量中文卡片
阅读量级120 分钟

Scaling Reasoning Efficiently via Relaxed On-Policy Distillation

论文导读

提出 Reopold 框架,通过奖励裁剪、熵引导采样和多阶段训练,稳定同策略蒸馏并提升小模型推理效率。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

通过松弛同策略蒸馏高效扩展推理能力

一句话定位

提出 Reopold 框架,通过奖励裁剪、熵引导采样和多阶段训练,稳定同策略蒸馏并提升小模型推理效率。

小学生也能听懂

这篇论文像教小徒弟学解题:大老师教小徒弟时,用奖励裁剪稳住学习节奏,挑难题重点练,分两步学,让小徒弟又快又好,甚至超过大老师还更省时间。

为什么值得记录

  • 同策略蒸馏是迁移大模型推理能力至小模型的关键技术,但存在训练不稳定和负迁移问题。
  • Reopold 首次将蒸馏与强化学习理论统一,识别出重尾负奖励和信号稀疏性为根本瓶颈。
  • 在数学、视觉和工具使用任务上,Reopold 实现 6.7~12 倍训练样本效率提升,7B 学生模型匹配 32B 教师性能且推理快 3.32 倍。

核心方法

  • 理论分析:证明带 stop-gradient 的同策略蒸馏等价于策略梯度,将教师-学生对数似然比视为固定奖励信号。
  • 奖励裁剪:基于混合分布理论推导下界 (\frac{\log\lambda}{1-\lambda}),截断重尾负奖励,防止梯度爆炸。
  • 熵引导采样:仅在高熵 token 上计算梯度,过滤低信息量区域,提升信号密度和样本效率。
  • 两阶段训练:探索阶段屏蔽强负奖励以维持多样性;精炼阶段启用熵采样以聚焦关键分歧点。

关键结果

  • 数学推理:在 AIME、MATH-500 等基准上,Reopold 比 RKL 平均提升 4.96%,训练步数减少至 1/6.7。
  • 视觉推理:Qwen2.5-VL-3B 经 Reopold 蒸馏后,在 Geo3K、MathVerse 等任务上平均准确率达 52.18%,优于 RKL 4.27%。
  • 测试时扩展:7B 学生模型在 Geometry3K 上 Pass@64 超越 32B 教师,延迟降低 3.32 倍。
  • 鲁棒性:在不同教师模型(7B/32B)下表现一致,而 RKL 在 7B 教师上几乎无提升。

局限与风险

  • 仍需依赖高质量教师模型生成监督信号,未解决教师偏差问题。
  • 多阶段切换阈值 (T_{\text{switch}}) 目前设为总步数 1/3,缺乏自适应机制。
  • 实验未涵盖代码生成等长序列推理任务,泛化性待验证。

适合沉淀的概念

on-policy-distillation, reward-clipping, entropy-guided-sampling, exploration-to-refinement, policy-gradient-equivalence, test-time-scaling, compact-reasoning-models

阅读注意

  • 重点理解 Section 3.1 中 stop-gradient 如何作为控制变量降低方差。
  • Figure 4 展示的重尾负奖励分布是理解裁剪必要性的关键。
  • Table 1 和 2 显示 Reopold 在跨模型尺寸和任务上的稳定增益。
  • Appendix A.2 提供了裁剪阈值的理论推导,区别于传统 PPO 的 (\rho(\theta)) 裁剪。

质量说明

  • 采用来源:cleanpapers/2026/03/2603.11137.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文结构完整,理论推导清晰,实验覆盖数学、视觉、工具使用三类推理任务,数据充分,消融分析到位。