论文
arXiv2602.12125
时间2026-02
来源Markdown
页面质量中文卡片
阅读量级110 分钟

Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation

论文导读

提出广义同策略蒸馏(G-OPD)框架,通过引入奖励缩放因子和灵活参考模型,实现奖励外推(ExOPD)与强到弱蒸馏中的奖励校正,使学生模型性能超越教师。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

广义同策略蒸馏:基于奖励外推的超越教师学习

一句话定位

提出广义同策略蒸馏(G-OPD)框架,通过引入奖励缩放因子和灵活参考模型,实现奖励外推(ExOPD)与强到弱蒸馏中的奖励校正,使学生模型性能超越教师。

小学生也能听懂

这篇论文像教学生做题时,不仅学老师的方法,还鼓励学生“跳一跳”想得更远(奖励外推),并用老师没学过的新知识当参考,让普通学生也能超过好老师。

为什么值得记录

  • 首次从理论上证明标准同策略蒸馏(OPD)是带KL约束的密集强化学习(RL)的特例,建立了蒸馏与RL之间的形式化联系;
  • 提出奖励外推机制(λ > 1),在数学推理和代码生成任务中 consistently 提升学生模型性能,甚至 surpass 教师模型;
  • 在强到弱蒸馏场景下,通过将参考模型设为教师的预训练版本(奖励校正),显著改善奖励信号质量,进一步提升蒸馏效果;
  • 支持多教师知识融合,ExOPD 能生成 unified 学生模型,在多个领域均优于各单领域专家教师。

核心方法

  • 将标准OPD目标重写为密集RL形式:最大化 λ·log(π*/π_ref) − KL(π_θ || π_ref),其中λ为奖励缩放因子,π_ref为可任选参考模型;
  • 定义两种关键操作模式:当0<λ<1时为奖励插值,学生行为介于参考模型与教师之间;当λ>1时为奖励外推(ExOPD),鼓励学生超越教师分布;
  • 在强到弱蒸馏中引入‘奖励校正’:将参考模型从学生基座替换为教师RL前的基座模型,使奖励信号 log(π*/π_base_teacher) 更准确反映教师所学知识;
  • 推导G-OPD的近似梯度:A_t = (log π_θ − log π) + (λ−1)(log π_ref − log π),用于策略优化;
  • 实验采用GRPO训练领域专家教师,再对原始学生进行G-OPD蒸馏,评估涵盖AIME、HMMT、HumanEval+等 benchmark。

关键结果

  • 在单教师蒸馏中,ExOPD(λ=1.25)在4个数学推理 benchmark 上平均准确率比标准OPD高2.0%,且优于继续训练100步的教师模型;
  • 在多教师蒸馏中,ExOPD 学生模型在数学和代码任务上的平均性能分别达到52.5%和64.4%,超越所有单领域教师;
  • 强到弱蒸馏实验显示,使用奖励校正后ExOPD比标准OPD提升显著,但需额外计算大尺寸参考模型的log概率,增加开销;
  • 过高的λ(如1.5)会导致不稳定,表明存在最优外推强度。

局限与风险

  • 奖励外推可能引发隐式奖励 hacking,尤其当log ratio存在偏差时,学生可能过度拟合噪声峰值;
  • 奖励校正需访问教师的预训练模型,若不可得则无法使用;
  • ExOPD倾向于生成长响应,可能存在长度偏差问题;
  • 当前实验基于Qwen3-4B模型,结论是否适用于其他架构需进一步验证。

适合沉淀的概念

on-policy-distillation, reward-extrapolation, generalized-on-policy-distillation, strong-to-weak-distillation, reward-correction, dense-reinforcement-learning, kl-constrained-rl, multi-teacher-distillation

阅读注意

  • 注意区分‘奖励插值’(λ<1)与‘奖励外推’(λ>1)对学生行为的影响;
  • 理解为何选择π_base_teacher作为参考模型能提供更准确的奖励信号;
  • 关注附录C中强教师(1200步RL)上的蒸馏结果,验证ExOPD的泛化能力;
  • 留意梯度近似中忽略未来项的假设及其对训练的影响。

质量说明

  • 采用来源:cleanpapers/2026/02/2602.12125.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文结构完整,理论推导清晰,实验设计充分,涵盖单/多教师、同尺寸/强到弱等多种设置,并提供了详细的训练参数与额外实验结果。