Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
论文导读
提出广义同策略蒸馏(G-OPD)框架,通过引入奖励缩放因子和灵活参考模型,实现奖励外推(ExOPD)与强到弱蒸馏中的奖励校正,使学生模型性能超越教师。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
广义同策略蒸馏:基于奖励外推的超越教师学习
一句话定位
提出广义同策略蒸馏(G-OPD)框架,通过引入奖励缩放因子和灵活参考模型,实现奖励外推(ExOPD)与强到弱蒸馏中的奖励校正,使学生模型性能超越教师。
小学生也能听懂
这篇论文像教学生做题时,不仅学老师的方法,还鼓励学生“跳一跳”想得更远(奖励外推),并用老师没学过的新知识当参考,让普通学生也能超过好老师。
为什么值得记录
- 首次从理论上证明标准同策略蒸馏(OPD)是带KL约束的密集强化学习(RL)的特例,建立了蒸馏与RL之间的形式化联系;
- 提出奖励外推机制(λ > 1),在数学推理和代码生成任务中 consistently 提升学生模型性能,甚至 surpass 教师模型;
- 在强到弱蒸馏场景下,通过将参考模型设为教师的预训练版本(奖励校正),显著改善奖励信号质量,进一步提升蒸馏效果;
- 支持多教师知识融合,ExOPD 能生成 unified 学生模型,在多个领域均优于各单领域专家教师。
核心方法
- 将标准OPD目标重写为密集RL形式:最大化 λ·log(π*/π_ref) − KL(π_θ || π_ref),其中λ为奖励缩放因子,π_ref为可任选参考模型;
- 定义两种关键操作模式:当0<λ<1时为奖励插值,学生行为介于参考模型与教师之间;当λ>1时为奖励外推(ExOPD),鼓励学生超越教师分布;
- 在强到弱蒸馏中引入‘奖励校正’:将参考模型从学生基座替换为教师RL前的基座模型,使奖励信号 log(π*/π_base_teacher) 更准确反映教师所学知识;
- 推导G-OPD的近似梯度:A_t = (log π_θ − log π) + (λ−1)(log π_ref − log π),用于策略优化;
- 实验采用GRPO训练领域专家教师,再对原始学生进行G-OPD蒸馏,评估涵盖AIME、HMMT、HumanEval+等 benchmark。
关键结果
- 在单教师蒸馏中,ExOPD(λ=1.25)在4个数学推理 benchmark 上平均准确率比标准OPD高2.0%,且优于继续训练100步的教师模型;
- 在多教师蒸馏中,ExOPD 学生模型在数学和代码任务上的平均性能分别达到52.5%和64.4%,超越所有单领域教师;
- 强到弱蒸馏实验显示,使用奖励校正后ExOPD比标准OPD提升显著,但需额外计算大尺寸参考模型的log概率,增加开销;
- 过高的λ(如1.5)会导致不稳定,表明存在最优外推强度。
局限与风险
- 奖励外推可能引发隐式奖励 hacking,尤其当log ratio存在偏差时,学生可能过度拟合噪声峰值;
- 奖励校正需访问教师的预训练模型,若不可得则无法使用;
- ExOPD倾向于生成长响应,可能存在长度偏差问题;
- 当前实验基于Qwen3-4B模型,结论是否适用于其他架构需进一步验证。
适合沉淀的概念
on-policy-distillation, reward-extrapolation, generalized-on-policy-distillation, strong-to-weak-distillation, reward-correction, dense-reinforcement-learning, kl-constrained-rl, multi-teacher-distillation
阅读注意
- 注意区分‘奖励插值’(λ<1)与‘奖励外推’(λ>1)对学生行为的影响;
- 理解为何选择π_base_teacher作为参考模型能提供更准确的奖励信号;
- 关注附录C中强教师(1200步RL)上的蒸馏结果,验证ExOPD的泛化能力;
- 留意梯度近似中忽略未来项的假设及其对训练的影响。
质量说明
- 采用来源:
clean,papers/2026/02/2602.12125.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文结构完整,理论推导清晰,实验设计充分,涵盖单/多教师、同尺寸/强到弱等多种设置,并提供了详细的训练参数与额外实验结果。