---
title: "Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation"
title_zh: "广义同策略蒸馏：基于奖励外推的超越教师学习"
arxiv_id: "2602.12125"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/02/2602.12125.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 广义同策略蒸馏：基于奖励外推的超越教师学习

## 一句话定位

提出广义同策略蒸馏（G-OPD）框架，通过引入奖励缩放因子和灵活参考模型，实现奖励外推（ExOPD）与强到弱蒸馏中的奖励校正，使学生模型性能超越教师。

## 小学生也能听懂

这篇论文像教学生做题时，不仅学老师的方法，还鼓励学生“跳一跳”想得更远（奖励外推），并用老师没学过的新知识当参考，让普通学生也能超过好老师。

## 为什么值得记录

- 首次从理论上证明标准同策略蒸馏（OPD）是带KL约束的密集强化学习（RL）的特例，建立了蒸馏与RL之间的形式化联系；
- 提出奖励外推机制（λ > 1），在数学推理和代码生成任务中 consistently 提升学生模型性能，甚至 surpass 教师模型；
- 在强到弱蒸馏场景下，通过将参考模型设为教师的预训练版本（奖励校正），显著改善奖励信号质量，进一步提升蒸馏效果；
- 支持多教师知识融合，ExOPD 能生成 unified 学生模型，在多个领域均优于各单领域专家教师。

## 核心方法

- 将标准OPD目标重写为密集RL形式：最大化 λ·log(π*/π_ref) − KL(π_θ || π_ref)，其中λ为奖励缩放因子，π_ref为可任选参考模型；
- 定义两种关键操作模式：当0<λ<1时为奖励插值，学生行为介于参考模型与教师之间；当λ>1时为奖励外推（ExOPD），鼓励学生超越教师分布；
- 在强到弱蒸馏中引入‘奖励校正’：将参考模型从学生基座替换为教师RL前的基座模型，使奖励信号 log(π*/π_base_teacher) 更准确反映教师所学知识；
- 推导G-OPD的近似梯度：A_t = (log π_θ − log π*) + (λ−1)(log π_ref − log π*)，用于策略优化；
- 实验采用GRPO训练领域专家教师，再对原始学生进行G-OPD蒸馏，评估涵盖AIME、HMMT、HumanEval+等 benchmark。

## 关键结果

- 在单教师蒸馏中，ExOPD（λ=1.25）在4个数学推理 benchmark 上平均准确率比标准OPD高2.0%，且优于继续训练100步的教师模型；
- 在多教师蒸馏中，ExOPD 学生模型在数学和代码任务上的平均性能分别达到52.5%和64.4%，超越所有单领域教师；
- 强到弱蒸馏实验显示，使用奖励校正后ExOPD比标准OPD提升显著，但需额外计算大尺寸参考模型的log概率，增加开销；
- 过高的λ（如1.5）会导致不稳定，表明存在最优外推强度。

## 局限与风险

- 奖励外推可能引发隐式奖励 hacking，尤其当log ratio存在偏差时，学生可能过度拟合噪声峰值；
- 奖励校正需访问教师的预训练模型，若不可得则无法使用；
- ExOPD倾向于生成长响应，可能存在长度偏差问题；
- 当前实验基于Qwen3-4B模型，结论是否适用于其他架构需进一步验证。

## 适合沉淀的概念

`on-policy-distillation`, `reward-extrapolation`, `generalized-on-policy-distillation`, `strong-to-weak-distillation`, `reward-correction`, `dense-reinforcement-learning`, `kl-constrained-rl`, `multi-teacher-distillation`

## 阅读注意

- 注意区分‘奖励插值’（λ<1）与‘奖励外推’（λ>1）对学生行为的影响；
- 理解为何选择π_base_teacher作为参考模型能提供更准确的奖励信号；
- 关注附录C中强教师（1200步RL）上的蒸馏结果，验证ExOPD的泛化能力；
- 留意梯度近似中忽略未来项的假设及其对训练的影响。

## 质量说明

- 采用来源：`clean`，`papers/2026/02/2602.12125.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，理论推导清晰，实验设计充分，涵盖单/多教师、同尺寸/强到弱等多种设置，并提供了详细的训练参数与额外实验结果。
