---
title: "Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes"
title_zh: "重访同策略蒸馏：经验性失败模式与简单修复"
arxiv_id: "2603.25562"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.25562.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 重访同策略蒸馏：经验性失败模式与简单修复

## 一句话定位

针对同策略蒸馏（OPD）中采样 token 方法的三大失败模式，提出基于教师 top-K 局部支持匹配的截断反向 KL 目标，结合 top-p 采样与特殊 token 掩码，提升优化稳定性与性能。

## 小学生也能听懂

这篇论文像教学生做题时，发现老师只讲一个答案容易出错，于是改成只讲最可能的几个答案，并避开奇怪符号，让学习更稳、成绩更好。

## 为什么值得记录

- 澄清了 token-level OPD 的理论权衡：虽相对于 sequence-level 反向 KL 有偏，但方差上界更优（O(T²) vs O(T⁴)），适合长序列训练。
- 系统识别了采样 token OPD 在实践中不稳定的三大原因：单 token 监督信号高度不平衡、学生生成前缀上教师指导不可靠、tokenizer 或特殊 token 不匹配。
- 提出的教师 top-K 局部支持匹配方法在单任务数学推理和多任务代理+推理训练中均显著优于标准采样 token OPD，平均性能提升达 +19.8%。

## 核心方法

- 将标准采样 token OPD 的单 token 对数概率差监督，替换为在教师 top-K 支持集上的截断反向 KL 目标。
- 在每个前缀上，选取教师模型概率最高的 K 个 token 构成支持集 S(c_{i,t})。
- 对支持集内的学生和教师分布分别进行重归一化，计算局部反向 KL 损失。
- 采用 top-p 采样生成 rollout，避免低概率 token 导致教师信号失效。
- 引入特殊 token 掩码，缓解因 tokenizer 不一致导致的虚假负样本问题。

## 关键结果

- 在单任务数学推理中，教师 top-K 方法（无掩码）平均分达 41.7，优于采样 token OPD（36.4）及其掩码版（40.7）。
- 在多任务交替训练中，教师 top-K 方法将数学平均分从 34.8 提升至 41.7（+19.8%），同时保持代理任务性能。
- 训练动态分析显示，新方法具有更低的梯度范数、更少的梯度裁剪和更高的策略熵，表明优化更稳定。
- 教师-学生对齐度（log-prob gap）更接近零，说明局部支持目标改善了整体对齐。

## 局限与风险

- 教师 top-K 支持匹配仍是一个不完美的任务成功代理，无法完全解决目标失配问题。
- 截断的 KL 目标本质上是带偏估计，且支持集大小 K 的选择需要权衡效率与信息量。
- 实验主要基于 Qwen 系列模型，结论在其他架构上的普适性需进一步验证。

## 适合沉淀的概念

`on-policy-distillation`, `reverse-kl-divergence`, `token-level-estimator`, `sequence-level-estimator`, `teacher-top-k-support`, `truncated-reverse-kl`, `top-p-sampling`, `special-token-masking`, `gradient-variance`, `optimization-stability`

## 阅读注意

- 关注第 2.1 节的理论分析，理解 token-level 与 sequence-level OPD 在偏差-方差权衡上的差异。
- 重点阅读第 2.2 节对三大失败模式的实证分析，特别是图 2、3、4、5 的解读。
- 注意第 3.1 节中支持集重归一化的必要性，这是稳定训练的关键。
- 查看附录 G.3 对五种 top-K 变体的比较，了解不同支持集构造方式的影响。
- 附录 H 的定性案例分析有助于直观理解采样 token OPD 的奖励黑客行为。

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.25562.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含理论分析、方法设计、多场景实验、消融研究和定性分析，数据详实，论证充分。
