---
title: "A Survey of On-Policy Distillation for Large Language Models"
title_zh: "大语言模型同策略蒸馏综述"
arxiv_id: "2604.00626"
paper_type: "survey"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.00626.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 大语言模型同策略蒸馏综述

## 一句话定位

本文首次系统梳理了大语言模型中的同策略蒸馏（On-Policy Distillation, OPD）方法，提出统一理论框架与三维分类体系，并分析工业部署与未来方向。

## 小学生也能听懂

这篇论文像教小老师向大老师学习时，让小老师先自己答题，再根据大老师的反馈改进，解决了传统方法“照抄答案”导致思路混乱的问题，并总结出三种分类方式帮大家更好地设计学习方法。

## 为什么值得记录

- 传统离线蒸馏存在训练-推理分布不匹配问题（暴露偏差），导致长序列生成性能下降；OPD通过让学生在自身生成轨迹上接受教师反馈，有效缓解该问题。
- OPD融合了知识蒸馏、强化学习与模仿学习等多个领域的方法，但此前缺乏统一视角，本综述填补了这一空白。
- DeepSeek-R1等前沿模型的成功表明，蒸馏已从单纯的模型压缩演变为能力迁移的核心引擎，OPD是实现高质量推理迁移的关键路径。
- 提出的三维分类法（反馈信号、教师访问权限、损失粒度）为研究者提供了清晰的设计空间导航工具。

## 核心方法

- 建立统一数学框架：将OPD形式化为在学生采样轨迹上最小化f-散度，涵盖GKD、MiniLLM、DistiLLM等方法作为不同参数化实例。
- 提出三维正交分类体系：按反馈信号（logit-based、outcome-based、self-play）、教师访问（white-box、black-box、teacher-free）、损失粒度（token-level、sequence-level、hybrid）对现有方法进行系统归类。
- 深入分析白盒OPD方法：包括基于f-散度的token级匹配（如Forward/Reverse KL、JSD）、自适应散度选择、跨架构蒸馏及混合采样策略。
- 系统比较黑盒与自蒸馏方法：涵盖仅依赖生成结果的反馈机制（如GAD、Lion）、自博弈（SPIN）及其饱和问题、特权信息注入与无奖励对齐策略。
- 专门章节探讨推理蒸馏：分析思维链蒸馏、奖励引导OPD，并重点讨论DeepSeek-R1的离线蒸馏为何有效，以及在其基础上叠加OPD的潜力。
- 结合工业实践：讨论大规模部署中的计算-质量权衡、效率创新（如Speculative KD）与成本实例分析。

## 关键结果

- 理论层面：揭示了Forward KL易导致模式覆盖而生成无意义文本，Reverse KL偏向模式寻求但可能忽略次要正确解，JSD和自适应方法可平衡二者。
- 方法层面：DistiLLM通过偏斜KL目标避免零除问题，MiniLLM利用策略梯度实现反向KL优化，GKD支持灵活的行为策略混合。
- 实践层面：工业案例显示，OPD虽增加在线生成开销，但能显著提升学生模型在长程推理任务上的鲁棒性；DeepSeek-R1蒸馏后学生模型在AIME等基准上表现优异。
- 局限识别：指出‘回音室效应’（低置信度状态下教师反馈噪声大）、计算成本高、动态课程设计不足等挑战。

## 局限与风险

- OPD需频繁调用教师模型进行在线反馈，计算与延迟开销显著高于离线蒸馏，尤其在大规模部署中可能成为瓶颈。
- 当学生生成严重偏离分布的序列时，教师的条件分布可能失效，此时强制匹配会引入噪声，破坏训练稳定性。
- 现有方法多聚焦于单轮生成，对多轮交互、状态依赖的代理级蒸馏（agent-level distillation）探索不足。
- 缺乏统一的评估协议，不同方法在任务、指标、基线上的差异使得横向比较困难。

## 适合沉淀的概念

`on-policy-distillation`, `exposure-bias`, `f-divergence`, `knowledge-distillation`, `self-play-fine-tuning`, `reasoning-distillation`, `teacher-student-gap`, `distillation-scaling-laws`

## 阅读注意

- 注意区分off-policy与on-policy蒸馏的本质差异：前者训练于静态数据，后者训练于学生自身策略生成的动态轨迹。
- 理解f-散度家族中Forward KL、Reverse KL、JSD的几何意义及其对生成质量的影响是掌握OPD优化目标的关键。
- Section 2.5的统一框架是全文核心，建议重点理解π_mix（行为策略）与D_f（散度度量）的解耦思想。
- DeepSeek-R1虽采用off-policy蒸馏成功，但作者强调在其基础上结合OPD可进一步提升小模型推理能力，这是未来重要方向。
- 工业部署部分（Section 7）提供了实际成本考量，有助于理解OPD在真实系统中的可行性边界。

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.00626.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含摘要、引言、方法论、实验分析、未来方向等标准综述结构，引用丰富（超过200篇），覆盖近三年关键工作，理论推导清晰，分类体系合理，具备高质量综述的所有特征。
