---
title: "On-policy Distillation of Language Models: Learning from Self-Generated Mistakes"
title_zh: "语言模型的在线蒸馏：从自生成错误中学习"
arxiv_id: "2306.13649"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2023/06/2306.13649.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 语言模型的在线蒸馏：从自生成错误中学习

## 一句话定位

提出广义知识蒸馏（GKD），通过让学生模型在自身生成的输出序列上进行训练，并利用教师模型的 token 级概率反馈，缓解自回归模型训练与推理间的分布不匹配问题。

## 小学生也能听懂

这篇论文让一个“学生”语言模型自己写答案，然后请“老师”模型打分，根据分数调整自己，就像小朋友做题后看答案改错，这样学得更准，还能用在翻译、算术等多种任务上。

## 为什么值得记录

- 解决了传统知识蒸馏中因使用固定输出序列导致的训练-推理分布不匹配问题
- 在摘要、机器翻译和算术推理任务上显著优于现有蒸馏方法，平均相对性能提升达 1.7–2.1 倍
- 支持灵活选择散度函数（如 forward KL、reverse KL、JSD）和混合训练数据来源，适应不同任务需求
- 可无缝结合强化学习微调（如 RLAIF），在提升性能的同时改善事实一致性
- 为任务无关的指令调优蒸馏提供了有效方案，在 MMLU 和 BBH 基准上实现绝对准确率提升

## 核心方法

- 将知识蒸馏建模为模仿学习问题，引入在线策略（on-policy）机制：学生生成输出序列后，由教师提供 token 级概率作为监督信号
- 提出广义知识蒸馏（GKD）框架，允许混合使用固定数据集（教师生成或真实标签）和学生自生成数据，通过超参数 λ 控制比例
- 支持多种散度函数优化，包括 forward KL、reverse KL 和广义 JSD(β)，其中 JSD 可平滑插值于两者之间
- 训练时不反向传播通过学生采样过程，保持计算效率与稳定性
- 可结合强化学习目标（如 RLAIF），构建正则化 RL 目标：(1−α)⋅E[r(y)] − α⋅E[D(p_T||p_S)]，平衡奖励最大化与知识保留
- 实验基于 T5 系列模型，教师为 T5-XL (~3B)，学生为 T5-small/base/large，均从监督微调 checkpoint 开始蒸馏

## 关键结果

- 在 XSum 摘要任务上，GKD 相比基线方法平均获得 2.1 倍相对性能提升；使用 5% 数据即可超越全量数据上的监督 KD
- 在 WMT 英德翻译任务上，GKD 比 ImitKD 和 f-distill 分别高出 53% 和 162% 的 BLEU 提升
- 在 GSM8K 算术推理任务上，GKD 实现 1.9 倍相对增益，且仅使用学生生成数据时效果最佳
- 在任务无关的 FLAN 指令调优中，GKD 在 MMLU 和 BBH 上分别提升 1% 和 2% 绝对准确率
- 模式寻求型散度（如 reverse KL、JSD(0.9)）在高温度采样下生成质量更高但多样性更低，而 forward KL 更利于覆盖多种输出模式

## 局限与风险

- 计算开销略高于传统 KD：学生采样成本约为固定数据训练的 1.8–2.2 倍，尤其当学生-教师规模差距大时
- 需从一个已具备基本生成能力的学生模型开始（如经监督微调），否则初始低质量输出可能影响蒸馏效果
- 最优散度选择与任务及评估方式强相关，需针对具体场景调参（如 greedy vs temperature sampling）
- 未探索极大规模模型（如 >10B）上的蒸馏效率与扩展性

## 适合沉淀的概念

`generalized-knowledge-distillation`, `on-policy-distillation`, `train-inference-distribution-mismatch`, `mode-seeking-vs-mode-covering`, `reverse-kl-distillation`, `rlaif-with-distillation`, `self-generated-mistakes`, `t5-model-distillation`

## 阅读注意

- 重点关注 GKD 如何统一监督 KD 与在线策略学习，并理解 λ 和散度选择对结果的影响
- 注意不同任务下最优散度的变化：摘要和推理偏向 forward KL，而翻译偏好 JSD(0.1)
- 图 4 展示了散度、温度与生成多样性/质量之间的权衡关系，是理解模式寻求行为的关键
- RL + GKD 组合（图 5）表明该方法不仅能提升指标，还能增强事实一致性，值得深入阅读
- 附录 A.16 提供了 forward/reverse KL 在容量不匹配下的可视化对比，有助于理解理论动机

## 质量说明

- 采用来源：`raw`，`raw/papers/2023/06/2306.13649.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含详细实验设置、消融研究、多任务验证及与基线方法的全面比较，数据充分支持结论。
