On-policy Distillation of Language Models: Learning from Self-Generated Mistakes
论文导读
提出广义知识蒸馏(GKD),通过让学生模型在自身生成的输出序列上进行训练,并利用教师模型的 token 级概率反馈,缓解自回归模型训练与推理间的分布不匹配问题。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
语言模型的在线蒸馏:从自生成错误中学习
一句话定位
提出广义知识蒸馏(GKD),通过让学生模型在自身生成的输出序列上进行训练,并利用教师模型的 token 级概率反馈,缓解自回归模型训练与推理间的分布不匹配问题。
小学生也能听懂
这篇论文让一个“学生”语言模型自己写答案,然后请“老师”模型打分,根据分数调整自己,就像小朋友做题后看答案改错,这样学得更准,还能用在翻译、算术等多种任务上。
为什么值得记录
- 解决了传统知识蒸馏中因使用固定输出序列导致的训练-推理分布不匹配问题
- 在摘要、机器翻译和算术推理任务上显著优于现有蒸馏方法,平均相对性能提升达 1.7–2.1 倍
- 支持灵活选择散度函数(如 forward KL、reverse KL、JSD)和混合训练数据来源,适应不同任务需求
- 可无缝结合强化学习微调(如 RLAIF),在提升性能的同时改善事实一致性
- 为任务无关的指令调优蒸馏提供了有效方案,在 MMLU 和 BBH 基准上实现绝对准确率提升
核心方法
- 将知识蒸馏建模为模仿学习问题,引入在线策略(on-policy)机制:学生生成输出序列后,由教师提供 token 级概率作为监督信号
- 提出广义知识蒸馏(GKD)框架,允许混合使用固定数据集(教师生成或真实标签)和学生自生成数据,通过超参数 λ 控制比例
- 支持多种散度函数优化,包括 forward KL、reverse KL 和广义 JSD(β),其中 JSD 可平滑插值于两者之间
- 训练时不反向传播通过学生采样过程,保持计算效率与稳定性
- 可结合强化学习目标(如 RLAIF),构建正则化 RL 目标:(1−α)⋅E[r(y)] − α⋅E[D(p_T||p_S)],平衡奖励最大化与知识保留
- 实验基于 T5 系列模型,教师为 T5-XL (~3B),学生为 T5-small/base/large,均从监督微调 checkpoint 开始蒸馏
关键结果
- 在 XSum 摘要任务上,GKD 相比基线方法平均获得 2.1 倍相对性能提升;使用 5% 数据即可超越全量数据上的监督 KD
- 在 WMT 英德翻译任务上,GKD 比 ImitKD 和 f-distill 分别高出 53% 和 162% 的 BLEU 提升
- 在 GSM8K 算术推理任务上,GKD 实现 1.9 倍相对增益,且仅使用学生生成数据时效果最佳
- 在任务无关的 FLAN 指令调优中,GKD 在 MMLU 和 BBH 上分别提升 1% 和 2% 绝对准确率
- 模式寻求型散度(如 reverse KL、JSD(0.9))在高温度采样下生成质量更高但多样性更低,而 forward KL 更利于覆盖多种输出模式
局限与风险
- 计算开销略高于传统 KD:学生采样成本约为固定数据训练的 1.8–2.2 倍,尤其当学生-教师规模差距大时
- 需从一个已具备基本生成能力的学生模型开始(如经监督微调),否则初始低质量输出可能影响蒸馏效果
- 最优散度选择与任务及评估方式强相关,需针对具体场景调参(如 greedy vs temperature sampling)
- 未探索极大规模模型(如 >10B)上的蒸馏效率与扩展性
适合沉淀的概念
generalized-knowledge-distillation, on-policy-distillation, train-inference-distribution-mismatch, mode-seeking-vs-mode-covering, reverse-kl-distillation, rlaif-with-distillation, self-generated-mistakes, t5-model-distillation
阅读注意
- 重点关注 GKD 如何统一监督 KD 与在线策略学习,并理解 λ 和散度选择对结果的影响
- 注意不同任务下最优散度的变化:摘要和推理偏向 forward KL,而翻译偏好 JSD(0.1)
- 图 4 展示了散度、温度与生成多样性/质量之间的权衡关系,是理解模式寻求行为的关键
- RL + GKD 组合(图 5)表明该方法不仅能提升指标,还能增强事实一致性,值得深入阅读
- 附录 A.16 提供了 forward/reverse KL 在容量不匹配下的可视化对比,有助于理解理论动机
质量说明
- 采用来源:
raw,raw/papers/2023/06/2306.13649.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含详细实验设置、消融研究、多任务验证及与基线方法的全面比较,数据充分支持结论。