论文
arXiv2306.13649
时间2023-06
来源Markdown
页面质量中文卡片
阅读量级85 分钟

On-policy Distillation of Language Models: Learning from Self-Generated Mistakes

论文导读

提出广义知识蒸馏(GKD),通过让学生模型在自身生成的输出序列上进行训练,并利用教师模型的 token 级概率反馈,缓解自回归模型训练与推理间的分布不匹配问题。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

语言模型的在线蒸馏:从自生成错误中学习

一句话定位

提出广义知识蒸馏(GKD),通过让学生模型在自身生成的输出序列上进行训练,并利用教师模型的 token 级概率反馈,缓解自回归模型训练与推理间的分布不匹配问题。

小学生也能听懂

这篇论文让一个“学生”语言模型自己写答案,然后请“老师”模型打分,根据分数调整自己,就像小朋友做题后看答案改错,这样学得更准,还能用在翻译、算术等多种任务上。

为什么值得记录

  • 解决了传统知识蒸馏中因使用固定输出序列导致的训练-推理分布不匹配问题
  • 在摘要、机器翻译和算术推理任务上显著优于现有蒸馏方法,平均相对性能提升达 1.7–2.1 倍
  • 支持灵活选择散度函数(如 forward KL、reverse KL、JSD)和混合训练数据来源,适应不同任务需求
  • 可无缝结合强化学习微调(如 RLAIF),在提升性能的同时改善事实一致性
  • 为任务无关的指令调优蒸馏提供了有效方案,在 MMLU 和 BBH 基准上实现绝对准确率提升

核心方法

  • 将知识蒸馏建模为模仿学习问题,引入在线策略(on-policy)机制:学生生成输出序列后,由教师提供 token 级概率作为监督信号
  • 提出广义知识蒸馏(GKD)框架,允许混合使用固定数据集(教师生成或真实标签)和学生自生成数据,通过超参数 λ 控制比例
  • 支持多种散度函数优化,包括 forward KL、reverse KL 和广义 JSD(β),其中 JSD 可平滑插值于两者之间
  • 训练时不反向传播通过学生采样过程,保持计算效率与稳定性
  • 可结合强化学习目标(如 RLAIF),构建正则化 RL 目标:(1−α)⋅E[r(y)] − α⋅E[D(p_T||p_S)],平衡奖励最大化与知识保留
  • 实验基于 T5 系列模型,教师为 T5-XL (~3B),学生为 T5-small/base/large,均从监督微调 checkpoint 开始蒸馏

关键结果

  • 在 XSum 摘要任务上,GKD 相比基线方法平均获得 2.1 倍相对性能提升;使用 5% 数据即可超越全量数据上的监督 KD
  • 在 WMT 英德翻译任务上,GKD 比 ImitKD 和 f-distill 分别高出 53% 和 162% 的 BLEU 提升
  • 在 GSM8K 算术推理任务上,GKD 实现 1.9 倍相对增益,且仅使用学生生成数据时效果最佳
  • 在任务无关的 FLAN 指令调优中,GKD 在 MMLU 和 BBH 上分别提升 1% 和 2% 绝对准确率
  • 模式寻求型散度(如 reverse KL、JSD(0.9))在高温度采样下生成质量更高但多样性更低,而 forward KL 更利于覆盖多种输出模式

局限与风险

  • 计算开销略高于传统 KD:学生采样成本约为固定数据训练的 1.8–2.2 倍,尤其当学生-教师规模差距大时
  • 需从一个已具备基本生成能力的学生模型开始(如经监督微调),否则初始低质量输出可能影响蒸馏效果
  • 最优散度选择与任务及评估方式强相关,需针对具体场景调参(如 greedy vs temperature sampling)
  • 未探索极大规模模型(如 >10B)上的蒸馏效率与扩展性

适合沉淀的概念

generalized-knowledge-distillation, on-policy-distillation, train-inference-distribution-mismatch, mode-seeking-vs-mode-covering, reverse-kl-distillation, rlaif-with-distillation, self-generated-mistakes, t5-model-distillation

阅读注意

  • 重点关注 GKD 如何统一监督 KD 与在线策略学习,并理解 λ 和散度选择对结果的影响
  • 注意不同任务下最优散度的变化:摘要和推理偏向 forward KL,而翻译偏好 JSD(0.1)
  • 图 4 展示了散度、温度与生成多样性/质量之间的权衡关系,是理解模式寻求行为的关键
  • RL + GKD 组合(图 5)表明该方法不仅能提升指标,还能增强事实一致性,值得深入阅读
  • 附录 A.16 提供了 forward/reverse KL 在容量不匹配下的可视化对比,有助于理解理论动机

质量说明

  • 采用来源:rawraw/papers/2023/06/2306.13649.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含详细实验设置、消融研究、多任务验证及与基线方法的全面比较,数据充分支持结论。