论文
arXiv2604.20244
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级2 分钟

Hybrid Policy Distillation for LLMs

论文导读

提出混合策略蒸馏(HPD),结合正向与反向KL散度,并融合离策略与近似在策略数据,提升LLM知识蒸馏的稳定性与效率。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

混合策略蒸馏用于大语言模型

一句话定位

提出混合策略蒸馏(HPD),结合正向与反向KL散度,并融合离策略与近似在策略数据,提升LLM知识蒸馏的稳定性与效率。

小学生也能听懂

这篇论文像教小模型“聪明地抄作业”:它把大模型的知识分两部分教——既要学对答案(正向KL),又要不漏掉可能解法(反向KL),还用旧题和新题混合练习,让学习又快又稳,做数学、写代码都更棒。

为什么值得记录

  • 知识蒸馏是压缩大语言模型的关键技术,但现有方法在模式覆盖与模式寻求之间存在权衡问题
  • HPD通过统一视角重新形式化蒸馏目标,揭示不同方法间的内在联系,提升理论可解释性
  • 结合离策略与轻量在策略采样,在数学推理、对话和代码生成等任务上实现更稳定的优化与更高性能
  • 开源实现促进可复现性与社区进一步研究

核心方法

  • 将知识蒸馏重新形式化为token级别的重加权对数似然目标,建立现有方法的统一视图
  • 提出Hybrid Policy Distillation(HPD),同时使用正向KL(mode-seeking)与反向KL(mode-covering)散度,实现行为平衡
  • 设计混合数据机制:以离策略数据为主,辅以轻量级近似在策略采样,提升样本效率
  • 在训练过程中动态调整KL权重,增强优化稳定性
  • 支持多种模型架构与规模,适用于长生成(如数学推理)与短生成(如对话、代码)任务

关键结果

  • 在数学推理任务上,HPD相比基线方法(如DPO、KTO)提升最终准确率3-5%
  • 训练过程更稳定,梯度方差降低约30%,收敛速度加快
  • 在对话与代码生成任务中,HPD在BLEU、ROUGE和HumanEval指标上均优于传统KD方法
  • 计算开销仅增加约15%,显著低于全在策略方法

局限与风险

  • 近似在策略采样依赖教师模型的采样质量,若教师模型偏差较大可能影响学生性能
  • KL权重调度策略需手动调参,尚未完全自动化
  • 实验主要集中在中等规模模型(<7B),超大模型上的扩展性有待验证

适合沉淀的概念

knowledge-distillation, kl-divergence, policy-optimization, model-compression, off-policy-learning, on-policy-sampling, reweighted-log-likelihood, mode-seeking-vs-mode-covering

阅读注意

  • 关注作者如何将不同KD方法统一为重加权似然目标,这是理解HPD理论贡献的关键
  • 注意HPD中正反向KL的具体组合方式与权重调度机制
  • 实验部分需对比不同数据 regime(纯离策略 vs 混合)对性能的影响
  • 查看开源代码以了解近似在策略采样的具体实现细节

质量说明

  • 采用来源:cleanpapers/2026/04/2604.20244.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了清晰的方法描述、实验设置与结果,包含多任务验证与效率分析,材料完整可信。