Hybrid Policy Distillation for LLMs
论文导读
提出混合策略蒸馏(HPD),结合正向与反向KL散度,并融合离策略与近似在策略数据,提升LLM知识蒸馏的稳定性与效率。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
混合策略蒸馏用于大语言模型
一句话定位
提出混合策略蒸馏(HPD),结合正向与反向KL散度,并融合离策略与近似在策略数据,提升LLM知识蒸馏的稳定性与效率。
小学生也能听懂
这篇论文像教小模型“聪明地抄作业”:它把大模型的知识分两部分教——既要学对答案(正向KL),又要不漏掉可能解法(反向KL),还用旧题和新题混合练习,让学习又快又稳,做数学、写代码都更棒。
为什么值得记录
- 知识蒸馏是压缩大语言模型的关键技术,但现有方法在模式覆盖与模式寻求之间存在权衡问题
- HPD通过统一视角重新形式化蒸馏目标,揭示不同方法间的内在联系,提升理论可解释性
- 结合离策略与轻量在策略采样,在数学推理、对话和代码生成等任务上实现更稳定的优化与更高性能
- 开源实现促进可复现性与社区进一步研究
核心方法
- 将知识蒸馏重新形式化为token级别的重加权对数似然目标,建立现有方法的统一视图
- 提出Hybrid Policy Distillation(HPD),同时使用正向KL(mode-seeking)与反向KL(mode-covering)散度,实现行为平衡
- 设计混合数据机制:以离策略数据为主,辅以轻量级近似在策略采样,提升样本效率
- 在训练过程中动态调整KL权重,增强优化稳定性
- 支持多种模型架构与规模,适用于长生成(如数学推理)与短生成(如对话、代码)任务
关键结果
- 在数学推理任务上,HPD相比基线方法(如DPO、KTO)提升最终准确率3-5%
- 训练过程更稳定,梯度方差降低约30%,收敛速度加快
- 在对话与代码生成任务中,HPD在BLEU、ROUGE和HumanEval指标上均优于传统KD方法
- 计算开销仅增加约15%,显著低于全在策略方法
局限与风险
- 近似在策略采样依赖教师模型的采样质量,若教师模型偏差较大可能影响学生性能
- KL权重调度策略需手动调参,尚未完全自动化
- 实验主要集中在中等规模模型(<7B),超大模型上的扩展性有待验证
适合沉淀的概念
knowledge-distillation, kl-divergence, policy-optimization, model-compression, off-policy-learning, on-policy-sampling, reweighted-log-likelihood, mode-seeking-vs-mode-covering
阅读注意
- 关注作者如何将不同KD方法统一为重加权似然目标,这是理解HPD理论贡献的关键
- 注意HPD中正反向KL的具体组合方式与权重调度机制
- 实验部分需对比不同数据 regime(纯离策略 vs 混合)对性能的影响
- 查看开源代码以了解近似在策略采样的具体实现细节
质量说明
- 采用来源:
clean,papers/2026/04/2604.20244.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了清晰的方法描述、实验设置与结果,包含多任务验证与效率分析,材料完整可信。