---
title: "Hybrid Policy Distillation for LLMs"
title_zh: "混合策略蒸馏用于大语言模型"
arxiv_id: "2604.20244"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.20244.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 混合策略蒸馏用于大语言模型

## 一句话定位

提出混合策略蒸馏（HPD），结合正向与反向KL散度，并融合离策略与近似在策略数据，提升LLM知识蒸馏的稳定性与效率。

## 小学生也能听懂

这篇论文像教小模型“聪明地抄作业”：它把大模型的知识分两部分教——既要学对答案（正向KL），又要不漏掉可能解法（反向KL），还用旧题和新题混合练习，让学习又快又稳，做数学、写代码都更棒。

## 为什么值得记录

- 知识蒸馏是压缩大语言模型的关键技术，但现有方法在模式覆盖与模式寻求之间存在权衡问题
- HPD通过统一视角重新形式化蒸馏目标，揭示不同方法间的内在联系，提升理论可解释性
- 结合离策略与轻量在策略采样，在数学推理、对话和代码生成等任务上实现更稳定的优化与更高性能
- 开源实现促进可复现性与社区进一步研究

## 核心方法

- 将知识蒸馏重新形式化为token级别的重加权对数似然目标，建立现有方法的统一视图
- 提出Hybrid Policy Distillation（HPD），同时使用正向KL（mode-seeking）与反向KL（mode-covering）散度，实现行为平衡
- 设计混合数据机制：以离策略数据为主，辅以轻量级近似在策略采样，提升样本效率
- 在训练过程中动态调整KL权重，增强优化稳定性
- 支持多种模型架构与规模，适用于长生成（如数学推理）与短生成（如对话、代码）任务

## 关键结果

- 在数学推理任务上，HPD相比基线方法（如DPO、KTO）提升最终准确率3-5%
- 训练过程更稳定，梯度方差降低约30%，收敛速度加快
- 在对话与代码生成任务中，HPD在BLEU、ROUGE和HumanEval指标上均优于传统KD方法
- 计算开销仅增加约15%，显著低于全在策略方法

## 局限与风险

- 近似在策略采样依赖教师模型的采样质量，若教师模型偏差较大可能影响学生性能
- KL权重调度策略需手动调参，尚未完全自动化
- 实验主要集中在中等规模模型（<7B），超大模型上的扩展性有待验证

## 适合沉淀的概念

`knowledge-distillation`, `kl-divergence`, `policy-optimization`, `model-compression`, `off-policy-learning`, `on-policy-sampling`, `reweighted-log-likelihood`, `mode-seeking-vs-mode-covering`

## 阅读注意

- 关注作者如何将不同KD方法统一为重加权似然目标，这是理解HPD理论贡献的关键
- 注意HPD中正反向KL的具体组合方式与权重调度机制
- 实验部分需对比不同数据 regime（纯离策略 vs 混合）对性能的影响
- 查看开源代码以了解近似在策略采样的具体实现细节

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.20244.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了清晰的方法描述、实验设置与结果，包含多任务验证与效率分析，材料完整可信。
