---
title: "HDPO Hybrid Distillation Policy Optimization"
title_zh: "HDPO：基于特权自蒸馏的混合策略优化"
arxiv_id: "2603.23871"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/03/2603.23871.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# HDPO：基于特权自蒸馏的混合策略优化

## 一句话定位

提出 Hybrid Distillation Policy Optimization (HDPO)，通过向模型自身注入真实答案生成特权轨迹，并在梯度消失的“悬崖”样本上进行自蒸馏，从而为强化学习提供有效学习信号。

## 小学生也能听懂

这篇论文发明了一种叫HDPO的新方法，就像让AI自己当老师，把正确答案悄悄告诉“过去的自己”，专门教那些完全不会做的难题，这样AI就能学会更多解法，考试时不仅第一题答得好，后面几题也能做出来。

## 为什么值得记录

- 解决了强化学习中“悬崖问题”（cliff problem）导致零梯度、无法学习 hardest 样本的核心瓶颈
- 利用模型自身作为教师，避免了跨模型蒸馏中的模型失配误差，理论保证更紧致的 realizability gap
- R=1 过滤机制被证明等价于 KL 正则化 RL 最优策略的硬阈值极限，具有理论最优性
- 实验显示在保持贪婪准确率（pass@1）的同时显著提升覆盖率（pass@4, pass@8）

## 核心方法

- HDPO 在标准 GRPO 损失基础上增加 JSD 蒸馏项：ℒ_HDPO = ℒ_GRPO + λ·ℒ_JSD
- 仅对“悬崖样本”（所有 rollout 奖励为 0）进行蒸馏：𝒞 = {x ∈ ℬ : ∑R(x,y^(k)) = 0}
- 教师模型通过在原始 prompt 后拼接 ground-truth 答案 y* 构造：ȳ ~ π_θ(·|x ⊕ y*)
- 仅保留教师生成的正确轨迹（R=1）用于蒸馏：𝒯 = {(x, ȳ) : R(x, ȳ) = 1}
- 使用 top-k=64 的 JSD 近似计算 token 级分布差异，全局归一化 token 数量
- 教师与学生共享权重（drifting teacher），仅在输入上下文不同
- λ 控制探索-利用权衡：小 λ 保持 pass@1，大 λ 提升 pass@k

## 关键结果

- 在 OpenMathInstruct-2 上，drifting teacher + λ=0.01 配置实现 pass@4 +1.1%（0.7861 vs 0.7749），pass@8 +0.4%（0.8271 vs 0.8228），pass@1 几乎不变（0.6514 vs 0.6519）
- λ=0.1 时 pass@8 提升更显著（+1.4–1.7%），但 pass@1 下降约 2.3–2.8%，体现明确 tradeoff
- frozen teacher 与 drifting teacher 效果相近，但 drifting 在 λ=0.01 时略优
- H100 与 H200 硬件结果趋势一致，λ=0.01 改进幅度受浮点非确定性影响接近噪声水平

## 局限与风险

- 依赖外部提供的 ground-truth 答案 y*，不适用于无监督或开放域任务
- R=1 过滤在高难度问题上可能 yield 极少或零样本，导致蒸馏失败
- 未解决非悬崖样本上的信用分配问题，仍需结合 process reward 等方法
- 实验仅验证于数学推理任务，泛化性待验证

## 适合沉淀的概念

`cliff-problem`, `privileged-self-distillation`, `realizability-gap`, `kl-regularized-rl`, `jsd-distillation`, `drifting-teacher`, `rejection-sampling`, `coverage-metrics`

## 阅读注意

- 重点理解 Proposition 1 如何证明同模型蒸馏的 realizability gap 严格小于跨模型情况
- 注意 R=1 过滤并非启发式，而是 Proposition 2 中 β→0 极限下的理论最优策略实现
- 比较 HDPO 与 ReLIFT、Scaf-GRPO 等方法在机制复杂度和理论保证上的差异
- 关注 λ 参数如何显式控制 pass@1 与 pass@k 的权衡，而非盲目提升单一指标

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/03/2603.23871.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的理论证明、算法描述、实验设置与多硬件验证，数据充分，逻辑自洽。
