HDPO Hybrid Distillation Policy Optimization
论文导读
提出 Hybrid Distillation Policy Optimization (HDPO),通过向模型自身注入真实答案生成特权轨迹,并在梯度消失的“悬崖”样本上进行自蒸馏,从而为强化学习提供有效学习信号。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
HDPO:基于特权自蒸馏的混合策略优化
一句话定位
提出 Hybrid Distillation Policy Optimization (HDPO),通过向模型自身注入真实答案生成特权轨迹,并在梯度消失的“悬崖”样本上进行自蒸馏,从而为强化学习提供有效学习信号。
小学生也能听懂
这篇论文发明了一种叫HDPO的新方法,就像让AI自己当老师,把正确答案悄悄告诉“过去的自己”,专门教那些完全不会做的难题,这样AI就能学会更多解法,考试时不仅第一题答得好,后面几题也能做出来。
为什么值得记录
- 解决了强化学习中“悬崖问题”(cliff problem)导致零梯度、无法学习 hardest 样本的核心瓶颈
- 利用模型自身作为教师,避免了跨模型蒸馏中的模型失配误差,理论保证更紧致的 realizability gap
- R=1 过滤机制被证明等价于 KL 正则化 RL 最优策略的硬阈值极限,具有理论最优性
- 实验显示在保持贪婪准确率(pass@1)的同时显著提升覆盖率(pass@4, pass@8)
核心方法
- HDPO 在标准 GRPO 损失基础上增加 JSD 蒸馏项:ℒ_HDPO = ℒ_GRPO + λ·ℒ_JSD
- 仅对“悬崖样本”(所有 rollout 奖励为 0)进行蒸馏:𝒞 = {x ∈ ℬ : ∑R(x,y^(k)) = 0}
- 教师模型通过在原始 prompt 后拼接 ground-truth 答案 y 构造:ȳ ~ π_θ(·|x ⊕ y)
- 仅保留教师生成的正确轨迹(R=1)用于蒸馏:𝒯 = {(x, ȳ) : R(x, ȳ) = 1}
- 使用 top-k=64 的 JSD 近似计算 token 级分布差异,全局归一化 token 数量
- 教师与学生共享权重(drifting teacher),仅在输入上下文不同
- λ 控制探索-利用权衡:小 λ 保持 pass@1,大 λ 提升 pass@k
关键结果
- 在 OpenMathInstruct-2 上,drifting teacher + λ=0.01 配置实现 pass@4 +1.1%(0.7861 vs 0.7749),pass@8 +0.4%(0.8271 vs 0.8228),pass@1 几乎不变(0.6514 vs 0.6519)
- λ=0.1 时 pass@8 提升更显著(+1.4–1.7%),但 pass@1 下降约 2.3–2.8%,体现明确 tradeoff
- frozen teacher 与 drifting teacher 效果相近,但 drifting 在 λ=0.01 时略优
- H100 与 H200 硬件结果趋势一致,λ=0.01 改进幅度受浮点非确定性影响接近噪声水平
局限与风险
- 依赖外部提供的 ground-truth 答案 y*,不适用于无监督或开放域任务
- R=1 过滤在高难度问题上可能 yield 极少或零样本,导致蒸馏失败
- 未解决非悬崖样本上的信用分配问题,仍需结合 process reward 等方法
- 实验仅验证于数学推理任务,泛化性待验证
适合沉淀的概念
cliff-problem, privileged-self-distillation, realizability-gap, kl-regularized-rl, jsd-distillation, drifting-teacher, rejection-sampling, coverage-metrics
阅读注意
- 重点理解 Proposition 1 如何证明同模型蒸馏的 realizability gap 严格小于跨模型情况
- 注意 R=1 过滤并非启发式,而是 Proposition 2 中 β→0 极限下的理论最优策略实现
- 比较 HDPO 与 ReLIFT、Scaf-GRPO 等方法在机制复杂度和理论保证上的差异
- 关注 λ 参数如何显式控制 pass@1 与 pass@k 的权衡,而非盲目提升单一指标
质量说明
- 采用来源:
raw,raw/papers/2026/03/2603.23871.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的理论证明、算法描述、实验设置与多硬件验证,数据充分,逻辑自洽。