论文
arXiv2603.23871
时间2026-03
来源https://arxiv.org/html/2603.23871
页面质量中文卡片
阅读量级87 分钟

HDPO Hybrid Distillation Policy Optimization

论文导读

提出 Hybrid Distillation Policy Optimization (HDPO),通过向模型自身注入真实答案生成特权轨迹,并在梯度消失的“悬崖”样本上进行自蒸馏,从而为强化学习提供有效学习信号。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

HDPO:基于特权自蒸馏的混合策略优化

一句话定位

提出 Hybrid Distillation Policy Optimization (HDPO),通过向模型自身注入真实答案生成特权轨迹,并在梯度消失的“悬崖”样本上进行自蒸馏,从而为强化学习提供有效学习信号。

小学生也能听懂

这篇论文发明了一种叫HDPO的新方法,就像让AI自己当老师,把正确答案悄悄告诉“过去的自己”,专门教那些完全不会做的难题,这样AI就能学会更多解法,考试时不仅第一题答得好,后面几题也能做出来。

为什么值得记录

  • 解决了强化学习中“悬崖问题”(cliff problem)导致零梯度、无法学习 hardest 样本的核心瓶颈
  • 利用模型自身作为教师,避免了跨模型蒸馏中的模型失配误差,理论保证更紧致的 realizability gap
  • R=1 过滤机制被证明等价于 KL 正则化 RL 最优策略的硬阈值极限,具有理论最优性
  • 实验显示在保持贪婪准确率(pass@1)的同时显著提升覆盖率(pass@4, pass@8)

核心方法

  • HDPO 在标准 GRPO 损失基础上增加 JSD 蒸馏项:ℒ_HDPO = ℒ_GRPO + λ·ℒ_JSD
  • 仅对“悬崖样本”(所有 rollout 奖励为 0)进行蒸馏:𝒞 = {x ∈ ℬ : ∑R(x,y^(k)) = 0}
  • 教师模型通过在原始 prompt 后拼接 ground-truth 答案 y 构造:ȳ ~ π_θ(·|x ⊕ y)
  • 仅保留教师生成的正确轨迹(R=1)用于蒸馏:𝒯 = {(x, ȳ) : R(x, ȳ) = 1}
  • 使用 top-k=64 的 JSD 近似计算 token 级分布差异,全局归一化 token 数量
  • 教师与学生共享权重(drifting teacher),仅在输入上下文不同
  • λ 控制探索-利用权衡:小 λ 保持 pass@1,大 λ 提升 pass@k

关键结果

  • 在 OpenMathInstruct-2 上,drifting teacher + λ=0.01 配置实现 pass@4 +1.1%(0.7861 vs 0.7749),pass@8 +0.4%(0.8271 vs 0.8228),pass@1 几乎不变(0.6514 vs 0.6519)
  • λ=0.1 时 pass@8 提升更显著(+1.4–1.7%),但 pass@1 下降约 2.3–2.8%,体现明确 tradeoff
  • frozen teacher 与 drifting teacher 效果相近,但 drifting 在 λ=0.01 时略优
  • H100 与 H200 硬件结果趋势一致,λ=0.01 改进幅度受浮点非确定性影响接近噪声水平

局限与风险

  • 依赖外部提供的 ground-truth 答案 y*,不适用于无监督或开放域任务
  • R=1 过滤在高难度问题上可能 yield 极少或零样本,导致蒸馏失败
  • 未解决非悬崖样本上的信用分配问题,仍需结合 process reward 等方法
  • 实验仅验证于数学推理任务,泛化性待验证

适合沉淀的概念

cliff-problem, privileged-self-distillation, realizability-gap, kl-regularized-rl, jsd-distillation, drifting-teacher, rejection-sampling, coverage-metrics

阅读注意

  • 重点理解 Proposition 1 如何证明同模型蒸馏的 realizability gap 严格小于跨模型情况
  • 注意 R=1 过滤并非启发式,而是 Proposition 2 中 β→0 极限下的理论最优策略实现
  • 比较 HDPO 与 ReLIFT、Scaf-GRPO 等方法在机制复杂度和理论保证上的差异
  • 关注 λ 参数如何显式控制 pass@1 与 pass@k 的权衡,而非盲目提升单一指标

质量说明

  • 采用来源:rawraw/papers/2026/03/2603.23871.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的理论证明、算法描述、实验设置与多硬件验证,数据充分,逻辑自洽。