Entropy-Aware On-Policy Distillation of Language Models
论文导读
提出熵感知在线策略蒸馏(EOPD),在高熵区域引入前向KL散度以保留教师模型的不确定性,从而缓解模式坍缩并提升推理任务表现。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
熵感知的在线策略语言模型蒸馏
一句话定位
提出熵感知在线策略蒸馏(EOPD),在高熵区域引入前向KL散度以保留教师模型的不确定性,从而缓解模式坍缩并提升推理任务表现。
小学生也能听懂
这篇论文像教学生做题时,不仅学答案,还学老师“不确定时怎么想”。新方法在高难度题(高熵区)用前向KL保留老师思路,简单题用反向KL,让AI更聪明,数学推理提升5分。
为什么值得记录
- 揭示了标准在线策略蒸馏中反向KL导致的多样性退化问题:学生模型仅保留6.8%的高熵token,而教师为18.5%
- 提出动态混合目标函数,在低熵区使用高效的反向KL,在高熵区启用前向KL以传递不确定性结构
- 在6个数学推理基准上实现一致增益,Qwen3-4B-Base的Pass@8平均提升+5.05
- 通过top-k截断近似前向KL,平衡计算开销与概率质量保留(k=16时内存144MiB,覆盖大部分质量)
核心方法
- 定义熵感知目标函数:L_t^EOPD = L_t^OPD + I(H_t^te > τ) * L_t^FKL,其中H_t^te为教师token级熵
- L_t^OPD采用PPO式裁剪反向KL损失,L_t^FKL为前向KL散度
- 前向KL通过教师top-k token期望近似计算,避免全词表开销
- 训练流程:采样学生轨迹→查询教师log概率→计算混合损失→策略梯度更新
- 超参数τ控制切换阈值,k=16用于平衡效率与精度
关键结果
- 在Qwen3-0.6B/1.7B/4B上,EOPD相比OPD平均提升Pass@8分别为+1.37/+2.39/+5.05
- AIME25上Qwen3-4B-Base的Pass@8从30.00%提升至33.33%
- 高熵区域(≥1.0)的token分布更接近教师,前向KL降低约20%
- Pass@k曲线显示EOPD在k增大时优势更明显,表明探索能力增强
局限与风险
- 需额外计算教师token级熵,增加推理开销
- τ和k需调参,未实现完全自适应
- 实验限于数学推理任务,通用性待验证
适合沉淀的概念
on-policy-distillation, reverse-kl-divergence, forward-kl-divergence, token-level-entropy, mode-seeking-vs-mode-covering, ppo-clipping, top-k-truncation, knowledge-distillation
阅读注意
- 重点关注第3节对多样性退化的量化分析(图3与表1)
- 注意EOPD目标函数中指示函数I(H_t^te > τ)的设计意图
- 附录F展示了top-k截断的内存-概率质量权衡,是工程实现关键
- 对比实验中Entropy Bonus与Advantage Shaping作为基线,凸显EOPD的结构优势
质量说明
- 采用来源:
clean,papers/2026/03/2603.07079.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、消融实验、多模型验证及实现参数,结果可复现性强。