论文
arXiv2603.07079
时间2026-03
来源Markdown
页面质量中文卡片
阅读量级85 分钟

Entropy-Aware On-Policy Distillation of Language Models

论文导读

提出熵感知在线策略蒸馏(EOPD),在高熵区域引入前向KL散度以保留教师模型的不确定性,从而缓解模式坍缩并提升推理任务表现。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

熵感知的在线策略语言模型蒸馏

一句话定位

提出熵感知在线策略蒸馏(EOPD),在高熵区域引入前向KL散度以保留教师模型的不确定性,从而缓解模式坍缩并提升推理任务表现。

小学生也能听懂

这篇论文像教学生做题时,不仅学答案,还学老师“不确定时怎么想”。新方法在高难度题(高熵区)用前向KL保留老师思路,简单题用反向KL,让AI更聪明,数学推理提升5分。

为什么值得记录

  • 揭示了标准在线策略蒸馏中反向KL导致的多样性退化问题:学生模型仅保留6.8%的高熵token,而教师为18.5%
  • 提出动态混合目标函数,在低熵区使用高效的反向KL,在高熵区启用前向KL以传递不确定性结构
  • 在6个数学推理基准上实现一致增益,Qwen3-4B-Base的Pass@8平均提升+5.05
  • 通过top-k截断近似前向KL,平衡计算开销与概率质量保留(k=16时内存144MiB,覆盖大部分质量)

核心方法

  • 定义熵感知目标函数:L_t^EOPD = L_t^OPD + I(H_t^te > τ) * L_t^FKL,其中H_t^te为教师token级熵
  • L_t^OPD采用PPO式裁剪反向KL损失,L_t^FKL为前向KL散度
  • 前向KL通过教师top-k token期望近似计算,避免全词表开销
  • 训练流程:采样学生轨迹→查询教师log概率→计算混合损失→策略梯度更新
  • 超参数τ控制切换阈值,k=16用于平衡效率与精度

关键结果

  • 在Qwen3-0.6B/1.7B/4B上,EOPD相比OPD平均提升Pass@8分别为+1.37/+2.39/+5.05
  • AIME25上Qwen3-4B-Base的Pass@8从30.00%提升至33.33%
  • 高熵区域(≥1.0)的token分布更接近教师,前向KL降低约20%
  • Pass@k曲线显示EOPD在k增大时优势更明显,表明探索能力增强

局限与风险

  • 需额外计算教师token级熵,增加推理开销
  • τ和k需调参,未实现完全自适应
  • 实验限于数学推理任务,通用性待验证

适合沉淀的概念

on-policy-distillation, reverse-kl-divergence, forward-kl-divergence, token-level-entropy, mode-seeking-vs-mode-covering, ppo-clipping, top-k-truncation, knowledge-distillation

阅读注意

  • 重点关注第3节对多样性退化的量化分析(图3与表1)
  • 注意EOPD目标函数中指示函数I(H_t^te > τ)的设计意图
  • 附录F展示了top-k截断的内存-概率质量权衡,是工程实现关键
  • 对比实验中Entropy Bonus与Advantage Shaping作为基线,凸显EOPD的结构优势

质量说明

  • 采用来源:cleanpapers/2026/03/2603.07079.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、消融实验、多模型验证及实现参数,结果可复现性强。