---
title: "Entropy-Aware On-Policy Distillation of Language Models"
title_zh: "熵感知的在线策略语言模型蒸馏"
arxiv_id: "2603.07079"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.07079.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 熵感知的在线策略语言模型蒸馏

## 一句话定位

提出熵感知在线策略蒸馏（EOPD），在高熵区域引入前向KL散度以保留教师模型的不确定性，从而缓解模式坍缩并提升推理任务表现。

## 小学生也能听懂

这篇论文像教学生做题时，不仅学答案，还学老师“不确定时怎么想”。新方法在高难度题（高熵区）用前向KL保留老师思路，简单题用反向KL，让AI更聪明，数学推理提升5分。

## 为什么值得记录

- 揭示了标准在线策略蒸馏中反向KL导致的多样性退化问题：学生模型仅保留6.8%的高熵token，而教师为18.5%
- 提出动态混合目标函数，在低熵区使用高效的反向KL，在高熵区启用前向KL以传递不确定性结构
- 在6个数学推理基准上实现一致增益，Qwen3-4B-Base的Pass@8平均提升+5.05
- 通过top-k截断近似前向KL，平衡计算开销与概率质量保留（k=16时内存144MiB，覆盖大部分质量）

## 核心方法

- 定义熵感知目标函数：L_t^EOPD = L_t^OPD + I(H_t^te > τ) * L_t^FKL，其中H_t^te为教师token级熵
- L_t^OPD采用PPO式裁剪反向KL损失，L_t^FKL为前向KL散度
- 前向KL通过教师top-k token期望近似计算，避免全词表开销
- 训练流程：采样学生轨迹→查询教师log概率→计算混合损失→策略梯度更新
- 超参数τ控制切换阈值，k=16用于平衡效率与精度

## 关键结果

- 在Qwen3-0.6B/1.7B/4B上，EOPD相比OPD平均提升Pass@8分别为+1.37/+2.39/+5.05
- AIME25上Qwen3-4B-Base的Pass@8从30.00%提升至33.33%
- 高熵区域（≥1.0）的token分布更接近教师，前向KL降低约20%
- Pass@k曲线显示EOPD在k增大时优势更明显，表明探索能力增强

## 局限与风险

- 需额外计算教师token级熵，增加推理开销
- τ和k需调参，未实现完全自适应
- 实验限于数学推理任务，通用性待验证

## 适合沉淀的概念

`on-policy-distillation`, `reverse-kl-divergence`, `forward-kl-divergence`, `token-level-entropy`, `mode-seeking-vs-mode-covering`, `ppo-clipping`, `top-k-truncation`, `knowledge-distillation`

## 阅读注意

- 重点关注第3节对多样性退化的量化分析（图3与表1）
- 注意EOPD目标函数中指示函数I(H_t^te > τ)的设计意图
- 附录F展示了top-k截断的内存-概率质量权衡，是工程实现关键
- 对比实验中Entropy Bonus与Advantage Shaping作为基线，凸显EOPD的结构优势

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.07079.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、消融实验、多模型验证及实现参数，结果可复现性强。
