TIP: Token Importance in On-Policy Distillation
论文导读
提出 TIP 双轴分类法,基于学生熵和师生分歧识别信息量最大的词元,结合 Soft-OR 评分实现高效在策略蒸馏。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
TIP:论在策略蒸馏中的词元重要性
一句话定位
提出 TIP 双轴分类法,基于学生熵和师生分歧识别信息量最大的词元,结合 Soft-OR 评分实现高效在策略蒸馏。
小学生也能听懂
这篇论文像给AI学生挑重点练习题:它发现不是每个词都重要,于是用两个指标(学生不确定度和师生答案差异)把词分成四类,再用一个聪明公式挑出最有用的词来训练,结果只学10%-20%的词就能达到原来效果,还省了近一半内存。
为什么值得记录
- 在策略蒸馏(OPD)中,并非所有词元位置对学习贡献相同,现有方法对词元重要性理解不完整;
- 学生熵是有效的一阶代理,但会遗漏低熵高分歧的过度自信错误词元(Q3 区域);
- TIP 提出双轴分类框架,无需额外标注或计算即可识别四类词元区域;
- Soft-OR 评分结合熵与分歧,在数学推理和长程规划任务上均优于纯熵选择;
- 实验显示仅用 10%-20% 的词元即可匹配或超越全词元训练,显著降低显存占用(最高节省 58%)。
核心方法
- 定义两个核心指标:学生熵 ht(归一化到 [0,1])和师生 KL 散度 δt(即标准 OPD 损失项);
- 构建 TIP 四象限分类:Q1(高熵高分歧)、Q2(高熵低分歧)、Q3(低熵高分歧,过度自信错误)、Q4(低熵低分歧,已解决);
- 提出 Soft-OR 评分:st = ĥt + δ̂t − ĥt·δ̂t,其中 ĥt 和 δ̂t 为 min-max 归一化值,参数自由;
- 训练时按 Soft-OR 分数 Top-K 选择保留 ρ 比例的词元进行损失计算;
- 理论证明:任何仅依赖熵的评分在结构上无法区分 Q3 与 Q4(命题 2),而 Soft-OR 可恢复 Q3 信号(备注 2);
- 实验涵盖 Qwen3、Llama、Qwen2.5 三组师生对,在 MATH-500、AIME 2024/2025 和 DeepPlanning 基准上验证。
关键结果
- 熵采样保留 50% 词元时,在多数基准上匹配或超越全词元训练(如 Qwen3 小模型 MATH 从 76.7 提升至 78.6);
- 峰值显存显著下降:Qwen3 从 72.0GB 降至 38.1GB(−47%),Qwen2.5 从 35.8GB 降至 14.9GB(−58%);
- Q3-only 训练(仅低熵高分歧词元)使用 <10% 词元,在 MATH 上达到 76.1,接近全词元基线 76.7;
- Soft-OR 在 50% 保留率下全面优于熵-only:Qwen3 在 MATH 上达 79.1 vs 78.6,AIME'24 达 25.7 vs 23.8;
- 在 DeepPlanning 代理规划任务中,Q3-only 20% 超越全词元 OPD(Avg@16: 12.6 vs 11.7);
- 底部 50% Soft-OR 词元训练性能显著低于顶部,验证 Q4 区域信号微弱。
局限与风险
- Soft-OR 依赖 min-max 归一化,可能对极端分布敏感,需确保 batch 内统计稳定性;
- Q3 区域占比小(3–15%),在低分歧任务中收益可能有限;
- 实验未探索动态调整 ρ 的策略,固定保留率可能非最优;
- 未与更复杂的元学习加权方法(如 AdaKD 的 IDTS 模块)深度集成;
- 理论分析基于梯度平滑和 token 可分近似,实际优化动态可能存在偏差。
适合沉淀的概念
on-policy-distillation, token-importance, student-entropy, teacher-student-divergence, overconfident-errors, soft-or-score, memory-efficient-training, curriculum-learning-at-token-level
阅读注意
- 重点关注图 1 和表 5:Soft-OR 在数学推理上的稳定提升;
- 注意表 8 的消融:纯分歧选择(Div-only)在等预算下弱于 Q3-only,说明低熵条件的关键作用;
- 附录 B.5 的定性示例(如例 1、3、4)直观展示 Q3 词元的‘高自信错误’特性;
- 命题 2 的理论洞察:任何 f(ht) 且 f(0)=0 的熵基评分必然忽略 Q3;
- DeepPlanning 结果(表 7)表明 TIP 可泛化至非数学领域。
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.14084.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含理论证明、多模型多任务实验、消融分析和定性案例,数据充分支持结论。