---
title: "TIP: Token Importance in On-Policy Distillation"
title_zh: "TIP：论在策略蒸馏中的词元重要性"
arxiv_id: "2604.14084"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.14084.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# TIP：论在策略蒸馏中的词元重要性

## 一句话定位

提出 TIP 双轴分类法，基于学生熵和师生分歧识别信息量最大的词元，结合 Soft-OR 评分实现高效在策略蒸馏。

## 小学生也能听懂

这篇论文像给AI学生挑重点练习题：它发现不是每个词都重要，于是用两个指标（学生不确定度和师生答案差异）把词分成四类，再用一个聪明公式挑出最有用的词来训练，结果只学10%-20%的词就能达到原来效果，还省了近一半内存。

## 为什么值得记录

- 在策略蒸馏（OPD）中，并非所有词元位置对学习贡献相同，现有方法对词元重要性理解不完整；
- 学生熵是有效的一阶代理，但会遗漏低熵高分歧的过度自信错误词元（Q3 区域）；
- TIP 提出双轴分类框架，无需额外标注或计算即可识别四类词元区域；
- Soft-OR 评分结合熵与分歧，在数学推理和长程规划任务上均优于纯熵选择；
- 实验显示仅用 10%-20% 的词元即可匹配或超越全词元训练，显著降低显存占用（最高节省 58%）。

## 核心方法

- 定义两个核心指标：学生熵 ht（归一化到 [0,1]）和师生 KL 散度 δt（即标准 OPD 损失项）；
- 构建 TIP 四象限分类：Q1（高熵高分歧）、Q2（高熵低分歧）、Q3（低熵高分歧，过度自信错误）、Q4（低熵低分歧，已解决）；
- 提出 Soft-OR 评分：st = ĥt + δ̂t − ĥt·δ̂t，其中 ĥt 和 δ̂t 为 min-max 归一化值，参数自由；
- 训练时按 Soft-OR 分数 Top-K 选择保留 ρ 比例的词元进行损失计算；
- 理论证明：任何仅依赖熵的评分在结构上无法区分 Q3 与 Q4（命题 2），而 Soft-OR 可恢复 Q3 信号（备注 2）；
- 实验涵盖 Qwen3、Llama、Qwen2.5 三组师生对，在 MATH-500、AIME 2024/2025 和 DeepPlanning 基准上验证。

## 关键结果

- 熵采样保留 50% 词元时，在多数基准上匹配或超越全词元训练（如 Qwen3 小模型 MATH 从 76.7 提升至 78.6）；
- 峰值显存显著下降：Qwen3 从 72.0GB 降至 38.1GB（−47%），Qwen2.5 从 35.8GB 降至 14.9GB（−58%）；
- Q3-only 训练（仅低熵高分歧词元）使用 <10% 词元，在 MATH 上达到 76.1，接近全词元基线 76.7；
- Soft-OR 在 50% 保留率下全面优于熵-only：Qwen3 在 MATH 上达 79.1 vs 78.6，AIME'24 达 25.7 vs 23.8；
- 在 DeepPlanning 代理规划任务中，Q3-only 20% 超越全词元 OPD（Avg@16: 12.6 vs 11.7）；
- 底部 50% Soft-OR 词元训练性能显著低于顶部，验证 Q4 区域信号微弱。

## 局限与风险

- Soft-OR 依赖 min-max 归一化，可能对极端分布敏感，需确保 batch 内统计稳定性；
- Q3 区域占比小（3–15%），在低分歧任务中收益可能有限；
- 实验未探索动态调整 ρ 的策略，固定保留率可能非最优；
- 未与更复杂的元学习加权方法（如 AdaKD 的 IDTS 模块）深度集成；
- 理论分析基于梯度平滑和 token 可分近似，实际优化动态可能存在偏差。

## 适合沉淀的概念

`on-policy-distillation`, `token-importance`, `student-entropy`, `teacher-student-divergence`, `overconfident-errors`, `soft-or-score`, `memory-efficient-training`, `curriculum-learning-at-token-level`

## 阅读注意

- 重点关注图 1 和表 5：Soft-OR 在数学推理上的稳定提升；
- 注意表 8 的消融：纯分歧选择（Div-only）在等预算下弱于 Q3-only，说明低熵条件的关键作用；
- 附录 B.5 的定性示例（如例 1、3、4）直观展示 Q3 词元的‘高自信错误’特性；
- 命题 2 的理论洞察：任何 f(ht) 且 f(0)=0 的熵基评分必然忽略 Q3；
- DeepPlanning 结果（表 7）表明 TIP 可泛化至非数学领域。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.14084.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含理论证明、多模型多任务实验、消融分析和定性案例，数据充分支持结论。
