Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
论文导读
提出 On-Policy Self-Distillation (OPSD),让单个 LLM 同时作为教师和学生,利用真实答案提供密集 token 级监督,提升推理任务训练效率。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
自蒸馏推理器:大语言模型的在线自蒸馏方法
一句话定位
提出 On-Policy Self-Distillation (OPSD),让单个 LLM 同时作为教师和学生,利用真实答案提供密集 token 级监督,提升推理任务训练效率。
小学生也能听懂
这篇论文让一个大语言模型自己当老师和学生,用正确答案教自己一步步思考数学题,通过比较每一步的答案来学习,比传统方法更高效,尤其在解难题时表现更好。
为什么值得记录
- 无需外部教师模型,仅用同一模型的不同上下文即可实现自蒸馏
- 结合在线采样与密集 token 级反馈,缓解分布偏移和稀疏奖励问题
- 在数学推理基准上显著优于 SFT,且 token 效率远超 GRPO
- 引入 per-token pointwise KL clipping 机制,稳定训练并提升性能
核心方法
- 将同一 LLM 实例化为两个策略:教师策略 p_T(·|x, y*) 条件于问题和真实解,学生策略 p_S(·|x) 仅条件于问题
- 学生策略在线生成响应 ŷ ~ p_S(·|x),教师策略基于 ŷ 的前缀提供每一步的 next-token 分布监督
- 训练目标是最小化教师与学生分布之间的逐 token 散度(如 forward KL),梯度仅通过学生 logits 回传
- 采用 full-vocabulary logit distillation,在完整词表上计算分布差异,提供更丰富的监督信号
- 提出 per-token pointwise divergence clipping,抑制风格 token 对训练信号的支配,突出数学相关 token 的学习
- 支持多种散度目标(KL、JSD)和生成模式组合(Thinking Mode on/off),实验表明 TM-off 学生 + TM-on 教师最优
关键结果
- 在 AIME24、AIME25、HMMT25 数学推理基准上,OPSD 在 Qwen3-1.7B/4B/8B 上均优于 SFT 和 GRPO
- Qwen3-1.7B 上,OPSD 平均准确率达 43.4,显著高于 base 模型的 37.1 和 GRPO 的 37.7
- OPSD 仅需每题 1024 token 生成长度和 100 步训练,而 GRPO 需 8×16k token 且易因奖励方差为零而停滞
- forward KL 散度目标表现最佳,reverse KL 和 JSD 效果有限或负向
- full-vocabulary logit distillation 优于 sampled-token policy gradient 方法
局限与风险
- 实验限于 8B 以下模型,更大规模是否有效待验证
- 未显式利用生成答案的正确性验证信号,可能错失额外监督机会
- 当问题难度超过模型理解阈值时,教师策略无法提供有效指导,需结合课程学习策略
适合沉淀的概念
on-policy-self-distillation, knowledge-distillation, reinforcement-learning-with-verifiable-rewards, per-token-kl-clipping, full-vocabulary-logit-distillation, thinking-mode-generation, dense-reward-policy-gradient, self-training-llm
阅读注意
- 关注 OPSD 如何将 ground-truth solution 作为 privileged information 构建教师策略
- 注意 per-token pointwise clipping 的设计动机:风格 token 的 KL 值远高于数学 token,易主导训练
- 比较 full-vocabulary 与 sampled-token 两种目标函数的内存-性能权衡
- 理解为何 TM-off 学生 + TM-on 教师组合能最大化数学 token 上的 KL 信号
- 附录 D 提供了 OPSD 与 STaR 在 reward structure 上的本质区别:token-level vs sequence-level
质量说明
- 采用来源:
clean,papers/2026/01/2601.18734.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文结构完整,方法清晰,实验充分,消融研究详实,代码已开源,材料可信度高。