论文
arXiv2601.18734
时间2026-01
来源Markdown
页面质量中文卡片
阅读量级68 分钟

Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models

论文导读

提出 On-Policy Self-Distillation (OPSD),让单个 LLM 同时作为教师和学生,利用真实答案提供密集 token 级监督,提升推理任务训练效率。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

自蒸馏推理器:大语言模型的在线自蒸馏方法

一句话定位

提出 On-Policy Self-Distillation (OPSD),让单个 LLM 同时作为教师和学生,利用真实答案提供密集 token 级监督,提升推理任务训练效率。

小学生也能听懂

这篇论文让一个大语言模型自己当老师和学生,用正确答案教自己一步步思考数学题,通过比较每一步的答案来学习,比传统方法更高效,尤其在解难题时表现更好。

为什么值得记录

  • 无需外部教师模型,仅用同一模型的不同上下文即可实现自蒸馏
  • 结合在线采样与密集 token 级反馈,缓解分布偏移和稀疏奖励问题
  • 在数学推理基准上显著优于 SFT,且 token 效率远超 GRPO
  • 引入 per-token pointwise KL clipping 机制,稳定训练并提升性能

核心方法

  • 将同一 LLM 实例化为两个策略:教师策略 p_T(·|x, y*) 条件于问题和真实解,学生策略 p_S(·|x) 仅条件于问题
  • 学生策略在线生成响应 ŷ ~ p_S(·|x),教师策略基于 ŷ 的前缀提供每一步的 next-token 分布监督
  • 训练目标是最小化教师与学生分布之间的逐 token 散度(如 forward KL),梯度仅通过学生 logits 回传
  • 采用 full-vocabulary logit distillation,在完整词表上计算分布差异,提供更丰富的监督信号
  • 提出 per-token pointwise divergence clipping,抑制风格 token 对训练信号的支配,突出数学相关 token 的学习
  • 支持多种散度目标(KL、JSD)和生成模式组合(Thinking Mode on/off),实验表明 TM-off 学生 + TM-on 教师最优

关键结果

  • 在 AIME24、AIME25、HMMT25 数学推理基准上,OPSD 在 Qwen3-1.7B/4B/8B 上均优于 SFT 和 GRPO
  • Qwen3-1.7B 上,OPSD 平均准确率达 43.4,显著高于 base 模型的 37.1 和 GRPO 的 37.7
  • OPSD 仅需每题 1024 token 生成长度和 100 步训练,而 GRPO 需 8×16k token 且易因奖励方差为零而停滞
  • forward KL 散度目标表现最佳,reverse KL 和 JSD 效果有限或负向
  • full-vocabulary logit distillation 优于 sampled-token policy gradient 方法

局限与风险

  • 实验限于 8B 以下模型,更大规模是否有效待验证
  • 未显式利用生成答案的正确性验证信号,可能错失额外监督机会
  • 当问题难度超过模型理解阈值时,教师策略无法提供有效指导,需结合课程学习策略

适合沉淀的概念

on-policy-self-distillation, knowledge-distillation, reinforcement-learning-with-verifiable-rewards, per-token-kl-clipping, full-vocabulary-logit-distillation, thinking-mode-generation, dense-reward-policy-gradient, self-training-llm

阅读注意

  • 关注 OPSD 如何将 ground-truth solution 作为 privileged information 构建教师策略
  • 注意 per-token pointwise clipping 的设计动机:风格 token 的 KL 值远高于数学 token,易主导训练
  • 比较 full-vocabulary 与 sampled-token 两种目标函数的内存-性能权衡
  • 理解为何 TM-off 学生 + TM-on 教师组合能最大化数学 token 上的 KL 信号
  • 附录 D 提供了 OPSD 与 STaR 在 reward structure 上的本质区别:token-level vs sequence-level

质量说明

  • 采用来源:cleanpapers/2026/01/2601.18734.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文结构完整,方法清晰,实验充分,消融研究详实,代码已开源,材料可信度高。