---
title: "Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models"
title_zh: "自蒸馏推理器：大语言模型的在线自蒸馏方法"
arxiv_id: "2601.18734"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/01/2601.18734.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 自蒸馏推理器：大语言模型的在线自蒸馏方法

## 一句话定位

提出 On-Policy Self-Distillation (OPSD)，让单个 LLM 同时作为教师和学生，利用真实答案提供密集 token 级监督，提升推理任务训练效率。

## 小学生也能听懂

这篇论文让一个大语言模型自己当老师和学生，用正确答案教自己一步步思考数学题，通过比较每一步的答案来学习，比传统方法更高效，尤其在解难题时表现更好。

## 为什么值得记录

- 无需外部教师模型，仅用同一模型的不同上下文即可实现自蒸馏
- 结合在线采样与密集 token 级反馈，缓解分布偏移和稀疏奖励问题
- 在数学推理基准上显著优于 SFT，且 token 效率远超 GRPO
- 引入 per-token pointwise KL clipping 机制，稳定训练并提升性能

## 核心方法

- 将同一 LLM 实例化为两个策略：教师策略 p_T(·|x, y*) 条件于问题和真实解，学生策略 p_S(·|x) 仅条件于问题
- 学生策略在线生成响应 ŷ ~ p_S(·|x)，教师策略基于 ŷ 的前缀提供每一步的 next-token 分布监督
- 训练目标是最小化教师与学生分布之间的逐 token 散度（如 forward KL），梯度仅通过学生 logits 回传
- 采用 full-vocabulary logit distillation，在完整词表上计算分布差异，提供更丰富的监督信号
- 提出 per-token pointwise divergence clipping，抑制风格 token 对训练信号的支配，突出数学相关 token 的学习
- 支持多种散度目标（KL、JSD）和生成模式组合（Thinking Mode on/off），实验表明 TM-off 学生 + TM-on 教师最优

## 关键结果

- 在 AIME24、AIME25、HMMT25 数学推理基准上，OPSD 在 Qwen3-1.7B/4B/8B 上均优于 SFT 和 GRPO
- Qwen3-1.7B 上，OPSD 平均准确率达 43.4，显著高于 base 模型的 37.1 和 GRPO 的 37.7
- OPSD 仅需每题 1024 token 生成长度和 100 步训练，而 GRPO 需 8×16k token 且易因奖励方差为零而停滞
- forward KL 散度目标表现最佳，reverse KL 和 JSD 效果有限或负向
- full-vocabulary logit distillation 优于 sampled-token policy gradient 方法

## 局限与风险

- 实验限于 8B 以下模型，更大规模是否有效待验证
- 未显式利用生成答案的正确性验证信号，可能错失额外监督机会
- 当问题难度超过模型理解阈值时，教师策略无法提供有效指导，需结合课程学习策略

## 适合沉淀的概念

`on-policy-self-distillation`, `knowledge-distillation`, `reinforcement-learning-with-verifiable-rewards`, `per-token-kl-clipping`, `full-vocabulary-logit-distillation`, `thinking-mode-generation`, `dense-reward-policy-gradient`, `self-training-llm`

## 阅读注意

- 关注 OPSD 如何将 ground-truth solution 作为 privileged information 构建教师策略
- 注意 per-token pointwise clipping 的设计动机：风格 token 的 KL 值远高于数学 token，易主导训练
- 比较 full-vocabulary 与 sampled-token 两种目标函数的内存-性能权衡
- 理解为何 TM-off 学生 + TM-on 教师组合能最大化数学 token 上的 KL 信号
- 附录 D 提供了 OPSD 与 STaR 在 reward structure 上的本质区别：token-level vs sequence-level

## 质量说明

- 采用来源：`clean`，`papers/2026/01/2601.18734.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，方法清晰，实验充分，消融研究详实，代码已开源，材料可信度高。
