---
title: "Fast and Effective On-policy Distillation from Reasoning Prefixes"
title_zh: "基于推理前缀的快速高效同策略蒸馏"
arxiv_id: "2602.15260"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/02/2602.15260.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 基于推理前缀的快速高效同策略蒸馏

## 一句话定位

提出一种改进的同策略蒸馏方法，仅对模型输出前缀进行蒸馏并提前终止采样，显著降低训练成本同时保持性能。

## 小学生也能听懂

这篇论文像教小朋友写作业时，只重点检查开头几行，因为开头对了后面就容易对，这样既省时间又学得好，新方法比原来快很多倍还差不多好。

## 为什么值得记录

- 同策略蒸馏（OPD）虽能提升泛化能力，但需实时采样学生策略，训练开销大，尤其对长响应场景不友好。
- 研究发现训练信号主要集中于输出前缀，短教师前缀即可显著帮助学生生成正确答案。
- 所提方法在保持与完整OPD相当性能的同时，将训练FLOP降低2倍至47倍，极大提升训练效率。

## 核心方法

- 基于同策略蒸馏（OPD）框架，采样学生模型生成的轨迹并使用教师模型进行逐token监督。
- 仅对学生输出序列的前缀部分应用蒸馏损失，忽略后续token的监督信号。
- 在蒸馏过程中提前终止学生策略的采样，减少生成完整响应的计算开销。
- 利用教师模型生成的短前缀作为强引导信号，增强学生在前缀阶段的对齐能力。

## 关键结果

- 在AI-for-Math和域外基准测试中，前缀蒸馏性能与完整OPD相当。
- 训练FLOP减少2×–47×，具体取决于任务响应长度。
- 实验表明短教师前缀能有效提升学生生成正确答案的概率。

## 局限与风险

- 方法假设训练信号集中在前缀，可能不适用于推理过程均匀分布的任务。
- 提前终止采样可能影响对学生长程推理能力的完整评估。
- 未报告不同前缀长度对性能的影响曲线，最优截断点需经验选择。

## 适合沉淀的概念

`on-policy-distillation`, `knowledge-distillation`, `reasoning-prefix`, `training-efficiency`, `flop-reduction`, `student-teacher-framework`

## 阅读注意

- 关注作者如何定义和提取‘前缀’，以及前缀长度的选择依据。
- 注意实验设置中学生与教师模型的具体架构与训练细节。
- 查看FLOP计算方式，确认效率提升是否包含采样与推理全过程。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/02/2602.15260.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：摘要提供了清晰的问题陈述、方法动机、核心做法与量化结果，信息完整，可支持研究卡片构建。
