Fast and Effective On-policy Distillation from Reasoning Prefixes
论文导读
提出一种改进的同策略蒸馏方法,仅对模型输出前缀进行蒸馏并提前终止采样,显著降低训练成本同时保持性能。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
基于推理前缀的快速高效同策略蒸馏
一句话定位
提出一种改进的同策略蒸馏方法,仅对模型输出前缀进行蒸馏并提前终止采样,显著降低训练成本同时保持性能。
小学生也能听懂
这篇论文像教小朋友写作业时,只重点检查开头几行,因为开头对了后面就容易对,这样既省时间又学得好,新方法比原来快很多倍还差不多好。
为什么值得记录
- 同策略蒸馏(OPD)虽能提升泛化能力,但需实时采样学生策略,训练开销大,尤其对长响应场景不友好。
- 研究发现训练信号主要集中于输出前缀,短教师前缀即可显著帮助学生生成正确答案。
- 所提方法在保持与完整OPD相当性能的同时,将训练FLOP降低2倍至47倍,极大提升训练效率。
核心方法
- 基于同策略蒸馏(OPD)框架,采样学生模型生成的轨迹并使用教师模型进行逐token监督。
- 仅对学生输出序列的前缀部分应用蒸馏损失,忽略后续token的监督信号。
- 在蒸馏过程中提前终止学生策略的采样,减少生成完整响应的计算开销。
- 利用教师模型生成的短前缀作为强引导信号,增强学生在前缀阶段的对齐能力。
关键结果
- 在AI-for-Math和域外基准测试中,前缀蒸馏性能与完整OPD相当。
- 训练FLOP减少2×–47×,具体取决于任务响应长度。
- 实验表明短教师前缀能有效提升学生生成正确答案的概率。
局限与风险
- 方法假设训练信号集中在前缀,可能不适用于推理过程均匀分布的任务。
- 提前终止采样可能影响对学生长程推理能力的完整评估。
- 未报告不同前缀长度对性能的影响曲线,最优截断点需经验选择。
适合沉淀的概念
on-policy-distillation, knowledge-distillation, reasoning-prefix, training-efficiency, flop-reduction, student-teacher-framework
阅读注意
- 关注作者如何定义和提取‘前缀’,以及前缀长度的选择依据。
- 注意实验设置中学生与教师模型的具体架构与训练细节。
- 查看FLOP计算方式,确认效率提升是否包含采样与推理全过程。
质量说明
- 采用来源:
raw,raw/papers/2026/02/2602.15260.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:摘要提供了清晰的问题陈述、方法动机、核心做法与量化结果,信息完整,可支持研究卡片构建。