论文
arXiv2602.15260
时间2026-02
来源Markdown
页面质量中文卡片
阅读量级2 分钟

Fast and Effective On-policy Distillation from Reasoning Prefixes

论文导读

提出一种改进的同策略蒸馏方法,仅对模型输出前缀进行蒸馏并提前终止采样,显著降低训练成本同时保持性能。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

基于推理前缀的快速高效同策略蒸馏

一句话定位

提出一种改进的同策略蒸馏方法,仅对模型输出前缀进行蒸馏并提前终止采样,显著降低训练成本同时保持性能。

小学生也能听懂

这篇论文像教小朋友写作业时,只重点检查开头几行,因为开头对了后面就容易对,这样既省时间又学得好,新方法比原来快很多倍还差不多好。

为什么值得记录

  • 同策略蒸馏(OPD)虽能提升泛化能力,但需实时采样学生策略,训练开销大,尤其对长响应场景不友好。
  • 研究发现训练信号主要集中于输出前缀,短教师前缀即可显著帮助学生生成正确答案。
  • 所提方法在保持与完整OPD相当性能的同时,将训练FLOP降低2倍至47倍,极大提升训练效率。

核心方法

  • 基于同策略蒸馏(OPD)框架,采样学生模型生成的轨迹并使用教师模型进行逐token监督。
  • 仅对学生输出序列的前缀部分应用蒸馏损失,忽略后续token的监督信号。
  • 在蒸馏过程中提前终止学生策略的采样,减少生成完整响应的计算开销。
  • 利用教师模型生成的短前缀作为强引导信号,增强学生在前缀阶段的对齐能力。

关键结果

  • 在AI-for-Math和域外基准测试中,前缀蒸馏性能与完整OPD相当。
  • 训练FLOP减少2×–47×,具体取决于任务响应长度。
  • 实验表明短教师前缀能有效提升学生生成正确答案的概率。

局限与风险

  • 方法假设训练信号集中在前缀,可能不适用于推理过程均匀分布的任务。
  • 提前终止采样可能影响对学生长程推理能力的完整评估。
  • 未报告不同前缀长度对性能的影响曲线,最优截断点需经验选择。

适合沉淀的概念

on-policy-distillation, knowledge-distillation, reasoning-prefix, training-efficiency, flop-reduction, student-teacher-framework

阅读注意

  • 关注作者如何定义和提取‘前缀’,以及前缀长度的选择依据。
  • 注意实验设置中学生与教师模型的具体架构与训练细节。
  • 查看FLOP计算方式,确认效率提升是否包含采样与推理全过程。

质量说明

  • 采用来源:rawraw/papers/2026/02/2602.15260.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:摘要提供了清晰的问题陈述、方法动机、核心做法与量化结果,信息完整,可支持研究卡片构建。