论文
arXiv2603.05433
时间2026-03
来源https://arxiv.org/html/2603.05433
页面质量中文卡片
阅读量级100 分钟

OPSDC On-Policy Self-Distillation Reasoning Compression

论文导读

提出CRISP方法,利用模型自身在“简洁指令”下的行为作为教师信号,通过反向KL散度的迭代自蒸馏实现推理压缩,无需真实答案或难度估计,在保持准确率的同时显著减少token使用。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

CRISP:通过迭代自策略蒸馏实现推理压缩

一句话定位

提出CRISP方法,利用模型自身在“简洁指令”下的行为作为教师信号,通过反向KL散度的迭代自蒸馏实现推理压缩,无需真实答案或难度估计,在保持准确率的同时显著减少token使用。

小学生也能听懂

这篇论文发明了一种叫CRISP的方法,让AI模型像学生一样,通过不断模仿自己“简洁回答”的样子来学习,从而在解数学题时用更少的字说清答案,还能答得更准,就像把长篇作文改成精炼的要点却不丢分。

为什么值得记录

  • 首次实现无需ground-truth答案的推理压缩,突破RL方法依赖奖励信号的局限
  • 提出周期性教师更新机制,解决传统冻结教师无法持续压缩的问题
  • 理论证明压缩可降低错误累积(Proposition 4),为‘少即是多’现象提供解释
  • 在Qwen3-8B/14B上实现57-59% token压缩同时提升MATH-500准确率9-16点
  • 跨模型族(DeepSeek-R1-Distill-Llama-8B)和跨任务(数学→代理规划)验证泛化能力

核心方法

  • 定义学生模型πθ(·|x)和教师模型πθ(·|x,c),后者接收简洁指令c(如'Solve concisely')
  • 采用反向KL散度作为损失函数:L(θ)=E[∑D_KL(πθ(·|x,y<t) || π̄θ(·|x,c,y<t))],确保更新仅作用于学生当前生成区域
  • 设计周期性教师更新策略:每M=50步将学生权重θ同步至教师权重θ̄,形成渐进式压缩目标
  • 训练流程:单轮epoch、batch size=32、lr=1e-6,基于DAPO-Math-17k数据生成学生rollout
  • 隐式奖励机制:r(yt,x)=logπ̄θ(yt|x,c,y<t)−logπθ(yt|x,y<t),自动抑制冗余token
  • 难度自适应:易题因教师trace更短产生强KL信号,难题因需充分推理信号较弱(Proposition 2)

关键结果

  • Qwen3-8B在MATH-500上token减少58.8%(4661→1921),准确率提升8.9点(77.7%→86.6%)
  • Qwen3-14B在AIME 2024上token减少41.0%(12844→7577),准确率提升10.5点(65.8%→76.3%)
  • 压缩量自然适配难度:MATH-500(易)压缩57-59%,AIME(难)压缩35-41%,验证难度自适应性
  • 熵稳定性:全程保持per-token熵稳定(图8),避免RL方法常见的探索能力崩溃
  • 跨模型验证:DeepSeek-R1-Distill-Llama-8B在MATH-500上实现32.2%压缩且准确率提升1.4点
  • 跨任务迁移:在DeepPlanning代理任务中减少42-51% token,规划质量保持稳定

局限与风险

  • 依赖模型对简洁指令的理解能力,小模型可能响应不佳(见6.1节)
  • 教师质量依赖基础模型的指令跟随能力,Llama架构响应弱于Qwen导致压缩量较低
  • 过度压缩风险:购物规划任务在step>70后质量下降,表明压缩 frontier 具任务依赖性
  • 未与prompt-only基线在DeepPlanning上对比,训练贡献需进一步隔离验证

适合沉淀的概念

on-policy-self-distillation, reverse-kl-divergence, periodic-teacher-update, difficulty-adaptive-compression, implicit-reward, compounding-error-reduction, reasoning-compression, instruction-following

阅读注意

  • 重点关注3.2节反向KL的理论优势:相比forward KL,其梯度加权方式天然抵抗周期性刷新带来的分布偏移
  • 图9和图10展示forward KL的锯齿形崩溃现象,是理解CRISP稳定性的关键证据
  • 附录A.4节的Proposition 2形式化证明了压缩信号与问题难度的负相关关系
  • 表3中DeepSeek模型压缩量较低的原因分析(基础trace更短+指令响应弱)对跨模型应用有指导意义
  • 图12的定性案例清晰展示冗余类型:推理内重复(self-doubt)与推理-答案间重复(formatted solution)

质量说明

  • 采用来源:cleanpapers/2026/03/2603.05433.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含理论证明、消融实验、跨模型/任务验证及详细实现细节。所有关键结论均有数据或定理支撑,无推测性断言。