OPSDC On-Policy Self-Distillation Reasoning Compression
论文导读
提出CRISP方法,利用模型自身在“简洁指令”下的行为作为教师信号,通过反向KL散度的迭代自蒸馏实现推理压缩,无需真实答案或难度估计,在保持准确率的同时显著减少token使用。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
CRISP:通过迭代自策略蒸馏实现推理压缩
一句话定位
提出CRISP方法,利用模型自身在“简洁指令”下的行为作为教师信号,通过反向KL散度的迭代自蒸馏实现推理压缩,无需真实答案或难度估计,在保持准确率的同时显著减少token使用。
小学生也能听懂
这篇论文发明了一种叫CRISP的方法,让AI模型像学生一样,通过不断模仿自己“简洁回答”的样子来学习,从而在解数学题时用更少的字说清答案,还能答得更准,就像把长篇作文改成精炼的要点却不丢分。
为什么值得记录
- 首次实现无需ground-truth答案的推理压缩,突破RL方法依赖奖励信号的局限
- 提出周期性教师更新机制,解决传统冻结教师无法持续压缩的问题
- 理论证明压缩可降低错误累积(Proposition 4),为‘少即是多’现象提供解释
- 在Qwen3-8B/14B上实现57-59% token压缩同时提升MATH-500准确率9-16点
- 跨模型族(DeepSeek-R1-Distill-Llama-8B)和跨任务(数学→代理规划)验证泛化能力
核心方法
- 定义学生模型πθ(·|x)和教师模型πθ(·|x,c),后者接收简洁指令c(如'Solve concisely')
- 采用反向KL散度作为损失函数:L(θ)=E[∑D_KL(πθ(·|x,y<t) || π̄θ(·|x,c,y<t))],确保更新仅作用于学生当前生成区域
- 设计周期性教师更新策略:每M=50步将学生权重θ同步至教师权重θ̄,形成渐进式压缩目标
- 训练流程:单轮epoch、batch size=32、lr=1e-6,基于DAPO-Math-17k数据生成学生rollout
- 隐式奖励机制:r(yt,x)=logπ̄θ(yt|x,c,y<t)−logπθ(yt|x,y<t),自动抑制冗余token
- 难度自适应:易题因教师trace更短产生强KL信号,难题因需充分推理信号较弱(Proposition 2)
关键结果
- Qwen3-8B在MATH-500上token减少58.8%(4661→1921),准确率提升8.9点(77.7%→86.6%)
- Qwen3-14B在AIME 2024上token减少41.0%(12844→7577),准确率提升10.5点(65.8%→76.3%)
- 压缩量自然适配难度:MATH-500(易)压缩57-59%,AIME(难)压缩35-41%,验证难度自适应性
- 熵稳定性:全程保持per-token熵稳定(图8),避免RL方法常见的探索能力崩溃
- 跨模型验证:DeepSeek-R1-Distill-Llama-8B在MATH-500上实现32.2%压缩且准确率提升1.4点
- 跨任务迁移:在DeepPlanning代理任务中减少42-51% token,规划质量保持稳定
局限与风险
- 依赖模型对简洁指令的理解能力,小模型可能响应不佳(见6.1节)
- 教师质量依赖基础模型的指令跟随能力,Llama架构响应弱于Qwen导致压缩量较低
- 过度压缩风险:购物规划任务在step>70后质量下降,表明压缩 frontier 具任务依赖性
- 未与prompt-only基线在DeepPlanning上对比,训练贡献需进一步隔离验证
适合沉淀的概念
on-policy-self-distillation, reverse-kl-divergence, periodic-teacher-update, difficulty-adaptive-compression, implicit-reward, compounding-error-reduction, reasoning-compression, instruction-following
阅读注意
- 重点关注3.2节反向KL的理论优势:相比forward KL,其梯度加权方式天然抵抗周期性刷新带来的分布偏移
- 图9和图10展示forward KL的锯齿形崩溃现象,是理解CRISP稳定性的关键证据
- 附录A.4节的Proposition 2形式化证明了压缩信号与问题难度的负相关关系
- 表3中DeepSeek模型压缩量较低的原因分析(基础trace更短+指令响应弱)对跨模型应用有指导意义
- 图12的定性案例清晰展示冗余类型:推理内重复(self-doubt)与推理-答案间重复(formatted solution)
质量说明
- 采用来源:
clean,papers/2026/03/2603.05433.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含理论证明、消融实验、跨模型/任务验证及详细实现细节。所有关键结论均有数据或定理支撑,无推测性断言。