---
title: "CRISP: Compressed Reasoning via Iterative Self-Policy Distillation"
title_zh: "CRISP：通过迭代自策略蒸馏实现推理压缩"
arxiv_id: "2603.05433"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.05433.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# CRISP：通过迭代自策略蒸馏实现推理压缩

## 一句话定位

提出CRISP方法，利用模型自身在“简洁指令”下的行为作为教师信号，通过反向KL散度的迭代自蒸馏实现推理压缩，无需真实答案或难度估计，在保持准确率的同时显著减少token使用。

## 小学生也能听懂

这篇论文发明了一种叫CRISP的方法，让AI模型像学生一样，通过不断模仿自己“简洁回答”的样子来学习，从而在解数学题时用更少的字说清答案，还能答得更准，就像把长篇作文改成精炼的要点却不丢分。

## 为什么值得记录

- 首次实现无需ground-truth答案的推理压缩，突破RL方法依赖奖励信号的局限
- 提出周期性教师更新机制，解决传统冻结教师无法持续压缩的问题
- 理论证明压缩可降低错误累积（Proposition 4），为‘少即是多’现象提供解释
- 在Qwen3-8B/14B上实现57-59% token压缩同时提升MATH-500准确率9-16点
- 跨模型族（DeepSeek-R1-Distill-Llama-8B）和跨任务（数学→代理规划）验证泛化能力

## 核心方法

- 定义学生模型πθ(·|x)和教师模型πθ(·|x,c)，后者接收简洁指令c（如'Solve concisely'）
- 采用反向KL散度作为损失函数：L(θ)=E[∑D_KL(πθ(·|x,y<t) || π̄θ(·|x,c,y<t))]，确保更新仅作用于学生当前生成区域
- 设计周期性教师更新策略：每M=50步将学生权重θ同步至教师权重θ̄，形成渐进式压缩目标
- 训练流程：单轮epoch、batch size=32、lr=1e-6，基于DAPO-Math-17k数据生成学生rollout
- 隐式奖励机制：r(yt,x)=logπ̄θ(yt|x,c,y<t)−logπθ(yt|x,y<t)，自动抑制冗余token
- 难度自适应：易题因教师trace更短产生强KL信号，难题因需充分推理信号较弱（Proposition 2）

## 关键结果

- Qwen3-8B在MATH-500上token减少58.8%（4661→1921），准确率提升8.9点（77.7%→86.6%）
- Qwen3-14B在AIME 2024上token减少41.0%（12844→7577），准确率提升10.5点（65.8%→76.3%）
- 压缩量自然适配难度：MATH-500（易）压缩57-59%，AIME（难）压缩35-41%，验证难度自适应性
- 熵稳定性：全程保持per-token熵稳定（图8），避免RL方法常见的探索能力崩溃
- 跨模型验证：DeepSeek-R1-Distill-Llama-8B在MATH-500上实现32.2%压缩且准确率提升1.4点
- 跨任务迁移：在DeepPlanning代理任务中减少42-51% token，规划质量保持稳定

## 局限与风险

- 依赖模型对简洁指令的理解能力，小模型可能响应不佳（见6.1节）
- 教师质量依赖基础模型的指令跟随能力，Llama架构响应弱于Qwen导致压缩量较低
- 过度压缩风险：购物规划任务在step>70后质量下降，表明压缩 frontier 具任务依赖性
- 未与prompt-only基线在DeepPlanning上对比，训练贡献需进一步隔离验证

## 适合沉淀的概念

`on-policy-self-distillation`, `reverse-kl-divergence`, `periodic-teacher-update`, `difficulty-adaptive-compression`, `implicit-reward`, `compounding-error-reduction`, `reasoning-compression`, `instruction-following`

## 阅读注意

- 重点关注3.2节反向KL的理论优势：相比forward KL，其梯度加权方式天然抵抗周期性刷新带来的分布偏移
- 图9和图10展示forward KL的锯齿形崩溃现象，是理解CRISP稳定性的关键证据
- 附录A.4节的Proposition 2形式化证明了压缩信号与问题难度的负相关关系
- 表3中DeepSeek模型压缩量较低的原因分析（基础trace更短+指令响应弱）对跨模型应用有指导意义
- 图12的定性案例清晰展示冗余类型：推理内重复（self-doubt）与推理-答案间重复（formatted solution）

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.05433.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含理论证明、消融实验、跨模型/任务验证及详细实现细节。所有关键结论均有数据或定理支撑，无推测性断言。
