---
title: "Scaling Reasoning Efficiently via Relaxed On-Policy Distillation"
title_zh: "通过松弛同策略蒸馏高效扩展推理能力"
arxiv_id: "2603.11137"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.11137.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 通过松弛同策略蒸馏高效扩展推理能力

## 一句话定位

提出 Reopold 框架，通过奖励裁剪、熵引导采样和多阶段训练，稳定同策略蒸馏并提升小模型推理效率。

## 小学生也能听懂

这篇论文像教小徒弟学解题：大老师教小徒弟时，用奖励裁剪稳住学习节奏，挑难题重点练，分两步学，让小徒弟又快又好，甚至超过大老师还更省时间。

## 为什么值得记录

- 同策略蒸馏是迁移大模型推理能力至小模型的关键技术，但存在训练不稳定和负迁移问题。
- Reopold 首次将蒸馏与强化学习理论统一，识别出重尾负奖励和信号稀疏性为根本瓶颈。
- 在数学、视觉和工具使用任务上，Reopold 实现 6.7~12 倍训练样本效率提升，7B 学生模型匹配 32B 教师性能且推理快 3.32 倍。

## 核心方法

- 理论分析：证明带 stop-gradient 的同策略蒸馏等价于策略梯度，将教师-学生对数似然比视为固定奖励信号。
- 奖励裁剪：基于混合分布理论推导下界 \(\frac{\log\lambda}{1-\lambda}\)，截断重尾负奖励，防止梯度爆炸。
- 熵引导采样：仅在高熵 token 上计算梯度，过滤低信息量区域，提升信号密度和样本效率。
- 两阶段训练：探索阶段屏蔽强负奖励以维持多样性；精炼阶段启用熵采样以聚焦关键分歧点。

## 关键结果

- 数学推理：在 AIME、MATH-500 等基准上，Reopold 比 RKL 平均提升 4.96%，训练步数减少至 1/6.7。
- 视觉推理：Qwen2.5-VL-3B 经 Reopold 蒸馏后，在 Geo3K、MathVerse 等任务上平均准确率达 52.18%，优于 RKL 4.27%。
- 测试时扩展：7B 学生模型在 Geometry3K 上 Pass@64 超越 32B 教师，延迟降低 3.32 倍。
- 鲁棒性：在不同教师模型（7B/32B）下表现一致，而 RKL 在 7B 教师上几乎无提升。

## 局限与风险

- 仍需依赖高质量教师模型生成监督信号，未解决教师偏差问题。
- 多阶段切换阈值 \(T_{\text{switch}}\) 目前设为总步数 1/3，缺乏自适应机制。
- 实验未涵盖代码生成等长序列推理任务，泛化性待验证。

## 适合沉淀的概念

`on-policy-distillation`, `reward-clipping`, `entropy-guided-sampling`, `exploration-to-refinement`, `policy-gradient-equivalence`, `test-time-scaling`, `compact-reasoning-models`

## 阅读注意

- 重点理解 Section 3.1 中 stop-gradient 如何作为控制变量降低方差。
- Figure 4 展示的重尾负奖励分布是理解裁剪必要性的关键。
- Table 1 和 2 显示 Reopold 在跨模型尺寸和任务上的稳定增益。
- Appendix A.2 提供了裁剪阈值的理论推导，区别于传统 PPO 的 \(\rho(\theta)\) 裁剪。

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.11137.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，理论推导清晰，实验覆盖数学、视觉、工具使用三类推理任务，数据充分，消融分析到位。
