---
title: "RLAD RL-aware Distillation"
title_zh: "RLAD：面向强化学习推理的感知蒸馏方法"
arxiv_id: "2602.22495"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/02/2602.22495.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# RLAD：面向强化学习推理的感知蒸馏方法

## 一句话定位

提出 RLAD 框架，通过信任区域比率蒸馏（TRRD）将教师策略融入 GRPO 的重要性采样比中，实现基于优势信号的选择性模仿，提升小模型在逻辑与数学推理任务上的表现。

## 小学生也能听懂

这篇论文教小模型像大模型一样聪明地做题：它让大模型当“老师”，小模型当“学生”，但只在学生做得对且老师可信时才模仿，就像只抄好答案，不抄错题，这样小模型在数学和逻辑题上进步更快、更稳。

## 为什么值得记录

- 传统知识蒸馏方法（如 KDRL）在 RL 训练中使用固定 KL 正则项，易与奖励最大化目标冲突，导致训练不稳定或性能下降。
- RLAD 引入 TRRD 机制，将教师策略作为信任区域锚点之一，仅在优势为正且教师行为可信时促进模仿，实现探索、利用与模仿的动态平衡。
- 在逻辑推理（K&K Logistics）和长上下文数学推理（AIME/AMC/MATH）任务上，RLAD 在 0.5B–7B 学生模型上均显著优于 GRPO、KDRL 和离线蒸馏，尤其在困难子集上提升明显。
- 训练过程更稳定，对混合系数 α 不敏感（α=0.5 时效果最佳），且无需精细调参即可实现高效蒸馏。

## 核心方法

- 提出 RL-aware Distillation (RLAD) 框架，核心是 Trust Region Ratio Distillation (TRRD) 方法。
- TRRD 将教师策略 π_T 与学生旧策略 π_S,old 混合为锚点分布 r_π_mix = (π_S,old)^α * (π_T)^(1−α)，替代 GRPO 中的单一旧策略锚点。
- 定义新的重要性采样比 r_TRRD = (π_S / π_S,old)^α * (π_S / π_T)^(1−α)，并将其代入 GRPO 的裁剪目标函数中。
- 通过 PPO/GRPO 风格的裁剪机制限制 r_TRRD ∈ [1−ε, 1+ε]，从而约束学生策略相对于混合锚点的变化幅度，形成信任区域。
- 优势信号 Â 直接加权 TRRD 比率，使教师指导仅在当前 rollout 具有正优势时生效，实现选择性模仿。
- 隐式优化一个加权 KL 目标：α·KL(π_S || π_S,old) + (1−α)·KL(π_S || π_T)，但受优势调制而非固定惩罚。
- 当 α→0 时，TRRD 趋近于以教师为参考策略的 DPO 风格优化；当 α=1 时退化为标准 GRPO。

## 关键结果

- 在 K&K Logistics 逻辑推理任务上，Qwen3-0.6B 使用 RLAD 后，8K 上下文平均准确率从 GRPO 的 0.76 提升至 0.94；Qwen3-1.7B 从 0.95 提升至 0.99。
- 在 2K 上下文设置下，Qwen3-0.6B 的平均准确率从 0.70 提升至 0.90，Qwen3-1.7B 从 0.86 提升至 0.93，表明 RLAD 在资源受限场景下仍有效。
- 在长上下文数学推理（30K）中，Qwen3-1.7B-Base 使用 RLAD 后平均性能（5 测试集 × 9 指标）比 GRPO 高 +2.5；Qwen3-8B-Base 高 +5.5。
- 在 8K 响应预算下，RLAD 相比 GRPO 分别提升 Qwen3-1.7B 和 Qwen3-8B 后训练模型平均性能 +6.6 和 +2.6。
- 在 AIME24/25 等难题上 Pass@32 提升显著，而 MATH500 等简单任务提升较小，说明性能增益集中于高难度样本。
- 相比 KDRL，RLAD 在 Pass@1 上提升更大，训练曲线更稳定，振荡更少，表明其更好地平衡了模仿与强化学习。

## 局限与风险

- TRRD 依赖教师模型在推理时提供 token-level 概率，增加了在线计算开销，可能影响训练效率。
- 尽管对 α 不敏感，但极端值（如 α=0 或 1）仍会导致性能下降，需避免完全依赖教师或完全忽略教师。
- 当前实验基于 Qwen3 系列模型，未验证跨架构（如从 LLaMA 到 Qwen）蒸馏的有效性。
- 未探讨不同奖励函数设计对 TRRD 效果的影响，假设奖励信号可靠且已归一化。

## 适合沉淀的概念

`rl-aware-distillation`, `trust-region-ratio-distillation`, `selective-imitation`, `grpo`, `knowledge-distillation`, `reinforcement-learning-for-llms`, `ppo-clipping`, `advantage-weighted-update`

## 阅读注意

- 重点关注 TRRD 如何重构重要性采样比，以及优势信号如何调制教师影响（Section 4.1）。
- 对比 RLAD 与 KDRL 在训练稳定性与 Pass@1/Pass@32 增益模式上的差异（Section 5.2.2）。
- 注意附录 C 中 TRRD 与 DPO 的理论联系，理解其作为 GRPO-DPO 插值的意义。
- 查看附录 A 的 α 消融实验，了解参数鲁棒性。
- 关注实验设置中的上下文长度（2K/8K/30K）对结果的影响，反映方法在不同推理长度下的适应性。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/02/2602.22495.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的理论推导、多任务实验结果、消融分析和稳定性讨论，数据充分，方法清晰，结论可信。
