RLAD RL-aware Distillation
论文导读
提出 RLAD 框架,通过信任区域比率蒸馏(TRRD)将教师策略融入 GRPO 的重要性采样比中,实现基于优势信号的选择性模仿,提升小模型在逻辑与数学推理任务上的表现。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
RLAD:面向强化学习推理的感知蒸馏方法
一句话定位
提出 RLAD 框架,通过信任区域比率蒸馏(TRRD)将教师策略融入 GRPO 的重要性采样比中,实现基于优势信号的选择性模仿,提升小模型在逻辑与数学推理任务上的表现。
小学生也能听懂
这篇论文教小模型像大模型一样聪明地做题:它让大模型当“老师”,小模型当“学生”,但只在学生做得对且老师可信时才模仿,就像只抄好答案,不抄错题,这样小模型在数学和逻辑题上进步更快、更稳。
为什么值得记录
- 传统知识蒸馏方法(如 KDRL)在 RL 训练中使用固定 KL 正则项,易与奖励最大化目标冲突,导致训练不稳定或性能下降。
- RLAD 引入 TRRD 机制,将教师策略作为信任区域锚点之一,仅在优势为正且教师行为可信时促进模仿,实现探索、利用与模仿的动态平衡。
- 在逻辑推理(K&K Logistics)和长上下文数学推理(AIME/AMC/MATH)任务上,RLAD 在 0.5B–7B 学生模型上均显著优于 GRPO、KDRL 和离线蒸馏,尤其在困难子集上提升明显。
- 训练过程更稳定,对混合系数 α 不敏感(α=0.5 时效果最佳),且无需精细调参即可实现高效蒸馏。
核心方法
- 提出 RL-aware Distillation (RLAD) 框架,核心是 Trust Region Ratio Distillation (TRRD) 方法。
- TRRD 将教师策略 π_T 与学生旧策略 π_S,old 混合为锚点分布 r_π_mix = (π_S,old)^α * (π_T)^(1−α),替代 GRPO 中的单一旧策略锚点。
- 定义新的重要性采样比 r_TRRD = (π_S / π_S,old)^α * (π_S / π_T)^(1−α),并将其代入 GRPO 的裁剪目标函数中。
- 通过 PPO/GRPO 风格的裁剪机制限制 r_TRRD ∈ [1−ε, 1+ε],从而约束学生策略相对于混合锚点的变化幅度,形成信任区域。
- 优势信号 Â 直接加权 TRRD 比率,使教师指导仅在当前 rollout 具有正优势时生效,实现选择性模仿。
- 隐式优化一个加权 KL 目标:α·KL(π_S || π_S,old) + (1−α)·KL(π_S || π_T),但受优势调制而非固定惩罚。
- 当 α→0 时,TRRD 趋近于以教师为参考策略的 DPO 风格优化;当 α=1 时退化为标准 GRPO。
关键结果
- 在 K&K Logistics 逻辑推理任务上,Qwen3-0.6B 使用 RLAD 后,8K 上下文平均准确率从 GRPO 的 0.76 提升至 0.94;Qwen3-1.7B 从 0.95 提升至 0.99。
- 在 2K 上下文设置下,Qwen3-0.6B 的平均准确率从 0.70 提升至 0.90,Qwen3-1.7B 从 0.86 提升至 0.93,表明 RLAD 在资源受限场景下仍有效。
- 在长上下文数学推理(30K)中,Qwen3-1.7B-Base 使用 RLAD 后平均性能(5 测试集 × 9 指标)比 GRPO 高 +2.5;Qwen3-8B-Base 高 +5.5。
- 在 8K 响应预算下,RLAD 相比 GRPO 分别提升 Qwen3-1.7B 和 Qwen3-8B 后训练模型平均性能 +6.6 和 +2.6。
- 在 AIME24/25 等难题上 Pass@32 提升显著,而 MATH500 等简单任务提升较小,说明性能增益集中于高难度样本。
- 相比 KDRL,RLAD 在 Pass@1 上提升更大,训练曲线更稳定,振荡更少,表明其更好地平衡了模仿与强化学习。
局限与风险
- TRRD 依赖教师模型在推理时提供 token-level 概率,增加了在线计算开销,可能影响训练效率。
- 尽管对 α 不敏感,但极端值(如 α=0 或 1)仍会导致性能下降,需避免完全依赖教师或完全忽略教师。
- 当前实验基于 Qwen3 系列模型,未验证跨架构(如从 LLaMA 到 Qwen)蒸馏的有效性。
- 未探讨不同奖励函数设计对 TRRD 效果的影响,假设奖励信号可靠且已归一化。
适合沉淀的概念
rl-aware-distillation, trust-region-ratio-distillation, selective-imitation, grpo, knowledge-distillation, reinforcement-learning-for-llms, ppo-clipping, advantage-weighted-update
阅读注意
- 重点关注 TRRD 如何重构重要性采样比,以及优势信号如何调制教师影响(Section 4.1)。
- 对比 RLAD 与 KDRL 在训练稳定性与 Pass@1/Pass@32 增益模式上的差异(Section 5.2.2)。
- 注意附录 C 中 TRRD 与 DPO 的理论联系,理解其作为 GRPO-DPO 插值的意义。
- 查看附录 A 的 α 消融实验,了解参数鲁棒性。
- 关注实验设置中的上下文长度(2K/8K/30K)对结果的影响,反映方法在不同推理长度下的适应性。
质量说明
- 采用来源:
raw,raw/papers/2026/02/2602.22495.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的理论推导、多任务实验结果、消融分析和稳定性讨论,数据充分,方法清晰,结论可信。