论文
arXiv2602.22495
时间2026-02
来源https://arxiv.org/html/2602.22495
页面质量中文卡片
阅读量级82 分钟

RLAD RL-aware Distillation

论文导读

提出 RLAD 框架,通过信任区域比率蒸馏(TRRD)将教师策略融入 GRPO 的重要性采样比中,实现基于优势信号的选择性模仿,提升小模型在逻辑与数学推理任务上的表现。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

RLAD:面向强化学习推理的感知蒸馏方法

一句话定位

提出 RLAD 框架,通过信任区域比率蒸馏(TRRD)将教师策略融入 GRPO 的重要性采样比中,实现基于优势信号的选择性模仿,提升小模型在逻辑与数学推理任务上的表现。

小学生也能听懂

这篇论文教小模型像大模型一样聪明地做题:它让大模型当“老师”,小模型当“学生”,但只在学生做得对且老师可信时才模仿,就像只抄好答案,不抄错题,这样小模型在数学和逻辑题上进步更快、更稳。

为什么值得记录

  • 传统知识蒸馏方法(如 KDRL)在 RL 训练中使用固定 KL 正则项,易与奖励最大化目标冲突,导致训练不稳定或性能下降。
  • RLAD 引入 TRRD 机制,将教师策略作为信任区域锚点之一,仅在优势为正且教师行为可信时促进模仿,实现探索、利用与模仿的动态平衡。
  • 在逻辑推理(K&K Logistics)和长上下文数学推理(AIME/AMC/MATH)任务上,RLAD 在 0.5B–7B 学生模型上均显著优于 GRPO、KDRL 和离线蒸馏,尤其在困难子集上提升明显。
  • 训练过程更稳定,对混合系数 α 不敏感(α=0.5 时效果最佳),且无需精细调参即可实现高效蒸馏。

核心方法

  • 提出 RL-aware Distillation (RLAD) 框架,核心是 Trust Region Ratio Distillation (TRRD) 方法。
  • TRRD 将教师策略 π_T 与学生旧策略 π_S,old 混合为锚点分布 r_π_mix = (π_S,old)^α * (π_T)^(1−α),替代 GRPO 中的单一旧策略锚点。
  • 定义新的重要性采样比 r_TRRD = (π_S / π_S,old)^α * (π_S / π_T)^(1−α),并将其代入 GRPO 的裁剪目标函数中。
  • 通过 PPO/GRPO 风格的裁剪机制限制 r_TRRD ∈ [1−ε, 1+ε],从而约束学生策略相对于混合锚点的变化幅度,形成信任区域。
  • 优势信号 Â 直接加权 TRRD 比率,使教师指导仅在当前 rollout 具有正优势时生效,实现选择性模仿。
  • 隐式优化一个加权 KL 目标:α·KL(π_S || π_S,old) + (1−α)·KL(π_S || π_T),但受优势调制而非固定惩罚。
  • 当 α→0 时,TRRD 趋近于以教师为参考策略的 DPO 风格优化;当 α=1 时退化为标准 GRPO。

关键结果

  • 在 K&K Logistics 逻辑推理任务上,Qwen3-0.6B 使用 RLAD 后,8K 上下文平均准确率从 GRPO 的 0.76 提升至 0.94;Qwen3-1.7B 从 0.95 提升至 0.99。
  • 在 2K 上下文设置下,Qwen3-0.6B 的平均准确率从 0.70 提升至 0.90,Qwen3-1.7B 从 0.86 提升至 0.93,表明 RLAD 在资源受限场景下仍有效。
  • 在长上下文数学推理(30K)中,Qwen3-1.7B-Base 使用 RLAD 后平均性能(5 测试集 × 9 指标)比 GRPO 高 +2.5;Qwen3-8B-Base 高 +5.5。
  • 在 8K 响应预算下,RLAD 相比 GRPO 分别提升 Qwen3-1.7B 和 Qwen3-8B 后训练模型平均性能 +6.6 和 +2.6。
  • 在 AIME24/25 等难题上 Pass@32 提升显著,而 MATH500 等简单任务提升较小,说明性能增益集中于高难度样本。
  • 相比 KDRL,RLAD 在 Pass@1 上提升更大,训练曲线更稳定,振荡更少,表明其更好地平衡了模仿与强化学习。

局限与风险

  • TRRD 依赖教师模型在推理时提供 token-level 概率,增加了在线计算开销,可能影响训练效率。
  • 尽管对 α 不敏感,但极端值(如 α=0 或 1)仍会导致性能下降,需避免完全依赖教师或完全忽略教师。
  • 当前实验基于 Qwen3 系列模型,未验证跨架构(如从 LLaMA 到 Qwen)蒸馏的有效性。
  • 未探讨不同奖励函数设计对 TRRD 效果的影响,假设奖励信号可靠且已归一化。

适合沉淀的概念

rl-aware-distillation, trust-region-ratio-distillation, selective-imitation, grpo, knowledge-distillation, reinforcement-learning-for-llms, ppo-clipping, advantage-weighted-update

阅读注意

  • 重点关注 TRRD 如何重构重要性采样比,以及优势信号如何调制教师影响(Section 4.1)。
  • 对比 RLAD 与 KDRL 在训练稳定性与 Pass@1/Pass@32 增益模式上的差异(Section 5.2.2)。
  • 注意附录 C 中 TRRD 与 DPO 的理论联系,理解其作为 GRPO-DPO 插值的意义。
  • 查看附录 A 的 α 消融实验,了解参数鲁棒性。
  • 关注实验设置中的上下文长度(2K/8K/30K)对结果的影响,反映方法在不同推理长度下的适应性。

质量说明

  • 采用来源:rawraw/papers/2026/02/2602.22495.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的理论推导、多任务实验结果、消融分析和稳定性讨论,数据充分,方法清晰,结论可信。