论文
arXiv2604.03128
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级141 分钟

Self-Distilled RLVR

论文导读

提出 RLSD 方法,将自蒸馏用于 token 级更新幅度调制,同时保留 RLVR 的环境反馈作为更新方向锚点,解决 OPSD 的信息泄露与训练不稳定问题。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

RLSD:基于自蒸馏的强化学习与可验证奖励融合方法

一句话定位

提出 RLSD 方法,将自蒸馏用于 token 级更新幅度调制,同时保留 RLVR 的环境反馈作为更新方向锚点,解决 OPSD 的信息泄露与训练不稳定问题。

小学生也能听懂

这篇论文发明了一种叫RLSD的新方法,就像让AI做题时既听老师提示又自己思考,用“自我教学”调整每一步的改进力度,同时靠环境反馈稳住方向,解决了旧方法会偷看答案和训练不稳的问题,让AI学得更快更准。

为什么值得记录

  • 揭示了 OPSD 失败的根本原因:信息不对称导致不可消除的互信息间隙,引发梯度偏差和特权信息泄露
  • 提出 RLSD 新范式,首次实现同时具备 on-policy 训练、高 token 效率、丰富信号和环境锚定优化的统一框架
  • 在五个多模态推理基准上平均准确率提升 4.69%,且训练稳定性优于 GRPO 和 OPSD
  • 无需额外模型或辅助损失,仅需一次额外前向传播,计算开销可忽略

核心方法

  • 将自蒸馏从分布匹配目标重构为信用分配信号:教师模型提供 token 级证据比 PT(yt)/PS(yt),学生模型仅用于采样轨迹
  • 设计方向感知的证据重加权机制:wt = (PT(yt)/PS(yt))^sign(A),正奖励时放大教师支持 token 的信用,负奖励时放大教师反对 token 的责任
  • 引入 stop-gradient 操作隔离梯度路径,确保特权信息仅影响更新幅度而不污染更新方向
  • 采用 clipped credit assignment 限制单 token 最大影响,增强训练稳定性
  • 线性调度混合系数 λ,实现从密集信用分配到标准 GRPO 的平滑过渡

关键结果

  • 在 Qwen3-VL-8B-Instruct 上,RLSD 在 200 步时性能超过 GRPO 训练 400 步的结果,收敛速度提升 2 倍
  • 五个多模态推理基准平均准确率相对基础模型提升 4.69%,且持续改进不退化
  • OPSD 在 10–20 步后性能下降,而 RLSD 继承 GRPO 的稳定性并达到更高收敛上限
  • KL 散度诊断显示 OPSD 存在不可约间隙,而 RLSD 无此问题

局限与风险

  • 依赖环境提供可靠的二元奖励信号,不适用于无明确验证机制的任务
  • 教师模型通过上下文条件引入特权信息,若条件化效果不佳(如参考解过长),证据比可能成为噪声
  • 目前实验仅验证了多模态推理任务,在其他类型任务上的泛化性待验证

适合沉淀的概念

on-policy-self-distillation, reinforcement-learning-with-verifiable-rewards, privileged-information-leakage, token-level-credit-assignment, evidence-ratio, gradient-direction-anchoring, mutual-information-gap, clipped-surrogate-objective

阅读注意

  • 重点关注第 3.2 节的理论分析,特别是 Theorem 1 和 Proposition 1 如何解释 OPSD 的失败机制
  • 注意图 3 中 KL 散度停滞与泄露计数上升的对应关系,这是理解问题的关键实证证据
  • 第 4.1 节的 Bayesian interpretation(Theorem 4)揭示了证据比的信息论含义,值得深入理解
  • 附录 A.6 的 leakage-free guarantee 从梯度结构角度证明了 RLSD 的安全性,是方法鲁棒性的核心

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.03128.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的理论分析、消融实验和多个基准测试结果,方法设计清晰,实验充分,结论可信。