Self-Distilled RLVR
论文导读
提出 RLSD 方法,将自蒸馏用于 token 级更新幅度调制,同时保留 RLVR 的环境反馈作为更新方向锚点,解决 OPSD 的信息泄露与训练不稳定问题。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
RLSD:基于自蒸馏的强化学习与可验证奖励融合方法
一句话定位
提出 RLSD 方法,将自蒸馏用于 token 级更新幅度调制,同时保留 RLVR 的环境反馈作为更新方向锚点,解决 OPSD 的信息泄露与训练不稳定问题。
小学生也能听懂
这篇论文发明了一种叫RLSD的新方法,就像让AI做题时既听老师提示又自己思考,用“自我教学”调整每一步的改进力度,同时靠环境反馈稳住方向,解决了旧方法会偷看答案和训练不稳的问题,让AI学得更快更准。
为什么值得记录
- 揭示了 OPSD 失败的根本原因:信息不对称导致不可消除的互信息间隙,引发梯度偏差和特权信息泄露
- 提出 RLSD 新范式,首次实现同时具备 on-policy 训练、高 token 效率、丰富信号和环境锚定优化的统一框架
- 在五个多模态推理基准上平均准确率提升 4.69%,且训练稳定性优于 GRPO 和 OPSD
- 无需额外模型或辅助损失,仅需一次额外前向传播,计算开销可忽略
核心方法
- 将自蒸馏从分布匹配目标重构为信用分配信号:教师模型提供 token 级证据比 PT(yt)/PS(yt),学生模型仅用于采样轨迹
- 设计方向感知的证据重加权机制:wt = (PT(yt)/PS(yt))^sign(A),正奖励时放大教师支持 token 的信用,负奖励时放大教师反对 token 的责任
- 引入 stop-gradient 操作隔离梯度路径,确保特权信息仅影响更新幅度而不污染更新方向
- 采用 clipped credit assignment 限制单 token 最大影响,增强训练稳定性
- 线性调度混合系数 λ,实现从密集信用分配到标准 GRPO 的平滑过渡
关键结果
- 在 Qwen3-VL-8B-Instruct 上,RLSD 在 200 步时性能超过 GRPO 训练 400 步的结果,收敛速度提升 2 倍
- 五个多模态推理基准平均准确率相对基础模型提升 4.69%,且持续改进不退化
- OPSD 在 10–20 步后性能下降,而 RLSD 继承 GRPO 的稳定性并达到更高收敛上限
- KL 散度诊断显示 OPSD 存在不可约间隙,而 RLSD 无此问题
局限与风险
- 依赖环境提供可靠的二元奖励信号,不适用于无明确验证机制的任务
- 教师模型通过上下文条件引入特权信息,若条件化效果不佳(如参考解过长),证据比可能成为噪声
- 目前实验仅验证了多模态推理任务,在其他类型任务上的泛化性待验证
适合沉淀的概念
on-policy-self-distillation, reinforcement-learning-with-verifiable-rewards, privileged-information-leakage, token-level-credit-assignment, evidence-ratio, gradient-direction-anchoring, mutual-information-gap, clipped-surrogate-objective
阅读注意
- 重点关注第 3.2 节的理论分析,特别是 Theorem 1 和 Proposition 1 如何解释 OPSD 的失败机制
- 注意图 3 中 KL 散度停滞与泄露计数上升的对应关系,这是理解问题的关键实证证据
- 第 4.1 节的 Bayesian interpretation(Theorem 4)揭示了证据比的信息论含义,值得深入理解
- 附录 A.6 的 leakage-free guarantee 从梯度结构角度证明了 RLSD 的安全性,是方法鲁棒性的核心
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.03128.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的理论分析、消融实验和多个基准测试结果,方法设计清晰,实验充分,结论可信。