---
title: "Self-Distilled RLVR"
title_zh: "RLSD：基于自蒸馏的强化学习与可验证奖励融合方法"
arxiv_id: "2604.03128"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.03128.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# RLSD：基于自蒸馏的强化学习与可验证奖励融合方法

## 一句话定位

提出 RLSD 方法，将自蒸馏用于 token 级更新幅度调制，同时保留 RLVR 的环境反馈作为更新方向锚点，解决 OPSD 的信息泄露与训练不稳定问题。

## 小学生也能听懂

这篇论文发明了一种叫RLSD的新方法，就像让AI做题时既听老师提示又自己思考，用“自我教学”调整每一步的改进力度，同时靠环境反馈稳住方向，解决了旧方法会偷看答案和训练不稳的问题，让AI学得更快更准。

## 为什么值得记录

- 揭示了 OPSD 失败的根本原因：信息不对称导致不可消除的互信息间隙，引发梯度偏差和特权信息泄露
- 提出 RLSD 新范式，首次实现同时具备 on-policy 训练、高 token 效率、丰富信号和环境锚定优化的统一框架
- 在五个多模态推理基准上平均准确率提升 4.69%，且训练稳定性优于 GRPO 和 OPSD
- 无需额外模型或辅助损失，仅需一次额外前向传播，计算开销可忽略

## 核心方法

- 将自蒸馏从分布匹配目标重构为信用分配信号：教师模型提供 token 级证据比 PT(yt)/PS(yt)，学生模型仅用于采样轨迹
- 设计方向感知的证据重加权机制：wt = (PT(yt)/PS(yt))^sign(A)，正奖励时放大教师支持 token 的信用，负奖励时放大教师反对 token 的责任
- 引入 stop-gradient 操作隔离梯度路径，确保特权信息仅影响更新幅度而不污染更新方向
- 采用 clipped credit assignment 限制单 token 最大影响，增强训练稳定性
- 线性调度混合系数 λ，实现从密集信用分配到标准 GRPO 的平滑过渡

## 关键结果

- 在 Qwen3-VL-8B-Instruct 上，RLSD 在 200 步时性能超过 GRPO 训练 400 步的结果，收敛速度提升 2 倍
- 五个多模态推理基准平均准确率相对基础模型提升 4.69%，且持续改进不退化
- OPSD 在 10–20 步后性能下降，而 RLSD 继承 GRPO 的稳定性并达到更高收敛上限
- KL 散度诊断显示 OPSD 存在不可约间隙，而 RLSD 无此问题

## 局限与风险

- 依赖环境提供可靠的二元奖励信号，不适用于无明确验证机制的任务
- 教师模型通过上下文条件引入特权信息，若条件化效果不佳（如参考解过长），证据比可能成为噪声
- 目前实验仅验证了多模态推理任务，在其他类型任务上的泛化性待验证

## 适合沉淀的概念

`on-policy-self-distillation`, `reinforcement-learning-with-verifiable-rewards`, `privileged-information-leakage`, `token-level-credit-assignment`, `evidence-ratio`, `gradient-direction-anchoring`, `mutual-information-gap`, `clipped-surrogate-objective`

## 阅读注意

- 重点关注第 3.2 节的理论分析，特别是 Theorem 1 和 Proposition 1 如何解释 OPSD 的失败机制
- 注意图 3 中 KL 散度停滞与泄露计数上升的对应关系，这是理解问题的关键实证证据
- 第 4.1 节的 Bayesian interpretation（Theorem 4）揭示了证据比的信息论含义，值得深入理解
- 附录 A.6 的 leakage-free guarantee 从梯度结构角度证明了 RLSD 的安全性，是方法鲁棒性的核心

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.03128.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的理论分析、消融实验和多个基准测试结果，方法设计清晰，实验充分，结论可信。
