Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision
论文导读
提出 SD-Zero 方法,通过两阶段自修正训练(SRT)和自蒸馏,将模型自身生成的二元奖励转化为 token 级密集监督,无需外部教师或高质量演示即可显著提升推理性能。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Self-Distillation Zero:自修正将二元奖励转化为密集监督
一句话定位
提出 SD-Zero 方法,通过两阶段自修正训练(SRT)和自蒸馏,将模型自身生成的二元奖励转化为 token 级密集监督,无需外部教师或高质量演示即可显著提升推理性能。
小学生也能听懂
这篇论文教AI像学生改作业一样,先自己答对错,再找出错在哪儿并改好,然后记住改法,反复练习,不用老师帮忙就能越做越好,答题更快更准。
为什么值得记录
- 在仅使用二元奖励(如答案正确性)的设定下,实现了比 RL(如 GRPO)和现有自蒸馏方法(如 SDFT)更高的训练样本效率和最终性能。
- 揭示了模型具备‘token 级自我定位’能力:修订器能基于奖励精准识别需修正的 token,提供局部化反馈。
- 提出‘迭代自进化’机制:通过定期同步教师模型,使模型持续自我改进,突破固定教师的性能瓶颈。
- 在 Qwen3-4B 和 Olmo-3-7B 上,平均性能提升超 10%,且推理时生成长度减少约 2 倍,兼顾效果与效率。
核心方法
- SD-Zero 分两个阶段:第一阶段为自修正训练(SRT),第二阶段为自蒸馏。
- SRT 阶段:模型首先生成初始响应,然后根据二元奖励(正确/错误)被提示进行自我修正或重述,仅保留成功修正的轨迹用于训练;训练目标包含修正损失和生成损失,以同时提升修正能力和生成能力。
- 自蒸馏阶段:以 SRT 模型为冻结教师,当前模型为学生;学生生成响应后,教师基于该响应及其奖励生成 token 级分布,学生通过 KL 散度损失学习匹配该分布,从而将修正行为内化。
- 采用 on-policy 方式,训练数据来自模型自身生成,无需外部数据。
- 支持迭代训练:每轮自蒸馏后,将学生模型同步为新教师,开启下一轮,实现持续性能增益。
关键结果
- 在 Qwen3-4B-Instruct 上,SD-Zero 平均准确率比基线提升 10.5%(从 49.8% 到 60.3%);在 Olmo-3-7B-Instruct 上提升 10.4%(从 41.1% 到 51.5%)。
- SRT 阶段(6K 样本)已显著优于 RFT、GRPO 等基线;自蒸馏阶段进一步带来 2.7%(Qwen)和 1.2%(Olmo)的增益。
- 自蒸馏使响应长度减少约 2 倍,显著提升推理效率。
- 迭代自进化:教师同步后,第二轮自蒸馏可再获至少 3% 的性能提升。
- 修订器展现出 token 级自我定位能力:对错误响应的 KL 奖励集中在少数关键 token 上,指导精准修正。
局限与风险
- 依赖可验证的二元奖励信号,目前不适用于无明确对错判断的任务。
- SRT 阶段需采样多个响应以构造成功修正轨迹,存在一定计算开销,尽管自蒸馏阶段样本效率更高。
- 实验主要在数学和代码推理任务上验证,泛化至其他领域需进一步研究。
适合沉淀的概念
self-distillation-zero, self-revision-training, outcome-conditioned-self-revision, on-policy-self-distillation, token-level-self-localization, iterative-self-evolution, teacher-synchronization, dense-supervision-from-binary-rewards
阅读注意
- 重点关注 SRT 阶段的双损失设计(修正损失 + 生成损失)如何互补地提升模型能力。
- 理解自蒸馏如何将显式的、冗长的自我修正行为内化为简洁、主动的生成策略。
- 注意实验中对训练预算(采样 token 数 vs. 训练 token 数)的归一化处理,确保方法比较的公平性。
- 附录 G 提供了关于训练数据来源和正确性过滤重要性的有力佐证,值得细读。
质量说明
- 采用来源:
clean,papers/2026/04/2604.12002.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了详尽的方法描述、充分的实验对比(包括多个基线和消融实验)、深入的行为分析以及附录中的额外验证,材料完整,结论可靠。