---
title: "Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision"
title_zh: "Self-Distillation Zero：自修正将二元奖励转化为密集监督"
arxiv_id: "2604.12002"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.12002.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Self-Distillation Zero：自修正将二元奖励转化为密集监督

## 一句话定位

提出 SD-Zero 方法，通过两阶段自修正训练（SRT）和自蒸馏，将模型自身生成的二元奖励转化为 token 级密集监督，无需外部教师或高质量演示即可显著提升推理性能。

## 小学生也能听懂

这篇论文教AI像学生改作业一样，先自己答对错，再找出错在哪儿并改好，然后记住改法，反复练习，不用老师帮忙就能越做越好，答题更快更准。

## 为什么值得记录

- 在仅使用二元奖励（如答案正确性）的设定下，实现了比 RL（如 GRPO）和现有自蒸馏方法（如 SDFT）更高的训练样本效率和最终性能。
- 揭示了模型具备‘token 级自我定位’能力：修订器能基于奖励精准识别需修正的 token，提供局部化反馈。
- 提出‘迭代自进化’机制：通过定期同步教师模型，使模型持续自我改进，突破固定教师的性能瓶颈。
- 在 Qwen3-4B 和 Olmo-3-7B 上，平均性能提升超 10%，且推理时生成长度减少约 2 倍，兼顾效果与效率。

## 核心方法

- SD-Zero 分两个阶段：第一阶段为自修正训练（SRT），第二阶段为自蒸馏。
- SRT 阶段：模型首先生成初始响应，然后根据二元奖励（正确/错误）被提示进行自我修正或重述，仅保留成功修正的轨迹用于训练；训练目标包含修正损失和生成损失，以同时提升修正能力和生成能力。
- 自蒸馏阶段：以 SRT 模型为冻结教师，当前模型为学生；学生生成响应后，教师基于该响应及其奖励生成 token 级分布，学生通过 KL 散度损失学习匹配该分布，从而将修正行为内化。
- 采用 on-policy 方式，训练数据来自模型自身生成，无需外部数据。
- 支持迭代训练：每轮自蒸馏后，将学生模型同步为新教师，开启下一轮，实现持续性能增益。

## 关键结果

- 在 Qwen3-4B-Instruct 上，SD-Zero 平均准确率比基线提升 10.5%（从 49.8% 到 60.3%）；在 Olmo-3-7B-Instruct 上提升 10.4%（从 41.1% 到 51.5%）。
- SRT 阶段（6K 样本）已显著优于 RFT、GRPO 等基线；自蒸馏阶段进一步带来 2.7%（Qwen）和 1.2%（Olmo）的增益。
- 自蒸馏使响应长度减少约 2 倍，显著提升推理效率。
- 迭代自进化：教师同步后，第二轮自蒸馏可再获至少 3% 的性能提升。
- 修订器展现出 token 级自我定位能力：对错误响应的 KL 奖励集中在少数关键 token 上，指导精准修正。

## 局限与风险

- 依赖可验证的二元奖励信号，目前不适用于无明确对错判断的任务。
- SRT 阶段需采样多个响应以构造成功修正轨迹，存在一定计算开销，尽管自蒸馏阶段样本效率更高。
- 实验主要在数学和代码推理任务上验证，泛化至其他领域需进一步研究。

## 适合沉淀的概念

`self-distillation-zero`, `self-revision-training`, `outcome-conditioned-self-revision`, `on-policy-self-distillation`, `token-level-self-localization`, `iterative-self-evolution`, `teacher-synchronization`, `dense-supervision-from-binary-rewards`

## 阅读注意

- 重点关注 SRT 阶段的双损失设计（修正损失 + 生成损失）如何互补地提升模型能力。
- 理解自蒸馏如何将显式的、冗长的自我修正行为内化为简洁、主动的生成策略。
- 注意实验中对训练预算（采样 token 数 vs. 训练 token 数）的归一化处理，确保方法比较的公平性。
- 附录 G 提供了关于训练数据来源和正确性过滤重要性的有力佐证，值得细读。

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.12002.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了详尽的方法描述、充分的实验对比（包括多个基线和消融实验）、深入的行为分析以及附录中的额外验证，材料完整，结论可靠。
