概念
distillation on-policy rl fine-tuning
创建2026-04-26
更新2026-04-26
阅读量级1 分钟
概念导读

通过自修订(self-revision)机制将 binary rewards 转化为 dense supervision,提供对比 RLVR 与 self-distillation 的视角。

  1. 定义
  2. 核心方法
  3. 自修订机制
  4. RLVR vs Self-Distillation 对比
  5. 零外部依赖
  6. 实验结果
  7. 开放问题
  8. Related

Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision

通过自修订(self-revision)机制将 binary rewards 转化为 dense supervision,提供对比 RLVR 与 self-distillation 的视角。

定义

Self-Distillation Zero 提出利用模型的自修订能力将稀疏的 binary reward 信号转化为密集的 token 级监督,无需外部 teacher 即可实现类似 OPD 的密集学习效果。

核心方法

自修订机制

  • 模型生成初始回答后,对自身回答进行修订(self-revision)
  • 修订过程产生 intermediate steps,为每个 token 提供学习信号
  • Binary reward(正确/错误)通过修订轨迹被分解为 dense supervision

RLVR vs Self-Distillation 对比

  • RLVR:sparse binary rewards,仅知道最终答案对错
  • Self-Distillation:dense signals,修订过程提供中间步骤的监督
  • 核心差异:signal granularity(信号粒度)

零外部依赖

实验结果

  • Self-revision 在推理任务上产生比 binary-only 更丰富的 learning signal
  • 在不需要外部 teacher 的情况下接近 OPD 的效果
  • 验证了 self-revision 作为 dense signal 来源的有效性

开放问题

  • 自修订的可靠性如何保证(模型能否正确识别自己的错误)?
  • 与外部 teacher 提供的信号相比,质量差距有多大?
  • 在不同领域(数学、代码、开放生成)上的泛化性?