---
title: "Proximal Policy Distillation"
title_zh: "近端策略蒸馏（PPD）：结合PPO与策略蒸馏的新方法"
arxiv_id: "2407.15134"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2024/07/2407.15134.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 近端策略蒸馏（PPD）：结合PPO与策略蒸馏的新方法

## 一句话定位

提出Proximal Policy Distillation（PPD），一种将学生驱动蒸馏与PPO结合的策略蒸馏方法，提升样本效率并增强对 imperfect teachers 的鲁棒性。

## 小学生也能听懂

这篇论文发明了一种叫PPD的新方法，就像让一个学生跟着老师学打游戏，但学生不仅模仿老师，还用PPO技巧反复练习旧关卡，学得更快更稳，即使老师教得不太好，学生也能超过老师。

## 为什么值得记录

- PPD 在 Atari、Mujoco 和 Procgen 等多个 RL 环境中均优于传统蒸馏方法（student-distill 和 teacher-distill）
- 通过引入 PPO 的近端约束和样本重用机制，显著提高蒸馏过程的样本效率
- 在教师策略性能受损（imperfect teachers）时，PPD 仍能生成优于教师的学生策略，表现出更强鲁棒性
- 支持不同架构的学生网络（更小、相同、更大），尤其在大网络下常能超越教师性能
- 开源了 sb3-distill 库，便于复现和扩展策略蒸馏研究

## 核心方法

- 基于 Czarnecki et al. (2019) 的通用蒸馏框架，将控制策略设为 student policy（student-driven）
- 将 PPO 的 surrogate loss 替代原始策略梯度项，实现近端优化
- 引入重要性采样权重 ρ_t(θ) 以支持 rollout buffer 的多轮更新，提升样本效率
- 使用 KL 散度作为蒸馏损失，并对其施加与 PPO 类似的 clipping 约束（max(ρ_t(θ), 1−ε)）
- 总目标函数为：L_PPO − λ·KL(π_teacher || π_θ)·clip(ρ_t(θ), 1−ε)，其中 λ 控制蒸馏强度
- 学生价值函数从头训练，无需蒸馏 critic
- 算法封装为隐式优化问题，通过 mini-batch SGD 迭代求解

## 关键结果

- 在 Atari 上，PPD 在 larger 学生网络上的测试性能达教师的 1.10x，优于 SD (1.09x) 和 TD (1.07x)
- 在 Procgen 上，PPD 在 larger 网络上达到 1.04x 教师性能，显著高于 SD (0.96x) 和 TD (0.91x)
- 面对 corrupted teachers（性能下降至原 34%-65%），PPD 学生仍能达到原教师性能的 64%-71%，远超其他方法
- 训练曲线显示 PPD 收敛更快，尤其在 Atari 和 Procgen 上样本效率更高
- λ 参数分析表明较低 λ（如 0.5）有助于学生最终超越教师，而高 λ 加快初期学习但限制上限

## 局限与风险

- 实验未涵盖部分可观测（partially observable）场景，尽管作者认为 PPD 可适配 LSTM 学生
- 蒸馏过程中未同时迁移教师的价值函数（critic），可能影响某些 actor-critic 方法的连续性训练
- 对 teacher-distill 的评估采用在线方式，未测试离线数据集重放的性能，可能低估其潜力
- imperfect teacher 实验仅覆盖部分环境，泛化性需进一步验证

## 适合沉淀的概念

`proximal-policy-distillation`, `policy-distillation`, `student-driven-distillation`, `ppo-with-distillation`, `imperfect-teacher-robustness`, `sample-efficiency-in-rl`, `knowledge-distillation-for-rl`, `sb3-distill-library`

## 阅读注意

- 注意区分 student-distill 与 teacher-distill 在训练曲线上的误导性表现：后者在教师轨迹上评估，易高估性能
- PPD 的核心创新在于将 PPO 的 clipping 机制同时应用于策略更新和蒸馏项，而非简单叠加损失
- Table 1 和 Table 2 是关键结果，建议结合置信区间解读性能差异
- Appendix B.4 显示 PPD 明显优于纯 PPO 训练，证明蒸馏项的有效性
- Procgen 的 train/test level 性能差异（Table 8）揭示了泛化能力的重要性

## 质量说明

- 采用来源：`clean`，`papers/2024/07/2407.15134.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，实验设计充分，涵盖多种环境、网络规模和鲁棒性测试，数据详实，结论有支撑。
