---
title: "PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning"
title_zh: "PerlAD：基于伪模拟强化学习的闭环端到端自动驾驶"
arxiv_id: "2603.14908"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.14908.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# PerlAD：基于伪模拟强化学习的闭环端到端自动驾驶

## 一句话定位

提出 PerlAD 方法，利用离线数据集构建向量空间伪模拟环境，结合预测世界模型与分层解耦规划器，实现高效、渲染无关的闭环端到端自动驾驶强化学习训练。

## 小学生也能听懂

这篇论文发明了一种叫PerlAD的新方法，让自动驾驶汽车像玩游戏一样在“假想世界”里练习开车，不用真车冒险，也不用花大钱渲染画面，就能学会安全又聪明地规划路线和速度，成绩比以前的办法好很多。

## 为什么值得记录

- 解决了传统模仿学习（IL）在闭环执行中因目标不一致导致的安全风险问题
- 克服了现有基于渲染的强化学习（RL）方法存在的输入域差距和高计算成本瓶颈
- 通过伪模拟环境实现无需在线交互的高效试错训练，显著提升训练效率
- 在 Bench2Drive 基准上取得 SOTA 性能，驾驶得分超越此前最优 E2E RL 方法 10.29%
- 在安全关键遮挡场景 DOS 基准上验证了模型可靠性

## 核心方法

- 构建基于离线数据集的向量空间伪模拟环境，避免渲染过程，消除输入域差距
- 引入预测世界模型（PWM），以自车规划为条件生成周围智能体的反应式轨迹预测
- 采用分层解耦规划器（DeP）：横向路径由 IL 监督生成，纵向速度由 RL 优化
- 设计两阶段训练策略：第一阶段训练稀疏感知模块，第二阶段联合优化 Transformer 块、DeP 和 PWM
- 使用 REINFORCE 算法配合组标准化优势估计进行纵向 RL 训练
- 实施横向-纵向对齐策略：后期将纵向规划输入切换为预测路径，并融合奖励信号调整路径选择
- 渐进式引入反应式模拟：训练后期用 PWM 预测替代真实轨迹，提供一致闭环奖励信号

## 关键结果

- 在 Bench2Drive 基准上达到 78.70 的驾驶得分（DS）和 57.27% 的成功率（SR），均为当前最优
- 相比 IL 基线 SparseDrive，DS 提升 76.7%（+34.16），SR 提升 40.56%
- 相比此前唯一 E2E RL 方法 Raw2Drive，DS 提升 10.29%，且无需昂贵在线探索
- 在 DOS 基准上表现出强安全性能，有效处理遮挡场景
- 消融实验显示：RL 纵向训练、横向-纵向对齐和反应式模拟分别贡献显著性能增益
- PWM 显著降低反事实碰撞数（从 166 降至 70），验证其反应式建模能力

## 局限与风险

- 依赖离线数据集质量，对未覆盖场景泛化能力有限
- 当前奖励函数仍包含基于距离的辅助项，未完全实现纯规则驱动
- 解耦规划在低速城市场景有效，但在高速或复杂耦合场景下可能受限
- 伪模拟中智能体行为仍基于预测而非真实交互动力学，存在建模偏差

## 适合沉淀的概念

`pseudo-simulation`, `prediction-world-model`, `decoupled-planner`, `reinforcement-learning-autonomous-driving`, `closed-loop-end-to-end-driving`, `reactive-agent-simulation`, `hierarchical-planning`, `offline-rl-for-ad`

## 阅读注意

- 重点关注伪模拟环境如何在不渲染的情况下模拟交互与奖励计算
- 理解 PWM 如何以自车轨迹为条件生成反应式预测，区别于传统非反应式预测模型
- 注意解耦规划中 IL 与 RL 的分工机制及二者对齐策略的具体实现
- 分析奖励函数四部分（碰撞、车道保持、进度、距离）各自的作用与协同效果
- 评估反事实实验设计如何验证模型对交互行为的建模能力

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.14908.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、定量结果与消融分析，数据充分支持结论。
