---
title: "2604.07944"
title_zh: "基于策略蒸馏的语言模型在自动驾驶运动规划中的应用"
arxiv_id: "2604.07944"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.07944.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 基于策略蒸馏的语言模型在自动驾驶运动规划中的应用

## 一句话定位

提出一种基于策略的广义知识蒸馏（GKD）方法，将大型教师语言模型（Qwen3-8B）的运动规划知识压缩至小型学生模型（Qwen3-1.7B），在nuScenes基准上实现接近教师性能且显著优于密集反馈强化学习基线。

## 小学生也能听懂

这篇论文就像让一个很聪明的大哥哥（大模型）教小弟弟（小模型）怎么开车，大哥哥把开车时的想法和路线说出来，小弟弟学着记下来，这样小弟弟也能安全开车，而且更省油（省资源），效果只比大哥哥差一点点。

## 为什么值得记录

- 解决了LLM在车载资源受限系统中部署的核心瓶颈——模型规模与推理开销问题
- 首次在自动驾驶运动规划任务中系统比较了全分布匹配（GKD）与采样token奖励塑形（RL）两种策略，为后续研究提供方法论参考
- 验证了链式思维输出格式（如轨迹+推理）可通过蒸馏有效迁移至小模型，保持可解释性同时提升效率
- 在nuScenes验证集上实现5倍参数量压缩（8B→1.7B）下仅5–6%轨迹精度损失，具备工程落地潜力

## 核心方法

- 采用GPT-Driver框架，将驾驶场景编码为自然语言提示，输出包含‘关键对象’、‘潜在影响’、‘元动作’和‘轨迹坐标’的结构化文本
- 教师模型：对Qwen3-8B在nuScenes-GPT-Driver数据集上进行监督微调（SFT），使用qwen3_nothink模板确保确定性输出
- 学生训练：采用广义知识蒸馏（GKD），学生基于自身生成序列计算与教师token级分布的Jensen-Shannon散度（β=0.5），混合50%真实数据与50%自生成数据
- 基线对比：设计密集反馈强化学习（RL）方法，以教师log-probabilities作为每token优势函数，在策略梯度框架中更新学生参数
- 训练细节：GKD学生使用TRL库的GKDTrainer，学习率5e-5；RL学生使用温度0.7采样，相同学习率；均在8×H200 GPU上训练5轮并选择验证最优检查点

## 关键结果

- 轨迹精度（STP-3平均L2误差）：教师0.355m → GKD学生0.373m（+5%），RL学生0.579m（+63% vs GKD）
- 碰撞率（STP-3平均）：教师0.101% → GKD学生0.138%，RL学生0.363%（GKD比RL低2.6倍）
- 格式可靠性：GKD与RL学生均实现0%格式错误率（教师≈0.08%）
- 长时程表现：在3秒 horizon，GKD的L2误差为0.634m，仅为RL学生（0.916m）的69%，表明误差累积更可控

## 局限与风险

- 实验仅基于开环评估（offline validation），未在闭环仿真中验证实际驾驶安全性
- 输入依赖上游感知系统的文本化输出，未整合原始传感器或向量化地图信息
- 教师-学生容量比固定为~5×，未探索其他压缩比例下的蒸馏效果
- 未引入显式安全约束（如硬避障规则）到蒸馏目标中，可能限制极端场景下的鲁棒性

## 适合沉淀的概念

`on-policy-distillation`, `generalized-knowledge-distillation-gkd`, `llm-based-motion-planning`, `chain-of-thought-reasoning-in-driving`, `teacher-student-compression`, `nuScenes-planning-benchmark`, `jensen-shannon-divergence-in-distillation`, `dense-feedback-reinforcement-learning`

## 阅读注意

- 重点关注GKD如何通过完整词汇分布监督缓解坐标生成中的误差传播问题（见IV-B.4节）
- 注意实验设计中控制变量的严谨性：除学习算法外，师生模型、数据、解码方式完全一致
- Table I中STP-3与UniAD两种平均方式需区分理解，前者强调累积误差，后者侧重终点精度
- Fig. 2定性案例显示GKD虽未完全复现转向行为，但路径更接近真值，体现分布匹配优势
- RL基线在epoch 1后性能下降，提示策略梯度方法在此任务上存在稳定性挑战

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.07944.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、定量结果与定性分析，数据充分支持结论。
