2604.07944
论文导读
提出一种基于策略的广义知识蒸馏(GKD)方法,将大型教师语言模型(Qwen3-8B)的运动规划知识压缩至小型学生模型(Qwen3-1.7B),在nuScenes基准上实现接近教师性能且显著优于密集反馈强化学习基线。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
基于策略蒸馏的语言模型在自动驾驶运动规划中的应用
一句话定位
提出一种基于策略的广义知识蒸馏(GKD)方法,将大型教师语言模型(Qwen3-8B)的运动规划知识压缩至小型学生模型(Qwen3-1.7B),在nuScenes基准上实现接近教师性能且显著优于密集反馈强化学习基线。
小学生也能听懂
这篇论文就像让一个很聪明的大哥哥(大模型)教小弟弟(小模型)怎么开车,大哥哥把开车时的想法和路线说出来,小弟弟学着记下来,这样小弟弟也能安全开车,而且更省油(省资源),效果只比大哥哥差一点点。
为什么值得记录
- 解决了LLM在车载资源受限系统中部署的核心瓶颈——模型规模与推理开销问题
- 首次在自动驾驶运动规划任务中系统比较了全分布匹配(GKD)与采样token奖励塑形(RL)两种策略,为后续研究提供方法论参考
- 验证了链式思维输出格式(如轨迹+推理)可通过蒸馏有效迁移至小模型,保持可解释性同时提升效率
- 在nuScenes验证集上实现5倍参数量压缩(8B→1.7B)下仅5–6%轨迹精度损失,具备工程落地潜力
核心方法
- 采用GPT-Driver框架,将驾驶场景编码为自然语言提示,输出包含‘关键对象’、‘潜在影响’、‘元动作’和‘轨迹坐标’的结构化文本
- 教师模型:对Qwen3-8B在nuScenes-GPT-Driver数据集上进行监督微调(SFT),使用qwen3_nothink模板确保确定性输出
- 学生训练:采用广义知识蒸馏(GKD),学生基于自身生成序列计算与教师token级分布的Jensen-Shannon散度(β=0.5),混合50%真实数据与50%自生成数据
- 基线对比:设计密集反馈强化学习(RL)方法,以教师log-probabilities作为每token优势函数,在策略梯度框架中更新学生参数
- 训练细节:GKD学生使用TRL库的GKDTrainer,学习率5e-5;RL学生使用温度0.7采样,相同学习率;均在8×H200 GPU上训练5轮并选择验证最优检查点
关键结果
- 轨迹精度(STP-3平均L2误差):教师0.355m → GKD学生0.373m(+5%),RL学生0.579m(+63% vs GKD)
- 碰撞率(STP-3平均):教师0.101% → GKD学生0.138%,RL学生0.363%(GKD比RL低2.6倍)
- 格式可靠性:GKD与RL学生均实现0%格式错误率(教师≈0.08%)
- 长时程表现:在3秒 horizon,GKD的L2误差为0.634m,仅为RL学生(0.916m)的69%,表明误差累积更可控
局限与风险
- 实验仅基于开环评估(offline validation),未在闭环仿真中验证实际驾驶安全性
- 输入依赖上游感知系统的文本化输出,未整合原始传感器或向量化地图信息
- 教师-学生容量比固定为~5×,未探索其他压缩比例下的蒸馏效果
- 未引入显式安全约束(如硬避障规则)到蒸馏目标中,可能限制极端场景下的鲁棒性
适合沉淀的概念
on-policy-distillation, generalized-knowledge-distillation-gkd, llm-based-motion-planning, chain-of-thought-reasoning-in-driving, teacher-student-compression, nuScenes-planning-benchmark, jensen-shannon-divergence-in-distillation, dense-feedback-reinforcement-learning
阅读注意
- 重点关注GKD如何通过完整词汇分布监督缓解坐标生成中的误差传播问题(见IV-B.4节)
- 注意实验设计中控制变量的严谨性:除学习算法外,师生模型、数据、解码方式完全一致
- Table I中STP-3与UniAD两种平均方式需区分理解,前者强调累积误差,后者侧重终点精度
- Fig. 2定性案例显示GKD虽未完全复现转向行为,但路径更接近真值,体现分布匹配优势
- RL基线在epoch 1后性能下降,提示策略梯度方法在此任务上存在稳定性挑战
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.07944.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验设置、定量结果与定性分析,数据充分支持结论。