← 论文拆解

两段式与模仿学习规划

PLUTO:把模仿学习规划推到极限

PLUTO: Pushing the Limit of Imitation Learning-based Planning for Autonomous Driving

把 IL 做到极致,再谈 RL

arXiv 2404.14327 ↗

它要解决什么问题

模仿学习被认为上限低、只能做 baseline。PLUTO 想证明:配好结构和训练目标,它能成为很强的量产基线。

机制拆解

  1. 把规划拆成更适合车辆运动的纵向、横向和交互结构,而不是普通轨迹回归
  2. 用辅助 loss、约束项和对比学习强化训练信号
  3. positive/negative augmentation 处理分布漂移与因果混淆——让模型知道哪些扰动应该行为不变,哪些必须改变规划
  4. 以闭环 nuPlan benchmark 为准,而不是开环 ADE/FDE

量产判断

读完应该能问

  • 我们的模仿学习这一层,数据增强和因果混淆处理做了吗?
  • 评估用的是闭环还是开环?PLUTO 的结论只在闭环下成立。

回到术语

  • 两段式——第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。
  • 模仿学习与强化学习的关系——RL 不是从零学开车,而是在模仿学习学出的基础策略上做对齐微调。