它要解决什么问题
模仿学习被认为上限低、只能做 baseline。PLUTO 想证明:配好结构和训练目标,它能成为很强的量产基线。
机制拆解
- 把规划拆成更适合车辆运动的纵向、横向和交互结构,而不是普通轨迹回归
- 用辅助 loss、约束项和对比学习强化训练信号
- positive/negative augmentation 处理分布漂移与因果混淆——让模型知道哪些扰动应该行为不变,哪些必须改变规划
- 以闭环 nuPlan benchmark 为准,而不是开环 ADE/FDE
量产判断
读完应该能问
- 我们的模仿学习这一层,数据增强和因果混淆处理做了吗?
- 评估用的是闭环还是开环?PLUTO 的结论只在闭环下成立。
回到术语
- 两段式——第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。
- 模仿学习与强化学习的关系——RL 不是从零学开车,而是在模仿学习学出的基础策略上做对齐微调。