会上可能听到:“我们用截断扩散做到了实时。——截断掉的是什么?会不会有损失?”
它到底是什么意思
anchor 是预定义或聚类得到的轨迹意图先验——比如「直行」「左变道」「减速让行」这些典型模式。从 anchor 出发只需少量去噪步数就能生成可用轨迹,同时因为有多个 anchor,多模态能力也保留下来。
另一条同目标不同机制的路线是 ResAD:先用车辆当前状态建立惯性参考轨迹,再学习归一化残差——让模型只学「相对合理先验的必要偏离」。
但截断有个后遗症:模仿学习只监督最接近真值的那个「正模式」,其他 anchor 下的候选可能质量很差甚至碰撞。这正是后续用 RL 约束候选质量的动机。
机制图解
从哪里开始去噪
标准扩散从纯噪声出发 · 要几十步 · 车端延迟扛不住
截断 + 锚点从「直行/左变道/减速」等典型意图出发 · 少数几步 · 多模态还在
容易搞混的地方
常见误解
截断会损失多模态能力
正确理解
多模态由 anchor 集合保证,不是由去噪步数保证
常见误解
所有候选都经过了训练监督
正确理解
模仿学习只监督最贴近真值的那个模式,其他锚点下的候选质量没人管
看懂之后可以追问
- 非最优的那些 anchor 下的候选,质量有人管吗?这是截断扩散最容易被漏掉的风险。模仿学习只监督正模式,负模式可能生成低质量甚至碰撞轨迹,而它们同样会进入候选集。
- anchor 是怎么得到的?覆盖了哪些驾驶意图,有没有遗漏的场景?anchor 集合决定了多模态的边界。缺失的意图模式,模型在那个场景下就没有对应候选。
沿着主线继续
先知道
- 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
接着看
- PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
相关论文
- DiffusionDrive:端到端自动驾驶的截断扩散模型——截断 + 锚点换实时
- ResAD:端到端自动驾驶的归一化残差轨迹建模——惯性参考 + 残差
- DiffusionDriveV2:强化学习约束的截断扩散建模——锚内提质,锚间协调
出处:课程学习总纲 总纲 §6.1、§8