← 术语图鉴

术语 · 轨迹生成

截断扩散与锚点

Truncated Diffusion / Anchor

不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。

会上可能听到:“我们用截断扩散做到了实时。——截断掉的是什么?会不会有损失?”

它到底是什么意思

anchor 是预定义或聚类得到的轨迹意图先验——比如「直行」「左变道」「减速让行」这些典型模式。从 anchor 出发只需少量去噪步数就能生成可用轨迹,同时因为有多个 anchor,多模态能力也保留下来。

另一条同目标不同机制的路线是 ResAD:先用车辆当前状态建立惯性参考轨迹,再学习归一化残差——让模型只学「相对合理先验的必要偏离」。

但截断有个后遗症:模仿学习只监督最接近真值的那个「正模式」,其他 anchor 下的候选可能质量很差甚至碰撞。这正是后续用 RL 约束候选质量的动机。

机制图解

从哪里开始去噪

标准扩散从纯噪声出发 · 要几十步 · 车端延迟扛不住
截断 + 锚点从「直行/左变道/减速」等典型意图出发 · 少数几步 · 多模态还在
省下的步数来自先验。但注意:模仿学习只监督最贴近真值的那个锚点,其他锚点下的候选质量没人管。

容易搞混的地方

常见误解

截断会损失多模态能力

正确理解

多模态由 anchor 集合保证,不是由去噪步数保证

常见误解

所有候选都经过了训练监督

正确理解

模仿学习只监督最贴近真值的那个模式,其他锚点下的候选质量没人管

看懂之后可以追问

  1. 非最优的那些 anchor 下的候选,质量有人管吗?这是截断扩散最容易被漏掉的风险。模仿学习只监督正模式,负模式可能生成低质量甚至碰撞轨迹,而它们同样会进入候选集。
  2. anchor 是怎么得到的?覆盖了哪些驾驶意图,有没有遗漏的场景?anchor 集合决定了多模态的边界。缺失的意图模式,模型在那个场景下就没有对应候选。

先知道

  • 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。

接着看

  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。

相关论文

出处:课程学习总纲 总纲 §6.1、§8