← 术语图鉴

术语 · 轨迹生成

扩散模型轨迹生成

Diffusion

先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。

会上可能听到:“轨迹生成我们用 diffusion。——它比直接回归好在哪?慢不慢?”

它到底是什么意思

训练时从真实轨迹出发逐步加噪,模型学习在场景条件(自车状态、地图、障碍物、导航)下预测所加的噪声;推理时从噪声反向逐步去噪,得到一条合理轨迹。采样多次就得到多条候选。

擅长:多模态候选、不确定性建模、长尾场景扩增、世界模型与场景生成。难点:多步去噪推理慢、候选之间没有显式价值排序、条件控制和规则对齐难、有 mode collapse 风险。

工程上的核心原则:别让生成模型从零学物理。给它 anchor、参考轨迹、归一化这些强先验,把学习目标缩小到「在合理先验上做必要偏离」。

机制图解

  1. 01真实轨迹训练数据
  2. 02逐步加噪训练时:把它一点点搞乱
  3. 03纯噪声
  4. 04学习反向去噪模型学「这一步加了多少噪」
  5. 05推理:噪声→轨迹采样多次 = 多条候选
训练是「学会把乱的还原」,推理是「从随机出发还原出一条合理轨迹」。采样几次就得到几条候选。

容易搞混的地方

常见误解

生成多条候选说明它更安全

正确理解

多样性只保证「想到几种可能」,每条能不能开要靠打分和规则检查

常见误解

Diffusion 太慢所以车端不能用

正确理解

截断扩散和锚点先验已经把步数压下来了,关键是看端到端延迟实测

看懂之后可以追问

  1. 车端推理需要几步去噪?延迟预算是多少,实测多少?标准扩散的多步去噪是它最大的落地障碍。截断方案能不能满足实时预算,是这条技术路线成不成立的关键。
  2. 我们给了模型哪些先验?还是让它从纯噪声开始学?anchor 和参考轨迹这类先验能大幅降低学习负担和不稳定性。从零学全部驾驶物理是量产不友好的选择。

先知道

  • 多模态轨迹——未来不是一个确定的点,而是一个分布:可以跟车、变道、让行、绕行,模型输出多条候选来表达这种不确定性。

对比着看

  • 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。

接着看

  • 截断扩散与锚点——不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。
  • 流匹配——不预测噪声,而是学习从噪声轨迹流向真实轨迹的连续速度场,推理时解 ODE——采样步数更少。

相关论文

出处:课程学习总纲 总纲 §6.1