会上可能听到:“轨迹生成我们用 diffusion。——它比直接回归好在哪?慢不慢?”
它到底是什么意思
训练时从真实轨迹出发逐步加噪,模型学习在场景条件(自车状态、地图、障碍物、导航)下预测所加的噪声;推理时从噪声反向逐步去噪,得到一条合理轨迹。采样多次就得到多条候选。
擅长:多模态候选、不确定性建模、长尾场景扩增、世界模型与场景生成。难点:多步去噪推理慢、候选之间没有显式价值排序、条件控制和规则对齐难、有 mode collapse 风险。
工程上的核心原则:别让生成模型从零学物理。给它 anchor、参考轨迹、归一化这些强先验,把学习目标缩小到「在合理先验上做必要偏离」。
机制图解
- 01真实轨迹训练数据
- 02逐步加噪训练时:把它一点点搞乱
- 03纯噪声
- 04学习反向去噪模型学「这一步加了多少噪」
- 05推理:噪声→轨迹采样多次 = 多条候选
容易搞混的地方
常见误解
生成多条候选说明它更安全
正确理解
多样性只保证「想到几种可能」,每条能不能开要靠打分和规则检查
常见误解
Diffusion 太慢所以车端不能用
正确理解
截断扩散和锚点先验已经把步数压下来了,关键是看端到端延迟实测
看懂之后可以追问
- 车端推理需要几步去噪?延迟预算是多少,实测多少?标准扩散的多步去噪是它最大的落地障碍。截断方案能不能满足实时预算,是这条技术路线成不成立的关键。
- 我们给了模型哪些先验?还是让它从纯噪声开始学?anchor 和参考轨迹这类先验能大幅降低学习负担和不稳定性。从零学全部驾驶物理是量产不友好的选择。
沿着主线继续
先知道
- 多模态轨迹——未来不是一个确定的点,而是一个分布:可以跟车、变道、让行、绕行,模型输出多条候选来表达这种不确定性。
对比着看
- 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。
接着看
- 截断扩散与锚点——不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。
- 流匹配——不预测噪声,而是学习从噪声轨迹流向真实轨迹的连续速度场,推理时解 ODE——采样步数更少。
相关论文
- DiffusionDrive:端到端自动驾驶的截断扩散模型——截断 + 锚点换实时
- ResAD:端到端自动驾驶的归一化残差轨迹建模——惯性参考 + 残差
- Diffuser:用扩散做灵活的行为合成——value 引导采样
出处:课程学习总纲 总纲 §6.1