← 术语图鉴

术语 · 轨迹生成

多模态轨迹

Multi-modal Trajectory

未来不是一个确定的点,而是一个分布:可以跟车、变道、让行、绕行,模型输出多条候选来表达这种不确定性。

会上可能听到:“模型输出了好几条候选轨迹。——为什么不直接给一条?多的那些有什么用?”

它到底是什么意思

先看一个具体场景:前方有辆慢车,你的车该怎么办?跟在后面减速、从左边超、或者等一等再决定——这三种做法都是合理的,真实司机也会做出不同选择。

如果模型只输出一条「平均」轨迹,会发生什么?平均一条向左、一条向右的轨迹,得到的是一条直直撞上去的中间线。这就是单条回归在分叉场景下的经典失效——它给出的答案谁都不像。

多模态的做法是:一次生成若干条完整的候选轨迹,每条对应一种合理意图,再由后面的打分模块挑一条执行。右图里扇形展开的几条线就是候选集。

但有个必须记住的分界:多模态不等于每条候选都安全。生成模型完全可能同时输出合理轨迹和碰撞轨迹——多样性只保证「想到了几种可能」,不保证「每种都能开」。所以候选后面必须接打分、规则检查和优化。

还有个落地时的隐性损失:为了输出确定性,很多量产系统最终只取打分最高的那一条。多模态的能力在训练时建立,在上车时被压回了单条。

机制图解

候选 A · 跟车减速留在本车道,跟着慢车走
候选 B · 左侧超车借左道绕过去
候选 C · 等待观察先减速,看对方意图再决定
× 取平均的结果把「向左」和「不动」平均一下 → 一条微微偏左、直直撞上慢车的线
前方一辆慢车,三种做法都合理。单条回归会把它们平均掉,得到第四条——那条谁都不像,而且会撞。这就是分叉场景必须多模态的原因。

容易搞混的地方

常见误解

多模态 = 更安全

正确理解

多模态只说明能生成多种候选,安全要靠 scoring、rule check 和 RL 约束

看懂之后可以追问

  1. 这几条候选是怎么打分和筛选的?会不会选出一条不安全的?生成多样性和最终安全性是两件事。打分器和规则检查才是决定线上表现的环节,但常常在方案里一笔带过。

先知道

  • Query 与候选轨迹——query 是模型内部「带槽位的探针」,proposal 才是解码后拿出来比较的候选结果。

接着看

  • 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
  • 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。

相关论文

出处:课程学习总纲 总纲 §6.1、§11.3 题 10