会上可能听到:“这些信息都在 latent 里。——那我怎么知道它到底学到了什么?”
它到底是什么意思
原始输入很复杂——图像、点云、地图、导航、历史轨迹、周围车。模型先把这些编码成一组内部向量。这组向量不是「车道线表格」或「车辆列表」,但里面可能隐含了「前方有车」「旁边车道能变道」「导航要求左转」这些信息。
两段式像「先把世界翻译成人能看懂的结构再规划」;一段式像「把世界压进模型内部,让它自己决定什么重要」。这就是一段式上限高但难 debug 的根源。
对跨岗位评审的实际影响:latent 越重,团队能直接检查的问题就越少,越依赖评测体系而不是中间结果来判断好坏。
机制图解
- 01原始世界图像 · 点云 · 地图 · 导航 · 历史轨迹
- 02编码器压缩
- 03latent 向量组隐含「前方有车」「该左转」,但没有一栏叫这个名字
- 04规划头解码
- 05未来轨迹
容易搞混的地方
常见误解
latent 里的信息更少,所以是压缩损失
正确理解
信息通常更丰富,问题是不可读,不是不够
看懂之后可以追问
- 如果最终轨迹错了,我们能不能从 latent 里读出任何可解释的信号?有没有做探针(probing)或辅助监督,直接决定线上出问题时的排查效率。
- 我们用什么代替「看中间结果」来判断这一版是不是变好了?latent 化之后,评测体系是唯一的抓手。这一问会暴露评测投入是否跟上了架构激进程度。
沿着主线继续
先知道
- 一段式——感知、预测、规划在统一表征里联合优化,直接输出轨迹——上限更高,但难 debug、难闭环验证。
接着看
- Query 与候选轨迹——query 是模型内部「带槽位的探针」,proposal 才是解码后拿出来比较的候选结果。
相关论文
- VAD:面向高效自动驾驶的向量化场景表示——黑盒与结构化之间的折中
出处:课程学习总纲 总纲 §3.3