会上可能听到:“一段式上限更高。——上限高在哪?我们为什么还不敢上?”
它到底是什么意思
它把相机、地图、历史轨迹、导航约束全压进同一个 latent space,让网络自己决定哪些信息对规划最重要,训练目标直接作用在驾驶输出上。
优点是信息不过早离散化、能避免 perception-induced planning failure(中间检测不完美但最终轨迹仍可能对)、也更自然地接世界模型、VLA 和大规模数据。
代价是:输出错了很难判断错在检测、地图、交互预测还是规划策略;多任务联训相互干扰;闭环仿真容易出现轨迹抖动、连续偏差发散;量产验证链路更长。
重要的是:一段式和两段式不是二选一,而是一条连续谱。VAD 那类工作就卡在中间——用向量化的 agent/map token 保留部分显式结构。
机制图解
同样的传感器输入,两种走法
两段式→ 结构化中间结果(框/线/灯,人能看懂)→ 规划 → 轨迹
一段式→ 统一 latent(人读不懂)→ 直接输出轨迹
容易搞混的地方
常见误解
一段式是完全黑盒
正确理解
VAD/VADv2 这类工作证明可以保留向量化结构和概率规划约束
常见误解
一段式和两段式二选一
正确理解
是连续谱。读方案时要问:哪些还是 explicit 的,哪些开始变 latent
看懂之后可以追问
- 我们保留了哪些显式的中间输出?哪些约束还是硬编码的?纯黑盒的一段式在量产上验证链路极长。能说出保留了哪些可评测中间结构,说明团队想清楚了验收路径。
- 闭环仿真里出现轨迹抖动或者发散时,我们怎么定位?这是一段式最典型的失败模式。没有答案意味着上线后会用真车去试错。
- 多任务联训现在有相互干扰吗?哪个任务在被牺牲?联训不稳定是一段式的固有成本,通常某个子任务的指标在悄悄退化。
沿着主线继续
先知道
对比着看
- 两段式——第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。
接着看
- 视觉-语言-动作模型——把视觉输入、语言/语义桥接和动作输出统一到一个多模态框架,适合更高层的意图和语义条件化。
相关论文
- VAD:面向高效自动驾驶的向量化场景表示——黑盒与结构化之间的折中
- VADv2:通过概率规划实现端到端向量化自动驾驶——概率规划
出处:课程学习总纲 总纲 §4.2