← 术语图鉴

术语 · 架构

一段式

One-stage End-to-End

感知、预测、规划在统一表征里联合优化,直接输出轨迹——上限更高,但难 debug、难闭环验证。

会上可能听到:“一段式上限更高。——上限高在哪?我们为什么还不敢上?”

它到底是什么意思

它把相机、地图、历史轨迹、导航约束全压进同一个 latent space,让网络自己决定哪些信息对规划最重要,训练目标直接作用在驾驶输出上。

优点是信息不过早离散化、能避免 perception-induced planning failure(中间检测不完美但最终轨迹仍可能对)、也更自然地接世界模型、VLA 和大规模数据。

代价是:输出错了很难判断错在检测、地图、交互预测还是规划策略;多任务联训相互干扰;闭环仿真容易出现轨迹抖动、连续偏差发散;量产验证链路更长。

重要的是:一段式和两段式不是二选一,而是一条连续谱。VAD 那类工作就卡在中间——用向量化的 agent/map token 保留部分显式结构。

机制图解

同样的传感器输入,两种走法

两段式→ 结构化中间结果(框/线/灯,人能看懂)→ 规划 → 轨迹
一段式→ 统一 latent(人读不懂)→ 直接输出轨迹
差别不在效果,在中间那一层你还看不看得见——它决定了出问题时能不能归因。

容易搞混的地方

常见误解

一段式是完全黑盒

正确理解

VAD/VADv2 这类工作证明可以保留向量化结构和概率规划约束

常见误解

一段式和两段式二选一

正确理解

是连续谱。读方案时要问:哪些还是 explicit 的,哪些开始变 latent

看懂之后可以追问

  1. 我们保留了哪些显式的中间输出?哪些约束还是硬编码的?纯黑盒的一段式在量产上验证链路极长。能说出保留了哪些可评测中间结构,说明团队想清楚了验收路径。
  2. 闭环仿真里出现轨迹抖动或者发散时,我们怎么定位?这是一段式最典型的失败模式。没有答案意味着上线后会用真车去试错。
  3. 多任务联训现在有相互干扰吗?哪个任务在被牺牲?联训不稳定是一段式的固有成本,通常某个子任务的指标在悄悄退化。

先知道

  • 端到端——让模型更直接地从传感器输入学到驾驶输出,减少中间环节的信息损失,但不等于取消工程约束。
  • 潜空间——模型内部的压缩工作台:信息比结构化标签丰富,但人读不懂,所以出错难归因。

对比着看

  • 两段式——第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。

接着看

  • 视觉-语言-动作模型——把视觉输入、语言/语义桥接和动作输出统一到一个多模态框架,适合更高层的意图和语义条件化。

相关论文

出处:课程学习总纲 总纲 §4.2