← 术语图鉴

术语 · 架构

两段式

Two-stage End-to-End

第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。

会上可能听到:“第一段出感知结果,第二段做规划。——这算端到端吗?为什么大家都先做这个?”

它到底是什么意思

第一段的输出是人能看懂的:3D 目标框、速度、tracking ID、车道线 polyline、交通灯颜色和路口通行性、以及多模态轨迹分支与概率。

它的价值全在工程上:能看见中间结果所以能定位问题;能接规则约束和风险检测;感知、预测、规划可以分开升级不必重训全链路;训练更稳定,问题归因更直接。

代价同样清楚:中间表征压缩掉了细粒度几何和交互意图,上下游容易互相甩锅,梯度无法完整跨模块反传,复杂交互场景的性能上限可能低于一段式。

课程里有个很实用的量产经验占比:数据解决约 60% 的问题,模仿学习约 30%,强化学习约 10%。别一上来就把 RL 当第一解法。

机制图解

传感器输入

第一段:感知3D 框 / 车道线 / 交通灯 / 预测轨迹(人能看懂)
第二段:规划基于结构化输入生成轨迹
第一段的输出是人能看懂的,所以能定位问题、能加规则。代价是这一层压缩掉的信息,第二段再也拿不回来。

容易搞混的地方

常见误解

两段式就是传统 pipeline 换个名字

正确理解

两段的感知和规划模块本身都是可学习的,不是手写规则

常见误解

两段式一定比一段式差

正确理解

它是拿上限换可控性,在量产阶段往往是更理性的选择

看懂之后可以追问

  1. 中间表征里,我们丢掉了哪些信息?这些信息在哪类场景会变成问题?两段式的天花板就在这个压缩上。让团队具体说出丢了什么,比笼统说「上限低」有用得多,也能提前锁定风险场景。
  2. 感知和规划出问题时,责任怎么划?有没有共同的评测口径?两段式最典型的组织问题是互相甩锅。提前建立联合评测口径,比事后开协调会便宜。
  3. 现在的瓶颈是数据、模仿学习还是 RL?我们的投入比例是多少?对照 60/30/10 的经验分布。如果团队在 RL 上投入过重而数据难例挖掘很薄,优先级大概率错了。

先知道

  • 端到端——让模型更直接地从传感器输入学到驾驶输出,减少中间环节的信息损失,但不等于取消工程约束。

对比着看

  • 一段式——感知、预测、规划在统一表征里联合优化,直接输出轨迹——上限更高,但难 debug、难闭环验证。

接着看

  • 导航路径——它表达的是长期路线意图(该往哪走),不是可执行轨迹,不能直接控车。

相关论文

出处:课程学习总纲 总纲 §4.1