会上可能听到:“第一段出感知结果,第二段做规划。——这算端到端吗?为什么大家都先做这个?”
它到底是什么意思
第一段的输出是人能看懂的:3D 目标框、速度、tracking ID、车道线 polyline、交通灯颜色和路口通行性、以及多模态轨迹分支与概率。
它的价值全在工程上:能看见中间结果所以能定位问题;能接规则约束和风险检测;感知、预测、规划可以分开升级不必重训全链路;训练更稳定,问题归因更直接。
代价同样清楚:中间表征压缩掉了细粒度几何和交互意图,上下游容易互相甩锅,梯度无法完整跨模块反传,复杂交互场景的性能上限可能低于一段式。
课程里有个很实用的量产经验占比:数据解决约 60% 的问题,模仿学习约 30%,强化学习约 10%。别一上来就把 RL 当第一解法。
机制图解
传感器输入
第一段:感知3D 框 / 车道线 / 交通灯 / 预测轨迹(人能看懂)
第二段:规划基于结构化输入生成轨迹
容易搞混的地方
常见误解
两段式就是传统 pipeline 换个名字
正确理解
两段的感知和规划模块本身都是可学习的,不是手写规则
常见误解
两段式一定比一段式差
正确理解
它是拿上限换可控性,在量产阶段往往是更理性的选择
看懂之后可以追问
- 中间表征里,我们丢掉了哪些信息?这些信息在哪类场景会变成问题?两段式的天花板就在这个压缩上。让团队具体说出丢了什么,比笼统说「上限低」有用得多,也能提前锁定风险场景。
- 感知和规划出问题时,责任怎么划?有没有共同的评测口径?两段式最典型的组织问题是互相甩锅。提前建立联合评测口径,比事后开协调会便宜。
- 现在的瓶颈是数据、模仿学习还是 RL?我们的投入比例是多少?对照 60/30/10 的经验分布。如果团队在 RL 上投入过重而数据难例挖掘很薄,优先级大概率错了。
沿着主线继续
先知道
- 端到端——让模型更直接地从传感器输入学到驾驶输出,减少中间环节的信息损失,但不等于取消工程约束。
对比着看
- 一段式——感知、预测、规划在统一表征里联合优化,直接输出轨迹——上限更高,但难 debug、难闭环验证。
接着看
- 导航路径——它表达的是长期路线意图(该往哪走),不是可执行轨迹,不能直接控车。
相关论文
- PLUTO:把模仿学习规划推到极限——把 IL 做到极致,再谈 RL
- BEVFormer:用时空 Transformer 从多摄像头学 BEV 表征——BEV query 是空间探针
- MOTR:基于 Transformer 的端到端多目标跟踪——track query 维持身份
- Sparse4D:稀疏时空融合的多视角 3D 检测——稀疏 query 换效率
出处:课程学习总纲 总纲 §4.1