← 深度专题

专题 01

端到端系统如何组织

一段式与两段式,真正的分界线在哪里?

行业讨论里,“一段式”“两段式”“端到端”“OneModel”“有辅助任务”经常被混在一起。真正有用的分法不是数网络有几个,而是检查三件事:Planner 必须经过什么信息接口,规划损失能回传到哪里,出了问题以后团队能定位到哪一层。

8 个小节 · 约 13 分钟阅读

分界线不在模型数量,而在必经接口

两段式的第一段把环境转换成可读结果,例如动态目标的 3D 框、速度、航向角、类别与跟踪 ID,静态道路的车道折线、路沿、属性和置信度,再把这些结果交给第二段 Planner。这里的“段”指信息契约:Planner 看到的是被定义过的世界,而不是前端视觉特征的全部内容。

一段式并不意味着感知头、地图头和 Occupancy 头全部消失。A 课给出的架构仍然保留这些辅助任务,变化在于从上游特征到 Planner 多了一条直接通路,结构化结果从“唯一通道”变成“辅助通道”。因此,一个系统有很多任务头,仍然可以是一段式;一个系统只有两个大模型,也不自动等于两段式。

B 课还给出另一套学术分类:有辅助任务与无辅助任务。它回答的是训练时有没有额外监督,不完全等同于产业所说的一段式和两段式。判断方案时需要把两套词汇拆开,否则容易把“保留检测 loss”误判成“仍然是两段式”。

  • 接口判断:Planner 是否必须消费结构化感知结果。
  • 梯度判断:规划目标能否跨过中间接口更新上游表征。
  • 监督判断:检测、建图、预测等任务是必经输出,还是辅助训练信号。
  • 运行判断:部署时是否需要后处理把第一段结果重新组织后才能进入 Planner。

两种架构共享的部分,比想象中更多

无论一段式还是两段式,系统都要处理多相机输入、时序对齐、动态目标、静态道路、导航和自车状态,并最终输出满足安全、合规、舒适与效率要求的轨迹。区别不是任务是否存在,而是这些任务以什么粒度交互。

B 课从 BEV Encoder 到动静态 Decoder 展示了感知内部的连续谱:Dense BEV 构造完整鸟瞰特征,Sparse 方法用对象或任务 Query 直接从图像读取信息;StreamPETR、Sparse4D 和 DriveTransformer 又都使用对象级记忆、坐标对齐与运动补偿。也就是说,“前端怎样组织表征”与“系统是一段还是两段”是两个相关但不同的设计维度。

导航也不会因为一段式而消失。A 课说明,SD 可以提供推荐车道、行点和剩余距离,经 embedding 与动态、静态信息并列进入 Planner。C 课的经典规则栈同样依赖路由、参考线和交通规则。端到端改变的是消费方式,不是把长期目标和交通约束凭空删除。

  1. 传感器与时序多视角图像、车辆状态和历史帧先被对齐并编码。
  2. 环境表征可以是 Dense BEV、Sparse Query、结构化目标与地图,也可以是它们的组合。
  3. 导航与行为先验路由、推荐车道、机动指令和剩余距离限定长期方向。
  4. Planner 交互Ego Query 或规划 Token 读取场景和导航信息,生成单模态或多模态轨迹。
  5. 约束与执行动力学、碰撞、道路边界和交规需要在训练目标、后处理或控制层中生效。

结构化世界与潜空间,各自丢什么

两段式的优势不是一句笼统的“可解释”。A 课把它拆成三层:能看见中间要素,能理解 Planner 为什么选择某条轨迹,能定位问题来自感知、特征还是规划。结构化接口还能承载规则约束和风险检测,让团队对输入输出建立明确验收标准。

代价是信息压缩。像素里的遮挡关系、纹理、交警手势或未被标签体系覆盖的上下文,可能在转换成有限类别、几何量和置信度时被丢掉。Planner 接收到的是被工程接口定义过的世界。A 课用窄路和交警手势说明,一段式的潜空间旁路理论上可以保留这类难以预先枚举的信号。

但潜空间并不自动等于理解力更强。它也会带来定位困难:轨迹错了,团队难以确认是检测、交互预测、导航融合还是规划头的问题。B 课的四种 Query Planner 范式进一步说明,任务关系、训练稳定和效率无法仅由“是否用 BEV”推断,必须落到具体交互结构上检查。

两段式

把中间表征做成系统契约

  • 可读、可测、可插入规则与安全检查。
  • 模块可独立训练、替换和回归验证。
  • 显式接口会压缩信息,并形成性能上限。
  • 上游误差可能通过固定接口传给 Planner。

一段式

让规划目标塑造共享表征

  • Planner 可读取未被标签体系压缩的特征。
  • 规划损失可影响上游表征,减少级联误差。
  • 任务耦合增加,训练稳定性更难保证。
  • 问题定位、闭环仿真和安全解释成本更高。
这里比较的是系统接口与优化路径,不是模型规模,也不是公司宣传中的代际名称。

证据链:结构被拆掉,又被一件件请回来

先看两笔硬账。训练成本:A 课给出的对比是一段式联训要“千卡 72 小时”,两段式只需“64 卡 24 小时”——差距不是百分比,是量级。运行时:UniAD 串行链延迟 555.6 毫秒、1.8 FPS,VAD-Tiny 用并行矢量化做到 59.5 毫秒、16.8 FPS。接口选择从来不只是学术分歧,它直接写进算力预算和迭代周期。

产业站队也没有收敛。A 课统计的八家厂商恰好 4:4:一段式阵营 Tesla、理想、地平线、文远,两段式阵营华为、Momenta、小鹏、元戎;输入侧 Momenta 是唯一把导航路径单列为输入的,数据侧地平线是唯一纯专家数据的,而强化学习一栏,没有任何一家标注“闭环 RL 已落地”——理想把“VLA+RL 闭环”写在优化方向列,是目标不是现状。分界线两侧都有量产公司,说明它是取舍而非代际。

更有意思的证据在论文的演进方向里。VAD 是一段式,却保留向量化场景表示和三类显式约束(自车-他车碰撞、道路边界越界、车道方向一致性);到 VADv2,干脆把轨迹回归改成 4096 条轨迹词表上的概率打分,外加场景冲突检查。一段式向量产走的每一步,都在把当初拆掉的结构一件件请回来:先请回约束,再请回概率,再请回可评测的中间结果。“结构化是负担”的论点,被一段式自己的演进史否决了。

反方向的报偿也真实存在。A 课的例子是交警手势:两段式的接口字段里没有“交警手势”这一栏,标签体系标不出的东西,Planner 永远看不见;一段式的潜空间旁路让“复杂标签体系的上限不再限制性能”,甚至“即使检测错,最终轨迹仍可能正确”。DriveTransformer 则展示了放弃 Dense BEV 后的可扩展红利:decoder 从 L3-D256 扩到 L12-D768,Driving Score +18.22、推理快 34%——不过注意,它的四项全优评分表出自论文自评,听宣称,看复现。

代价同样具体。A 课列出一段式闭环仿真的五连不稳定:BEV 特征 warp 失真、轨迹左右抖动、无法稳定跟车、切入车辆无法处理、连续偏差后直接发散。潜空间的信息完整性在闭环里兑现之前,先兑现的是调试成本——这五条正是“难 debug、难闭环验证”在工程日志里的样子。

  • 成本账:千卡 72 小时 vs 64 卡 24 小时;555.6ms/1.8FPS vs 59.5ms/16.8FPS。
  • 站队账:八家厂商 4:4,无一家闭环 RL 已落地——分界线是取舍不是代际。
  • 演进账:VAD 保留显式约束 → VADv2 补回概率与词表——一段式在把结构请回来。
  • 报偿账:交警手势类信号只有潜空间旁路能保留;检测错但轨迹可对。
  • 代价账:闭环仿真五连不稳定,从特征 warp 失真到连续偏差发散。

训练方法才会暴露架构的真实边界

B 课把联合训练的困难量化成“十多个任务、几十种数据、几百个 loss”。动态检测与跟踪、静态建图、Occupancy、红绿灯、规划和其他任务同时存在时,问题不只是算力,而是标注缺失、损失尺度和学习率策略相互牵制。所谓“一段式训练不稳定”,对应的是这个真实的多任务优化问题。

两段式通常先推理或缓存感知结果,也可能用感知真值训练 Planner,再独立做模仿学习和强化微调。它放弃感知与规划联合更新,换来收敛速度、复现实验和模块回归的确定性。隐藏风险是训练时的真值或高质量缓存,比部署时实际感知输出更干净,Planner 会遇到训练与推理分布不一致。

一段式也不等于从随机初始化开始全量联训。UniAD 使用先感知、再感知预测规划联合训练的阶段;更大的 VLA 路线还会经过语言、视觉语言、驾驶任务和强化优化等阶段。多阶段训练是处理复杂度的工程方法,不应被误读为系统不端到端。

A 课在 PLUTO 中展示了另一个重点:分布转移和因果混淆往往要靠数据干预、对比学习与辅助约束先解决。系统是否一段式,并不能替代对数据分布和因果捷径的治理。

两段式常见训练

先稳定接口,再优化 Planner

  • 感知模块独立收敛并输出缓存结果。
  • Planner 基于感知输出或感知真值做模仿学习。
  • 感知与 Planner 联训步骤通常被省略。
  • 强化学习集中在 Planning 侧小步微调。

一段式常见训练

分阶段解冻,最终让规划目标回传

  • 先完成 2D、3D、单帧和时序感知预训练。
  • 冻结上游,先让 Planner 学会基础驾驶。
  • 降低上游学习率和辅助 loss 权重后联合优化。
  • 基础策略稳定后再进入偏好或闭环强化阶段。
两列都是常见工程路径,不是对所有公司的事实描述;具体方案应以训练图和梯度流为准。

量产团队为什么不会只按理论上限选架构

B 课对两段式给出一个罕见的组织解释:感知模块已经基本收敛,规则 PnC 的数据驱动能力不足,同时感知与规划团队的合作方式已经形成。于是更现实的迁移路径,是先把感知整合成 OneModel,再由规划团队建设 PlanNN,而不是一次性打散全部边界。

A 课补上了这条路径的反面。两段式虽然便于分工,也可能形成“Planner 认为感知太差,感知认为规划太敏感”的协同问题。组织边界塑造系统接口,系统接口又会强化组织边界。这种张力不能靠换一个网络名称自动消失。

一段式追求更高的联合优化上限,但要求团队同时具备多任务训练、端到端数据闭环、闭环仿真、潜空间诊断和系统级安全验证能力。缺少这些基础设施时,理论上的信息完整性可能转化为更长的定位周期和更难控制的回归风险。

因此,量产路线常常不是永久二选一,而是能力迁移顺序:先让规划数据驱动化,再逐步缩短中间接口、增加特征旁路、把可验证的辅助任务保留下来。

  • 存量资产:感知模型、标注体系、规则约束和回归工具是否已成熟。
  • 团队结构:感知、预测、规划和数据团队是否能共同承担跨模块指标。
  • 验证能力:是否具备反应式闭环、失效回放和潜空间诊断手段。
  • 算力预算:Dense BEV、时序缓存和多任务头能否满足车端时延。
  • 场景目标:当前瓶颈是感知接口、交互规划、舒适性,还是长尾恢复。

别停在二分法,系统其实是一条连续谱

B 课把 Query Planner 进一步分成 Direct Planning、BEV Sequential、Parallel BEV 和 Pure Transformer 四种范式。UniAD 用 Query 串起感知、预测和规划,任务关系清楚但训练与效率承压;VAD 并行解码并保留矢量化约束;DriveTransformer 取消 Dense BEV,以稀疏任务 Token 和时序记忆组织多任务。它们很难用一个“一段式”标签解释完。

C 课提供了判断这些方案是否真的覆盖规划问题的基线。经典规则栈明确区分预测、行为决策、路径规划和轨迹优化,并暴露横纵解耦在窄道会车等场景的失效边界。学习式系统即使合并了模块,也仍需证明自己处理了多模态预测、交互、动力学和时空联合约束。

更成熟的评审方式,是给方案画出信息图和梯度图:每种输入经过哪些表示,哪些结果必须显式输出,哪些 Query 能彼此交互,哪些损失能更新哪些模块,部署时哪些规则仍在后处理生效。画完这两张图,一段式或两段式的标签通常就不再含糊。

  1. 画信息流标出图像、BEV或图像特征、对象与地图 Query、导航、自车状态到轨迹的所有通路。
  2. 画梯度流标出规划 loss、感知 loss、约束 loss 和强化信号分别能更新哪些模块。
  3. 列运行时接口确认哪些结构化结果是 Planner 必须等待的,哪些只是可视化或辅助监督。
  4. 列失效归因对感知错、导航跳变、交互误判、轨迹不可执行分别定义定位手段。
  5. 在闭环中比较用相同数据、算力、场景和安全边界比较,而不是只比较单个开环 L2 指标。

把架构争论改写成可回答的问题

“我们要不要上一段式”太宽,通常只会得到立场。更好的问题是:当前最严重的信息瓶颈在哪里;它是否真的来自结构化接口;绕过接口后,新增能力能否在闭环里被测出;出现回归时,团队有没有足够快的归因和回退路径。

若目标是先把成熟感知能力接入数据驱动 Planner,两段式可能是更可控的迁移方案。若核心长尾来自标签体系无法表达的上下文,且已有稳定的多任务训练和闭环验证基础,一段式的特征旁路更值得投入。若主要问题是交互轨迹生成或奖励偏好,先更换 Planner 或训练目标,可能比重做整条感知链更直接。

最终评审不应问哪一派更先进,而应记录这次选择保留了什么、放弃了什么、用什么指标验证,以及在什么条件成熟后重新评估。架构是阶段性判断,不是身份标签。

  • 我们要绕过的具体信息瓶颈是什么,有没有失败样本支持?
  • 中间结构化输出继续承担哪些安全、可视化和回归职责?
  • 规划损失回传上游后,如何防止感知任务掉点或训练振荡?
  • 训练使用感知真值、缓存输出还是真实在线输出,分布差异怎样覆盖?
  • 车端时延、闭环仿真和问题定位工具是否随架构一起升级?
  • 如果新方案不达预期,能够回退到哪一个稳定接口?

三门课怎么对上

同一个工程问题,三门课的观察层级不同。下面逐条标出它们是相互印证、作用域不同,还是在相同前提下保留张力——不把任何一门课单独当作行业定论。

端到端的核心是让规划获得更完整的信息,而不是简单减少模块数量。

相互印证
A · 端到端早期课
A 课从信息损失和误差累积解释动机,并展示一段式的特征直连旁路。
B · 端到端一期
B 课把端到端定义为感知信息到决策规划的传输,并以规划导向联合优化为主线。
C · 决策规划课
C 课完整列出模块化链路与各接口,提供了“被重新组织的对象”。

合并读法:三门课在问题起点上一致:改变的是信息如何传到规划,而不是传感器和驾驶任务凭空消失。

产业的一段式与两段式,可以直接等同于学术的无辅助任务与有辅助任务。

作用域不同
A · 端到端早期课
A 课按中间接口和特征旁路区分一段式、两段式,一段式仍可保留感知头。
B · 端到端一期
B 课明确并列两套分类:产业看一段式/两段式,学术看有/无辅助任务。
C · 决策规划课
C 课不使用这组分类,而是按预测、决策、规划职责拆分系统。

合并读法:两套分类讨论的维度不同。辅助任务是监督设计,中间接口是运行时与梯度边界,不能一一对应。

两段式更可解释,因此团队协同一定更顺畅。

保留张力
A · 端到端早期课
A 课肯定“能看见、能理解、能调试”,同时记录上下游可能互相归因的协同问题。
B · 端到端一期
B 课认为团队既有协作方式会推动二段式迁移,强调组织惯性带来的落地可行性。
C · 决策规划课
C 课的模块化系统给每层明确职责,但没有讨论跨团队归因成本。

合并读法:接口可读有利于定位,不代表责任边界自然合理。可解释性与组织协同需要分别验收。

一段式的联合优化上限更高,所以量产团队应该直接跳过两段式。

作用域不同
A · 端到端早期课
A 课强调潜空间信息和跨模块梯度的上限,也同时列出训练、调试与闭环仿真困难。
B · 端到端一期
B 课从多任务 loss、分阶段训练、存量感知和团队习惯说明为什么二段式是现实迁移路径。
C · 决策规划课
C 课显示经典规划仍承担大量明确约束与失效处理,迁移不能只看表示上限。

合并读法:上限判断与迁移顺序不是同一个问题。先建立可控 PlanNN,再逐步缩短接口,可能是更合理的阶段策略。

一段式会把导航和规则都删掉,让模型只看图像开车。

相互印证
A · 端到端早期课
A 课的一段式图仍保留 SD,并给出推荐车道、行点、剩余距离的量产编码。
B · 端到端一期
B 课的 Planner Q、VAD Driving Command 和 Query 交互都显式接收导航或场景约束。
C · 决策规划课
C 课说明 Routing、参考线、交通规则和动力学是规划问题的固有输入与约束。

合并读法:三门课共同否定了“只看图像即可”的简单想象。端到端改变融合方式,不取消任务本身。

一段式与两段式的核心差异,会在训练流程中表现为是否允许感知与规划联合更新。

相互印证
A · 端到端早期课
A 课指出两段式网络割裂,无法跨段梯度反传;一段式允许规划目标直接作用于共享特征。
B · 端到端一期
B 课在二段式训练页明确划掉感知与 Planning 联训步骤,并给出一段式多阶段联合训练方法。
C · 决策规划课
C 课主要讲规则与模型化规划,没有跨感知到规划的梯度训练。

合并读法:梯度流比模型数量更接近真正边界;但一段式也常用分阶段训练,不代表每一步都全量联训。

结构化中间表征只是负担,删掉后 Planner 会自然学会所有约束。

保留张力
A · 端到端早期课
A 课说明结构化表征会丢信息,也展示一段式和 Diffusion 仍需辅助约束或后处理。
B · 端到端一期
B 课的 VAD 保留向量化场景与碰撞、越界、车道方向约束,Query Planner 训练目标也覆盖交规和舒适性。
C · 决策规划课
C 课把运动学、障碍物、道路边界和时空联合约束写成显式搜索与优化问题。

合并读法:减少表征瓶颈不等于取消约束。更实际的问题是约束放在训练、解码、后处理还是控制层。

Query 架构已经把一段式与两段式的差异消除了。

作用域不同
A · 端到端早期课
A 课的两段式 PLUTO 和一段式 VAD 都使用 Query,说明 Query 不是段式专属。
B · 端到端一期
B 课用 UniAD、VAD、DriveTransformer 展示 Query 可以承载串行、并行和无 BEV 多种组织方式。
C · 决策规划课
C 课的传统方法也采用候选道路、轨迹库和代价排序,只是没有用 Transformer Query 表达。

合并读法:Query 是信息槽位和交互机制,不能单独决定系统边界。要继续检查它读取什么、输出什么、损失回到哪里。

相关术语

  • 端到端——让模型更直接地从传感器输入学到驾驶输出,减少中间环节的信息损失,但不等于取消工程约束。
  • 两段式——第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。
  • 一段式——感知、预测、规划在统一表征里联合优化,直接输出轨迹——上限更高,但难 debug、难闭环验证。
  • 潜空间——模型内部的压缩工作台:信息比结构化标签丰富,但人读不懂,所以出错难归因。
  • 鸟瞰图表征——把多摄像头视角融合到统一的鸟瞰空间,降低对高精地图的依赖。
  • 占据栅格——用空间中每一块「有没有被占据」来表达障碍,解决检测框只能识别规则形状物体的问题。
  • Query 与候选轨迹——query 是模型内部「带槽位的探针」,proposal 才是解码后拿出来比较的候选结果。
  • 导航路径——它表达的是长期路线意图(该往哪走),不是可执行轨迹,不能直接控车。
  • 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。

相关论文

材料来源

课程章节页码说明
AA-01 端到端任务概述p7-p12, p20方案演进、信息损失与传统/端到端框架的输入输出边界。
AA-02 两段式端到端算法p5, p8-p11两段式数据流、可解释性、模块化迭代和跨团队协同代价。
AA-02 两段式端到端算法p13-p21, p24-p27结构化接口的具体字段、Planner 输出和模仿学习训练难点。
AA-03 一段式端到端算法p7, p9-p12特征直连旁路、统一潜空间、规划导向监督与闭环仿真困难。
AA-04 导航信息的量产应用p7-p15, p25-p30导航职责、Navigation Path 边界、一段式融合、特征编码与退化增强。
BB-01 端到端自动驾驶概述与课程介绍p13, p16-p20模块化到端到端、产业/学术两套分类和 UniAD 五类 Query。
BB-02 BEV Encoderp9, p24, p27-p35Dense/Sparse 表征、实时性边界和对象级时序记忆。
BB-03 动静态感知 Decoderp12-p19, p31-p37HDMap/在线感知取舍、动静态接口及其与 Planner 的输入关系。
BB-04 基于 Query 的端到端 Plannerp5-p11, p13-p30QKV 交互、四种 Planner 范式、UniAD/VAD/DriveTransformer 与训练约束。
BB-07 端到端模型的训练范式p5, p7-p12多任务训练复杂度、感知/规划多阶段训练,以及二段式的组织成因。
BB-07 DriveTransformer 架构分享sec4 p2-p7Dense BEV 长距离与长时序代价、Sparse Query 和可学习任务关系。
CC-00 自动驾驶决策规划简介p6, p22-p25, p31-p34模块化系统职责、交互规划需求、规则规划谱系和 UniAD 接缝。
CC-02 基于模型的预测方法p4-p7, p16-p27, p33-p35预测接口、多模态与长时意图,以及手工特征的表达边界。
CC-04a 路径与轨迹规划p14-p28, p31-p44经典规划的候选、代价、约束、DP/QP 和横纵解耦边界。
CC-04b 时空联合规划p4-p14, p27-p38时空联合动作、语义走廊和显式动力学/安全约束。
CC-09 数据驱动前沿算法与发展趋势p24UniAD 555.6ms/1.8FPS 与 VAD-Tiny 59.5ms/16.8FPS 的延迟对比。
AA-03 一段式端到端算法p6, p12, p15八家厂商段式站队、闭环仿真五连不稳定与 DiffusionDrive 步数反直觉结果。