← 深度专题

专题 02

Planner:一段式端到端怎样生成一条可执行轨迹

当感知、导航与自车状态已经被编码,一段式端到端究竟怎样用 Query、AR、Diffusion 或 Flow Matching 产生轨迹,并在实时预算内选出最后一条?

“一段式”描述的是训练和信息流边界,不等于从像素直接吐方向盘角。量产链路通常仍包含场景编码、条件化轨迹生成、候选排序、规则过滤、时空优化与控制。本专题把 Query、AR、Diffusion、Flow 放在同一套输入—表示—训练—推理—选轨框架里比较,重点解释它们各自把困难放在了哪里。

10 个小节 · 约 24 分钟阅读

先画清边界:一段式不是删掉所有模块

一段式端到端把动态目标、静态道路、导航和自车状态放进统一的可学习信息流,让规划损失能够影响共享表征;它并不要求取消编码器、后处理或控制器。A 课程给出的量产链路中,动态元素包含位置、尺寸、航向、速度和预测轨迹,静态元素包含路沿、车道线、箭头与属性,SD 导航另外提供推荐车道、行点和剩余距离。三路输入编码成环境特征,再由 ego multimode query 交叉注意并回归轨迹。

B 课程把 Planner 的最小问题定义为:场景表征作为条件,输出未来自车轨迹。场景表征可以是 BEV feature、稀疏 query、agent/map token 或几种形式的组合。所谓“感知规划一体化”主要改变中间接口是否可学习,而不是让地图拓扑、交通灯语义和车辆动力学凭空消失。

A 的量产经验还明确保留多模轨迹过滤、横纵向打分、时空联合 refine 和控制模块。因此评审一个一段式系统时,至少要问清四个边界:Planner 收到什么;生成器输出什么;谁负责从多条候选中选一条;执行前还有哪些硬约束。只看网络结构图会把真正决定可用性的选择器与安全链路漏掉。

  • 输入:传感器或其场景表征、agent/map/navigation token、ego history 与车辆状态。
  • 输出:单轨迹、多模轨迹及分数,或可进一步解码为控制量的 action token。
  • 执行前:导航一致性过滤、碰撞与可行驶区检查、时空优化、控制跟踪。
  • 训练边界:共享表征是否被规划损失更新,比界面上是否还叫“模块”更能区分一段式与传统串联。

四种 Planner,其实在解同一个条件生成问题

统一写法是从当前场景 s 生成未来轨迹 τ:π(τ|s)。差别在于怎样表示 τ、怎样定义训练目标,以及推理时如何搜索。Query 回归直接预测若干连续轨迹;Query 打分先准备 anchor 或轨迹词表,再预测每个候选的分数与修正量;AR 把轨迹拆成有顺序的离散 action token;Diffusion 从带噪整段轨迹反复去噪;Flow Matching 学习从噪声轨迹流向数据轨迹的连续速度场。

传统规划课提供了不可跳过的物理参照。Frenet 采样、Lattice、时空联合规划与走廊优化都在做“生成多个可行动作,再按安全、效率、舒适和动力学选优”。学习型 Planner 不是取消这个问题,而是把候选分布、代价或二者都交给数据学习。因而比较生成模型时,仍应检查候选是否覆盖正确机动、轨迹是否动力学可行、与他车预测是否交互一致、最终选轨是否能解释。

Query 方案是重要基线:回归型结构简单、易与感知 query 统一,但单轨迹 MSE 容易平均多种合理未来;anchor 打分能稳定提供多模候选,却受词表覆盖上限约束。AR、Diffusion 和 Flow 的价值,是用不同的生成假设扩大候选表达能力,而不是绕开候选覆盖与选择这两个基本问题。

AR

离散序列

  • 表示:acc/yaw_rate 或 dx/dy/dyaw 等 action token
  • 训练:teacher forcing 下的 next-token 交叉熵
  • 推理:逐 token 采样或 Top-K,串行解码
  • 主要风险:量化误差、exposure bias、早期分支选择造成模式坍缩

Diffusion

整段轨迹分布

  • 表示:轨迹、anchor 附近残差或归一化残差
  • 训练:随机时间步的噪声或 score 回归
  • 推理:多候选迭代去噪,可并行处理候选
  • 主要风险:采样延迟、候选无天然排序、锚点盲区

Flow

连续速度场

  • 表示:从噪声轨迹到真实轨迹的概率路径
  • 训练:任意时刻的 velocity regression
  • 推理:解条件 ODE,可用少步积分
  • 主要风险:少步质量、目标条件和选择器仍决定可用性
B 课程把三种范式作为 Planner 横向索引;A 课程进一步补齐了 AR/Diffusion 的量产接口与 RL 结合方式。

AR:从场景 token 到动作 token,再自回归还原轨迹

AR 的第一步不是“套一个 GPT”,而是定义动作词表。A 课程给出两类常用表示:一类用 acc 与 yaw_rate,便于对应车辆控制与动力学;另一类用局部坐标下 dx、dy、dyaw,直接表达相邻时刻位姿变化。连续动作可按固定区间离散,也可用 K-means 建码本。Plan-R1 的示例按 Vehicle、Pedestrian、Bicycle 分别建立 [1024,3] 的 x、y、heading 码本,以 box 平均角点距离而非中心点距离匹配真值,避免同位置不同朝向被误认为同一动作。

场景侧也必须 token 化。A 的实现将动态 Polygon、静态 Polyline、Property 和 Mask 编成统一 token:一个动态体每个历史时刻占一个 token,车道线、路沿、停止线与红绿灯携带几何和属性,导航车道把是否推荐、车道序号、道路类型、距路口距离和转向语义写进 Property,导航行点则作为 Polyline。随后 Transformer decoder 在这些场景条件上预测下一个 action token。

训练时,真值连续动作先匹配最近的离散 token,teacher forcing 让每一步都看到真实历史,交叉熵最大化 p(z_t|z_<t,context)。这使所有时间步可并行训练、损失单一、梯度稳定。推理时则不同:模型必须把自己刚预测的 token 解码成下一位姿,再把预测历史喂回下一步,直到生成完整 T 步轨迹。Top-K 或采样可形成多模候选,序列似然可提供排序信号,但似然高不等于长期安全收益高。

AR 的实时性瓶颈来自因果串行:action token 越密、预测时域越长,解码次数越多。减少 token 数、一次输出 action chunk 或分层先出意图再出细动作可以降延迟,却会改变 credit 粒度和闭环纠错频率。B 课程引用的 DriveVLA-W0 对比中,AR latency 随 action token 数增长,而 Query-based 和 Flow Matching 近似恒定;这是一条架构趋势,不等于任何具体实现都必然更慢。

  1. 构建动作词表把连续控制或相邻位姿变换离散成 token;验证码本覆盖率、量化误差和不同速度区间的分辨率。
  2. 编码场景上下文融合 ego history、动态 agent、道路拓扑、交通灯、导航和有效性 mask,避免只用视觉 token 丢失车端必需语义。
  3. 监督预训练以 teacher forcing 做 next-token 交叉熵,先获得可驾驶、接近人类分布的策略初始解。
  4. 自回归推理逐步采样 token、更新局部位姿并反馈;同时监控解码延迟、非法 token、误差累积和分支过早收缩。
  5. 候选排序与约束不能只按序列似然执行;仍需碰撞、可行驶区、导航、舒适度与控制可跟踪性检查。

Diffusion:不是把轨迹画成图片,而是对动作序列做条件去噪

Diffusion Planner 把整段未来轨迹或动作序列当作随机变量。训练时从专家轨迹 τ 采样时间步 t 并加入高斯噪声,网络以场景 s、时间步 t 和带噪轨迹 x_t 为输入,回归加入的噪声或等价 score。视觉观察可通过 FiLM 注入 Conv1D,也可作为 Transformer cross-attention 的 key/value;自动驾驶实现通常还接入 BEV、agent、map、ego status 与导航目标,因此并非无条件“从噪声造线”。

推理从一组噪声轨迹开始,循环执行 x_T 到 x_0 的去噪。候选之间可以并行,但每个候选内部仍有多次 decoder 调用。Vanilla Diffusion 需要较多采样步,车端难以承受;DiffusionDrive 用 K-means anchor 表示直行、转弯、变道等意图,只在 anchor 附近按截断 schedule 加噪,再用约两步级别的 decoder 局部恢复。它以结构先验换取速度,但当 anchor 词表没有覆盖新机动时,截断采样也会把盲区固化。

ResAD 进一步不预测整条轨迹,而是先由当前 ego state 构造惯性参考,再让 Diffusion 生成归一化残差。这样不同预测时刻和速度尺度更一致,网络只学“相对物理先验需要修多少”。急转、紧急避障、低速博弈等惯性参考较差的场景,必须单独验证 residual 空间是否仍覆盖真值。

Diffusion 的多模态只是候选能力,不是决策能力。基础模型生成 N 条轨迹后,必须有 score head、trajectory ranker、mode selector 或外部代价函数选出最终轨迹。DiffusionDrive 同时预测 score 和 trajectory;ResAD 明确输出 Top-1/Top-5;DiffusionDriveV2 先用 score 选 Top-K,再学习排序。评测应把“真值是否在 Top-K”与“Top-1 是否选对”分开,否则无法判断失败来自生成器还是选择器。

  1. 定义生成空间选择整轨迹、anchor 残差或惯性参考残差,并做好坐标归一化与物理可行性检查。
  2. 构造场景条件将 BEV/PV、agent/map、ego status、导航或 goal point 注入 denoiser,而非只依赖随机噪声。
  3. 随机时间步训练对专家轨迹加噪,回归噪声/score;同时可保留监督规划损失,避免生成目标与驾驶目标脱节。
  4. 截断或少步去噪围绕 anchor 初始化多组候选,按固定步数迭代,实测端到端 P50/P99 延迟而不是只报 decoder 单步耗时。
  5. 排序和执行前检查用可驾驶区、碰撞、导航、舒适和 goal alignment 选 Top-1,再经规则过滤、时空 refine 与控制。

Flow Matching:学习“往哪里流”,再用 ODE 把噪声推成轨迹

Flow Matching 同样学习条件轨迹分布,但训练对象从 Diffusion 的噪声/score 变成速度场。对每条专家轨迹 τ 采样高斯噪声 ε 和 t∈[0,1],在线性概率路径上构造 x_t=(1-t)ε+tτ,目标速度是 τ-ε。模型 v_θ(x_t,t,s) 看到场景编码 s 和当前中间轨迹 x_t,回归“此刻应该向哪个方向移动”。训练仍然是可并行的均方误差,并不需要在训练时完整解 ODE。

推理从 x_0=ε 出发,根据 dx/dt=v_θ(x,t,s) 做 Euler 或更高阶积分,直到 x_1 成为轨迹。因为学习的是确定性 ODE,给定同一初始噪声和条件时路径确定;通过不同初始噪声仍可生成多模候选。步数可以少于典型 Diffusion,但每减少一步都会提高数值积分与模型逼近误差,必须用闭环安全和候选覆盖验证,而不能把“可少步甚至一步”直接写成量产事实。

GoalFlow 展示了 Flow 在 Planner 中的完整接口:感知模块生成 BEV feature;goal point 词表结合 ego status 与 BEV,用距离分数和可驾驶区合规分数选目标点;轨迹解码器以 BEV 和 goal point 为条件做 Flow Matching;最后 trajectory scorer 在多条候选中选一条。可见 Flow 并没有取消离散先验和选择器,而是把“从目标到完整轨迹”的连续生成环节换成速度场。

Flow 的实时优势也不能脱离轨迹长度和网络结构。它可以并行更新整段 x_1:T,延迟对 action token 数不像 AR 那样线性串行增长;但 ODE solver 的函数评估次数、候选数、场景 cross-attention 和最终 scorer 都在总预算内。工程验收应报告 NFE、候选数、端到端频率、最坏延迟和闭环降采样影响。

  1. 采样端点从专家数据取目标轨迹 τ,从简单分布取噪声轨迹 ε,并保留场景条件 s。
  2. 随机选取中间时刻构造 x_t=(1-t)ε+tτ,让模型覆盖从纯噪声到真实轨迹的整条概率路径。
  3. 回归条件速度场最小化 v_θ(x_t,t,s) 与 τ-ε 的差异;场景编码、导航或 goal point 决定生成方向。
  4. 少步 ODE 推理从多组 ε 出发积分到 t=1;以 NFE 和端到端延迟衡量“少步”,而不是只用方法名称判断。
  5. 目标与候选选择先验证 goal vocabulary 覆盖,再验证 trajectory scorer 能否把安全、可行驶且导航一致的候选排到 Top-1。

选轨是第一等公民:生成得多,不等于最后选得对

传统 Lattice、DP/QP 和时空走廊方法早已把候选生成与代价选优分开:候选要覆盖足够机动,代价再权衡障碍、道路边界、效率、平滑和动力学。学习型 Planner 仍遵守这条结构,只是候选和代价可能都由网络产生。若论文只报告 minADE/minFDE,它测到的是候选集中最好的一条,不能证明系统执行的 Top-1 正确。

AR 可用 token 概率或 beam score 排序,但局部最大似然并不等于整段长期回报;Diffusion 本身没有显式 likelihood ordering,通常外接 score/ranker;Flow 也需要 goal scorer 与 trajectory scorer。候选选择至少要融合碰撞、TTC、DAC、导航一致性、速度限制、舒适、进度和可控制性,并显式处理冲突优先级。

预测与规划的耦合也影响选轨。C 课程区分边际预测和联合预测:分别给每辆车选最高概率轨迹,可能组合出彼此碰撞的“不可能场景”;联合预测或 ego-conditioned prediction 把自车候选与他车反应配套评估。Planner 若只在固定他车预测上打分,会把交互风险留给执行时兜底。

  • 生成质量:GT/安全可行轨迹是否进入 Top-K,是否覆盖直行、转弯、让行、绕行等关键 mode。
  • 排序质量:Top-1 相对 Top-K oracle 的差距,排序分数是否经过场景分层校准。
  • 约束质量:候选在道路、碰撞、交通规则和动力学上的硬失败率。
  • 闭环质量:执行 Top-1 后,环境反馈是否使下一周期候选发生正确变化。

硬数字对撞:三条路线各自的账单

AR 的第一笔账是词表。时间步 token 化在 10 秒 × 10Hz 下要生成 100 个 token,序列长、误差累积严重;改成空间点 token 只需 10-20 个——同一条轨迹,表示方式决定了序列长度和误差传播路径。词表大小也有最优点:AutoVLA 的动作码本从 256 扩到 2048 时,覆盖率从 86.47% 升到 99.42%、使用率保持 100%;再扩到 4096,覆盖率满了,使用率却跌到 91.46%——近一成的码本变成死权重。Plan-R1 的做法更工程化:[1024, 3] 的码本按车辆、行人、骑行者分别构建,用角点距离而非中心距离匹配。

tokenizer 的选择直接可测。同一套 AutoVLA 框架下,K-disk 聚类词表拿到 PDMS 80.54,换成 FAST 的 DCT 压缩只有 67.63;让视觉语言模型用物理动作 token 输出是 80.54 分、3.95 秒,让它用文字写航点坐标掉到 71.31 分、7.65 秒——慢一倍还差九分。FAST 论文那句“tokenizer 即控制接口”在这里有了完整的实证版本:选错表示,模型看起来会预测,落到控制却又慢又抖。

Diffusion 的账单是延迟。标准扩散推理要 20-100 步、每步跑一遍完整网络,课件的判断是“实时自动驾驶几乎不可接受”。DiffusionDrive 的解法是用 K-means 聚出驾驶意图锚点、围绕锚点加噪,把去噪截断到 2 步——反直觉的是对照组 Transfuser_DP 跑满 20 步反而 mode collapse,2 步的截断版本保持了多样模式。截断的真正价值不是少跑几步,而是把无结构的高斯探索换成围绕意图锚点的局部探索。ResAD 走另一条路:不从噪声重建整条轨迹,只预测相对惯性参考的归一化残差——把驾驶物理放进生成空间的先验里。DriveVLA-W0 的横向对照收尾:AR 延迟随 token 数线性增长,Query 与 Flow Matching 近似恒定。

生成之后还有一段被低估的差距。AutoVLA 的 One-shot 是 80.54,Best-of-N 采样是 92.12——差 11.6 分意味着生成器“知道”更好的答案,只是第一次没采到,选择器没选到。GoalFlow 的反面证据同样直接:没有目标点引导时生成轨迹“混乱分散”,加上 goal 词表打分和可行驶区域合规分才收敛。Diffuser 早就给出这套分工的原型:用 value 梯度引导采样,“生成”和“择优”分开,不必重训生成器。三条证据指向同一结论:选轨器不是生成器的附件,是并列的第一等公民——这也回应了本篇 selection 一节的判断。

最后两个单变量实验,提醒不要把性能差异全部归因给路线本身。DrivingGPT 只加了一个 Action 位置编码,PDMS 从 65.3 涨到 82.4——17 分来自一个 embedding,不是范式革命。DriveMoE 的专家数量存在最优点:6 个专家 Driving Score 74.22,切到 13 个降到 70.88,44 个只剩 68.22——分治切得太细,每个专家分到的数据不够。很多“路线 A 打败路线 B”的对比里,藏着的是这类工程变量。

  • 词表:100 个时间步 token vs 10-20 个空间点 token;码本 2048 是甜点,4096 使用率跌到 91.46%。
  • tokenizer 实测:K-disk 80.54 vs FAST 67.63;物理动作 3.95s vs 文本航点 7.65s。
  • 延迟:标准扩散 20-100 步不可上车;DiffusionDrive 截断到 2 步反而模式更全。
  • 生成-选择差距:One-shot 80.54 vs Best-of-N 92.12——答案在分布里,选择器没捞到。
  • 单变量警示:一个位置编码 +17.1 分;MoE 专家 6 个最优,44 个反降。

与 RL 的接口:优化的是 token、去噪过程,还是整段候选

AR 天然给出 π_θ(a_t|s_t):监督阶段用 -logπ(a_t^gt|s_t),RL 阶段只是在 log probability 上乘优势并增加相对 reference policy 的 KL。动作、环境步和 reward 的时间粒度容易对齐,Plan-R1 因而可以冻结 world model decoder、更新 planning decoder,并按 On-road、Collision、Speed Limit、Comfort 做组内 rollout。

Diffusion 有三类 RL 接口。Energy-Based 在生成后按 exp(βR) 重排样本,改动小但主要优化选择;Value-Guided 在去噪时加入价值梯度,不重训生成器但依赖可微、可靠的 value;Policy-Level 把整条去噪策略纳入 PPO/GRPO 更新,能改变分布,却要解决多步 log probability、轨迹级 credit 和高方差。DiffusionDriveV2 用 anchor 内与 anchor 间两层 GRPO,既防组内模式坍缩,也避免“矮子里拔将军”。

Flow-GRPO 把 Flow 生成过程视为策略,以同场景多样本的组内相对 reward 调整向量场方向,并用 clipped objective 与 KL 限制更新。它让整段轨迹 reward 进入连续生成器,但 credit 仍是 trajectory-level;少步采样降低 rollout 成本,不自动解决 reward 是否正确。无论哪种 Planner,RL 都应建立在已有监督策略上,不能替代场景表示、动作词表与基本可驾驶行为的学习。

AR + RL

逐动作 credit

  • policy likelihood 明确,KL 与 reference model 接口直接
  • rollout 粒度与环境 step 对齐
  • 长期 reward 仍可能被错误归因给早期 token

Diffusion + RL

整轨迹与去噪 credit

  • 适合对完整多模候选施加长期 reward
  • 可选重排、采样引导或直接更新三种深度
  • 去噪链长、log probability 和 credit assignment 更复杂

Flow + RL

向量场 credit

  • 少步生成有利于降低组 rollout 成本
  • GRPO 可用组内相对优势更新连续生成器
  • 仍依赖可靠 reward、闭环环境和行为锚点
A 课程倾向把 AR + RL 视为更直接的量产接口,同时也明确记录 Diffusion/Flow 在整轨迹多模态上的优势与训练风险。

终局判断:AR+RL 是当下的多数派,但要知道代价

A 课在 AR 与 Diffusion 的终局对比里给了一张五维表:决策可解释性,AR 强(逐步决策可回放)、Diffusion 弱;RL 的信用分配,AR 清晰(每个 token 都有 log 概率)、Diffusion 非常模糊;动作控制粒度,AR 精细、Diffusion 粗;在线 rollout 成本,AR 便宜、Diffusion 昂贵;reward 注入,AR 直接、Diffusion 困难。结论是讲师的原话:“AR + RL 是目前绝大多数公司的选择,范式可以参考 Plan-R1。”这句判断与 DPPO 论文侧的方法论背景一致——扩散策略接 on-policy 优化要解决 log 概率难算、方差大的问题,AR 天生没有这一关。

但同一份材料立刻给出反向对照,防止判断变成站队:多模态表达 AR 弱、易 collapse——第一个关键时间步必须“选边站”,选完之后条件分布就压缩成单模;Diffusion 强,整段轨迹级的多模态更容易保持。长期规划 Diffusion 更强,reward 可以覆盖整段生成;误差累积 AR 高——训练时 teacher forcing 看真值历史、推理时 self-feeding 吃自己的预测,exposure bias 在真车上还会沿动力学继续放大——Diffusion 低。课件的收尾句值得整段引用:“量产选择取决于团队更愿意承担哪一类复杂性。”

Diffusion 阵营对自己短板的回应也已经成体系。落地判断来自 A 课:“Diffusion 擅长覆盖多个 mode,但落地需要的是可排序、可筛选、可评估风险”——它没有显式概率排序,不像 AR 有 likelihood,不像 RL 有 value,所以量产组合是 Diffusion 只做候选生成,把筛选交给规则、优化或 RL。DiffusionDriveV2 是这条路的论文版本:intra-anchor GRPO 提升同一意图内候选的质量,inter-anchor GRPO 防止“矮子里拔将军”——正面回答了“谁来管那些不是最优的候选”。Flow-GRPO 则解决了流匹配的先天问题:确定性 ODE 没有探索空间,转成 SDE 才有可优化的分布。生成器路线之争的真实形态,不是三选一,而是各自补齐“生成-排序-优化”三件套的不同顺序。

路线评审:不要问“选 AR 还是 Diffusion”,先问七个可验证问题

方法名无法替代系统规格。对行业从业者更有用的评审方式,是把所有方案放回相同工作量和相同闭环场景,逐项比较表示、输入、训练、推理、选轨、实时性和 RL 接口。若一个方案用更多候选、更大的感知骨干或额外规则优化,却只比较 Planner 名称,结论没有决策价值。

还要区分课程口径与行业共识。B 课程把 AR 概括为“一步一步 decode 比较慢”、Diffusion 概括为“天然多模,并行解码”;这是合适的教学索引,但不包含实际 token 数、去噪步数和硬件。A 课程补充了更多量产判断,仍属于课程作者的经验总结。最终选型必须用本团队数据分布、芯片预算、闭环仿真和安全约束复验。

  • 表示:连续轨迹、动作 token、anchor 残差还是速度场?表示盲区如何测?
  • 输入:动态、静态、导航、ego history 是否齐全?异步、缺失和噪声是否训练过?
  • 训练:监督目标是否覆盖基本驾驶分布?多模态是否被平均或过早坍缩?
  • 推理:token 数、NFE/去噪步数、候选数和 P99 端到端延迟是多少?
  • 选轨:Top-K coverage 与 Top-1 selection 分别多好?失败能否定位到生成器或排序器?
  • 闭环:执行动作改变场景后是否重新产生合理分支?预测是否条件化于 ego action?
  • 优化:RL 的动作粒度、reward、reference、KL、credit 与安全兜底分别在哪里?

三门课怎么对上

同一个工程问题,三门课的观察层级不同。下面逐条标出它们是相互印证、作用域不同,还是在相同前提下保留张力——不把任何一门课单独当作行业定论。

一段式端到端仍可保留后处理、选轨、时空优化与控制。

相互印证
A · 端到端早期课
A-04 把动态、静态、SD 导航统一编码进 Planner;A-08 又给出多模轨迹过滤、打分、时空联合优化和控制的量产输出链。
B · 端到端一期
B-04 至 B-06 将端到端边界放在可学习场景表征与 Planner,多个方案都包含 score、anchor 或 trajectory selector,并未主张删除所有执行约束。
C · 决策规划课
C-04a/C-04b 把候选生成、代价选优和轨迹优化视为规划基本结构,为学习型 Planner 的执行前检查提供传统参照。

合并读法:三门课在系统结构上互相印证:端到端改变的是可学习接口,不是取消“生成—选择—优化—控制”职责。

AR 的工程优势是训练目标和 RL policy 接口直接,主要代价是串行解码与 exposure bias。

相互印证
A · 端到端早期课
A-06b 给出 action token、teacher forcing、交叉熵与 π(a|s) 到 policy gradient 的直接对应,同时专门列出误差累积和局部似然不等于长期回报。
B · 端到端一期
B-05 用 tokenizer、DriveGPT/DriveMoE/AutoVLA 展开 AR,并在三路线总结页标注逐步 decode 较慢、Top-K 采样形成多模。
C · 决策规划课
C-08 的 TRAJEGLISH 把轨迹建模为 next-token prediction,补充词表大小这一设计旋钮,但没有给出量产 RL 结论。

合并读法:“接口直接”是结构事实;“绝大公司选择 AR+RL”只出现在 A 课程,应视为课程判断而非行业统计。

Diffusion 的核心价值是整段多模态生成,但基础生成分布不能替代候选排序。

相互印证
A · 端到端早期课
A-06a 明确写出“多模态不等于可用多模态”,建议 Diffusion 生成 N 条后接规则、优化或 RL 选择,并用 DiffusionDrive/ResAD 展示 score 与 ranker。
B · 端到端一期
B-06 将 Diffusion 总结为天然多模、并行解码;GoalFlow 与 DiffusionDriveV2 都有 goal/trajectory scorer 或 mode selector。
C · 决策规划课
C-08 的 Diffusion-ES 也是 proposal—score—elite—mutation—final 的闭环,说明生成与选择不可分。

合并读法:三门课一致支持把候选覆盖与最终选择拆开评估。

Flow Matching 可少步推理,因此一定比 AR 或 Diffusion 更适合量产。

保留张力
A · 端到端早期课
A-06a 从速度场与 ODE 出发,强调可少步甚至一步,同时主动提示“可一步”是能力上限,不代表已经同时满足安全、舒适与多模态。
B · 端到端一期
B-06 以 GoalFlow 展示 goal point、Flow decoder 和 scorer,另引用示例称 Flow latency 对 token 数近似恒定,但也标注单个稳定性示例仅供参考。
C · 决策规划课
C-08 主要覆盖 Diffusion、GAN、AR、IL 与 RL,没有系统给出 Flow 的量产延迟对比。

合并读法:“少步”是有条件的潜力,不是跨硬件、候选数和网络规模都成立的行业结论;需要以 NFE 与端到端 P99 实测。

Query、AR、Diffusion、Flow 都可放进候选生成与代价选优的统一框架。

相互印证
A · 端到端早期课
A-06a/A-06b 分别把三类生成器落到轨迹或动作空间,并都保留 score、ranker 或 reward 接口。
B · 端到端一期
B-04 至 B-06 连续三章正是按 Query、AR、Diffusion 三种 Planner 组织,GoalFlow 又补入 Flow Matching。
C · 决策规划课
C-04a/C-04b 的采样、搜索、优化与时空走廊,以及 C-08 的生成模型,均采用候选或分布加代价的规划视角。

合并读法:统一框架有利于公平比较,但不能抹掉不同方法在表示盲区、搜索成本和 credit 粒度上的差异。

导航只是辅助 metadata,不影响生成模型的核心能力。

保留张力
A · 端到端早期课
A-04 把 SD 推荐车道、行点和剩余距离作为与动静态元素并列的输入,并给出 waypoint/lane prior token 与 cross-attention 的具体 shape 和增强策略。
B · 端到端一期
B-05 的 AR tokenizer 将导航车道语义和行点作为场景 token;B-06 GoalFlow 先选 goal point,再生成轨迹。
C · 决策规划课
C-04a 传统采样依赖参考线/Frenet,C-08 GAD 也把 route 列为输入,说明目标与道路先验一直是规划条件。

合并读法:导航/目标条件决定候选分布朝哪里展开。真正争议是用硬参考线、软导航 token 还是 goal vocabulary,而不是要不要目标。

联合预测或 ego-conditioned prediction 比独立边际预测更适合交互式选轨。

作用域不同
A · 端到端早期课
A-06a/A-06b 更关注自车生成器和 RL 接口,没有系统展开多车联合预测。
B · 端到端一期
B-04 的 UniAD 串行 prediction-planning 与 Query 交互提供一体化结构,但课程重点是端到端架构而非联合概率定义。
C · 决策规划课
C-07 明确对比边际与联合预测,并用 DTPP/Planning-informed prediction 展示自车候选如何改变他车场景树。

合并读法:这不是互相矛盾,而是 C 课程补上了 A/B 对选择器上游交互建模讲得较少的一层。

论文中的 minADE/minFDE 或 Top-K 最优结果足以证明 Planner 可以执行。

保留张力
A · 端到端早期课
A-06a 要求区分候选覆盖和排序,A-08 又把过滤、打分、时空优化放在执行前。
B · 端到端一期
B-06 的多个方案都保留 scorer/mode selector,B-07 强调开环指标与真实闭环驾驶弱相关。
C · 决策规划课
C-07 的 minADE/minFDE 测预测候选误差,C-04a/C-04b 则要求碰撞、道路、动力学和代价可行,不能被单一距离指标替代。

合并读法:Top-K oracle 是生成器诊断,不是执行策略验收;必须同时报告 Top-1、闭环与约束失败率。

相关术语

  • 一段式——感知、预测、规划在统一表征里联合优化,直接输出轨迹——上限更高,但难 debug、难闭环验证。
  • Query 与候选轨迹——query 是模型内部「带槽位的探针」,proposal 才是解码后拿出来比较的候选结果。
  • 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。
  • 动作词元设计——「下一步」到底表示什么——不同的 token 定义会改变学习难度、噪声传播和极端场景表现。
  • 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
  • 截断扩散与锚点——不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。
  • 流匹配——不预测噪声,而是学习从噪声轨迹流向真实轨迹的连续速度场,推理时解 ODE——采样步数更少。
  • 多模态轨迹——未来不是一个确定的点,而是一个分布:可以跟车、变道、让行、绕行,模型输出多条候选来表达这种不确定性。
  • 导航路径——它表达的是长期路线意图(该往哪走),不是可执行轨迹,不能直接控车。
  • 逐步展开与误差累积——策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。
  • 信用分配——整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 天然对齐,Diffusion 要摊回多个去噪步。
  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。

相关论文

材料来源

课程章节页码说明
AA-04 导航信息的量产应用p15, p25-p30一段式输入链、SD tensor/token、导航增强与变道晚问题。
AA-06a Diffusion 轨迹优化4.1-p11-p26条件扩散、推理成本、多模态选择、DiffusionDrive 与 ResAD。
AA-06a Diffusion 轨迹优化4.4-p4-p11Energy-Based、Value-Guided、Policy-Level RL 与 DiffusionDriveV2。
AA-06a Diffusion 轨迹优化4.4-p12-p18Conditional Flow Matching、自动驾驶速度场建模、GoalFlow 与 Flow-GRPO。
AA-06b AR 轨迹优化4.2-p13-p18时间状态、空间点、acc/yaw_rate、dx/dy/dyaw 与 FAST token 表示。
AA-06b AR 轨迹优化4.2-p19-p31AR 输入 token、训练/推理链、实时性、误差累积与多模态边界。
AA-06b AR 轨迹优化4.3-p5-p20Plan-R1、码本实现、GRPO、开闭环和 AR/Diffusion 的 RL 接口比较。
AA-08 端到端量产经验分享p28-p34reward 冲突优先级、轨迹过滤/打分/时空优化和红绿灯执行链。
BB-04 L4 端到端规划:基于 Query 的 Plannerp6-p30Planner 定义、Query 范式、UniAD/VAD/DriveTransformer 与模仿学习约束。
BB-05 L5 端到端规划:基于自回归 AR 的 Plannerp3-p32三路线对比、trajectory tokenizer、AR 案例与 AutoVLA RFT。
BB-06 L6 端到端规划:基于 Diffusion 的 Plannerp5-p30Diffusion Policy、GoalFlow、DiffusionDrive、Flow 延迟参照与三范式总结。
BB-07 L7 端到端模型的训练范式补充材料 sec4-p9-p21开环与闭环评测弱相关、Bench2Drive 场景和指标。
CC-04a 路径与轨迹规划p13-p45Frenet 采样、候选组合、代价函数、ST 决策与优化边界。
CC-04b 时空联合规划p3-p40s-l-t 搜索、轨迹参数化、时空走廊和可执行轨迹优化。
CC-07 L7 数据驱动的预测方法p27-p48, p61-p63轨迹输出表达、目标点、边际/联合预测、DTPP 与评测指标。
CC-08 L8 数据驱动的规划方法p4-p64Diffusion-ES、GenAD、QuAD 与 TRAJEGLISH 的生成和选择视角。
BB-05 基于自回归 AR 的端到端 Plannerp14, p26, p28-p32Tokenizer 设计矩阵、DrivingGPT 位置编码消融、AutoVLA 码本取舍与 Best-of-N、MoE 专家数量。
BB-06 基于 Diffusion 的端到端 Plannerp7, p10, p15-p23去噪步数、Diffusion Policy 多模态对照实验、DiffusionDrive 截断与 GoalFlow 目标点收束。
AA-06a Diffusion 轨迹优化4.1-p17-p25多模态未来立论、20-100 步成本页、截断的探索语义与“可排序可筛选可评估风险”判断。
AA-06b AR 轨迹优化4.2-p13, p29-p30; 4.3-p10, p16-p18token 粒度对比、exposure bias、Plan-R1 码本与 AR/Diffusion 五维终局对照。