E2E-AD STUDY · 复习汇总

端到端自动驾驶复习汇总

生成 2026-07-03 课件 10 份 论文 17 篇 章节 11 章

面向"已学过一遍、要快速回忆"的场景。每章五段式:一句话核心 → 必须能复述的点 → 关键公式 → 论文卡 → 易混点 → 自测钩子。这门课回答一个问题:怎样从传统模块化自动驾驶,走向能直接生成轨迹、又能被评测和量产约束的端到端系统。

技术演进:2021 前 高精地图 → 2022 BEV 无图 → 2023 Occupancy → 2024 端到端 → 2025 VLA/VLM

01

为什么端到端

第一章课件

端到端解决传统 pipeline 的信息损失、误差累积和规则瓶颈,但它改变的是"模型学多深",不是"工程要不要"。

必须能复述的点

  • 三个系统性动机:信息损失(世界被压成检测框/车道线/置信度标签)、误差累积(上游不确定性被下游放大)、规则瓶颈(模块多、长尾规则难穷举)。
  • 量产形态:模型给候选,规则管底线,评测找回归,数据闭环修分布。导航、法规检查、后处理、评测一个都不能少。
  • 数据集与指标:nuPlan(HD 地图+轨迹+行为标签,开环/闭环反应式/非反应式);ADE/FDE 衡量"像不像专家",不等于安全舒适;开环可复现但验证不了纠错能力,闭环真实但依赖仿真质量。

关键公式

ADE = (1/T) · Σt=1..T ‖x̂t − xt‖₂    FDE = ‖x̂T − xT‖₂

ADE 是预测轨迹与真值轨迹逐点距离的平均,FDE 只看终点。两者都是"模仿误差",不含安全、法规、交互语义。

易混点

  • 端到端 ≠ 没有中间约束、没有后处理。红绿灯至今仍需检测/选灯/倒计时/故障处理等工程模块。
  • 开环指标好 ≠ 闭环能跑:开环看不到"自己犯错后的状态"。

自测端到端解决哪两类问题?为什么不等于取消规则?(长文自测题 1、2)

02

两段式端到端

第二章课件

先输出结构化世界(第一段),再基于它规划轨迹(第二段)——用信息压缩换可解释、可控、可量产。

必须能复述的点

  • 中间表征四类:动态(3D 框、速度、yaw、tracking ID)、静态(车道线 polyline、boundary、curb)、交通灯(框、颜色、路口通行性)、规控输出(未来 N 步多模态轨迹+概率)。
  • 四个价值:可解释(能问"是不是感知错了")、可控(接规则/风险检测)、可迭代(模块分开升级)、易量产(训练稳定、归因直接)。
  • 三个代价:中间表征压缩丢细节、上下游互相甩锅、梯度无法跨模块反传,复杂交互上限低于一段式。
  • 量产经验占比金句:数据 60%、模仿学习 30%、RL 10%——别把 RL 当第一解法。

关键公式

𝓛BC = 𝔼(s, a*)∼𝒟 [ ‖πθ(s) − a*‖² ]

行为克隆(behavior cloning):让策略输出逼近专家动作。PLUTO 的贡献是在这个框架上叠加辅助 loss、对比学习和 positive/negative augmentation,而不是换掉框架。

论文卡

论文解决什么记忆钩子
PLUTO模仿学习配好结构+辅助 loss+数据增强+因果混淆处理,闭环逼近甚至超过规则 planner把 IL 做到极致,再谈 RL
BEVFormer多摄像头 → BEV:spatial cross-attention 采样图像特征,temporal self-attention 融历史BEV query 是空间探针
Sparse4D稀疏 object query + deformable 4D 聚合做 3D 检测,比 dense BEV 高效稀疏 query 换效率
MOTRtrack query 维持目标身份 + newborn query 发现新目标,检测跟踪一体化感知第一段也在端到端化

易混点

  • PLUTO 的 positive/negative augmentation:让模型知道哪些扰动应该行为不变(抗噪)、哪些扰动必须改变规划(因果关键)——这是处理 causal confusion 的核心。
  • 两段式不是传统手写 pipeline 复刻:第一段和第二段本身都可学习。

自测两段式为什么量产友好?中间表征丢什么信息?(长文自测题 3、4)

03

一段式端到端

第三章课件

感知、预测、规划压进统一 latent space 联合优化,上限更高,代价是难 debug、难闭环验证。

必须能复述的点

  • Latent space = 模型内部的压缩工作台:信息比结构化标签丰富,但人读不懂;出错难归因到感知/预测/导航/规划。
  • 四个优点:信息完整不过早离散化、统一时空表示、避免 perception-induced planning failure(中间检测不完美但最终轨迹仍可能对)、天然接世界模型/VLA/RL/大数据。
  • 四个代价:不可解释、多任务联训相互干扰、闭环仿真难(feature warp 失真、轨迹抖动发散)、量产验证链路长。
  • 三个建模方向:Diffusion(多模态强但慢)、世界模型(推演未来但长期不稳、会虚构物体)、VLA(语义条件化强但验证链路最长)。

关键结构

原始世界:图像 + 点云 + 地图 + 导航 + 历史轨迹 + 周围车
    ↓ 编码器
latent space:模型内部压缩向量(隐含"前车在减速""导航要左转"等信息)
    ↓ planner / policy head
输出:未来轨迹 / 动作 token / 控制建议

论文卡

论文解决什么记忆钩子
VAD场景不 raster 成图,用 agent motion + map element 向量化表示,规划时保留显式交互和约束黑盒和结构化之间的折中
VADv2从单条确定轨迹走向概率规划,把不确定性纳入 action distribution量产需要概率+约束+可评测结构

易混点

  • 一段式 vs 两段式不是二选一,是连续谱——读 VAD 要追问:哪些结构还是显式的?哪些开始变 latent?
  • Query ≠ 候选轨迹:query 是带槽位的探针(可学习向量),proposal 才是解码后拿出来比较的候选。

自测什么是 perception-induced planning failure?一段式为什么 debug 难?(总纲 扩展题 28、§11.3 题 5)

04

导航信息

第四章课件

Navigation Path 是长期路线意图(战略地图),不是可控轨迹——它告诉模型"该往哪走",轨迹还要自己规划。

必须能复述的点

  • 导航模块五职责:车道级全局路径规划(lane sequence 搜索)、关键机动点识别、参考线生成(centerline/曲率/限速)、规划约束与优先级、偏航监控与 reroute。
  • 适用场景四类:路口择道(感知不充分时人驾轨迹给提前选口监督)、主辅路/环岛出口(需要超视距车道联通)、地下停车场(几何不稳定,核心是"往哪走")、通行概率估计(学类人通行选择)。
  • 一段式中的编码:SD waypoints、waypoint action、speed limit、lane action/recommend,经 cross-attention 把 lane-prior 注入 waypoint query。
  • 导航增强四类:横向偏移(模拟定位漂移)、行点稀疏缺失(地图不可用)、纵向时序偏移(更新慢)、时间不一致(帧间异步)——目的是防止模型过度依赖完美导航输入。

易混点

  • 参考线 ≠ 轨迹:参考线是几何基准和长期方向;轨迹要满足避障、动力学、舒适、规则。
  • 导航增强不是把导航变随机,是主动注入真实世界会出现的导航退化。

自测Navigation Path 为什么不能直接控车?哪四类场景最需要它?(长文自测题 7、8)

05

Diffusion 轨迹生成

课件 4.1

未来不是一个点而是一个分布,Diffusion 用"加噪-去噪"一次生成多条候选轨迹,但落地必须解决实时性和候选质量。

必须能复述的点

  • 核心机制:从真实轨迹逐步加噪,模型学反向去噪;条件是自车状态、地图、障碍物、导航。
  • 擅长:多模态候选、不确定未来建模、世界模型/场景生成、长尾扩增。难点:多步去噪慢、候选间无显式价值排序、条件控制和规则对齐难、mode collapse 风险。
  • 工程原则:别让生成模型从零学物理——给 anchor、reference、normalization 强先验,把学习目标缩小到"在合理先验上做必要偏离"。

关键公式

q(xt | x0) = 𝒩( √ᾱt · x0,  (1 − ᾱt) · I )
𝓛 = 𝔼x₀, ε, t [ ‖ε − εθ(xt, t, c)‖² ]

ᾱt 随 t 增大而减小,轨迹逐渐变纯噪声;模型 εθ 学习在条件 c(场景信息)下预测所加噪声,采样时反向逐步去噪。truncated diffusion 的做法:不从纯噪声出发,从 anchor + 少量噪声出发,去噪步数大幅减少。

论文卡

论文解决什么记忆钩子
DiffusionDrive多模态好但采样慢 → truncated diffusion + 多模态 anchors,少量步数出多样轨迹截断 + 锚点换实时
ResAD从零预测被远期不确定性拖累 → 惯性参考系 + 归一化残差先给惯性参考,只学偏离
Diffuser生成和择优分离 → 采样时用 value/reward gradient 引导生成归生成,价值来导航

易混点

  • 多模态 ≠ 每条候选都安全:生成后仍需 scoring / rule check / refine(这是 V2 引入 RL 的原因)。
  • Diffuser 的 value guidance 是采样期引导、不改生成器;Diffusion-QL/DPPO 是训练期微调——别混。

自测DiffusionDrive 为什么要 truncated?ResAD 的 residual 什么时候比直接预测稳?(长文自测题 11、12)

06

AR 轨迹生成

课件 4.2

AR 把轨迹变成 next-token prediction,训练稳定、天然接 RL rollout,代价是误差累积和多模态坍缩——关键设计是"下一步 token 到底是什么"。

必须能复述的点

token 设计优点风险
时间步状态 / 轨迹点直观、可加动力学约束序列长、误差累积重
acc / yaw_rate 量化学习难度低、积分平滑、dyaw 抖动小急加减速时 action 分布稀疏
dx / dy / dyaw 量化贴近几何、极端场景更真实噪声几何放大、dyaw 抖动大
FAST 类 action token控制接口紧凑需验证物理可执行性
  • 三个优点:CE 目标清晰稳定、transformer 天然适配(causal mask)、和 RL 接口自然(生成即 rollout,先 BC/CE 再 PPO/GRPO 顺)。
  • 三个缺点:exposure bias(训练看真实历史、推理看自己的预测,错误改变输入分布并放大)、多模态弱(早期 token 选边后条件分布坍缩到单模式)、只最大化局部似然不最大化长期回报。

关键公式

𝓛AR = − Σt log pθ( at | a<t, s )

在场景条件 s 下,最大化每个动作 token 对历史 token 的条件概率——把连续控制变成离散分类。一句话对比:AR 像一步步开车,Diffusion 像一次提出多条路线。

论文卡

论文解决什么记忆钩子
FAST高频连续动作压成 AR 可学的 token,同时保留可执行控制结构tokenizer 不是预处理,是策略的控制接口

易混点

  • AR 也能输出概率分布,问题不是"不能多模态",而是 rollout 中会向 top1 坍缩。
  • exposure bias 和 RL 误差累积是同一机制(rollout 中前步影响后步分布),课件把它们统一在 rollout 概念下。

自测acc/yaw_rate 和 dx/dy/dyaw 怎么取舍?rollout 为什么误差累积?(长文自测题 14、15)

07

AR + RL 与 Plan-R1

课件 4.3

先用 IL/CE 学会"开得像人"的 base policy,再用 PPO/GRPO 微调,让它对安全、效率、舒适、法规、偏好做长期权衡——RL 是对齐,不是从零学开车。

必须能复述的点

  • 五步流程:IL 预训练 AR policy → 冻结 reference model(KL 基准)→ policy 生成 token 序列 → reward model 打分 → PPO/GRPO 微调。
  • Plan-R1 结构:码本把连续轨迹变 motion token → 感知/地图变条件 token → AR next-token → rollout 后 GRPO 组内相对优势优化;先 principle alignment(懂安全可行原则)再 behavior learning(开得像人)。
  • AR+RL 的不足:AR 不显式建模未来因果;长期效果和多智能体反应要靠 RL/环境/reward 弥补;量产仍需多候选+打分+后处理(top1 牺牲多模态)。

关键公式

R = Rsafety + λ₁Rprogress + λ₂Rcomfort + λ₃Rrule + λ₄Rpreference − β · KL(π ‖ πref)
Ai = ( ri − mean(r₁..rG) ) / std(r₁..rG)
𝓛 = 𝔼[ min( ρtAt,  clip(ρt, 1−ε, 1+ε) · At ) ],  ρt = πθ(at|st) / πold(at|st)

reward 让策略"不仅快,还要安全舒服合规像人";KL 项拴住策略别跑出 reference 的合理驾驶分布;GRPO 不需要显式 value function,同一场景采 G 条 rollout,组内标准化算相对优势——天然匹配"多候选轨迹规划"。PPO 裁剪目标限制单步更新幅度,GRPO 沿用其裁剪形式但用组内优势替代 value baseline。

论文卡

论文解决什么记忆钩子
Plan-R1轨迹规划语言建模化 + GRPO 推高安全可行类人轨迹先学原则,再学行为,组内比出好轨迹

易混点

  • reference model 是冻结的锚,不是教师:作用是 KL 约束防跑偏,不是提供监督信号。
  • GRPO vs PPO:GRPO 用组内相对优势省掉 value/critic,适合一次采多条候选的场景。

自测reference model 起什么作用?GRPO 为什么适合多候选 rollout?(长文自测题 18、19)

08

Diffusion / Flow + RL

课件 4.4

AR+RL 自然(rollout 粒度对齐),Diffusion/Flow+RL 难在 credit assignment——整条轨迹的 reward 要回传到多个去噪步或连续流过程。

必须能复述的点

  • 五条路线:Value-Guided(采样期引导,不重训)、Policy-Level RL(diffusion 当策略微调)、Energy-Based(reward 当 energy 做指数重加权)、RL-Constrained(GRPO 约束多模态质量)、RLHF/偏好(驾驶风格)。
  • DiffusionDriveV2 的关键洞见:IL 只监督最接近 GT 的正模式,负模式可能是低质量甚至碰撞轨迹;intra-anchor GRPO 提升同一意图内候选质量,inter-anchor GRPO 协调不同意图间质量,同时防生成分布塌掉。
  • Flow Matching 动机:不预测噪声,学从噪声轨迹到专家轨迹的连续速度场,采样步数更少。

关键公式

xt = (1−t) · x₀ + t · x₁    𝓛FM = 𝔼x₀, x₁, t [ ‖vθ(xt, t, c) − (x₁ − x₀)‖² ]
dx/dt = vθ(xt, t, c),  x₀ ∼ 𝒩(0, I) → x₁ = 轨迹

x₀ 是噪声轨迹、x₁ 是真实轨迹,模型学"往真实轨迹方向流动的速度场",推理即解 ODE。Flow-GRPO 的关键一步是把确定性 ODE 转成带随机性的采样(ODE→SDE),否则没有探索、无法做 RL。一句话:Flow 是生成器,GRPO 根据组内相对奖励让流的方向朝高 reward 区域弯曲。

论文卡

论文解决什么记忆钩子
DiffusionDriveV2IL 的负模式质量差 → intra/inter-anchor GRPO 保多样提质量锚内提质,锚间协调
GoalFlowFlow 生成轨迹易发散 → goal point 约束方向 + scoring 选择给流一个目标点
DPPOdiffusion policy 怎么接 on-policy PG:advantage 估计、denoising 步数处理diffusion 微调的方法论
Diffusion-QLoffline RL 中 Gaussian policy 表达不了多峰动作 → diffusion policy + Q-learning 引导多峰动作用 diffusion 装
Flow-GRPO确定性 flow 没探索 → ODE 转 SDE + GRPO 相对优势先加随机性,才能 RL
TrajHF手写 reward 到不了的类人性/个人风格 → 人类反馈微调轨迹模型偏好接管 reward 写不出的部分

易混点

  • credit assignment 难度排序:AR+RL(token 级对齐,最自然)< Diffusion+RL(reward 要摊回多个去噪步)。
  • GoalFlow 与 DiffusionDrive 的对比轴:一个学连续速度场少采样步,一个截断去噪过程少采样步——目的同为实时,机制不同。
  • TrajHF 的代价别忘:偏好标注主观、可能不一致,不是免费替代手写 reward。

自测为什么 Diffusion+RL 的 credit assignment 比 AR+RL 难?intra/inter-anchor 各解决什么?(长文自测题 20)

09

RL 基础

第五章课件

按概念链复习——MDP → Policy → Return → V/Q → Bellman → MC/TD → REINFORCE → Actor-Critic → PPO/GRPO,缺一环后面就断。

必须能复述的点

  • MDP 五元组:状态、动作、转移概率、奖励函数、折扣因子。
  • RL 在自动驾驶解决 5 类问题:长时序决策(提前变道)、多目标权衡(安全/效率/舒适/法规)、不确定交互(博弈:让不让、抢不抢)、稀疏延迟反馈(一路无接管、舒适性)、灰色决策区(规则写不清:礼让但不被拖死)。
  • 六个工程难点:训练不稳、样本效率低、GPU 利用率低、超参敏感、reward 难设计、reward hacking。
  • 开环 vs 闭环:开环用数据集真实下一状态(稳定、可复现、看不到误差累积、学不到纠错),闭环用环境动力学(能学纠错、强依赖仿真、难复现)。仿真不完全可信时用伪闭环/规则代理/IDM/logsim。

关键公式

Gt = Σk=0..∞ γk rt+k    Vπ(s) = 𝔼π[Gt | st=s]    Qπ(s,a) = 𝔼π[Gt | st=s, at=a]
Vπ(s) = 𝔼a∼π, s′[ r(s,a) + γVπ(s′) ]

Return 是一条具体轨迹的折扣累积奖励;V 是"站在状态 s 按策略走下去平均能拿多少";Q 多锁定第一步动作。Bellman 方程把当前价值拆成即时奖励 + 折扣后续价值,是 MC/TD/Actor-Critic 全部方法的地基。

易混点

  • V(s) vs Q(s,a):V 评估状态,Q 评估状态-动作对;优势 A = Q − V 衡量"这个动作比平均好多少"。
  • reward hacking 不是偶发 bug,是 RL 的本性:模型最大化你写下的数值,不是你心里想要的行为。只奖励安全 → 学会"慢到永远不出事"。
  • 开环不是闭环的低级替代,是工程妥协:安全、稳定、复现、便宜。

自测RL 解决哪 5 类问题?开环为什么学不到纠错?(长文自测题 16、扩展题 36)

10

量产经验

量产经验分享课件

量产是模型、数据、场景、规则、评测组成的闭环——不要假设 reward 完美,而要设计能容忍 reward 不完美的系统。

必须能复述的点

  • 模型侧常见问题:静态碰撞、轨迹不类人、控速弱、横向犹豫、AR 因果弱、量产只取 top1 丢多模态。
  • RL 数据规模数字:验 reward 方向 ~10 条;单任务百到千条 clip;全量 ~10w clip;一段式预训练千万级。
  • 数据配比:多标签数据按 1/n 计数,先定一级标签配比再细化——防止复合场景被重复计满。
  • 拥堵加塞:安全/效率/舒适三目标冲突 + 博弈。只用安全 reward → 学会原地等待(hacking);要奖励成功插入合理 gap,再用失败折回数据、IDM 后车不让行做对抗。
  • 静态偏航:双阶段平滑 reward(距最晚换道点纵向距离 × 距导航中心线横向距离,Sigmoid 过渡);车道锁定抑制无效换道但要隔离绕行场景;虚拟墙惩罚偏航但警惕 GT 跟随式标注偏差。
  • 碰撞绕行:TTC、最小距离、VRU 交汇时间(不只看轨迹交点,还看是否同时到达);优先级安全 > 法规 > 体感;已触发安全惩罚时不要再叠绕行奖励把梯度搞乱。
  • 闭环工作流:发现问题 → 归因 → 难例挖掘 → 数据配比 → reward/规则/token/结构调整 → 开环评测 → 闭环评测 → 小流量实车 → 回到发现问题。

关键原则

多 reward 组合 ≠ Σi Ri  ;必须有 优先级 + 场景隔离 + 冲突处理

reward 不是全局常开的加法。同一个 reward 在不同场景可能含义相反(车道锁定 vs 绕行慢车),一个时刻触发安全惩罚后再叠加绕行奖励只会搞乱梯度方向。

易混点

  • "等到完全安全再动"在仿真里是高分行为,在真实驾驶里是坏策略——这是 reward hacking 的典型形态,不是模型 bug。
  • 数据不是越多越好,是分层、配比、挖难例。

自测加塞为什么三目标冲突?多 reward 为什么不能简单相加?(长文自测题 22、24)

11

终极速查

6 句 + 对比表 + 17 篇一行版

六句话背下来

  1. 端到端是减少信息损失和规则瓶颈,但不是取消工程约束。
  2. 两段式保留可解释中间结构,一段式追求统一表征和联合优化上限。
  3. Navigation Path 表达长期路线意图,不是直接控车轨迹。
  4. Diffusion 适合一次生成多种未来,AR 适合一步步 rollout。
  5. RL 负责长期目标、多目标权衡、交互博弈、延迟反馈和灰色决策。
  6. 量产系统必须承认 reward 不完美,用数据闭环、场景隔离、规则兜底和评测回归控制风险。

七主题横向对比

主题最强能力主要代价适合解决
两段式可解释、可控、易工程化信息压缩,上下游割裂量产稳定性、模块化迭代
一段式信息完整、联合优化上限高难 debug、难闭环验证复杂交互、统一表征、规模化
Navigation Path长期意图和路线约束抖动、跳变、不能直接控车路口择道、环岛、主辅路
Diffusion多模态整段轨迹生成推理慢、RL credit 难候选轨迹、长尾不确定性
AR训练稳定、RL 接口自然误差累积、多模态坍缩token policy、闭环 rollout
Flow Matching连续速度场、采样更快工程成熟度低轨迹生成、Flow-GRPO
RL长期目标和多目标权衡reward 难、样本贵、hacking加塞、偏航、博弈、灰色决策

17 篇论文一行版

PLUTOIL 做到极致
BEVFormerBEV query 是空间探针
Sparse4D稀疏 query 换效率
MOTRtrack query 维持身份
VAD向量化场景表示
VADv2概率规划
DiffusionDrive截断 + 锚点换实时
ResAD惯性参考 + 残差
Diffuservalue 引导采样
FASTtokenizer 即控制接口
Plan-R1规划语言化 + GRPO
DiffusionDriveV2锚内提质,锚间协调
GoalFlow目标点约束流
DPPOdiffusion 微调方法论
Diffusion-QL多峰动作 + Q 引导
Flow-GRPOODE 转 SDE 再 RL
TrajHF偏好定驾驶风格