E2E-AD STUDY · 复习汇总
端到端自动驾驶复习汇总
面向"已学过一遍、要快速回忆"的场景。每章五段式:一句话核心 → 必须能复述的点 → 关键公式 → 论文卡 → 易混点 → 自测钩子。这门课回答一个问题:怎样从传统模块化自动驾驶,走向能直接生成轨迹、又能被评测和量产约束的端到端系统。
技术演进:2021 前 高精地图 → 2022 BEV 无图 → 2023 Occupancy → 2024 端到端 → 2025 VLA/VLM
为什么端到端
第一章课件端到端解决传统 pipeline 的信息损失、误差累积和规则瓶颈,但它改变的是"模型学多深",不是"工程要不要"。
必须能复述的点
- 三个系统性动机:信息损失(世界被压成检测框/车道线/置信度标签)、误差累积(上游不确定性被下游放大)、规则瓶颈(模块多、长尾规则难穷举)。
- 量产形态:模型给候选,规则管底线,评测找回归,数据闭环修分布。导航、法规检查、后处理、评测一个都不能少。
- 数据集与指标:nuPlan(HD 地图+轨迹+行为标签,开环/闭环反应式/非反应式);ADE/FDE 衡量"像不像专家",不等于安全舒适;开环可复现但验证不了纠错能力,闭环真实但依赖仿真质量。
关键公式
ADE 是预测轨迹与真值轨迹逐点距离的平均,FDE 只看终点。两者都是"模仿误差",不含安全、法规、交互语义。
易混点
- 端到端 ≠ 没有中间约束、没有后处理。红绿灯至今仍需检测/选灯/倒计时/故障处理等工程模块。
- 开环指标好 ≠ 闭环能跑:开环看不到"自己犯错后的状态"。
自测端到端解决哪两类问题?为什么不等于取消规则?(长文自测题 1、2)
两段式端到端
第二章课件先输出结构化世界(第一段),再基于它规划轨迹(第二段)——用信息压缩换可解释、可控、可量产。
必须能复述的点
- 中间表征四类:动态(3D 框、速度、yaw、tracking ID)、静态(车道线 polyline、boundary、curb)、交通灯(框、颜色、路口通行性)、规控输出(未来 N 步多模态轨迹+概率)。
- 四个价值:可解释(能问"是不是感知错了")、可控(接规则/风险检测)、可迭代(模块分开升级)、易量产(训练稳定、归因直接)。
- 三个代价:中间表征压缩丢细节、上下游互相甩锅、梯度无法跨模块反传,复杂交互上限低于一段式。
- 量产经验占比金句:数据 60%、模仿学习 30%、RL 10%——别把 RL 当第一解法。
关键公式
行为克隆(behavior cloning):让策略输出逼近专家动作。PLUTO 的贡献是在这个框架上叠加辅助 loss、对比学习和 positive/negative augmentation,而不是换掉框架。
论文卡
| 论文 | 解决什么 | 记忆钩子 |
|---|---|---|
| PLUTO | 模仿学习配好结构+辅助 loss+数据增强+因果混淆处理,闭环逼近甚至超过规则 planner | 把 IL 做到极致,再谈 RL |
| BEVFormer | 多摄像头 → BEV:spatial cross-attention 采样图像特征,temporal self-attention 融历史 | BEV query 是空间探针 |
| Sparse4D | 稀疏 object query + deformable 4D 聚合做 3D 检测,比 dense BEV 高效 | 稀疏 query 换效率 |
| MOTR | track query 维持目标身份 + newborn query 发现新目标,检测跟踪一体化 | 感知第一段也在端到端化 |
易混点
- PLUTO 的 positive/negative augmentation:让模型知道哪些扰动应该行为不变(抗噪)、哪些扰动必须改变规划(因果关键)——这是处理 causal confusion 的核心。
- 两段式不是传统手写 pipeline 复刻:第一段和第二段本身都可学习。
自测两段式为什么量产友好?中间表征丢什么信息?(长文自测题 3、4)
一段式端到端
第三章课件感知、预测、规划压进统一 latent space 联合优化,上限更高,代价是难 debug、难闭环验证。
必须能复述的点
- Latent space = 模型内部的压缩工作台:信息比结构化标签丰富,但人读不懂;出错难归因到感知/预测/导航/规划。
- 四个优点:信息完整不过早离散化、统一时空表示、避免 perception-induced planning failure(中间检测不完美但最终轨迹仍可能对)、天然接世界模型/VLA/RL/大数据。
- 四个代价:不可解释、多任务联训相互干扰、闭环仿真难(feature warp 失真、轨迹抖动发散)、量产验证链路长。
- 三个建模方向:Diffusion(多模态强但慢)、世界模型(推演未来但长期不稳、会虚构物体)、VLA(语义条件化强但验证链路最长)。
关键结构
原始世界:图像 + 点云 + 地图 + 导航 + 历史轨迹 + 周围车
↓ 编码器
latent space:模型内部压缩向量(隐含"前车在减速""导航要左转"等信息)
↓ planner / policy head
输出:未来轨迹 / 动作 token / 控制建议
论文卡
| 论文 | 解决什么 | 记忆钩子 |
|---|---|---|
| VAD | 场景不 raster 成图,用 agent motion + map element 向量化表示,规划时保留显式交互和约束 | 黑盒和结构化之间的折中 |
| VADv2 | 从单条确定轨迹走向概率规划,把不确定性纳入 action distribution | 量产需要概率+约束+可评测结构 |
易混点
- 一段式 vs 两段式不是二选一,是连续谱——读 VAD 要追问:哪些结构还是显式的?哪些开始变 latent?
- Query ≠ 候选轨迹:query 是带槽位的探针(可学习向量),proposal 才是解码后拿出来比较的候选。
自测什么是 perception-induced planning failure?一段式为什么 debug 难?(总纲 扩展题 28、§11.3 题 5)
导航信息
第四章课件Navigation Path 是长期路线意图(战略地图),不是可控轨迹——它告诉模型"该往哪走",轨迹还要自己规划。
必须能复述的点
- 导航模块五职责:车道级全局路径规划(lane sequence 搜索)、关键机动点识别、参考线生成(centerline/曲率/限速)、规划约束与优先级、偏航监控与 reroute。
- 适用场景四类:路口择道(感知不充分时人驾轨迹给提前选口监督)、主辅路/环岛出口(需要超视距车道联通)、地下停车场(几何不稳定,核心是"往哪走")、通行概率估计(学类人通行选择)。
- 一段式中的编码:SD waypoints、waypoint action、speed limit、lane action/recommend,经 cross-attention 把 lane-prior 注入 waypoint query。
- 导航增强四类:横向偏移(模拟定位漂移)、行点稀疏缺失(地图不可用)、纵向时序偏移(更新慢)、时间不一致(帧间异步)——目的是防止模型过度依赖完美导航输入。
易混点
- 参考线 ≠ 轨迹:参考线是几何基准和长期方向;轨迹要满足避障、动力学、舒适、规则。
- 导航增强不是把导航变随机,是主动注入真实世界会出现的导航退化。
自测Navigation Path 为什么不能直接控车?哪四类场景最需要它?(长文自测题 7、8)
Diffusion 轨迹生成
课件 4.1未来不是一个点而是一个分布,Diffusion 用"加噪-去噪"一次生成多条候选轨迹,但落地必须解决实时性和候选质量。
必须能复述的点
- 核心机制:从真实轨迹逐步加噪,模型学反向去噪;条件是自车状态、地图、障碍物、导航。
- 擅长:多模态候选、不确定未来建模、世界模型/场景生成、长尾扩增。难点:多步去噪慢、候选间无显式价值排序、条件控制和规则对齐难、mode collapse 风险。
- 工程原则:别让生成模型从零学物理——给 anchor、reference、normalization 强先验,把学习目标缩小到"在合理先验上做必要偏离"。
关键公式
ᾱt 随 t 增大而减小,轨迹逐渐变纯噪声;模型 εθ 学习在条件 c(场景信息)下预测所加噪声,采样时反向逐步去噪。truncated diffusion 的做法:不从纯噪声出发,从 anchor + 少量噪声出发,去噪步数大幅减少。
论文卡
| 论文 | 解决什么 | 记忆钩子 |
|---|---|---|
| DiffusionDrive | 多模态好但采样慢 → truncated diffusion + 多模态 anchors,少量步数出多样轨迹 | 截断 + 锚点换实时 |
| ResAD | 从零预测被远期不确定性拖累 → 惯性参考系 + 归一化残差 | 先给惯性参考,只学偏离 |
| Diffuser | 生成和择优分离 → 采样时用 value/reward gradient 引导 | 生成归生成,价值来导航 |
易混点
- 多模态 ≠ 每条候选都安全:生成后仍需 scoring / rule check / refine(这是 V2 引入 RL 的原因)。
- Diffuser 的 value guidance 是采样期引导、不改生成器;Diffusion-QL/DPPO 是训练期微调——别混。
自测DiffusionDrive 为什么要 truncated?ResAD 的 residual 什么时候比直接预测稳?(长文自测题 11、12)
AR 轨迹生成
课件 4.2AR 把轨迹变成 next-token prediction,训练稳定、天然接 RL rollout,代价是误差累积和多模态坍缩——关键设计是"下一步 token 到底是什么"。
必须能复述的点
| token 设计 | 优点 | 风险 |
|---|---|---|
| 时间步状态 / 轨迹点 | 直观、可加动力学约束 | 序列长、误差累积重 |
| acc / yaw_rate 量化 | 学习难度低、积分平滑、dyaw 抖动小 | 急加减速时 action 分布稀疏 |
| dx / dy / dyaw 量化 | 贴近几何、极端场景更真实 | 噪声几何放大、dyaw 抖动大 |
| FAST 类 action token | 控制接口紧凑 | 需验证物理可执行性 |
- 三个优点:CE 目标清晰稳定、transformer 天然适配(causal mask)、和 RL 接口自然(生成即 rollout,先 BC/CE 再 PPO/GRPO 顺)。
- 三个缺点:exposure bias(训练看真实历史、推理看自己的预测,错误改变输入分布并放大)、多模态弱(早期 token 选边后条件分布坍缩到单模式)、只最大化局部似然不最大化长期回报。
关键公式
在场景条件 s 下,最大化每个动作 token 对历史 token 的条件概率——把连续控制变成离散分类。一句话对比:AR 像一步步开车,Diffusion 像一次提出多条路线。
论文卡
| 论文 | 解决什么 | 记忆钩子 |
|---|---|---|
| FAST | 高频连续动作压成 AR 可学的 token,同时保留可执行控制结构 | tokenizer 不是预处理,是策略的控制接口 |
易混点
- AR 也能输出概率分布,问题不是"不能多模态",而是 rollout 中会向 top1 坍缩。
- exposure bias 和 RL 误差累积是同一机制(rollout 中前步影响后步分布),课件把它们统一在 rollout 概念下。
自测acc/yaw_rate 和 dx/dy/dyaw 怎么取舍?rollout 为什么误差累积?(长文自测题 14、15)
AR + RL 与 Plan-R1
课件 4.3先用 IL/CE 学会"开得像人"的 base policy,再用 PPO/GRPO 微调,让它对安全、效率、舒适、法规、偏好做长期权衡——RL 是对齐,不是从零学开车。
必须能复述的点
- 五步流程:IL 预训练 AR policy → 冻结 reference model(KL 基准)→ policy 生成 token 序列 → reward model 打分 → PPO/GRPO 微调。
- Plan-R1 结构:码本把连续轨迹变 motion token → 感知/地图变条件 token → AR next-token → rollout 后 GRPO 组内相对优势优化;先 principle alignment(懂安全可行原则)再 behavior learning(开得像人)。
- AR+RL 的不足:AR 不显式建模未来因果;长期效果和多智能体反应要靠 RL/环境/reward 弥补;量产仍需多候选+打分+后处理(top1 牺牲多模态)。
关键公式
reward 让策略"不仅快,还要安全舒服合规像人";KL 项拴住策略别跑出 reference 的合理驾驶分布;GRPO 不需要显式 value function,同一场景采 G 条 rollout,组内标准化算相对优势——天然匹配"多候选轨迹规划"。PPO 裁剪目标限制单步更新幅度,GRPO 沿用其裁剪形式但用组内优势替代 value baseline。
论文卡
| 论文 | 解决什么 | 记忆钩子 |
|---|---|---|
| Plan-R1 | 轨迹规划语言建模化 + GRPO 推高安全可行类人轨迹 | 先学原则,再学行为,组内比出好轨迹 |
易混点
- reference model 是冻结的锚,不是教师:作用是 KL 约束防跑偏,不是提供监督信号。
- GRPO vs PPO:GRPO 用组内相对优势省掉 value/critic,适合一次采多条候选的场景。
自测reference model 起什么作用?GRPO 为什么适合多候选 rollout?(长文自测题 18、19)
Diffusion / Flow + RL
课件 4.4AR+RL 自然(rollout 粒度对齐),Diffusion/Flow+RL 难在 credit assignment——整条轨迹的 reward 要回传到多个去噪步或连续流过程。
必须能复述的点
- 五条路线:Value-Guided(采样期引导,不重训)、Policy-Level RL(diffusion 当策略微调)、Energy-Based(reward 当 energy 做指数重加权)、RL-Constrained(GRPO 约束多模态质量)、RLHF/偏好(驾驶风格)。
- DiffusionDriveV2 的关键洞见:IL 只监督最接近 GT 的正模式,负模式可能是低质量甚至碰撞轨迹;intra-anchor GRPO 提升同一意图内候选质量,inter-anchor GRPO 协调不同意图间质量,同时防生成分布塌掉。
- Flow Matching 动机:不预测噪声,学从噪声轨迹到专家轨迹的连续速度场,采样步数更少。
关键公式
x₀ 是噪声轨迹、x₁ 是真实轨迹,模型学"往真实轨迹方向流动的速度场",推理即解 ODE。Flow-GRPO 的关键一步是把确定性 ODE 转成带随机性的采样(ODE→SDE),否则没有探索、无法做 RL。一句话:Flow 是生成器,GRPO 根据组内相对奖励让流的方向朝高 reward 区域弯曲。
论文卡
| 论文 | 解决什么 | 记忆钩子 |
|---|---|---|
| DiffusionDriveV2 | IL 的负模式质量差 → intra/inter-anchor GRPO 保多样提质量 | 锚内提质,锚间协调 |
| GoalFlow | Flow 生成轨迹易发散 → goal point 约束方向 + scoring 选择 | 给流一个目标点 |
| DPPO | diffusion policy 怎么接 on-policy PG:advantage 估计、denoising 步数处理 | diffusion 微调的方法论 |
| Diffusion-QL | offline RL 中 Gaussian policy 表达不了多峰动作 → diffusion policy + Q-learning 引导 | 多峰动作用 diffusion 装 |
| Flow-GRPO | 确定性 flow 没探索 → ODE 转 SDE + GRPO 相对优势 | 先加随机性,才能 RL |
| TrajHF | 手写 reward 到不了的类人性/个人风格 → 人类反馈微调轨迹模型 | 偏好接管 reward 写不出的部分 |
易混点
- credit assignment 难度排序:AR+RL(token 级对齐,最自然)< Diffusion+RL(reward 要摊回多个去噪步)。
- GoalFlow 与 DiffusionDrive 的对比轴:一个学连续速度场少采样步,一个截断去噪过程少采样步——目的同为实时,机制不同。
- TrajHF 的代价别忘:偏好标注主观、可能不一致,不是免费替代手写 reward。
自测为什么 Diffusion+RL 的 credit assignment 比 AR+RL 难?intra/inter-anchor 各解决什么?(长文自测题 20)
RL 基础
第五章课件按概念链复习——MDP → Policy → Return → V/Q → Bellman → MC/TD → REINFORCE → Actor-Critic → PPO/GRPO,缺一环后面就断。
必须能复述的点
- MDP 五元组:状态、动作、转移概率、奖励函数、折扣因子。
- RL 在自动驾驶解决 5 类问题:长时序决策(提前变道)、多目标权衡(安全/效率/舒适/法规)、不确定交互(博弈:让不让、抢不抢)、稀疏延迟反馈(一路无接管、舒适性)、灰色决策区(规则写不清:礼让但不被拖死)。
- 六个工程难点:训练不稳、样本效率低、GPU 利用率低、超参敏感、reward 难设计、reward hacking。
- 开环 vs 闭环:开环用数据集真实下一状态(稳定、可复现、看不到误差累积、学不到纠错),闭环用环境动力学(能学纠错、强依赖仿真、难复现)。仿真不完全可信时用伪闭环/规则代理/IDM/logsim。
关键公式
Return 是一条具体轨迹的折扣累积奖励;V 是"站在状态 s 按策略走下去平均能拿多少";Q 多锁定第一步动作。Bellman 方程把当前价值拆成即时奖励 + 折扣后续价值,是 MC/TD/Actor-Critic 全部方法的地基。
易混点
- V(s) vs Q(s,a):V 评估状态,Q 评估状态-动作对;优势 A = Q − V 衡量"这个动作比平均好多少"。
- reward hacking 不是偶发 bug,是 RL 的本性:模型最大化你写下的数值,不是你心里想要的行为。只奖励安全 → 学会"慢到永远不出事"。
- 开环不是闭环的低级替代,是工程妥协:安全、稳定、复现、便宜。
自测RL 解决哪 5 类问题?开环为什么学不到纠错?(长文自测题 16、扩展题 36)
量产经验
量产经验分享课件量产是模型、数据、场景、规则、评测组成的闭环——不要假设 reward 完美,而要设计能容忍 reward 不完美的系统。
必须能复述的点
- 模型侧常见问题:静态碰撞、轨迹不类人、控速弱、横向犹豫、AR 因果弱、量产只取 top1 丢多模态。
- RL 数据规模数字:验 reward 方向 ~10 条;单任务百到千条 clip;全量 ~10w clip;一段式预训练千万级。
- 数据配比:多标签数据按 1/n 计数,先定一级标签配比再细化——防止复合场景被重复计满。
- 拥堵加塞:安全/效率/舒适三目标冲突 + 博弈。只用安全 reward → 学会原地等待(hacking);要奖励成功插入合理 gap,再用失败折回数据、IDM 后车不让行做对抗。
- 静态偏航:双阶段平滑 reward(距最晚换道点纵向距离 × 距导航中心线横向距离,Sigmoid 过渡);车道锁定抑制无效换道但要隔离绕行场景;虚拟墙惩罚偏航但警惕 GT 跟随式标注偏差。
- 碰撞绕行:TTC、最小距离、VRU 交汇时间(不只看轨迹交点,还看是否同时到达);优先级安全 > 法规 > 体感;已触发安全惩罚时不要再叠绕行奖励把梯度搞乱。
- 闭环工作流:发现问题 → 归因 → 难例挖掘 → 数据配比 → reward/规则/token/结构调整 → 开环评测 → 闭环评测 → 小流量实车 → 回到发现问题。
关键原则
reward 不是全局常开的加法。同一个 reward 在不同场景可能含义相反(车道锁定 vs 绕行慢车),一个时刻触发安全惩罚后再叠加绕行奖励只会搞乱梯度方向。
易混点
- "等到完全安全再动"在仿真里是高分行为,在真实驾驶里是坏策略——这是 reward hacking 的典型形态,不是模型 bug。
- 数据不是越多越好,是分层、配比、挖难例。
自测加塞为什么三目标冲突?多 reward 为什么不能简单相加?(长文自测题 22、24)
终极速查
6 句 + 对比表 + 17 篇一行版六句话背下来
- 端到端是减少信息损失和规则瓶颈,但不是取消工程约束。
- 两段式保留可解释中间结构,一段式追求统一表征和联合优化上限。
- Navigation Path 表达长期路线意图,不是直接控车轨迹。
- Diffusion 适合一次生成多种未来,AR 适合一步步 rollout。
- RL 负责长期目标、多目标权衡、交互博弈、延迟反馈和灰色决策。
- 量产系统必须承认 reward 不完美,用数据闭环、场景隔离、规则兜底和评测回归控制风险。
七主题横向对比
| 主题 | 最强能力 | 主要代价 | 适合解决 |
|---|---|---|---|
| 两段式 | 可解释、可控、易工程化 | 信息压缩,上下游割裂 | 量产稳定性、模块化迭代 |
| 一段式 | 信息完整、联合优化上限高 | 难 debug、难闭环验证 | 复杂交互、统一表征、规模化 |
| Navigation Path | 长期意图和路线约束 | 抖动、跳变、不能直接控车 | 路口择道、环岛、主辅路 |
| Diffusion | 多模态整段轨迹生成 | 推理慢、RL credit 难 | 候选轨迹、长尾不确定性 |
| AR | 训练稳定、RL 接口自然 | 误差累积、多模态坍缩 | token policy、闭环 rollout |
| Flow Matching | 连续速度场、采样更快 | 工程成熟度低 | 轨迹生成、Flow-GRPO |
| RL | 长期目标和多目标权衡 | reward 难、样本贵、hacking | 加塞、偏航、博弈、灰色决策 |