先定义环:到底是谁在响应谁
“闭环”不是一个二元标签。最少要拆成三个问题:自车状态是否由模型动作推进,背景交通是否会因自车动作改变,下一帧传感器观测是否根据新位置重新生成。A 课用 nuPlan 的 2×3 矩阵把前两项分开:log replay 中自车和他车都开环;non-reactive simulation 中自车闭环、他车仍按录像走;reactive simulation 才是双方闭环。
这一区分直接改变评测能回答的问题。逐帧对专家轨迹只能回答“像不像这位司机”;自车闭环但背景不响应,可以回答“偏离以后能不能继续走、会不会撞上固定未来”;双方响应,才开始回答“我强行并线时后车会不会刹、我让步时对方会不会插入”。交互和长期因果不能从静态日志里推导出来。
因此评测报告中不应只写 open-loop 或 closed-loop,而应显式写出 ego、agents、observation 三列的更新方式。没有这三列,所谓闭环结果很可能把 NAVSIM 式非反应背景与 CARLA 式可交互交通混在一起。
LOG
日志开环
- 自车不真正推进,只对未来轨迹真值
- 他车按已记录未来,不受模型影响
- 高吞吐、可复现,适合训练回归
EGO
非反应式闭环
- 自车按预测轨迹更新
- 背景交通继续回放,不回应自车
- 可测偏航恢复,但不能证明博弈能力
WORLD
反应式闭环
- 自车、他车和观测共同演化
- 可测长期规划、互动和恢复
- 结果受交通代理真实性与仿真域差影响
四类基准不是替代关系
nuPlan 是数据集也是规划仿真器,课程材料给出 Replay、Rails、ML policy 等 agent 配置,以及 open-loop、closed-loop 的组合。它的优势是来自真实城市日志并保留规划语义,但是否形成真实互动取决于具体 agent 配置,不能看到“nuPlan”三个字就自动视为完全闭环。
NAVSIM 用真实交通背景和 3DGS 生成自车偏离原轨迹后的新视角,但背景车辆和行人仍按数据回放。因此它在自车状态和视觉观测上更接近闭环,在多智能体交互上仍是开环。课程把它放进闭环评测章节并使用 PDM/PDMS 家族指标,是评测用途上的归类;从交互机理看,它仍属于非反应式闭环。
CARLA 能配置交通参与者、天气、交通灯和传感器,支持真正的交互式闭环,但合成世界与真实道路之间存在 sim-to-real gap。Bench2Drive 建在 CARLA 之上,用统一训练集、150–200 米短路线和单技能场景,把过去“各自采数据、比整套系统”的比较改成更接近算法级的单科考试。它提高了可比性,却不消除仿真交通行为失真。
REAL LOG
nuPlan
- 真实城市数据与规划语义
- 支持开环和多种仿真配置
- 需披露 agent 是否会响应
3DGS
NAVSIM
- 自车可偏离并获得合成观测
- 背景交通按日志回放
- 适合 PDM/PDMS 式快速规划评测
INTERACTIVE
CARLA / Bench2Drive
- 交通、天气、传感器可交互配置
- Bench2Drive 按技能拆短路线
- 要额外审视交通代理和域差
从几何误差到驾驶能力
ADE 衡量整段轨迹逐点平均误差,FDE 只看终点;它们便宜、稳定,适合检查预测或规划是否突然退化,但“离专家近”不等于“安全可行”。多模态预测里的 minADE/minFDE 又只取 K 条候选中最好的一条,K 越大越容易蒙中;p-min 与 Brier 版本把候选概率纳入惩罚,才开始检查模型是否知道哪条更可能。
同名指标还可能不同义。A 课 nuPlan 页的 Miss Rate 是轨迹越出预设边界的比例,C 课预测章节的 MR 是所有预测终点都未落入真值 2 米范围的场景数。跨论文或跨数据集汇总时,必须同时记录任务、阈值、候选数 K、采样时域和聚合方式。
NAVSIM 使用的 PDM/PDMS 家族把 NC、DAC 等安全项作为惩罚门,再对 EP、TTC、Comfort 等做加权组合;CARLA Driving Score 则以 Route Completion 乘 Infraction Score。两者都试图把“开到了”和“开得对”合起来,但总分会隐藏原因:一个模型可能极舒适却不前进,也可能路线完成度很高却一路违规。
安全、舒适、效率和交互应保留独立子指标。碰撞还要区分有责、静态碰撞、后向追尾和近碰;舒适要看纵横向加速度与 jerk 的分布而非单阈值通过率;效率不能只看进度,还应分辨是谨慎等待还是策略冻结;交互要在汇入、让行、无保护左转等需要对方响应的场景单独测。
- 几何层:ADE、FDE、L2、MR,回答轨迹是否接近参考。
- 可行层:DAC、道路边界、动力学、碰撞与 TTC,回答轨迹能否执行。
- 体验层:纵横向加速度、jerk、停车与起步平顺性,回答乘客是否接受。
- 任务层:EP、Route Completion、导航成功、超时,回答有没有完成任务。
- 交互层:Merging、Give Way、Emergency Brake、无保护左转,回答是否理解其他交通参与者会回应。
- 校准层:候选概率、Top-1 与 Oracle/Top-K 差距,回答生成器和选择器分别出了什么问题。
漂亮分数怎样与真实能力错位
C 课的 AD-MLP 是最直接的压力测试:它不看相机或 LiDAR,也不接收高层指令,只用自车速度、加速度和历史轨迹,两层 MLP 在 nuScenes 开环 L2 上做到 0.29,反而优于 VAD-Base 的 0.37。它并没有突然学会驾驶,只是利用直行样本占比和自车历史对短期未来的强先验。
B 课把同类问题带到闭环:AD-MLP 在 Bench2Drive 的 Merging、Overtaking、Emergency Brake、Give Way、Traffic Sign 五项技能全部为 0。B-L8 还给出 perception-free LAW 在开环 L2 上优于 UniAD 的例子。三处材料共同说明,开环排序可能奖励“最会外推自车惯性”的模型,而不是“最会看世界并做决定”的模型。
总分也会制造另一类错位。CARLA 长路线把违规惩罚持续累乘,最终分数可能被挤到很低,却无法定位是哪种能力失败;Bench2Drive 改成一条短路线只考一个行为,目的不是降低难度,而是降低方差、保留诊断性。评测不是把更多指标乘起来,而是让一次失败能回到明确的能力和场景。
一个有效的评测体系应包含反事实对照:去掉感知、打乱导航、只保留自车状态、改变候选数 K、交换交通代理风格。如果分数几乎不变,说明指标没有测到声称的能力。
- 做弱基线恒速、仅自车状态、规则规划器和人类基线必须同表,避免只比较复杂模型。
- 做输入消融移除视觉、导航或历史,观察指标是否真的对关键输入敏感。
- 做开闭环交叉同一 checkpoint 同时报开环、非反应式闭环和反应式闭环,不用不同版本拼故事。
- 做场景归因总分下钻到技能、天气、道路、速度区间和失败责任,保留分母与置信区间。
论文自己怎么选考卷
评测素养的一个速查办法,是看方法论文自己选了哪张考卷。PLUTO 把模仿学习规划推到极限,评测却明确“以闭环 nuPlan benchmark 为准,而不是开环 ADE/FDE”——一篇 IL 论文主动放弃更容易刷分的考卷,这本身就是可信度信号。反过来,只报开环 L2 的规划论文,应当默认追问一句:换到闭环还成立吗?AD-MLP 和 LAW 已经演示过这一问的杀伤力。
第二类值得学的,是把“生成器-选择器”差距摆上台面的论文。AutoVLA 同时报了 One-shot 80.54 和 Best-of-N 92.12:11.6 分的差距说明答案在生成分布里、第一次没采到——这正是本篇“校准层”指标(Top-1 与 Oracle/Top-K 差距)的论文版实例。一份合格的评测表应该让读者分得清:模型是不会生成好轨迹,还是不会挑出好轨迹。
第三类论文的动机本身就是评测论证。DiffusionDriveV2 指出:模仿学习只监督离真值最近的正模式,其余锚点下的候选可能低质量甚至碰撞——只看 Top-1 的评测永远发现不了这些候选,而量产系统在罕见场景里恰恰可能采到它们。所以它用组内与组间 GRPO 专门管“不是最优的那些候选”的质量。翻译成评测语言:多模态输出的系统,必须单独审计非最优候选的安全性,Top-1 合格不等于分布合格。
最后是榜单名次的成绩来源拆解。TrajHF 以 93.95 的 PDMS 居 NAVSIM 榜首,但它的机制是人类偏好反馈微调——榜首成绩里混合了“更会开”与“更符合人类打分口味”两种成分,而偏好标注本身主观且可能不一致。读榜单时把名次拆成成绩来源,和把总分拆成子项,是同一种纪律。
把能力做成矩阵,而不是一列总分
能力矩阵的横轴应是安全、合规、效率、舒适、导航、交互与恢复,纵轴应是常规分布、长尾专项、传感器退化、导航退化、不同交通代理和不同城市道路。每个格子绑定测试环境、核心指标、硬门槛和诊断指标,才能知道一个模型究竟在哪一层变好。
Bench2Drive 的五类技能提供了一个起点:Merging 测汇入博弈,Overtaking 测绕行与时机,Emergency Brake 测紧急风险,Give Way 测社会性驾驶,Traffic Sign 测规则遵循。但五类仍不足以覆盖量产,还需要加入静态偏航、施工改道、非机动车道、VRU 时间同步、红绿灯异常状态、感知遮挡和导航跳变等专项。
指标要区分硬门与排序项。碰撞、驶出可行域、逆行等可以作为发布门槛;舒适、效率和类人性适合做分布比较。把所有目标压成一个加权和会让团队不断争权重,也给模型留下以一个目标补偿另一个目标的空间。
GATE
硬门槛
- 有责碰撞、逆行、闯灯
- 驶出可行域、动力学越界
- 关键场景不得回归
RANK
排序指标
- 进度、通行效率、接管
- 舒适分布与类人性
- 同门槛内比较优劣
DIAGNOSE
诊断指标
- Top-1 与 Top-K 差距
- 按场景、速度、天气切片
- 感知、选择器、后处理分别归因
量产需要一条持续验收阶梯
模型评测不应从开环直接跳到公开 benchmark,再跳到实车。更稳妥的路径是六级:离线回归、非反应式闭环、反应式仿真、单场景专项、影子模式与封闭场道路、灰度车队。每一级都有明确退出条件,失败时能回到数据、模型、reward、交通代理或系统接口。
A 课的量产案例表明,reward 修复可能把“安全但一直等”推向“过度自信地抢”。因此每个专项优化必须同时带反向场景:奖励成功加塞时,也要加入加塞失败折回、后车不让行和等待更优的样本。验收不是证明修复场景变好,而是证明相邻失效模式没有被放大。
道路验证也不能只看接管率。接管的触发策略、驾驶员风格、道路构成和里程分母都会改变结果。应保留场景触发率、人工接管原因、系统最小安全裕度、模型置信度和版本配置,才能把线上信号回流到离线可复现用例。
- 01 离线烟测用 ADE/FDE、碰撞代理和弱基线检查训练是否收敛、数据与接口是否异常。
- 02 非反应式闭环检查自车偏离日志后的观测更新、道路合规与恢复,不声称已验证互动。
- 03 反应式闭环更换交通代理风格与随机种子,验证长期因果、博弈和错误恢复。
- 04 单科专项对汇入、绕行、VRU、红绿灯、导航退化逐项设硬门,并带相邻反例。
- 05 道路影子与封闭场记录模型建议但不控车,或在可控道路验证动力学、延迟和系统接口。
- 06 灰度与持续回归小车队分版本放量,线上问题转成可复现用例并永久进入回归集。
一张可信评测表必须交代什么
评测结论必须能被另一个团队复现。至少要披露 checkpoint、训练数据版本、传感器与地图输入、候选数、推理频率、控制器、交通代理、随机种子数、场景分母、失败责任口径和置信区间。缺一项,跨版本涨跌都可能来自系统配置而非模型能力。
同时报告人类、恒速、仅自车状态和现有量产版本。B-L8 的 Human PDMS 94.8、EP 87.5 很有启发:人类也不是所有维度满分,保守等待可能降低效率。基线的意义不是装饰,而是校准“超过人类”“接近量产”的具体维度。
最后,把公开 benchmark 与内部量产指标分开。公开榜单适合外部可比性,内部验收要围绕自己的 ODD、硬件预算、导航质量、交通规则与客户问题。两套都要,但不能用公开榜单替代产品责任。
- 注明 open-loop、ego-closed/agent-open、fully reactive 中的哪一种。
- 注明 ADE/FDE/MR 的定义、时域、K 值和概率是否计分。
- 总分旁必须给安全、效率、舒适、交互、导航的独立子项。
- 给出弱基线、人类基线、当前量产基线与相同 checkpoint 的交叉环境结果。
- 报告均值之外的分位数、最坏场景、样本数与置信区间。
- 每个线上严重问题转成具名专项,并进入永久回归而非一次性报告。
三门课怎么对上
同一个工程问题,三门课的观察层级不同。下面逐条标出它们是相互印证、作用域不同,还是在相同前提下保留张力——不把任何一门课单独当作行业定论。
开环评测无法验证自车动作对其他交通参与者的影响。
相互印证- A · 端到端早期课
- A-01 p25 用 ego simulation 与 agent simulation 两轴区分三种评测,只有 reactive agents 才是双方闭环。
- B · 端到端一期
- B-07 sec4 p9 明确开环碰撞率假设他车不受自车影响,并指出只是逐帧画结果、并不真实开车。
- C · 决策规划课
- C-09 p29 用不看感知的 AD-MLP 刷高开环 L2,说明静态日志没有测到互动驾驶能力。
合并读法:三门课从定义、机理和反例三个角度指向同一结论:开环只适合快速回归,不是驾驶能力终审。
NAVSIM 可以直接等同于完全反应式闭环。
保留张力- A · 端到端早期课
- A-01 p25 的矩阵把 ego 闭环、agent 开环命名为 closed-loop non-reactive,是独立于 fully reactive 的一档。
- B · 端到端一期
- B-08 p6 说明 NAVSIM 背景车辆和行人按数据回放;p16 又把使用 PDMS 的 NAVSIM 放在闭环评测章节。
- C · 决策规划课
- C-09 p34-p36 把可编辑真实重建和端到端闭环仿真视为发展方向,并未把背景回放视为完整互动。
合并读法:不是材料互相否定,而是“闭环”口径不同。NAVSIM 对自车与观测闭环,对背景交通非反应;报告中应写清两层。
ADE/FDE 足以代表规划质量。
相互印证- A · 端到端早期课
- A-01 p24-p27 给出 ADE/FDE,同时补充 MR 与空间重叠,已经显示几何误差并非全部。
- B · 端到端一期
- B-08 p14 明确开环指标只用于快速迭代、算法稳定后仅供参考;p16-p17 引入安全、进度、舒适与违规。
- C · 决策规划课
- C-07 p62 区分 min、概率校准和 DAC;C-09 p29 进一步证明 L2 可被自车状态先验刷高。
合并读法:三门课一致认为几何误差是低成本诊断指标,不能单独承担安全、合规、互动和概率校准。
不同材料中的 Miss Rate 可以直接横向比较。
保留张力- A · 端到端早期课
- A-01 p25 的 nuPlan MR 被记为轨迹超出预设边界的比例,p27 的 Motion MR 又按未匹配真值时刻描述。
- B · 端到端一期
- B-08 主要使用 L2、碰撞、PDMS 与 Driving Score,没有建立统一 MR 口径。
- C · 决策规划课
- C-07 p62 的 MR 是所有候选终点都未落入真值 2 米范围的场景数。
合并读法:同名不等义。横向对比前必须回到数据集官方定义,并记录阈值、对象和聚合方式。
开环排名高通常意味着闭环能力也高。
相互印证- A · 端到端早期课
- A-05 p30-p34 从训练侧指出固定环境学不到长期因果、博弈与 self-recovery。
- B · 端到端一期
- B-07 sec4 p10-p19 给出 AD-MLP 开环可看、Bench2Drive 五技能全零的强反例。
- C · 决策规划课
- C-09 p29 给出 AD-MLP L2 0.29 优于 VAD-Base 0.37,结论是指标失效而非模型更强。
合并读法:三门课互相闭合:开环排名和闭环能力可能弱相关,必须对同一模型做跨环境复验。
CARLA Driving Score 越综合,越容易定位能力短板。
相互印证- A · 端到端早期课
- A-08 p28 强调安全、法规、体感要有优先级和冲突处理,不能简单互相补偿。
- B · 端到端一期
- B-07 sec4 p15-p19 指出长路线累乘惩罚会挤压分数且失去细节,Bench2Drive 因此改成单科短路线。
- C · 决策规划课
- C-09 p32-p33 把 CARLA 总分与 DOS 遮挡专项并列,显示综合分仍需具名长尾基准补充。
合并读法:总分适合排序,专项分适合诊断。越综合不等于越可解释。
安全、效率与舒适应被压成同一个可互相补偿的加权分。
保留张力- A · 端到端早期课
- A-08 p28 给出安全大于法规大于体感,并规定碰撞时清空绕行奖励,体现硬优先级。
- B · 端到端一期
- B-08 p16 的 PDMS 把 NC、DAC 作为乘法惩罚项,再对 EP、TTC、Comfort 加权,部分目标不可自由补偿。
- C · 决策规划课
- C-04a p34-p43 把障碍、安全边界和动力学写入可行域与约束,平滑和引导才进入代价优化。
合并读法:三门课都更支持“硬约束先行、软目标排序”,而不是让舒适或效率抵消安全失败。
Bench2Drive 已经解决了真实道路能力验证。
作用域不同- A · 端到端早期课
- A 课提供量产专项与道路问题闭环,但没有把公开 benchmark 视为最终验收。
- B · 端到端一期
- B-07/B-08 强调 Bench2Drive 的统一数据、短路线和五技能,主要解决算法可比性与诊断性。
- C · 决策规划课
- C-09 p66 仍把有效闭环、长尾 benchmark、实时部署列为开放问题,并称 Bench2Drive 为准真实场景闭环。
合并读法:Bench2Drive 是重要的实验室单科考试,不是道路量产证书;它与道路影子、封闭场和车队验收是上下游关系。
人类基线应该默认等于满分。
作用域不同- A · 端到端早期课
- A-08 的工程案例显示人驾数据也可能因遮挡、风格和采集分布产生偏差。
- B · 端到端一期
- B-08 p16 的 Human PDMS 为 94.8,EP 为 87.5,明确说明人类在效率等维度不是满分。
- C · 决策规划课
- C-07 的预测指标和 C-09 的闭环讨论没有给统一人类满分假设。
合并读法:人类既是重要参照也是有偏数据源。应按能力维度比较,而不是把 Human 当作无条件 100。
沿着主线继续
相关术语
- 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。
- 位移误差指标——ADE 是预测轨迹与真值逐点距离的平均,FDE 只看终点——它们衡量「像不像专家」,不等于安全或舒适。
- 碰撞时间与弱势交通参与者——TTC 是碰撞时间;VRU 是行人骑行者。关键不只是轨迹会不会相交,而是会不会在接近同一时刻到达交点。
- 多模态轨迹——未来不是一个确定的点,而是一个分布:可以跟车、变道、让行、绕行,模型输出多条候选来表达这种不确定性。
- 数据闭环——从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。
- 场景隔离——同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。
- 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
- 逐步展开与误差累积——策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。
- 信用分配——整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 天然对齐,Diffusion 要摊回多个去噪步。
相关论文
- VAD:面向高效自动驾驶的向量化场景表示——黑盒与结构化之间的折中
- VADv2:通过概率规划实现端到端向量化自动驾驶——概率规划
- DiffusionDrive:端到端自动驾驶的截断扩散模型——截断 + 锚点换实时
- DiffusionDriveV2:强化学习约束的截断扩散建模——锚内提质,锚间协调
- Plan-R1:把安全可行的轨迹规划建模为语言建模——规划语言化 + GRPO
- PLUTO:把模仿学习规划推到极限——把 IL 做到极致,再谈 RL
- TrajHF:通过人类反馈强化学习学个性化驾驶风格——偏好定驾驶风格
材料来源
| 课程 | 章节 | 页码 | 说明 |
|---|---|---|---|
| A | A-01 端到端任务概述 | p24-p27 | nuPlan 的 ego/agent 评测矩阵,以及 ADE、FDE、MR、Overlap Rate 的定义。 |
| A | A-05 自动驾驶中的 RL 算法介绍 | p30-p34 | 固定数据开环训练与真实闭环在长期规划、互动和错误恢复上的能力边界。 |
| A | A-05 自动驾驶中的 RL 算法介绍 | p36-p42 | IDM 环境代理、交通行为失真与 RL 利用环境漏洞的问题。 |
| A | A-08 端到端量产经验分享 | p7-p9 | reward 验证规模和开闭环训练的工程取舍。 |
| A | A-08 端到端量产经验分享 | p17-p20 | 加塞专项从过度保守到过度积极的回归风险,以及反应式交通代理需求。 |
| A | A-08 端到端量产经验分享 | p25-p28 | TTC、VRU 交汇和安全大于法规大于体感的优先级。 |
| B | B-07 端到端模型的训练范式 | sec4 p9-p12 | 开环评测机理、自车状态弱基线和开闭环弱相关性。 |
| B | B-07 端到端模型的训练范式 | sec4 p14-p21 | CARLA、Bench2Drive、短路线单科考试、五技能结果和评测可比性。 |
| B | B-08 端到端训练数据与评测方法 | p4-p9 | nuPlan、NAVSIM、CARLA 与 Bench2Drive 的数据和仿真边界。 |
| B | B-08 端到端训练数据与评测方法 | p14-p17 | 开环 L2/碰撞、PDM/PDMS 子项、人类基线和 CARLA Driving Score。 |
| C | C-07 数据驱动的预测方法 | p61-p63 | minADE/minFDE、MR、DAC、概率惩罚与 Brier 指标的口径。 |
| C | C-09 数据驱动前沿算法与发展趋势 | p24-p33 | VAD 延迟、AD-MLP 开环反例、CARLA 指标和 DOS 遮挡专项。 |
| C | C-09 数据驱动前沿算法与发展趋势 | p34-p36 | 真实场景重建、可编辑闭环仿真与现有评测局限。 |
| C | C-09 数据驱动前沿算法与发展趋势 | p66 | 有效闭环、长尾 benchmark、实时部署仍是开放问题,Bench2Drive 是准真实评测。 |
| B | B-05 基于自回归 AR 的端到端 Planner | p31-p32 | AutoVLA One-shot 与 Best-of-N 的差距,以及 TrajHF 的 PDMS 榜首成绩构成。 |