← 深度专题

专题 04

评测不只是一个分数

开环、闭环和道路验收各自能证明什么,怎样避免被漂亮指标误导?

自动驾驶评测的第一原则不是选一个最权威的榜单,而是先问:自车真的动了吗,其他交通参与者会回应吗,传感器观测会随动作更新吗?只有把交互层级、指标口径和场景覆盖拆开,ADE/FDE、PDM/PDMS、CARLA Driving Score 才能成为能力证据,而不是排行榜装饰。

8 个小节 · 约 14 分钟阅读

先定义环:到底是谁在响应谁

“闭环”不是一个二元标签。最少要拆成三个问题:自车状态是否由模型动作推进,背景交通是否会因自车动作改变,下一帧传感器观测是否根据新位置重新生成。A 课用 nuPlan 的 2×3 矩阵把前两项分开:log replay 中自车和他车都开环;non-reactive simulation 中自车闭环、他车仍按录像走;reactive simulation 才是双方闭环。

这一区分直接改变评测能回答的问题。逐帧对专家轨迹只能回答“像不像这位司机”;自车闭环但背景不响应,可以回答“偏离以后能不能继续走、会不会撞上固定未来”;双方响应,才开始回答“我强行并线时后车会不会刹、我让步时对方会不会插入”。交互和长期因果不能从静态日志里推导出来。

因此评测报告中不应只写 open-loop 或 closed-loop,而应显式写出 ego、agents、observation 三列的更新方式。没有这三列,所谓闭环结果很可能把 NAVSIM 式非反应背景与 CARLA 式可交互交通混在一起。

LOG

日志开环

  • 自车不真正推进,只对未来轨迹真值
  • 他车按已记录未来,不受模型影响
  • 高吞吐、可复现,适合训练回归

EGO

非反应式闭环

  • 自车按预测轨迹更新
  • 背景交通继续回放,不回应自车
  • 可测偏航恢复,但不能证明博弈能力

WORLD

反应式闭环

  • 自车、他车和观测共同演化
  • 可测长期规划、互动和恢复
  • 结果受交通代理真实性与仿真域差影响
闭环程度越高,能验证的因果越多;同时环境模型带来的偏差也越大。

四类基准不是替代关系

nuPlan 是数据集也是规划仿真器,课程材料给出 Replay、Rails、ML policy 等 agent 配置,以及 open-loop、closed-loop 的组合。它的优势是来自真实城市日志并保留规划语义,但是否形成真实互动取决于具体 agent 配置,不能看到“nuPlan”三个字就自动视为完全闭环。

NAVSIM 用真实交通背景和 3DGS 生成自车偏离原轨迹后的新视角,但背景车辆和行人仍按数据回放。因此它在自车状态和视觉观测上更接近闭环,在多智能体交互上仍是开环。课程把它放进闭环评测章节并使用 PDM/PDMS 家族指标,是评测用途上的归类;从交互机理看,它仍属于非反应式闭环。

CARLA 能配置交通参与者、天气、交通灯和传感器,支持真正的交互式闭环,但合成世界与真实道路之间存在 sim-to-real gap。Bench2Drive 建在 CARLA 之上,用统一训练集、150–200 米短路线和单技能场景,把过去“各自采数据、比整套系统”的比较改成更接近算法级的单科考试。它提高了可比性,却不消除仿真交通行为失真。

REAL LOG

nuPlan

  • 真实城市数据与规划语义
  • 支持开环和多种仿真配置
  • 需披露 agent 是否会响应

3DGS

NAVSIM

  • 自车可偏离并获得合成观测
  • 背景交通按日志回放
  • 适合 PDM/PDMS 式快速规划评测

INTERACTIVE

CARLA / Bench2Drive

  • 交通、天气、传感器可交互配置
  • Bench2Drive 按技能拆短路线
  • 要额外审视交通代理和域差
选基准时不是寻找唯一冠军,而是让不同基准覆盖不同的不确定性。

从几何误差到驾驶能力

ADE 衡量整段轨迹逐点平均误差,FDE 只看终点;它们便宜、稳定,适合检查预测或规划是否突然退化,但“离专家近”不等于“安全可行”。多模态预测里的 minADE/minFDE 又只取 K 条候选中最好的一条,K 越大越容易蒙中;p-min 与 Brier 版本把候选概率纳入惩罚,才开始检查模型是否知道哪条更可能。

同名指标还可能不同义。A 课 nuPlan 页的 Miss Rate 是轨迹越出预设边界的比例,C 课预测章节的 MR 是所有预测终点都未落入真值 2 米范围的场景数。跨论文或跨数据集汇总时,必须同时记录任务、阈值、候选数 K、采样时域和聚合方式。

NAVSIM 使用的 PDM/PDMS 家族把 NC、DAC 等安全项作为惩罚门,再对 EP、TTC、Comfort 等做加权组合;CARLA Driving Score 则以 Route Completion 乘 Infraction Score。两者都试图把“开到了”和“开得对”合起来,但总分会隐藏原因:一个模型可能极舒适却不前进,也可能路线完成度很高却一路违规。

安全、舒适、效率和交互应保留独立子指标。碰撞还要区分有责、静态碰撞、后向追尾和近碰;舒适要看纵横向加速度与 jerk 的分布而非单阈值通过率;效率不能只看进度,还应分辨是谨慎等待还是策略冻结;交互要在汇入、让行、无保护左转等需要对方响应的场景单独测。

  • 几何层:ADE、FDE、L2、MR,回答轨迹是否接近参考。
  • 可行层:DAC、道路边界、动力学、碰撞与 TTC,回答轨迹能否执行。
  • 体验层:纵横向加速度、jerk、停车与起步平顺性,回答乘客是否接受。
  • 任务层:EP、Route Completion、导航成功、超时,回答有没有完成任务。
  • 交互层:Merging、Give Way、Emergency Brake、无保护左转,回答是否理解其他交通参与者会回应。
  • 校准层:候选概率、Top-1 与 Oracle/Top-K 差距,回答生成器和选择器分别出了什么问题。

漂亮分数怎样与真实能力错位

C 课的 AD-MLP 是最直接的压力测试:它不看相机或 LiDAR,也不接收高层指令,只用自车速度、加速度和历史轨迹,两层 MLP 在 nuScenes 开环 L2 上做到 0.29,反而优于 VAD-Base 的 0.37。它并没有突然学会驾驶,只是利用直行样本占比和自车历史对短期未来的强先验。

B 课把同类问题带到闭环:AD-MLP 在 Bench2Drive 的 Merging、Overtaking、Emergency Brake、Give Way、Traffic Sign 五项技能全部为 0。B-L8 还给出 perception-free LAW 在开环 L2 上优于 UniAD 的例子。三处材料共同说明,开环排序可能奖励“最会外推自车惯性”的模型,而不是“最会看世界并做决定”的模型。

总分也会制造另一类错位。CARLA 长路线把违规惩罚持续累乘,最终分数可能被挤到很低,却无法定位是哪种能力失败;Bench2Drive 改成一条短路线只考一个行为,目的不是降低难度,而是降低方差、保留诊断性。评测不是把更多指标乘起来,而是让一次失败能回到明确的能力和场景。

一个有效的评测体系应包含反事实对照:去掉感知、打乱导航、只保留自车状态、改变候选数 K、交换交通代理风格。如果分数几乎不变,说明指标没有测到声称的能力。

  1. 做弱基线恒速、仅自车状态、规则规划器和人类基线必须同表,避免只比较复杂模型。
  2. 做输入消融移除视觉、导航或历史,观察指标是否真的对关键输入敏感。
  3. 做开闭环交叉同一 checkpoint 同时报开环、非反应式闭环和反应式闭环,不用不同版本拼故事。
  4. 做场景归因总分下钻到技能、天气、道路、速度区间和失败责任,保留分母与置信区间。

论文自己怎么选考卷

评测素养的一个速查办法,是看方法论文自己选了哪张考卷。PLUTO 把模仿学习规划推到极限,评测却明确“以闭环 nuPlan benchmark 为准,而不是开环 ADE/FDE”——一篇 IL 论文主动放弃更容易刷分的考卷,这本身就是可信度信号。反过来,只报开环 L2 的规划论文,应当默认追问一句:换到闭环还成立吗?AD-MLP 和 LAW 已经演示过这一问的杀伤力。

第二类值得学的,是把“生成器-选择器”差距摆上台面的论文。AutoVLA 同时报了 One-shot 80.54 和 Best-of-N 92.12:11.6 分的差距说明答案在生成分布里、第一次没采到——这正是本篇“校准层”指标(Top-1 与 Oracle/Top-K 差距)的论文版实例。一份合格的评测表应该让读者分得清:模型是不会生成好轨迹,还是不会挑出好轨迹。

第三类论文的动机本身就是评测论证。DiffusionDriveV2 指出:模仿学习只监督离真值最近的正模式,其余锚点下的候选可能低质量甚至碰撞——只看 Top-1 的评测永远发现不了这些候选,而量产系统在罕见场景里恰恰可能采到它们。所以它用组内与组间 GRPO 专门管“不是最优的那些候选”的质量。翻译成评测语言:多模态输出的系统,必须单独审计非最优候选的安全性,Top-1 合格不等于分布合格。

最后是榜单名次的成绩来源拆解。TrajHF 以 93.95 的 PDMS 居 NAVSIM 榜首,但它的机制是人类偏好反馈微调——榜首成绩里混合了“更会开”与“更符合人类打分口味”两种成分,而偏好标注本身主观且可能不一致。读榜单时把名次拆成成绩来源,和把总分拆成子项,是同一种纪律。

把能力做成矩阵,而不是一列总分

能力矩阵的横轴应是安全、合规、效率、舒适、导航、交互与恢复,纵轴应是常规分布、长尾专项、传感器退化、导航退化、不同交通代理和不同城市道路。每个格子绑定测试环境、核心指标、硬门槛和诊断指标,才能知道一个模型究竟在哪一层变好。

Bench2Drive 的五类技能提供了一个起点:Merging 测汇入博弈,Overtaking 测绕行与时机,Emergency Brake 测紧急风险,Give Way 测社会性驾驶,Traffic Sign 测规则遵循。但五类仍不足以覆盖量产,还需要加入静态偏航、施工改道、非机动车道、VRU 时间同步、红绿灯异常状态、感知遮挡和导航跳变等专项。

指标要区分硬门与排序项。碰撞、驶出可行域、逆行等可以作为发布门槛;舒适、效率和类人性适合做分布比较。把所有目标压成一个加权和会让团队不断争权重,也给模型留下以一个目标补偿另一个目标的空间。

GATE

硬门槛

  • 有责碰撞、逆行、闯灯
  • 驶出可行域、动力学越界
  • 关键场景不得回归

RANK

排序指标

  • 进度、通行效率、接管
  • 舒适分布与类人性
  • 同门槛内比较优劣

DIAGNOSE

诊断指标

  • Top-1 与 Top-K 差距
  • 按场景、速度、天气切片
  • 感知、选择器、后处理分别归因
硬门决定能不能发,排序决定哪个更好,诊断决定下一轮改哪里。

量产需要一条持续验收阶梯

模型评测不应从开环直接跳到公开 benchmark,再跳到实车。更稳妥的路径是六级:离线回归、非反应式闭环、反应式仿真、单场景专项、影子模式与封闭场道路、灰度车队。每一级都有明确退出条件,失败时能回到数据、模型、reward、交通代理或系统接口。

A 课的量产案例表明,reward 修复可能把“安全但一直等”推向“过度自信地抢”。因此每个专项优化必须同时带反向场景:奖励成功加塞时,也要加入加塞失败折回、后车不让行和等待更优的样本。验收不是证明修复场景变好,而是证明相邻失效模式没有被放大。

道路验证也不能只看接管率。接管的触发策略、驾驶员风格、道路构成和里程分母都会改变结果。应保留场景触发率、人工接管原因、系统最小安全裕度、模型置信度和版本配置,才能把线上信号回流到离线可复现用例。

  1. 01 离线烟测用 ADE/FDE、碰撞代理和弱基线检查训练是否收敛、数据与接口是否异常。
  2. 02 非反应式闭环检查自车偏离日志后的观测更新、道路合规与恢复,不声称已验证互动。
  3. 03 反应式闭环更换交通代理风格与随机种子,验证长期因果、博弈和错误恢复。
  4. 04 单科专项对汇入、绕行、VRU、红绿灯、导航退化逐项设硬门,并带相邻反例。
  5. 05 道路影子与封闭场记录模型建议但不控车,或在可控道路验证动力学、延迟和系统接口。
  6. 06 灰度与持续回归小车队分版本放量,线上问题转成可复现用例并永久进入回归集。

一张可信评测表必须交代什么

评测结论必须能被另一个团队复现。至少要披露 checkpoint、训练数据版本、传感器与地图输入、候选数、推理频率、控制器、交通代理、随机种子数、场景分母、失败责任口径和置信区间。缺一项,跨版本涨跌都可能来自系统配置而非模型能力。

同时报告人类、恒速、仅自车状态和现有量产版本。B-L8 的 Human PDMS 94.8、EP 87.5 很有启发:人类也不是所有维度满分,保守等待可能降低效率。基线的意义不是装饰,而是校准“超过人类”“接近量产”的具体维度。

最后,把公开 benchmark 与内部量产指标分开。公开榜单适合外部可比性,内部验收要围绕自己的 ODD、硬件预算、导航质量、交通规则与客户问题。两套都要,但不能用公开榜单替代产品责任。

  • 注明 open-loop、ego-closed/agent-open、fully reactive 中的哪一种。
  • 注明 ADE/FDE/MR 的定义、时域、K 值和概率是否计分。
  • 总分旁必须给安全、效率、舒适、交互、导航的独立子项。
  • 给出弱基线、人类基线、当前量产基线与相同 checkpoint 的交叉环境结果。
  • 报告均值之外的分位数、最坏场景、样本数与置信区间。
  • 每个线上严重问题转成具名专项,并进入永久回归而非一次性报告。

三门课怎么对上

同一个工程问题,三门课的观察层级不同。下面逐条标出它们是相互印证、作用域不同,还是在相同前提下保留张力——不把任何一门课单独当作行业定论。

开环评测无法验证自车动作对其他交通参与者的影响。

相互印证
A · 端到端早期课
A-01 p25 用 ego simulation 与 agent simulation 两轴区分三种评测,只有 reactive agents 才是双方闭环。
B · 端到端一期
B-07 sec4 p9 明确开环碰撞率假设他车不受自车影响,并指出只是逐帧画结果、并不真实开车。
C · 决策规划课
C-09 p29 用不看感知的 AD-MLP 刷高开环 L2,说明静态日志没有测到互动驾驶能力。

合并读法:三门课从定义、机理和反例三个角度指向同一结论:开环只适合快速回归,不是驾驶能力终审。

NAVSIM 可以直接等同于完全反应式闭环。

保留张力
A · 端到端早期课
A-01 p25 的矩阵把 ego 闭环、agent 开环命名为 closed-loop non-reactive,是独立于 fully reactive 的一档。
B · 端到端一期
B-08 p6 说明 NAVSIM 背景车辆和行人按数据回放;p16 又把使用 PDMS 的 NAVSIM 放在闭环评测章节。
C · 决策规划课
C-09 p34-p36 把可编辑真实重建和端到端闭环仿真视为发展方向,并未把背景回放视为完整互动。

合并读法:不是材料互相否定,而是“闭环”口径不同。NAVSIM 对自车与观测闭环,对背景交通非反应;报告中应写清两层。

ADE/FDE 足以代表规划质量。

相互印证
A · 端到端早期课
A-01 p24-p27 给出 ADE/FDE,同时补充 MR 与空间重叠,已经显示几何误差并非全部。
B · 端到端一期
B-08 p14 明确开环指标只用于快速迭代、算法稳定后仅供参考;p16-p17 引入安全、进度、舒适与违规。
C · 决策规划课
C-07 p62 区分 min、概率校准和 DAC;C-09 p29 进一步证明 L2 可被自车状态先验刷高。

合并读法:三门课一致认为几何误差是低成本诊断指标,不能单独承担安全、合规、互动和概率校准。

不同材料中的 Miss Rate 可以直接横向比较。

保留张力
A · 端到端早期课
A-01 p25 的 nuPlan MR 被记为轨迹超出预设边界的比例,p27 的 Motion MR 又按未匹配真值时刻描述。
B · 端到端一期
B-08 主要使用 L2、碰撞、PDMS 与 Driving Score,没有建立统一 MR 口径。
C · 决策规划课
C-07 p62 的 MR 是所有候选终点都未落入真值 2 米范围的场景数。

合并读法:同名不等义。横向对比前必须回到数据集官方定义,并记录阈值、对象和聚合方式。

开环排名高通常意味着闭环能力也高。

相互印证
A · 端到端早期课
A-05 p30-p34 从训练侧指出固定环境学不到长期因果、博弈与 self-recovery。
B · 端到端一期
B-07 sec4 p10-p19 给出 AD-MLP 开环可看、Bench2Drive 五技能全零的强反例。
C · 决策规划课
C-09 p29 给出 AD-MLP L2 0.29 优于 VAD-Base 0.37,结论是指标失效而非模型更强。

合并读法:三门课互相闭合:开环排名和闭环能力可能弱相关,必须对同一模型做跨环境复验。

CARLA Driving Score 越综合,越容易定位能力短板。

相互印证
A · 端到端早期课
A-08 p28 强调安全、法规、体感要有优先级和冲突处理,不能简单互相补偿。
B · 端到端一期
B-07 sec4 p15-p19 指出长路线累乘惩罚会挤压分数且失去细节,Bench2Drive 因此改成单科短路线。
C · 决策规划课
C-09 p32-p33 把 CARLA 总分与 DOS 遮挡专项并列,显示综合分仍需具名长尾基准补充。

合并读法:总分适合排序,专项分适合诊断。越综合不等于越可解释。

安全、效率与舒适应被压成同一个可互相补偿的加权分。

保留张力
A · 端到端早期课
A-08 p28 给出安全大于法规大于体感,并规定碰撞时清空绕行奖励,体现硬优先级。
B · 端到端一期
B-08 p16 的 PDMS 把 NC、DAC 作为乘法惩罚项,再对 EP、TTC、Comfort 加权,部分目标不可自由补偿。
C · 决策规划课
C-04a p34-p43 把障碍、安全边界和动力学写入可行域与约束,平滑和引导才进入代价优化。

合并读法:三门课都更支持“硬约束先行、软目标排序”,而不是让舒适或效率抵消安全失败。

Bench2Drive 已经解决了真实道路能力验证。

作用域不同
A · 端到端早期课
A 课提供量产专项与道路问题闭环,但没有把公开 benchmark 视为最终验收。
B · 端到端一期
B-07/B-08 强调 Bench2Drive 的统一数据、短路线和五技能,主要解决算法可比性与诊断性。
C · 决策规划课
C-09 p66 仍把有效闭环、长尾 benchmark、实时部署列为开放问题,并称 Bench2Drive 为准真实场景闭环。

合并读法:Bench2Drive 是重要的实验室单科考试,不是道路量产证书;它与道路影子、封闭场和车队验收是上下游关系。

人类基线应该默认等于满分。

作用域不同
A · 端到端早期课
A-08 的工程案例显示人驾数据也可能因遮挡、风格和采集分布产生偏差。
B · 端到端一期
B-08 p16 的 Human PDMS 为 94.8,EP 为 87.5,明确说明人类在效率等维度不是满分。
C · 决策规划课
C-07 的预测指标和 C-09 的闭环讨论没有给统一人类满分假设。

合并读法:人类既是重要参照也是有偏数据源。应按能力维度比较,而不是把 Human 当作无条件 100。

相关术语

  • 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。
  • 位移误差指标——ADE 是预测轨迹与真值逐点距离的平均,FDE 只看终点——它们衡量「像不像专家」,不等于安全或舒适。
  • 碰撞时间与弱势交通参与者——TTC 是碰撞时间;VRU 是行人骑行者。关键不只是轨迹会不会相交,而是会不会在接近同一时刻到达交点。
  • 多模态轨迹——未来不是一个确定的点,而是一个分布:可以跟车、变道、让行、绕行,模型输出多条候选来表达这种不确定性。
  • 数据闭环——从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。
  • 场景隔离——同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。
  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
  • 逐步展开与误差累积——策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。
  • 信用分配——整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 天然对齐,Diffusion 要摊回多个去噪步。

相关论文

材料来源

课程章节页码说明
AA-01 端到端任务概述p24-p27nuPlan 的 ego/agent 评测矩阵,以及 ADE、FDE、MR、Overlap Rate 的定义。
AA-05 自动驾驶中的 RL 算法介绍p30-p34固定数据开环训练与真实闭环在长期规划、互动和错误恢复上的能力边界。
AA-05 自动驾驶中的 RL 算法介绍p36-p42IDM 环境代理、交通行为失真与 RL 利用环境漏洞的问题。
AA-08 端到端量产经验分享p7-p9reward 验证规模和开闭环训练的工程取舍。
AA-08 端到端量产经验分享p17-p20加塞专项从过度保守到过度积极的回归风险,以及反应式交通代理需求。
AA-08 端到端量产经验分享p25-p28TTC、VRU 交汇和安全大于法规大于体感的优先级。
BB-07 端到端模型的训练范式sec4 p9-p12开环评测机理、自车状态弱基线和开闭环弱相关性。
BB-07 端到端模型的训练范式sec4 p14-p21CARLA、Bench2Drive、短路线单科考试、五技能结果和评测可比性。
BB-08 端到端训练数据与评测方法p4-p9nuPlan、NAVSIM、CARLA 与 Bench2Drive 的数据和仿真边界。
BB-08 端到端训练数据与评测方法p14-p17开环 L2/碰撞、PDM/PDMS 子项、人类基线和 CARLA Driving Score。
CC-07 数据驱动的预测方法p61-p63minADE/minFDE、MR、DAC、概率惩罚与 Brier 指标的口径。
CC-09 数据驱动前沿算法与发展趋势p24-p33VAD 延迟、AD-MLP 开环反例、CARLA 指标和 DOS 遮挡专项。
CC-09 数据驱动前沿算法与发展趋势p34-p36真实场景重建、可编辑闭环仿真与现有评测局限。
CC-09 数据驱动前沿算法与发展趋势p66有效闭环、长尾 benchmark、实时部署仍是开放问题,Bench2Drive 是准真实评测。
BB-05 基于自回归 AR 的端到端 Plannerp31-p32AutoVLA One-shot 与 Best-of-N 的差距,以及 TrajHF 的 PDMS 榜首成绩构成。