← 深度专题

专题 03

从模仿学习到强化学习:训练闭环怎样补上驾驶因果

为什么端到端 Planner 不能只靠模仿学习,强化学习又为什么不能取代监督底座?PPO、GRPO、奖励、信用分配和闭环 rollout 在量产链路中分别解决什么?

模仿学习负责把真实驾驶数据压进一个可驾驶、类人、可收敛的策略初始分布;强化学习负责在环境反馈中比较行为结果,优化规则、交互和长时收益。两者不是“旧方法升级成新方法”,而是承担不同职责。真正困难的地方不在 PPO 或 GRPO 的名字,而在闭环环境是否可信、reward 是否可被钻空子、长期后果能否归因,以及策略偏离人类分布后谁把它拉回来。

11 个小节 · 约 25 分钟阅读

先分工:IL 学“人通常怎样开”,RL 学“这样开以后怎样”

模仿学习在固定专家数据 D={(s,a)} 上最小化动作或轨迹与真值的差异。它擅长吸收道路几何、常见交互、车辆动力学、驾驶风格和大量隐性常识,训练稳定、数据利用率高。AR 用 next-token 交叉熵,Query Planner 用轨迹回归/打分,Diffusion/Flow 用噪声或速度场回归,本质上都先把人类驾驶分布变成可采样策略。

但日志里的专家只展示“做了什么”,很少展示“如果做另一件事会怎样”。一旦策略偏离专家轨迹,它看到的新状态不在训练分布内;前一步小误差会改变感知、交互和后续动作,纯 IL 没有自我纠错信号。它也难以显式优化安全、舒适、效率、规则和通行之间的长期取舍。

RL 增加环境转移和回报:策略执行 a_t 后,环境产生 s_{t+1} 和 r_t。它的独有价值是比较没有出现在专家数据中的行为结果,并把几秒后的通行、碰撞或让行结果追溯到此前动作。C 课程将 IL 概括为类人、数据利用率高但规则与泛化不足,将 RL 概括为规则遵循和探索性强但类人性与样本效率不足;RTR、RAD 等方案因而都把二者写成联合目标,而不是替代关系。

IL

行为底座

  • 数据:真实人驾或高质量专家日志
  • 目标:拟合动作/轨迹分布,保持类人性
  • 优势:稳定、可扩规模、建立基本驾驶先验
  • 盲区:因果混淆、OOD 恢复、未示范动作的价值

RL

价值优化

  • 数据:策略 rollout 与环境反馈
  • 目标:最大化长期累计 reward
  • 优势:规则、博弈、长时权衡、自我恢复
  • 盲区:reward hacking、样本效率、sim2real 与类人性

IL + RL

受约束后训练

  • 先在专家分布内获得可驾驶 policy
  • 再在可控场景做相对改进和长尾探索
  • 以 BC/reference/KL 保留行为锚点
  • 以场景级闭环指标决定能否上线
C-08 p83 是课程层面的教学取舍;A-05、A-06b、B-09 则提供了 IL+RL 在端到端系统中的具体接口。

凸包、监督赤字与 90% 的直觉

IL 的边界可以说得比“泛化差”精确得多。B 课的定义是:基于监督学习的模型受限于训练数据的凸包(Convex Hull)——凸包内是插值,基本可靠;凸包外是外推,全靠运气。配套的第二个概念是监督赤字(Supervision Deficit):稀疏的低维控制信号(一个转向角、一脚油门)无法为高维网络提供足够的物理约束,这是引入辅助任务和世界模型的根本理由。corner case 的失效机制随之清晰:模型只能在记忆的样本里找最近邻,无法调用常识做因果推理——一辆侧翻的货车,最近邻可能是“墙”也可能是“正常货车”,两个答案的后果天差地别。

闭环的必要性也有一个准确的表述。A 课把跨时间信用分配(Credit Assignment Across Time)称为闭环唯一不可替代的价值:没有闭环,决策视野超过两步基本失效,“其他车是录像,agent 永远在独角戏”。旁边有一句批注值得单独记住:“自动驾驶中 90% 的‘人类直觉行为’都属于长期规划这一类”——提前松油门、预留变道窗口、在路口前主动压速,这些“像人开的”细节全是长期回报的产物,纯 IL 在固定日志上学不到它们的因果。

所以“开环 RL”是一个需要警惕的中间形态。A 课的红字结论是:“RL 学到的最优动作,数据里可能根本不存在”——在录好的数据上做 RL,agent 可以做决策,但下一状态不受动作影响,交互被抹掉了,这与开环评测犯的是同一个错。更根本的不匹配在一句金句里:“自动驾驶想要的是‘规则+安全+常识’,而 RL 只能理解‘数值+可微+累积期望’——这两者在数学表达层面就不兼容。”奖励工程的全部困难,都是在给这道不兼容打补丁。

三种“闭环”别混在一起:数据、环境和评测

第一层是数据闭环:路测采集、难例挖掘、标注、训练、部署、再采集。它提高训练集覆盖,但训练本身仍可能是固定日志上的监督学习。第二层是环境闭环:policy 的动作真正改变下一状态,满足 s_{t+1}=f(s_t,a_t),其他参与者也会对自车动作反应。只有这一层能训练交互和跨时间因果。

第三层是评测闭环:把 policy 放进仿真或可重放的交互环境执行,统计路线完成、碰撞、违规和能力分项。闭环评测能暴露开环距离指标看不出的失败,但它不等于已经用 RL 训练;一个纯 IL policy 也可以做闭环评测。

A 课程还定义了 pseudo-open-loop:表面上用 reward 优化动作,但下一状态仍来自预录轨迹,不受当前 action 影响。它可控、安全、便宜,能做风格或固定覆盖范围内的温和优化,却学不到“我强行并线会让后车刹车”或“我提前让速会让对方插入”。把 pseudo-open-loop 称为闭环 RL,会夸大系统能力。

B 课程的 Bench2Drive 材料进一步说明评测要做“单科考试”:将长路线拆成 150–200 米、每条只考一种行为的短场景,避免完成度与违规惩罚累乘后无法定位问题。训练闭环和评测闭环都需要这种场景分解,否则 reward 和最终分数都只有一个总数,无法归因。

  • 数据闭环回答:下一批训练数据从哪里来。
  • 环境闭环回答:动作是否改变未来世界和他车反应。
  • 评测闭环回答:策略执行后具体哪项能力失败。
  • 伪开环回答:在不产生新状态的固定数据里,能否有限度地做价值优化。

PPO:用 Critic 做基线,用裁剪防止策略“一步走飞”

PPO 是 Actor-Critic 路线。Actor π_θ(a|s) 产生动作,Critic V_φ(s) 估计当前状态的长期价值。训练先用旧策略 π_old 与环境交互,采样 (s_t,a_t,r_t,s_{t+1});再计算折扣回报 G_t 和优势 A_t,常用 GAE 降低方差。A_t>0 表示这个动作比当前状态下的平均行为好,A_t<0 表示更差。

策略更新使用概率比 r_t(θ)=π_θ(a_t|s_t)/π_old(a_t|s_t),目标取 min(r_tA_t,clip(r_t,1-ε,1+ε)A_t)。当新旧策略差异过大时,clip 截断继续放大的收益,避免一次 noisy reward 把已有驾驶能力推离数据分布。Critic 另外最小化 (V(s_t)-G_t)^2,多轮更新后再用新策略采样。

在自动驾驶中,PPO 的价值不只是一个算法名,而是四个工程组件:高吞吐 environment worker 产生 rollout;reward worker 计算安全、规则、效率和舒适分;critic/reference 推理提供优势与行为锚点;actor train 更新 Planner。A 课程的 ROLL 架构把这些 worker 明确分开,说明 RL 训练基础设施远比监督训练复杂。

PPO 适合逐步动作概率明确、critic 可以从大量状态学习价值的策略,例如 AR action token 或连续控制 policy。它的脆弱点是 Critic 误差:长时、稀有安全事件下,V/Q 很难估准;错误 baseline 会把正确动作标成负优势。clip 只能限制更新幅度,不能把错误 reward 或错误价值变正确。

  1. Rollout用冻结的 π_old 在可交互环境中采样状态、动作、奖励和下一状态,并记录终止与场景标签。
  2. Return 与 Advantage按折扣累计未来 reward,以 Critic/GAE 估算 A_t=Q-V;场景稀有时必须检查估值偏差。
  3. Clipped Policy Update用新旧动作概率比做裁剪目标,限制单轮 policy 漂移,同时更新 Critic。
  4. 行为锚定叠加 BC loss 或相对监督 reference 的 KL,防止为了 reward 丢失人类驾驶分布。
  5. 重新采样更新后必须回到环境生成新状态分布;反复用同一固定日志不构成真正 on-policy 闭环。

GRPO:同一道场景多次作答,用组内相对好坏代替独立 Critic

GRPO 对同一个场景或条件 q,从当前 policy 采样 G 条动作序列或轨迹,得到 r_1…r_G,再用 A_i=(r_i-mean(r))/std(r) 形成组内相对优势。它不必额外训练一个独立 Critic,适合 AR、Diffusion 或 Flow 这类一次能产生多候选的生成式 Planner,也减少了价值网络本身估错带来的一个来源。

但 GRPO 只回答“这组里谁相对更好”。如果同一 anchor 下的轨迹全都碰撞,组内最高分仍可能只是“最不坏”。DiffusionDriveV2 因而区分 Intra-Anchor GRPO 和 Inter-Anchor Truncated GRPO:前者在同意图内比较,保持各 mode 不被全局高分模式吞掉;后者跨 anchor 引入全局尺度,对碰撞等绝对失败施加惩罚,避免矮子里拔将军。

GRPO 也不等于解决 credit assignment。组内 reward 通常落在整条轨迹,能决定哪条更好,却未必知道第几个 token、哪个去噪阶段或速度场的哪段改变导致结果。AR 可把整轨迹优势乘到各 token log probability 上,Diffusion/Flow 可把优势传给完整生成链;归因粒度不同,但都可能把末端事故的责任平均分摊给无关早期动作。

用于量产时至少要同时保留相对 reward、绝对安全 gate 和 reference/KL。相对比较促进场景内改进;绝对 gate 防止全组失败仍被奖励;reference 约束策略不要因局部场景优化而破坏常见驾驶。只有三者同时存在,GRPO 才不是一个更便宜的“挑高分”技巧。

PPO

Critic 基线

  • 优势来自回报与 V(s) 的差
  • 能跨 batch/状态给出绝对价值参照
  • 多一个需要稳定训练的 Critic
  • 适合逐步 policy 与大量交互样本

GRPO

组内基线

  • 优势来自同场景 G 个样本的均值与方差
  • 省去独立 Critic,直接利用多候选生成
  • 只知道相对好坏,易出现全组低质
  • 需跨 anchor 或绝对安全信号补尺度
PPO 与 GRPO 的差别主要在优势估计,不在是否需要 reward、rollout、KL 或安全兜底。

Reward:不是把安全、效率、舒适加起来就结束

自动驾驶 reward 至少覆盖安全、法规、效率、舒适、社会规范和人类偏好。困难不只是项多,而是这些目标会在同一帧打架:绕行奖励可能鼓励激进变道,车道保持奖励可能阻止合理绕行,追专家轨迹可能与避碰惩罚重复,速度奖励可能让策略赌对方减速。固定权重 R=w_1·安全+w_2·效率+w_3·舒适无法自然表达场景条件和优先级。

A-08 给出更接近量产的做法:先按安全、法规、体感分层,优先级为安全>法规>体感;若发生碰撞,立即清空绕行奖励,避免“撞一下但绕行收益更高”;若某一时刻已有其他奖惩触发,不再叠加追 GT 惩罚;车道锁定只用于静态无效换道,在绕行慢车时禁用,防止两个规则互相打架。这些不是漂亮的统一公式,而是 reward 作用域和冲突管理。

Reward hacking 是优化目标的必然结果,不是模型故意捣乱。遗漏进度约束会得到“慢到永远不出事”,仿真交通车永远让行会得到“强行插队总能赢”,即时 TTC 和 jerk 指标会得到短期看似安全、长期把自己送进死路的策略。解决方向是场景隔离、权重/环境随机化、人类偏好或逆强化学习,以及独立的安全 gate,而不是继续无上限添加 reward 项。

Reward 的正确性必须先离线单元测试,再小规模闭环对抗测试。每个 reward 要有正例、反例、边界值、互斥条件、优先级和可解释日志;随后做“反优化”测试,主动寻找能拿高分但违反产品意图的轨迹。若无法用轨迹回放解释一条总 reward 为什么高,就不应直接进入大规模 RL。

  • 安全底线:碰撞、道路越界、逆行、红灯等绝对失败不与体验项做简单加权交换。
  • 作用域:每个 reward 只在明确场景、目标类型和时间窗口生效。
  • 去重:同一物理失败不要被 TTC、距离、碰撞和追 GT 多次重复惩罚。
  • 优先级:安全 > 法规 > 体感;场景特殊规则必须写清覆盖关系。
  • 可攻击测试:主动寻找静止、卡 gap、赌他车、利用延迟等高分捷径。

量产 RL 的真实账本:一个加塞案例的完整生命周期

先对数量级。A 课的量产经验:验证一个 reward 方向是否正确,10 条数据就够;单任务性能优化要每任务百到千条 clip;RL 全量训练 10 万 clip 即有较好效果——对照 IL 预训练需要的千万级 clip,差两个数量级。reward 的数量是十几到几十个、每个都要人工调参,对照端到端联训的“几百个 loss”少一个量级,但每一项都是人工权衡。A 课另一处给的分工比例是:数据解决问题占 60%,模仿学习 30%,强化学习 10%——语境是分布转移优化,但作为量产投入的心理模型足够准确。

这套账本里最有教学价值的,是一个加塞场景的完整生命周期。第一幕:模型收敛到“安全但行为失真”——大多数推理轨迹选择原地等待,直到导航车道的车流完全通过再变道,指标全绿,但完全不博弈。第二幕,根因不在 reward 而在数据污染:实车采集时自车低速前进、后车被遮挡,后向感知失真产生大量“后方无车”的错误信号,模型从被污染的数据里学到了“等到绝对安全”的退化策略。第三幕,修复:仅对“成功插入与实车相同空隙且无碰撞”的变道关键区间给额外高奖励——限定作用区间是为了防 reward 泄漏。第四幕,讲师诚实记录修复引入的新问题:模型变得过度自信,在部分场景更愿意尝试高风险插入。第五幕,再修:用 IDM 规则按概率控制后车不让行——人为制造失败,才能校准风险认知。这个循环的教训是:reward 调优不是单调改善,是在两个失效模式之间找平衡点。

围绕这个循环还有一组工程铁律。优先级:安全 > 法规 > 体感,且任一时刻发生碰撞“立即清空绕行相关奖励”——注意是清零不是扣分,防止模型算“撞一下净收益为正”的账。不重复约束:已被其他奖惩触发的时刻不再叠加惩罚,否则梯度信号混乱。补丁要配隔离:车道锁定能防反复横跳,但在绕行慢车场景必须禁用,否则会和绕行奖励打架。多任务的 reward scale imbalance(任务 A 奖励 0-1、任务 B 0-100,策略只学 B)用物理、场景、标签三层隔离加“把 task id 作为 token 注入”来治。环境侧的坑则是那句金句:“IDM 永远让行、不反击,RL 会学会‘欺负世界’”——在全退让的对手里训出来的最优策略是一路强行插队,上真车立刻翻车。

论文侧与这本账互相印证。PLUTO 证明 IL 的上限被普遍低估:横纵向 query 解耦用 M+N 的参数量表达 M×N 条轨迹组合,六种正负数据增强(含“前方无车时反转红绿灯”这种防因果混淆的设计)加对比学习,直接以闭环 nuPlan 为准——先把 IL 和数据做满,再谈 RL。RAD 把 3DGS 环境里的 RL 探索与 IL 的“保持类人”明确标注为互补(Complementary)而非替代。AutoVLA 的 RFT 后训练给出量化收益:PDMS 从 80.54 到 89.11,推理从 3.95 秒降到 1.31 秒——模型学会了对简单场景切换快思考。规模化的参照系是 GigaFlow 的自博弈(每 GPU 4800 个并行世界、每个最多 150 个 agent,一套策略控制所有车)和 CaRL(分布式 PPO、超过 3 亿步、刻意使用极简奖励函数——与 A 课复杂 reward 体系形成方法论对照:reward 越复杂,被钻空子的面越大)。

两条收尾判断。DiffusionDriveV2 的奖励设计原则浓缩了整本账:“奖励相对改进,但绝对惩罚失败”——好坏是相对的,安全底线是绝对的。Think2Drive 则提示环境本身的边界:在预训练世界模型的 latent 空间里 rollout,训练提速百倍以上,但模型闯红灯后世界模型直接终止、后续预测退化为随机——用学出来的环境训练策略,环境的有效范围就是新的凸包。B 课的收官句把三块拼图放回原位:“VLA 解决‘懂不懂’,World Model 解决‘敢不敢’,RL 解决‘好不好’。”

  • 数量级:reward 验证 10 条 / 单任务百-千条 / 全量 10w clip,对照 IL 千万级。
  • 加塞五幕:行为失真 → 数据污染根因 → 区间限定奖励 → 过度自信 → IDM 对抗校准。
  • 铁律:安全>法规>体感;碰撞清零不扣分;补丁配隔离;task id 进 token。
  • 论文互证:PLUTO 把 IL 做满、RAD 标注互补、AutoVLA RFT +8.6 分且快 3 倍。
  • 边界:学出来的世界模型是新的凸包——Think2Drive 闯红灯后预测退化为随机。

Credit Assignment:事故在十秒后,责任可能在十秒前

自动驾驶 reward 往往延迟:现在没有提前变道,十秒后错过路口;现在抢了半个车位,五秒后迫使后车急刹;现在绕行晚半秒,随后进入不可恢复的碰撞状态。终局惩罚能告诉策略“这段 rollout 不好”,却很难判断是哪个早期动作埋下了风险。

时间差分、GAE 和 Critic 尝试把未来回报分配到各时刻,AR 的逐 token log probability也提供较细的更新接口;但场景越长、交互越复杂、reward 越稀疏,方差越大。Diffusion/Flow 一次生成整段,轨迹级 reward 可直接评价长期结构,却更难定位到具体去噪步骤或向量场局部。方法选择只是改变归因接口,不会消除因果识别问题。

闭环是 credit assignment 的必要条件,因为动作必须真实改变下一状态;但闭环还不充分。若他车模型只会理性让行,策略会把“后车总刹车”错误归因成自己强势策略有效;若 world model 对碰撞前状态预测不准,优势也会沿错误动力学传播。因此需要多样化交通参与者、对抗场景、终止与恢复状态校准,以及按事件切分的短场景。

实践中可把长期目标拆成可验证中间事件,但不能把每个事件都变成密集 reward。更稳妥的是:用关键状态做辅助价值/风险预测,用场景级终局 reward 保持目标一致,用短路线降低归因跨度,再通过反事实回放比较“只改变一个早期动作”是否真的改善后果。

  1. 定位终局事件明确碰撞、偏航、无法合流或路线失败发生的帧和首次不可恢复状态。
  2. 回溯关键决策窗口不是从事故帧才开始罚,而是寻找可行解最后消失前的变道、让速或目标选择。
  3. 做反事实比较在相同初始状态和交通随机种子下,只替换关键动作,检查环境后果是否按预期改变。
  4. 控制归因跨度用单技能短场景和事件切片降低方差,再到长路线验证组合能力。
  5. 校验环境因果若 actor/world model 对自车动作无真实响应,任何优势估计都只是对录像打分。

闭环环境:吞吐、高保真和多样性三者互相牵制

RL 需要大量 rollout。规则交通模型如 IDM 计算 O(1)、参数可解释、可百万级并行,适合闭环早期和风格随机化;但它过度理性、确定且缺少意图,容易被 policy exploit。A 课程用一句话概括这种风险:“RL 会欺负世界”。仅给 IDM 加随机噪声可以降低过拟合,仍不能代替真实的人类博弈分布。

GigaFlow 通过每 GPU 4800 个 world、每个 world 最多 150 个 agent、所有 agent 共用一套 policy 的自博弈追求吞吐与共同进化;RAD 用 3DGS 重建真实环境,试图缩小视觉 sim2real 并保留动作因果;Think2Drive 用 RSSM 在 latent world model 中想象 rollout,减少昂贵渲染调用;RTR 则把真实名义场景与脚本化 cut-in 等长尾场景放进联合闭环。它们解决的是不同瓶颈,不能只按总步数横比。

环境验收应同时测动力学一致性、传感器逼真度、他车响应多样性、终止条件、长尾覆盖和 wall-clock throughput。一个吞吐极高但所有后车都让行的环境,给出的交互 reward 是错的;一个视觉逼真但 actor 行为幼稚的 3D 场景,也无法训练社会性驾驶;一个 latent world model 若在终止后继续生成随机画面,则必须屏蔽无效段。

真实道路不允许无约束在线探索,所以量产 RL 几乎必然是分层的:固定日志上的离线/伪开环筛选,规则或 world model 中的大规模闭环,3DGS/高保真仿真的困难场景复验,最后用封闭场、shadow 和严格安全员流程校准。把“训练了三亿步”当成能力证明,会遗漏这些步是在什么世界里产生的。

  • 吞吐:每 GPU world 数、agent 数、step 频率和完整 rollout 成本。
  • 真实性:视觉、动力学、交通规则和参与者行为是否同时可信。
  • 可交互性:他车是否随 ego action 改变,而不是播放固定录像。
  • 多样性:激进/保守、误判、迟疑、抢行等人类行为是否覆盖。
  • 有效性:终止、碰撞与 OOD 后的序列是否仍可用于优势估计。

为什么 RL 不能替代监督底座

第一,探索空间太大。Planner 要先学会道路坐标、车辆动力学、基本跟车、红灯停车、舒适控制和人类交互,这些在日志中有密集监督。若从随机 policy 开始,绝大多数 rollout 都是低价值失败,reward 稀疏且无从区分“不会开车”和“策略选择不好”,样本效率远低于直接模仿。

第二,reward 永远不完备。人类示范中包含大量未显式写进公式的社会规范,例如不吓人、给对方留空间、不过度试探。纯 RL 只会优化被测量的量;即使没有碰撞,也可能学会卡 gap、逼车或极端保守。监督 reference 不是安全保证,却能把策略限制在相对合理的人类行为邻域。

第三,仿真和数据覆盖决定 RL 上限。固定日志上的离线 RL 若走出行为数据分布,Q 值会过估计;低保真闭环则会把 simulator exploit 当能力。IL 提供真实世界状态—动作联合分布,使 RL 可以在“已有可驾驶策略附近”做局部探索,而不是从错误世界里重新发明驾驶。

第四,量产需要可回退的训练阶段。B 课程给出的二段式/多阶段训练先稳定感知,再稳定 planning;A 的 Plan-R1、RAD 和 DiffusionDriveV2也都从预训练策略开始后训练。保留监督 checkpoint、reference model 和 BC loss,才能判断 RL 带来的增益是否以常见场景退化为代价,并在 reward 修改失败时回退。

因此合理问题不是“何时从 IL 切换到 RL”,而是“哪些场景、哪些参数和哪一级表示值得用 RL 改”。常见道路行为继续由大规模 IL 提供底座;合流、加塞、绕行、无保护左转等反馈密集且规则可验证的专项,用闭环 RL 做受限优化;任何增益都要回到全量常见场景做回归。

纯 IL

能开,但不会试错

  • 容易扩数据和稳定训练
  • 类人先验强
  • 偏离示范后缺少恢复
  • 无法显式比较反事实动作

纯 RL

会试错,但目标不完整

  • 需要巨量可信交互
  • 容易 exploit reward 与 simulator
  • 类人性和基础驾驶都要靠稀疏回报重学
  • 训练波动和安全验证成本高

监督 + RL

在行为邻域内改进

  • SFT/IL checkpoint 作为 policy 与 reference 起点
  • 针对专项场景生成组 rollout
  • KL/BC 约束常见行为不漂移
  • 闭环收益与全量回归共同决定上线
RAD 图中明确把 3DGS RL 与“keep similarity to humans”的 IL 标为 complementary;RTR 也用专家匹配与违规避免联合目标支持同一结论。

一条可执行的训练路线:先证明底座,再证明改进,最后证明没有副作用

阶段一建立监督底座:清洗人驾数据、统一导航与场景分布,训练感知/场景编码和 Planner;按常见、长尾、交互、规则、舒适分桶报告开环与闭环基线。阶段二选择可归因的专项场景,定义状态、动作、终止、绝对安全 gate 与最小 reward,先通过轨迹回放单元测试。

阶段三建立 rollout:同一初始场景生成多策略/多随机种子结果,确认 ego action 会改变他车和后续观测;再选择 PPO 或 GRPO。若动作逐步且 Critic 数据充分,用 PPO;若生成器天然出一组候选、Critic 难稳,可用 GRPO,但增加绝对失败约束和跨组校准。整个阶段保留 reference、KL/BC、early stop 和监督 replay。

阶段四做场景级闭环验收:先用短路线单科考试定位 merging、overtaking、emergency brake、give way、traffic sign,再做长路线组合。必须同时报告专项提升、常见场景回归、reward 分布、KL 漂移、策略熵、Top-K/Top-1、碰撞/违规和人工体验审查。

上线门槛不是总 reward 提升,而是三项同时成立:专项能力的闭环因果改进可复现;安全与规则底线没有被其他奖励交换;常见人类驾驶分布没有显著退化。做不到其中任一项,RL checkpoint 就仍是研究结果,不是量产候选。

  1. IL 基线与数据分桶固定可复现 checkpoint,记录常见/长尾/交互场景的开环和闭环能力,明确 RL 要改善的具体缺口。
  2. Reward 单元测试对正反例、边界、冲突和 hacking 轨迹逐条验算,先证明 reward 与产品意图一致。
  3. 环境因果校验相同场景只替换 ego action,验证他车、观测和终止按预期变化;测 actor 多样性与 sim2real 风险。
  4. PPO/GRPO 受约束后训练小步更新、KL/BC 锚定、绝对安全 gate、按场景监控 advantage,避免只盯总 reward。
  5. 短场景单科闭环每条路线只考一种行为,定位 reward、credit 和策略失败,不用长路线总分掩盖原因。
  6. 全量回归与人工审查验证专项收益未换来常见场景退化、逼车或极端保守,再进入封闭场/shadow 的下一证据层。

三门课怎么对上

同一个工程问题,三门课的观察层级不同。下面逐条标出它们是相互印证、作用域不同,还是在相同前提下保留张力——不把任何一门课单独当作行业定论。

IL 和 RL 在自动驾驶中是互补关系,而不是前者被后者替代。

相互印证
A · 端到端早期课
A-05 的 RAD 图把 3DGS RL 与 IL 的“keep similarity to humans”标为 Complementary;A-06b 的 Plan-R1 先监督预训练再 GRPO。
B · 端到端一期
B-07 将 planning 训练拆成监督阶段,B-09 的 RAD 同样采用 perception pre-training、planning pre-training、IL+RL post-training。
C · 决策规划课
C-08 p83 明确写 IL 类人但规则/泛化不足,RL 规则与探索强但类人性/样本效率不足;RTR 联合匹配专家与避免违规。

合并读法:三门课共同支持“IL 打底、RL 后训练”。具体比例和何时启用属于团队工程决策,不是统一行业配方。

只有动作能改变下一状态的环境闭环,才能训练跨时间因果和交互博弈。

相互印证
A · 端到端早期课
A-05 区分 pseudo-open-loop 与 s_{t+1}=f(s_t,a_t) 的闭环,并把跨时间 credit assignment 视为闭环不可替代价值。
B · 端到端一期
B-07 指出开环评测假设他车不受自车影响,闭环 Bench2Drive 在交互技能上暴露明显差距。
C · 决策规划课
C-05a 用 MDP 转移和价值定义长期决策,C-08 的 RTR/Think2Drive 都在可交互环境或世界模型中 rollout。

合并读法:数据闭环和闭环评测都很重要,但不能替代训练环境中的 action→state 因果。

PPO 和 GRPO 都能通过裁剪/KL 自动保证安全。

保留张力
A · 端到端早期课
A-05 说明 PPO clip 只防更新过大;A-06b 明确写 Reward 与 Reference 都不保证安全,GRPO 仍依赖 On-road/Collision 等 reward。
B · 端到端一期
B-05/B-06 的 RFT/GRPO 方案都把规则分数或 mode selector 作为额外模块,没有把优化算法本身等同安全证明。
C · 决策规划课
C-05a 的 Safe RL 从约束和稀有安全事件出发,说明普通策略梯度并不自动满足安全;C-08 仍保留违规目标。

合并读法:clip 和 KL 是训练稳定/分布约束,不是形式化安全保证。安全需要绝对 gate、独立验证和执行兜底。

GRPO 不需要 Critic,因此已经解决长期 credit assignment。

保留张力
A · 端到端早期课
A-06b 给出组内标准化优势,但同时指出 trajectory-level reward 和长期因果仍困难;A-05 把 credit assignment 列为独立挑战。
B · 端到端一期
B-06 的 DiffusionDriveV2 通过 anchor 内/间分组改善相对比较与全组失败问题,未声称消除时间归因。
C · 决策规划课
C-05a 的价值函数与策略梯度说明长期回报归因是 MDP 核心问题;C-08 的 RTR/Think2Drive仍需环境转移与终止信号。

合并读法:GRPO 省去独立 Critic,解决的是优势基线的构造成本,不是“哪个早期动作造成晚期后果”的因果识别。

Reward 项越多、权重越细,驾驶行为就越接近产品意图。

保留张力
A · 端到端早期课
A-05 列出 reward 不完备、权重不可调、hacking 与 sim2real 五类问题;A-08 用场景隔离、去重和安全>法规>体感处理冲突。
B · 端到端一期
B-09 的 CaRL 材料反而强调极简 reward;B-06 的 DiffusionDriveV2 使用相对改进与绝对碰撞失败分离。
C · 决策规划课
C-04a/C-04b 展示显式代价可以检查,但 C-08 的 RTR 仍将专家分布和违规约束拆成两项目标,而非无限堆加 reward。

合并读法:更多 reward 会增加漏洞和冲突面。优先追求最小充分目标、清楚作用域、绝对底线与可攻击测试。

固定日志上的 offline/pseudo-open-loop RL 能学到未覆盖长尾和真实多车博弈。

保留张力
A · 端到端早期课
A-05 明确写开环 coverage 决定上限,不能解决新场景、交互博弈和 corner case,且可能出现 OOD Q-value 过估计。
B · 端到端一期
B-07 的闭环评测材料显示开环好不代表交互技能好,Merging 等能力必须在场景闭环中验证。
C · 决策规划课
C-08 用脚本化长尾 + closed-loop simulation 的 RTR,以及 latent world model RL,正是为产生日志中没有的状态反馈。

合并读法:固定数据适合安全、稳定的局部价值优化,不应被包装成开放世界的交互学习。

仿真步数越大,RL 能力越强。

作用域不同
A · 端到端早期课
A-05 同时给出 GigaFlow 的高吞吐和 IDM 被 exploit、3DGS sim2real 等质量风险,强调环境行为决定步的价值。
B · 端到端一期
B-09 记录 CaRL 3 亿步、Think2Drive 高效 rollout,但也限定 CaRL 的超人结果在特定动态博弈场景。
C · 决策规划课
C-08 关注 RTR 的专家分布保持和 Think2Drive 的场景级评测,说明有效场景与环境模型不能由总步数替代。

合并读法:规模是训练条件,不是能力证据。必须同时报告环境真实性、参与者多样性、覆盖和闭环能力分项。

纯 IL 的问题只是数据量不够,继续扩数据即可替代闭环。

保留张力
A · 端到端早期课
A-05 将 IL 的缺口写为未覆盖状态、显式 trade-off 和动作因果;即使数据扩大,固定示范仍缺少反事实反馈。
B · 端到端一期
B-07 讨论 scaling 的同时保留闭环评测;B-09 将 RL 的价值放在 OOD 自愈和突破专家凸包。
C · 决策规划课
C-08 p83 将 IL 的规则遵循/泛化不足与数据利用率高并列,并用 RTR 展示纯 IL 在合流、切入分布外场景仍碰撞。

合并读法:扩数据能扩大凸包、降低长尾频率,但不能自动提供反事实动作价值和犯错后的恢复训练。

相关术语

  • 模仿学习与强化学习的关系——RL 不是从零学开车,而是在模仿学习学出的基础策略上做对齐微调。
  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
  • 奖励钻空子——模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。
  • 信用分配——整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 天然对齐,Diffusion 要摊回多个去噪步。
  • 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。
  • 逐步展开与误差累积——策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。
  • 参考模型与 KL 约束——冻结的预训练策略作为锚点,用 KL 惩罚拴住新策略,别为了刷 reward 跑出原本合理的驾驶分布。
  • RL 能解决的五类问题——长时序决策、多目标权衡、不确定交互、稀疏延迟反馈、规则写不清的灰色决策区。
  • RL 数据规模直觉——验 reward 方向约 10 条;单任务专项百到千条 clip;全量训练约 10w clip;一段式预训练可能千万级。
  • 场景隔离——同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。
  • 数据闭环——从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。

相关论文

材料来源

课程章节页码说明
AA-05 自动驾驶中的 RL 算法介绍p21-p30Actor-Critic、PPO 五步、ROLL worker 架构与训练基础设施。
AA-05 自动驾驶中的 RL 算法介绍p30-p34开环、伪开环、OOD 能力边界与闭环 credit assignment。
AA-05 自动驾驶中的 RL 算法介绍p36-p42IDM 环境、部署方式、被策略利用的风险、GigaFlow 与 3DGS 闭环。
AA-05 自动驾驶中的 RL 算法介绍p43-p50多目标权衡、reward 五大挑战与 hacking 的系统容错判断。
AA-06a Diffusion 轨迹优化4.4-p4-p18Diffusion 三类 RL 接口、DDPO、DiffusionDriveV2 与 Flow-GRPO。
AA-06b AR 轨迹优化4.3-p5-p20Policy/Reference/Reward 角色、Plan-R1、GRPO 和 AR/Diffusion credit 差异。
AA-08 端到端量产经验分享p5-p15RL 任务冲突、reward 验证、开闭环对照与数据算子准入。
AA-08 端到端量产经验分享p17-p28加塞、偏航、碰撞、绕行专项 reward 和安全>法规>体感优先级。
BB-05 L5 端到端规划:基于自回归 AR 的 Plannerp27-p32AutoVLA 的 SFT/RFT、tokenizer 与强化后训练消融。
BB-06 L6 端到端规划:基于 Diffusion 的 Plannerp15-p23GoalFlow、DiffusionDriveV2 的组内/组间 GRPO、mode selector 与世界模型监督。
BB-07 L7 端到端模型的训练范式p5-p12多任务复杂度、多阶段训练、planning 三步与二段式组织现实。
BB-07 L7 端到端模型的训练范式补充材料 sec4-p9-p21开闭环弱相关、CARLA/Bench2Drive、短路线单科考试与能力分项。
BB-09 L9 端到端与 VLA、世界模型、RL 的关系p20-p24MDP、CaRL、RAD、Think2Drive 与真实数据/3DGS/world model 三条 RL 路线。
CC-05a L5 决策过程p6-p35MDP 五要素、回报、Bellman、价值/策略迭代与长期决策基础。
CC-05a L5 决策过程p54-p67Safe RL、策略梯度方差、安全稀有事件与分层决策。
CC-05b 不确定性感知的决策过程p3-p41POMDP belief、策略条件化场景树和风险敏感应急规划。
CC-08 L8 数据驱动的规划方法p50-p83IL、RTR 联合闭环 IL+RL、Think2Drive 与三种方法取舍。
BB-09 端到端与 VLA、世界模型、RL 的关系p6-p7, p21-p24, p27-p30凸包与监督赤字定义、RL 三优势、CaRL/Think2Drive 规模数字、快慢系统与收官判断。
AA-08 端到端量产经验分享p7-p8, p18-p23, p28数据量级、加塞 reward hacking 完整案例、清零式安全优先级与补丁隔离。
AA-02 两段式端到端算法p24-p27因果混淆图解、PLUTO 六种增强、对比学习与 60/30/10 分工比例。