会上可能听到:“我们要上强化学习。——是要从头用 RL 学开车吗?”
它到底是什么意思
现实路径是:先用模仿学习/交叉熵训一个「开得像人」的基础策略,再用 PPO/GRPO 微调,让它在安全、效率、舒适、法规、偏好之间做长期权衡。
为什么不能从零 RL:样本效率低、探索风险高、reward 难写、结果容易不类人。而模仿学习能极快地把策略拉进合理驾驶分布。
PLUTO 那类工作证明了另一件事——把模仿学习配好结构、辅助 loss、数据增强和因果混淆处理,闭环表现能逼近甚至超过规则 planner。别过早跳过这一步。
机制图解
- 01模仿学习看人怎么开,学会开得像人
- 02拿到基础策略已经在合理驾驶分布里
- 03RL 微调在安全 / 效率 / 舒适 / 法规之间做长期权衡
- 04对齐后的策略
容易搞混的地方
常见误解
RL 是模仿学习的升级版,可以替代它
正确理解
更常见的是 BC/CE 预训练 + RL 微调,两者是接力不是替代
看懂之后可以追问
- 我们的基础策略是模仿学习到位了才上 RL,还是想用 RL 补模仿学习的不足?后者是常见误区。模仿学习没做扎实就上 RL,通常是在用最贵的方法解决最便宜的问题。
- RL 微调之后,轨迹的类人性有没有退化?怎么测的?RL 优化数值目标时经常牺牲类人性,而类人性正是用户体感的主要来源。
沿着主线继续
先知道
- 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
接着看
- PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
相关论文
- PLUTO:把模仿学习规划推到极限——把 IL 做到极致,再谈 RL
- Plan-R1:把安全可行的轨迹规划建模为语言建模——规划语言化 + GRPO
出处:课程学习总纲 总纲 §6.3、§11.3 题 17