← 术语图鉴

术语 · 强化学习

模仿学习与强化学习的关系

Imitation Learning vs RL · 也叫 IL / BC / 行为克隆

RL 不是从零学开车,而是在模仿学习学出的基础策略上做对齐微调。

会上可能听到:“我们要上强化学习。——是要从头用 RL 学开车吗?”

它到底是什么意思

现实路径是:先用模仿学习/交叉熵训一个「开得像人」的基础策略,再用 PPO/GRPO 微调,让它在安全、效率、舒适、法规、偏好之间做长期权衡。

为什么不能从零 RL:样本效率低、探索风险高、reward 难写、结果容易不类人。而模仿学习能极快地把策略拉进合理驾驶分布。

PLUTO 那类工作证明了另一件事——把模仿学习配好结构、辅助 loss、数据增强和因果混淆处理,闭环表现能逼近甚至超过规则 planner。别过早跳过这一步。

机制图解

  1. 01模仿学习看人怎么开,学会开得像人
  2. 02拿到基础策略已经在合理驾驶分布里
  3. 03RL 微调在安全 / 效率 / 舒适 / 法规之间做长期权衡
  4. 04对齐后的策略
RL 做的是最后这一段「对齐」,不是从零学开车。跳过模仿学习直接上 RL,是用最贵的方法解最便宜的问题。

容易搞混的地方

常见误解

RL 是模仿学习的升级版,可以替代它

正确理解

更常见的是 BC/CE 预训练 + RL 微调,两者是接力不是替代

看懂之后可以追问

  1. 我们的基础策略是模仿学习到位了才上 RL,还是想用 RL 补模仿学习的不足?后者是常见误区。模仿学习没做扎实就上 RL,通常是在用最贵的方法解决最便宜的问题。
  2. RL 微调之后,轨迹的类人性有没有退化?怎么测的?RL 优化数值目标时经常牺牲类人性,而类人性正是用户体感的主要来源。

先知道

  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。

接着看

  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。

相关论文

出处:课程学习总纲 总纲 §6.3、§11.3 题 17