会上可能听到:“这版我们从 PPO 换成 GRPO 了。——差别在哪,为什么要换?”
它到底是什么意思
PPO 需要一个价值网络来估计「这个状态大概能拿多少分」,再用裁剪机制限制单步更新幅度,防止策略跳变。
GRPO 换了个思路:同一个场景采样一组候选轨迹,直接比较组内的相对好坏来算优势,不一定需要显式价值函数。
为什么它天然适合自动驾驶:规划本来就会生成多条候选轨迹,「哪条更安全、更可行、更类人」的比较是现成的。
机制图解
怎么判断这条轨迹好不好
PPO养一个「裁判」(价值网络)给每条轨迹打绝对分,再限制策略每次别改太多
GRPO同一个路口一次采 8 条候选,直接互相比谁更安全、更可行、更类人——不需要裁判
容易搞混的地方
常见误解
GRPO 比 PPO 更先进所以更好
正确理解
它省掉了价值网络,但上限完全取决于组内比较用的打分器
常见误解
换算法带来了这次的效果提升
正确理解
算法切换常和数据、reward 改动一起上线,收益要能分开归因
看懂之后可以追问
- 组内比较是拿什么打分的?这个打分器本身可靠吗?GRPO 的上限完全取决于打分质量。打分器如果有偏,整组候选一起被带偏,而且比 PPO 更难察觉。
- 换算法带来的收益,能不能和「换数据」「改 reward」的收益分开衡量?算法切换常常和其他改动一起上线,导致收益归因不清,下次不知道该复制哪一步。
沿着主线继续
先知道
- 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
- 模仿学习与强化学习的关系——RL 不是从零学开车,而是在模仿学习学出的基础策略上做对齐微调。
接着看
- 参考模型与 KL 约束——冻结的预训练策略作为锚点,用 KL 惩罚拴住新策略,别为了刷 reward 跑出原本合理的驾驶分布。
相关论文
- Plan-R1:把安全可行的轨迹规划建模为语言建模——规划语言化 + GRPO
- DiffusionDriveV2:强化学习约束的截断扩散建模——锚内提质,锚间协调
- Flow-GRPO:通过在线强化学习训练流匹配模型——ODE 转 SDE 再 RL
出处:课程学习总纲 总纲 §6.3、§11.3 题 19