← 术语图鉴

术语 · 强化学习

PPO 与 GRPO

PPO / GRPO

都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。

会上可能听到:“这版我们从 PPO 换成 GRPO 了。——差别在哪,为什么要换?”

它到底是什么意思

PPO 需要一个价值网络来估计「这个状态大概能拿多少分」,再用裁剪机制限制单步更新幅度,防止策略跳变。

GRPO 换了个思路:同一个场景采样一组候选轨迹,直接比较组内的相对好坏来算优势,不一定需要显式价值函数。

为什么它天然适合自动驾驶:规划本来就会生成多条候选轨迹,「哪条更安全、更可行、更类人」的比较是现成的。

机制图解

怎么判断这条轨迹好不好

PPO养一个「裁判」(价值网络)给每条轨迹打绝对分,再限制策略每次别改太多
GRPO同一个路口一次采 8 条候选,直接互相比谁更安全、更可行、更类人——不需要裁判
规划本来就会生成多条候选,「哪条更好」的比较是现成的,所以 GRPO 在这里很顺手。但它的上限完全取决于比较的打分器。

容易搞混的地方

常见误解

GRPO 比 PPO 更先进所以更好

正确理解

它省掉了价值网络,但上限完全取决于组内比较用的打分器

常见误解

换算法带来了这次的效果提升

正确理解

算法切换常和数据、reward 改动一起上线,收益要能分开归因

看懂之后可以追问

  1. 组内比较是拿什么打分的?这个打分器本身可靠吗?GRPO 的上限完全取决于打分质量。打分器如果有偏,整组候选一起被带偏,而且比 PPO 更难察觉。
  2. 换算法带来的收益,能不能和「换数据」「改 reward」的收益分开衡量?算法切换常常和其他改动一起上线,导致收益归因不清,下次不知道该复制哪一步。

先知道

  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
  • 模仿学习与强化学习的关系——RL 不是从零学开车,而是在模仿学习学出的基础策略上做对齐微调。

接着看

  • 参考模型与 KL 约束——冻结的预训练策略作为锚点,用 KL 惩罚拴住新策略,别为了刷 reward 跑出原本合理的驾驶分布。

相关论文

出处:课程学习总纲 总纲 §6.3、§11.3 题 19