← 术语图鉴

术语 · 强化学习

参考模型与 KL 约束

Reference Model / KL Penalty

冻结的预训练策略作为锚点,用 KL 惩罚拴住新策略,别为了刷 reward 跑出原本合理的驾驶分布。

会上可能听到:“我们加了 KL 约束。——约束的是什么,加大加小有什么影响?”

它到底是什么意思

参考模型不是老师,不提供监督信号,它只是一个基准:新策略每偏离它一点,就付出一点代价。这让 RL 微调更像「对齐」,而不是「重学驾驶」。

调这个系数是有取舍的:约束太紧,RL 学不动,reward 提不上去;约束太松,策略可能为了高分跑出奇怪但得分高的行为——也就是 reward hacking 的温床。

机制图解

KL 系数:让模型能跑多远

拴太紧策略动不了,reward 提不上去,RL 白做
放太松为了刷分跑出得分高但很怪的行为——reward hacking 的温床
参考模型是一个冻结的旧版策略,不当老师,只当锚点:你每偏离它一点,就付一点代价。

容易搞混的地方

常见误解

参考模型是老师,提供正确答案

正确理解

它只是锚点,不给监督信号——偏离它就付代价,仅此而已

常见误解

KL 系数是个随手调的超参

正确理解

它是「敢让模型跑多远」的旋钮,直接决定 reward hacking 的风险窗口

看懂之后可以追问

  1. KL 系数是怎么定的?放松之后有没有观察到行为分布的漂移?这个系数是「敢让模型跑多远」的旋钮,直接关联 reward hacking 风险,但常常被当成一个随手调的超参。
  2. 参考模型本身是哪一版?它的行为分布是我们认可的基准吗?所有约束都是相对参考模型的。如果基准本身就有问题,KL 约束只会把问题固化下来。

先知道

  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。

接着看

  • 奖励钻空子——模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。

相关论文

出处:课程学习总纲 总纲 §6.3、§11.3 题 18