会上可能听到:“我们加了 KL 约束。——约束的是什么,加大加小有什么影响?”
它到底是什么意思
参考模型不是老师,不提供监督信号,它只是一个基准:新策略每偏离它一点,就付出一点代价。这让 RL 微调更像「对齐」,而不是「重学驾驶」。
调这个系数是有取舍的:约束太紧,RL 学不动,reward 提不上去;约束太松,策略可能为了高分跑出奇怪但得分高的行为——也就是 reward hacking 的温床。
机制图解
KL 系数:让模型能跑多远
拴太紧策略动不了,reward 提不上去,RL 白做
放太松为了刷分跑出得分高但很怪的行为——reward hacking 的温床
容易搞混的地方
常见误解
参考模型是老师,提供正确答案
正确理解
它只是锚点,不给监督信号——偏离它就付代价,仅此而已
常见误解
KL 系数是个随手调的超参
正确理解
它是「敢让模型跑多远」的旋钮,直接决定 reward hacking 的风险窗口
看懂之后可以追问
- KL 系数是怎么定的?放松之后有没有观察到行为分布的漂移?这个系数是「敢让模型跑多远」的旋钮,直接关联 reward hacking 风险,但常常被当成一个随手调的超参。
- 参考模型本身是哪一版?它的行为分布是我们认可的基准吗?所有约束都是相对参考模型的。如果基准本身就有问题,KL 约束只会把问题固化下来。
沿着主线继续
先知道
- PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
接着看
- 奖励钻空子——模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。
相关论文
- Plan-R1:把安全可行的轨迹规划建模为语言建模——规划语言化 + GRPO
出处:课程学习总纲 总纲 §6.3、§11.3 题 18