← 术语图鉴

术语 · 强化学习

奖励函数

Reward Function

把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。

会上可能听到:“我们在 reward 里加了舒适性权重。——这些权重是怎么定的?加了会不会顾此失彼?”

它到底是什么意思

典型形态是加权和:安全惩罚 + λ₁·推进奖励 + λ₂·舒适 + λ₃·合规 + λ₄·偏好 − β·KL(新策略‖参考策略)。前面几项定义「什么算开得好」,最后一项防止模型为了刷分跑出合理驾驶分布。

但量产里最重要的一条是:多个 reward 不能简单相加。必须有优先级(安全 > 法规 > 体感)、场景隔离、冲突处理。已经触发安全惩罚的时刻,就不该再叠加绕行奖励把梯度方向搞乱。

还有个实用数字:验证 reward 方向是否正确,约 10 条数据就能发现明显问题;单任务专项优化需要百到千条 clip;全量训练约 10w clip。

容易搞混的地方

常见误解

多个 reward 加权求和就行

正确理解

必须有优先级(安全 > 法规 > 体感)、场景隔离和冲突处理

常见误解

权重调不好是因为没调够

正确理解

更常见的是两个 reward 在同一时刻给了相反信号,调权重解决不了

看懂之后可以追问

  1. 这几项 reward 冲突的时候,优先级是怎么定的?谁压过谁?没有明确优先级的 reward 组合,等于让模型自己决定安全和体感谁重要。安全 > 法规 > 体感应该是写死的。
  2. 调这个权重之前,我们用多少条数据验证过方向是对的?对照「10 条数据就能发现明显方向问题」这个经验。如果团队直接上全量训练才发现 reward 写反了,是很贵的浪费。

接着看

  • 奖励钻空子——模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。
  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
  • 场景隔离——同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。

相关论文

出处:课程学习总纲 总纲 §6.3、§9.1、§9.4