会上可能听到:“我们在 reward 里加了舒适性权重。——这些权重是怎么定的?加了会不会顾此失彼?”
它到底是什么意思
典型形态是加权和:安全惩罚 + λ₁·推进奖励 + λ₂·舒适 + λ₃·合规 + λ₄·偏好 − β·KL(新策略‖参考策略)。前面几项定义「什么算开得好」,最后一项防止模型为了刷分跑出合理驾驶分布。
但量产里最重要的一条是:多个 reward 不能简单相加。必须有优先级(安全 > 法规 > 体感)、场景隔离、冲突处理。已经触发安全惩罚的时刻,就不该再叠加绕行奖励把梯度方向搞乱。
还有个实用数字:验证 reward 方向是否正确,约 10 条数据就能发现明显问题;单任务专项优化需要百到千条 clip;全量训练约 10w clip。
容易搞混的地方
常见误解
多个 reward 加权求和就行
正确理解
必须有优先级(安全 > 法规 > 体感)、场景隔离和冲突处理
常见误解
权重调不好是因为没调够
正确理解
更常见的是两个 reward 在同一时刻给了相反信号,调权重解决不了
看懂之后可以追问
- 这几项 reward 冲突的时候,优先级是怎么定的?谁压过谁?没有明确优先级的 reward 组合,等于让模型自己决定安全和体感谁重要。安全 > 法规 > 体感应该是写死的。
- 调这个权重之前,我们用多少条数据验证过方向是对的?对照「10 条数据就能发现明显方向问题」这个经验。如果团队直接上全量训练才发现 reward 写反了,是很贵的浪费。
沿着主线继续
接着看
- 奖励钻空子——模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。
- PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
- 场景隔离——同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。
相关论文
- Plan-R1:把安全可行的轨迹规划建模为语言建模——规划语言化 + GRPO
- TrajHF:通过人类反馈强化学习学个性化驾驶风格——偏好定驾驶风格
出处:课程学习总纲 总纲 §6.3、§9.1、§9.4