会上可能听到:“加了车道锁定之后,绕行变差了。——这两个是不是打架了?”
它到底是什么意思
教科书案例:车道锁定机制能抑制静态无效换道(来回跳变),但前方有慢车需要绕行时,锁定就会阻碍合理避障。
静态偏航还有两个实用做法:用「距最晚可换道点的纵向距离」和「距导航中心线的横向距离」构造双阶段平滑 reward,用 Sigmoid 过渡避免硬阈值导致策略震荡;主辅路和环岛出口可用虚拟墙惩罚,但虚拟墙标注容易跟随 GT 偏差,要谨慎。
这一条的工程味最重——它说明 reward 设计不是数学题,是场景工程。
机制图解
同一条规则「车道锁定」
在静态偏航场景抑制来回跳变的无效换道 → 有用
在前方有慢车时阻碍合理绕行 → 帮倒忙
容易搞混的地方
常见误解
reward 写好了就该全局生效
正确理解
同一个 reward 在不同场景含义可能相反,必须按场景开关
常见误解
虚拟墙是硬约束所以最可靠
正确理解
虚拟墙标注常跟随人驾 GT,会把偶然选择固化成硬规则,分叉路口尤其危险
看懂之后可以追问
- 这个 reward 在哪些场景下生效?有没有场景下它的含义会反过来?全局常开的 reward 几乎必然会在某类场景里帮倒忙。这一问应该在每次新增 reward 时都问一遍。
- 虚拟墙的标注是跟随人驾 GT 生成的吗?GT 跟随式标注会把人驾的偶然选择固化成硬约束,在分叉路口尤其危险。
沿着主线继续
先知道
- 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
- 奖励钻空子——模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。
接着看
- 数据闭环——从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。
出处:课程学习总纲 总纲 §9.3、§9.4