← 术语图鉴

术语 · 量产验收

场景隔离

Scenario Isolation

同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。

会上可能听到:“加了车道锁定之后,绕行变差了。——这两个是不是打架了?”

它到底是什么意思

教科书案例:车道锁定机制能抑制静态无效换道(来回跳变),但前方有慢车需要绕行时,锁定就会阻碍合理避障。

静态偏航还有两个实用做法:用「距最晚可换道点的纵向距离」和「距导航中心线的横向距离」构造双阶段平滑 reward,用 Sigmoid 过渡避免硬阈值导致策略震荡;主辅路和环岛出口可用虚拟墙惩罚,但虚拟墙标注容易跟随 GT 偏差,要谨慎。

这一条的工程味最重——它说明 reward 设计不是数学题,是场景工程。

机制图解

同一条规则「车道锁定」

在静态偏航场景抑制来回跳变的无效换道 → 有用
在前方有慢车时阻碍合理绕行 → 帮倒忙
同一个 reward 在不同场景含义可能相反,所以不能全局常开。这是 reward 设计里最工程的一条。

容易搞混的地方

常见误解

reward 写好了就该全局生效

正确理解

同一个 reward 在不同场景含义可能相反,必须按场景开关

常见误解

虚拟墙是硬约束所以最可靠

正确理解

虚拟墙标注常跟随人驾 GT,会把偶然选择固化成硬规则,分叉路口尤其危险

看懂之后可以追问

  1. 这个 reward 在哪些场景下生效?有没有场景下它的含义会反过来?全局常开的 reward 几乎必然会在某类场景里帮倒忙。这一问应该在每次新增 reward 时都问一遍。
  2. 虚拟墙的标注是跟随人驾 GT 生成的吗?GT 跟随式标注会把人驾的偶然选择固化成硬约束,在分叉路口尤其危险。

先知道

  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
  • 奖励钻空子——模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。

接着看

  • 数据闭环——从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。

出处:课程学习总纲 总纲 §9.3、§9.4