会上可能听到:“VRU 场景我们加了 TTC 惩罚。——够吗?”
它到底是什么意思
碰撞相关 reward 通常包括 TTC、最小距离、危险变道、VRU 交汇时间。适用于车辆、对向会车、横穿、cut-in 等场景。
VRU 处理的要点常被忽略:只比较两条轨迹 polyline 有没有交点是不够的,还要看自车和 VRU 是否会在接近同一时间到达那个交点——空间相交但时间错开,并不构成风险。
绕行场景的优先级必须写死:安全 > 法规 > 体感。已经触发安全惩罚的时刻不要再叠加绕行奖励。
机制图解
行人的路线和我的路线交叉了
只看空间相交判定为危险 → 刹车。但行人可能 5 秒后才到那个点
看时空同步比较双方到达交点的时间差 → 错开就不必刹
容易搞混的地方
常见误解
轨迹相交就是有碰撞风险
正确理解
还要看双方是否在接近同一时刻到达交点——空间相交、时间错开并不危险
常见误解
VRU 场景越保守越好
正确理解
过度保守会造成大量误刹,是最伤体感的失效模式之一
看懂之后可以追问
- VRU 判定是只看轨迹相交,还是也看到达时间的同步程度?只看空间相交会产生大量误刹,直接伤害体感;只看时间又会漏掉真实风险。这一问能快速判断实现的成熟度。
- 安全惩罚和绕行奖励同时触发时,系统的行为是什么?两个 reward 给相反信号是量产里的经典坑。明确的优先级处理比事后调权重可靠。
沿着主线继续
先知道
- 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
接着看
- 场景隔离——同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。
出处:课程学习总纲 总纲 §9.4