面对几个都有道理的未来,选哪个不是数学题,是风险偏好题——但风险偏好可以写成数学。
规划器已经会算轨迹了,为什么还要决策
课件用一个左转场景把这个问题问到底。目标点已知,运动规划算一条平滑轨迹过去——看起来齐活了。然后往场景里加一辆对向直行车、一个横穿行人,事情立刻变成四个方案:
- 停车等待,车和行人都过去再走;
- 先加速抢在对向车前面,再停下等行人;
- 连车带行人一起抢;
- 认为左边太复杂,干脆放弃这个目标点,改走直行。
课件在这一页边上写了两句话,是整个决策层存在的理由:**每种方案实际上对应一种决策,每种决策实际上对应一簇规划。**规划器能在"给定意图"下算出最优轨迹,但"抢不抢""换不换目标"这种离散选择,它表达不了——如果不先分层,规划器就得在一个巨大的连续轨迹空间里同时猜意图和算几何。方案 1-3 是低层决策(同一目标下的通行次序),方案 4 是高层决策(换掉目标本身)——这个区分后面还会用到。
我们的汇入口是同一个结构:预测交上来的分支摆在面前,候选行为无非三个——继续等、低速探出去表明意图、直接汇入。这一章讲怎么把"选哪个"变成一个可计算、可解释、还能管住尾部风险的问题。
MDP:两个旋钮,保守还是激进
把连续决策写成数学的标准工具是 MDP(马尔可夫决策过程):系统处在某个状态,选一个动作,环境按概率转移到下一个状态并给出奖励,目标是最大化折扣后的累积奖励。折扣因子 γ 决定看多远——课件的类比是金融:今天的一块钱比明天的值钱。
抽象定义不如一个例子。课件用悬崖网格世界把 MDP 的两个旋钮拧给你看:网格里有近处的 +1 出口、远处的 +10 出口、和一整排 −10 的悬崖。四种参数组合养出四种"性格":
- γ 小:只看眼前,奔近处 +1 去了;γ 大:愿意多走几步去拿 +10;
- noise = 0(动作从不失手):敢贴着悬崖边走最短路线;noise 大(动作会打滑):主动绕开悬崖留余量。
γ 控制"看多远",noise 控制"多冒险"——这两个旋钮直接对应量产调参里的"保守/激进"。 一辆被用户抱怨"太怂"的车和一辆被安全员抱怨"太猛"的车,差别可能就在这类参数上。
MDP 有一个致命的前提:它假设当前状态完全可测——你知道世界的全部真相。路口那辆深色轿车的位置速度你确实知道,但它"打算"完成切入还是缩回去,写在司机脑子里,任何传感器都测不到。
看不全的世界:POMDP 和老虎问题
放松"状态可测"假设,就得到 POMDP(部分可观测 MDP)。理解它的标准例子是老虎问题,课件把数字给全了,值得完整看一遍。
两扇门,一扇后面是老虎。三个动作:听、开左门、开右门。听不是免费的也不是可靠的——每听一次花 1 分,且只有 85% 的概率听对方位。开对门 +10,开错门 −100。
你永远不知道老虎真正在哪,只有一个不断更新的置信:"老虎在左边的概率是 0.85"。策略也不再是"状态→动作"的映射,而是**"置信→动作"**:置信多高就该动手,多低就该继续听。
**这个例子的全部精髓在那个 −1:获取信息是有代价的。**你可以一直听下去,把置信度推到 99%,但每听一次都在付钱。翻译到汇入口,付的不是分数,是时间和路权:再等一帧看清切入车的意图,还是现在就动?"低速探出"这个候选行为在 POMDP 语言里有了精确的身份——它就是驾驶版的"听":花一点时间和位置的代价,买更多关于对方意图的观测(顺便也向对方广播了我方意图)。
POMDP 的麻烦在于求解:它的"状态空间"是概率分布空间,精确求解在真实驾驶问题的规模上不可行。所以工程上的问题从"怎么解"变成了"怎么砍"。
把不可解砍成可解:MPDM 和 EPSILON
第一刀是 MPDM(2015)砍的,思路极其务实:不在连续动作空间里搜索,预先定义一小撮语义策略——车道保持、左变道、右变道——假设自己和周围每辆车都在执行其中一种,然后对每个自车候选策略做闭环前向仿真,看模拟结果的安全、效率、舒适代价,选最优。把无限的决策问题变成"有限集合里挑一个"。
EPSILON(2021)把这套做成了完整系统。这里值得停一句:这门课的讲师丁文超就是 EPSILON 和它的后继 MARC 的作者——接下来两节等于作者本人拆解自己的系统,最后还会亲口告诉你它的天花板在哪。
EPSILON 用 POMDP 把问题形式化,然后从两个方向砍:
动作侧,DCP-Tree:决策树的节点是语义动作(变道、变速),但树的展开有一条约束——每条策略序列在一个决策周期内最多变更一次动作。依据不是数学,是对人类司机的观察:没人会在两秒内"变道—取消—再变道"地反复横跳,反复行为交给下一个重规划周期去实现。这一刀把指数级的动作空间砍成了可枚举的候选集。
观测侧:不做完整的置信更新,用前向仿真代替——假设他车执行预测给出的语义动作,用带上下文感知的控制器模拟所有车的闭环互动。仿真里嵌一层 RSS(责任敏感安全)安全机制兜底,最后按效率、安全、导航三部分的奖励给每个候选策略打分。
我们汇入口的三个候选——等待、探出、汇入——在这套框架里各自前向仿真出几条场景线,逐一评分。如果只看期望分数,故事到这里就完了。但期望会撒谎。
平均值撒谎:尾部风险和 CVaR
课件在 Safe RL 一节把问题挑明:**机器学习倾向于优化大量样本的平均行为,极端情况下的安全问题会被忽视。**数字例子更扎心:一条危险轨迹出现概率是 p,想让它在期望里保持 −1 的存在感,惩罚就得设成 −1/p——p 越小惩罚越要夸张,纯靠调 reward 治标不治本。
汇入口的具体形态:"直接汇入"策略在 90% 的分支里顺畅通过(收益不错),在 10% 的分支里——切入车没停、后车也没让——撞上(−100)。算期望:0.9×收益 + 0.1×(−100),那个灾难被平均值稀释得看起来"还行"。
MARC 的做法分两步。第一步,场景树:不把每个未来分开处理,而是找出它们的共同前缀——好几个分支在前 1.5 秒里对自车的要求是一样的,合并成共享段,之后再分叉。轨迹优化时共享段必须对所有分支都成立,分叉后各管各的。这在数学上兑现了"防御性驾驶":先走一段对所有可能性都留有余地的轨迹,等世界揭晓再分化——正是"先探出、看情况再汇入"的形式化版本。
第二步,CVaR(条件风险价值):不优化全部分支的期望,而是只盯着最坏的那部分尾巴优化,α 参数决定"尾巴"取多宽——这就是风险容忍度的数学旋钮。期望值会拿 90% 的顺畅稀释 10% 的碰撞,CVaR 不会。
效果是可量化的。MARC 的消融实验里,从"无分支"到"动态分支 + 风险感知",成功率 83% → 100%,与前车最小距离 1.37 米 → 4.12 米,最大减速度 3.48 → 1.14 m/s²——更安全的同时反而更平顺,因为提前留了余地就不需要急刹。
讲师亲口说的天花板
讲完自己的两个系统,丁文超在最后一页列了三条局限,这三条比前面所有内容都值钱:
- 基于意图组合生成场景,存在组合爆炸——车一多、交互一密,枚举不动了;
- 基于模型的前向仿真,处理复杂交互的能力有限——你的"他车模型"终究是个手写的假设;
- 基于模型产生的决策,泛化性和多样性有限——没见过的场景组合,规则栈给不出新答案。
一位研究者在展示完自己领域内的先进系统之后,亲口承认这条路线的天花板——这三条就是第七章端到端方法的存在理由。记住它们,到那一章我们会看到学习栈分别怎么回应。
决策交付什么
回到停止线前。综合预测分支和尾部风险,决策层的输出是:当前策略——保持停止,随后低速探出;切换条件——目标间隙收窄则立即停车,确认切入完成且后车留出安全间隙后切换为汇入;以及交给下一层的约束——探出阶段的限速、必须能在可见距离内停住、目标汇入区域。
注意它交付的不是轨迹,是带切换条件的策略和一组约束。把这个策略变成每个时刻的位置、速度、加速度——一条底层控制真正能执行的曲线——是下一章的事。
本章速查
| 概念 | 一句话 |
|---|---|
| 决策 vs 规划 | 每种决策对应一簇规划;离散的"做什么"不分层,规划就要同时猜意图和算几何 |
| MDP 两个旋钮 | γ 看多远、noise 多冒险——对应量产的保守/激进调参 |
| POMDP | 状态测不到,只有置信;策略是"置信→动作"的映射 |
| 老虎问题的 −1 | 获取信息有代价;"低速探出"就是驾驶版的"听一次" |
| MPDM | 有限语义策略集 + 闭环前向仿真 + 评分选优,把无限问题变有限 |
| DCP-Tree | 一个决策周期内最多变更一次动作——用人类驾驶观察砍掉指数空间 |
| 期望的谎言 | 0.9×顺畅会稀释 0.1×灾难;稀有风险靠调 reward 治标不治本 |
| 场景树 + CVaR | 共享段对所有分支留余地;只优化最坏尾部,α 是风险容忍旋钮 |
| 规则栈天花板 | 组合爆炸、仿真交互能力有限、泛化有限——端到端的动机 |
材料来源
| 课程 | 章节 | 页码 | 用在哪 |
|---|---|---|---|
| C | C-05a 决策过程 | p3-p8 | 左转四方案、"每种决策对应一簇规划"、低层/高层决策 |
| C | C-05a 决策过程 | p8-p36 | MDP 定义、γ 与 noise、悬崖网格世界、价值/策略迭代 |
| C | C-05a 决策过程 | p54-p75 | Safe RL 平均行为问题、−1/p 稀有风险例子、MPDM 有限策略集与前向仿真 |
| C | C-05b 不确定性感知的决策过程 | p3-p14 | POMDP、老虎问题(85%/−100/−1)、置信状态与求解难度 |
| C | C-05b 不确定性感知的决策过程 | p15-p29 | EPSILON:DCP-Tree、引导观测分支、前向仿真、RSS、效率/安全/导航评分 |
| C | C-05b 不确定性感知的决策过程 | p30-p41 | MARC:场景树、CVaR、消融数据(83%→100%、1.37m→4.12m),讲师自述三条局限 |