← 术语图鉴

术语 · 强化学习

RL 能解决的五类问题

What RL Is For

长时序决策、多目标权衡、不确定交互、稀疏延迟反馈、规则写不清的灰色决策区。

会上可能听到:“这个问题上 RL 能解决吗?——什么样的问题才该用 RL?”

它到底是什么意思

长时序决策:当前动作的好坏几秒甚至几十秒后才体现,比如高速提前变道、路口通行策略。

多目标权衡:安全、效率、舒适、法规同时冲突,比如加塞、绕行、危险变道。

不确定交互:交通是多智能体博弈,对方也在判断你让不让。

稀疏/延迟反馈:一路顺畅无接管、舒适性这类体验没有逐帧标签。

灰色决策区:规则写不清也会互相冲突——礼让但不被拖死、拥堵中适度进取、窄路会车。

反过来说:能靠逐帧监督或固定规则解决的问题,都不该优先上 RL。

机制图解

长时序决策好坏几秒后才体现:提前变道、路口通行
多目标权衡安全 / 效率 / 舒适同时冲突:加塞、绕行
不确定交互对方也在判断你让不让:博弈
稀疏延迟反馈「一路顺畅」没有逐帧标签
灰色决策区规则写不清:礼让但不被拖死
共同特征是「靠逐帧监督或固定规则解决不了」。不属于这五类的问题上 RL,通常是选错了工具。

容易搞混的地方

常见误解

RL 能解决所有效果不好的问题

正确理解

只适合这五类。有逐帧标签的问题,监督学习更稳更便宜

常见误解

上了 RL 就不需要规则了

正确理解

RL 优化的是长期目标,安全底线仍然靠规则兜底

看懂之后可以追问

  1. 这个问题属于这五类里的哪一类?如果不属于,为什么不用数据或规则解决?RL 训练不稳、样本贵、超参敏感、还会 hacking。不属于这五类的问题上 RL,通常是用最贵的工具解最简单的题。
  2. 这个体验问题有逐帧标签吗?如果有,为什么不用监督学习?RL 的价值在于处理没有逐帧标签的长期目标。有标签却上 RL,是在放弃更稳定更便宜的方案。

先知道

  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。

接着看

  • 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。

出处:课程学习总纲 总纲 §7