← 论文拆解

人类偏好

TrajHF:通过人类反馈强化学习学个性化驾驶风格

TrajHF: Learning Personalized Driving Styles via Reinforcement Learning from Human Feedback

偏好定驾驶风格

arXiv 2503.10434 ↗

它要解决什么问题

手写 reward 写不出「类人」和「个人风格」,平均轨迹分布和个体偏好之间存在系统性差异。

机制拆解

  1. 用人类反馈驱动轨迹模型微调
  2. 让生成轨迹符合特定驾驶风格或个人偏好

量产判断

读完应该能问

  • 我们的「类人」是谁定义的?标注者之间一致性如何?
  • 个性化和安全底线冲突时以谁为准?

回到术语

  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
  • 奖励钻空子——模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。