它要解决什么问题
手写 reward 写不出「类人」和「个人风格」,平均轨迹分布和个体偏好之间存在系统性差异。
机制拆解
- 用人类反馈驱动轨迹模型微调
- 让生成轨迹符合特定驾驶风格或个人偏好
量产判断
读完应该能问
- 我们的「类人」是谁定义的?标注者之间一致性如何?
- 个性化和安全底线冲突时以谁为准?
人类偏好
TrajHF: Learning Personalized Driving Styles via Reinforcement Learning from Human Feedback
偏好定驾驶风格
arXiv 2503.10434 ↗手写 reward 写不出「类人」和「个人风格」,平均轨迹分布和个体偏好之间存在系统性差异。