← 论文拆解

AR + RL

Plan-R1:把安全可行的轨迹规划建模为语言建模

Plan-R1: Safe and Feasible Trajectory Planning as Language Modeling

规划语言化 + GRPO

arXiv 2505.17659 ↗

它要解决什么问题

怎样把轨迹规划变成可以用语言模型范式训练、并能接强化对齐的问题。

机制拆解

  1. 用码本把连续轨迹压成 motion token
  2. 感知和地图信息作为条件 token
  3. 先做 principle alignment(懂安全和可行性原则),再做 behavior learning(开得像人)
  4. rollout 后用 GRPO 在候选之间比较相对优势

量产判断

读完应该能问

  • 码本把连续轨迹离散化,损失了什么?
  • principle alignment 的原则是谁定的?怎么验证模型真的学到了?

回到术语

  • 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。
  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
  • 参考模型与 KL 约束——冻结的预训练策略作为锚点,用 KL 惩罚拴住新策略,别为了刷 reward 跑出原本合理的驾驶分布。