← 论文拆解

Diffusion / Flow + RL

DiffusionDriveV2:强化学习约束的截断扩散建模

DiffusionDriveV2: RL-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving

锚内提质,锚间协调

arXiv 2512.07745 ↗

它要解决什么问题

截断扩散保留了多模态,但模仿学习只监督最接近真值的正模式,其他 anchor 下的候选可能低质量甚至碰撞。

机制拆解

  1. 继承 truncated diffusion 生成器
  2. intra-anchor GRPO:提升同一驾驶意图内候选的质量
  3. inter-anchor GRPO:协调不同意图之间的质量,避免互相压塌
  4. 通过探索设计防止生成分布坍缩

量产判断

读完应该能问

  • 各个 anchor 下候选的最差表现是什么?我们测过吗?

回到术语

  • 截断扩散与锚点——不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。
  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
  • 信用分配——整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 天然对齐,Diffusion 要摊回多个去噪步。