它要解决什么问题
截断扩散保留了多模态,但模仿学习只监督最接近真值的正模式,其他 anchor 下的候选可能低质量甚至碰撞。
机制拆解
- 继承 truncated diffusion 生成器
- intra-anchor GRPO:提升同一驾驶意图内候选的质量
- inter-anchor GRPO:协调不同意图之间的质量,避免互相压塌
- 通过探索设计防止生成分布坍缩
量产判断
读完应该能问
- 各个 anchor 下候选的最差表现是什么?我们测过吗?
回到术语
- 截断扩散与锚点——不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。
- PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
- 信用分配——整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 天然对齐,Diffusion 要摊回多个去噪步。