论文拆解

这里不是逐段翻译论文。每篇只回答四件事:解决什么问题、机制是什么、放在自动驾驶主线的哪一环、量产判断应该看哪里。

17 篇论文 · 按主线坐标分组

两段式与模仿学习规划 · 1 篇

arXiv 2404.14327

PLUTO:把模仿学习规划推到极限

把 IL 做到极致,再谈 RL

感知背景 · 3 篇

arXiv 2203.17270

BEVFormer:用时空 Transformer 从多摄像头学 BEV 表征

BEV query 是空间探针

arXiv 2211.10581

Sparse4D:稀疏时空融合的多视角 3D 检测

稀疏 query 换效率

arXiv 2105.03247

MOTR:基于 Transformer 的端到端多目标跟踪

track query 维持身份

一段式向量化 · 2 篇

arXiv 2303.12077

VAD:面向高效自动驾驶的向量化场景表示

黑盒与结构化之间的折中

arXiv 2402.13243

VADv2:通过概率规划实现端到端向量化自动驾驶

概率规划

Diffusion 轨迹生成 · 3 篇

arXiv 2411.15139

DiffusionDrive:端到端自动驾驶的截断扩散模型

截断 + 锚点换实时

arXiv 2510.08562

ResAD:端到端自动驾驶的归一化残差轨迹建模

惯性参考 + 残差

arXiv 2205.09991

Diffuser:用扩散做灵活的行为合成

value 引导采样

AR 与 action token · 1 篇

arXiv 2501.09747

FAST:面向视觉-语言-动作模型的高效动作词元化

tokenizer 即控制接口

AR + RL · 1 篇

arXiv 2505.17659

Plan-R1:把安全可行的轨迹规划建模为语言建模

规划语言化 + GRPO

Diffusion / Flow + RL · 3 篇

arXiv 2512.07745

DiffusionDriveV2:强化学习约束的截断扩散建模

锚内提质,锚间协调

arXiv 2503.05689

GoalFlow:目标驱动的流匹配多模态轨迹生成

给流一个目标点

arXiv 2505.05470

Flow-GRPO:通过在线强化学习训练流匹配模型

ODE 转 SDE 再 RL

Offline / policy gradient RL 背景 · 2 篇

arXiv 2409.00588

DPPO:扩散策略的策略优化

diffusion 微调方法论

arXiv 2208.06193

Diffusion-QL:把扩散策略作为离线 RL 的表达性策略类

多峰动作 + Q 引导

人类偏好 · 1 篇

arXiv 2503.10434

TrajHF:通过人类反馈强化学习学个性化驾驶风格

偏好定驾驶风格