论文拆解
这里不是逐段翻译论文。每篇只回答四件事:解决什么问题、机制是什么、放在自动驾驶主线的哪一环、量产判断应该看哪里。
17 篇论文 · 按主线坐标分组
两段式与模仿学习规划 · 1 篇
arXiv 2404.14327
PLUTO:把模仿学习规划推到极限
把 IL 做到极致,再谈 RL
感知背景 · 3 篇
arXiv 2203.17270
BEVFormer:用时空 Transformer 从多摄像头学 BEV 表征
BEV query 是空间探针
arXiv 2211.10581
Sparse4D:稀疏时空融合的多视角 3D 检测
稀疏 query 换效率
arXiv 2105.03247
MOTR:基于 Transformer 的端到端多目标跟踪
track query 维持身份
一段式向量化 · 2 篇
arXiv 2303.12077
VAD:面向高效自动驾驶的向量化场景表示
黑盒与结构化之间的折中
arXiv 2402.13243
VADv2:通过概率规划实现端到端向量化自动驾驶
概率规划
Diffusion 轨迹生成 · 3 篇
arXiv 2411.15139
DiffusionDrive:端到端自动驾驶的截断扩散模型
截断 + 锚点换实时
arXiv 2510.08562
ResAD:端到端自动驾驶的归一化残差轨迹建模
惯性参考 + 残差
arXiv 2205.09991
Diffuser:用扩散做灵活的行为合成
value 引导采样
AR 与 action token · 1 篇
arXiv 2501.09747
FAST:面向视觉-语言-动作模型的高效动作词元化
tokenizer 即控制接口
AR + RL · 1 篇
arXiv 2505.17659
Plan-R1:把安全可行的轨迹规划建模为语言建模
规划语言化 + GRPO
Diffusion / Flow + RL · 3 篇
arXiv 2512.07745
DiffusionDriveV2:强化学习约束的截断扩散建模
锚内提质,锚间协调
arXiv 2503.05689
GoalFlow:目标驱动的流匹配多模态轨迹生成
给流一个目标点
arXiv 2505.05470
Flow-GRPO:通过在线强化学习训练流匹配模型
ODE 转 SDE 再 RL
Offline / policy gradient RL 背景 · 2 篇
arXiv 2409.00588
DPPO:扩散策略的策略优化
diffusion 微调方法论
arXiv 2208.06193
Diffusion-QL:把扩散策略作为离线 RL 的表达性策略类
多峰动作 + Q 引导
人类偏好 · 1 篇
arXiv 2503.10434
TrajHF:通过人类反馈强化学习学个性化驾驶风格
偏好定驾驶风格