深度专题
主线讲基础,专题讲进阶争议。每篇围绕一个工程问题,把三门课和论文证据放在一起:一致的合并理解,作用域不同的拆开解释,真正冲突的保留张力。
5 篇专题
端到端系统如何组织
一段式与两段式,真正的分界线在哪里?
行业讨论里,“一段式”“两段式”“端到端”“OneModel”“有辅助任务”经常被混在一起。真正有用的分法不是数网络有几个,而是检查三件事:Planner 必须经过什么信息接口,规划损失能回传到哪里,出了问题以后团队能定位到哪一层。
Planner:一段式端到端怎样生成一条可执行轨迹
当感知、导航与自车状态已经被编码,一段式端到端究竟怎样用 Query、AR、Diffusion 或 Flow Matching 产生轨迹,并在实时预算内选出最后一条?
“一段式”描述的是训练和信息流边界,不等于从像素直接吐方向盘角。量产链路通常仍包含场景编码、条件化轨迹生成、候选排序、规则过滤、时空优化与控制。本专题把 Query、AR、Diffusion、Flow 放在同一套输入—表示—训练—推理—选轨框架里比较,重点解释它们各自把困难放在了哪里。
从模仿学习到强化学习:训练闭环怎样补上驾驶因果
为什么端到端 Planner 不能只靠模仿学习,强化学习又为什么不能取代监督底座?PPO、GRPO、奖励、信用分配和闭环 rollout 在量产链路中分别解决什么?
模仿学习负责把真实驾驶数据压进一个可驾驶、类人、可收敛的策略初始分布;强化学习负责在环境反馈中比较行为结果,优化规则、交互和长时收益。两者不是“旧方法升级成新方法”,而是承担不同职责。真正困难的地方不在 PPO 或 GRPO 的名字,而在闭环环境是否可信、reward 是否可被钻空子、长期后果能否归因,以及策略偏离人类分布后谁把它拉回来。
评测不只是一个分数
开环、闭环和道路验收各自能证明什么,怎样避免被漂亮指标误导?
自动驾驶评测的第一原则不是选一个最权威的榜单,而是先问:自车真的动了吗,其他交通参与者会回应吗,传感器观测会随动作更新吗?只有把交互层级、指标口径和场景覆盖拆开,ADE/FDE、PDM/PDMS、CARLA Driving Score 才能成为能力证据,而不是排行榜装饰。
从论文方法到车上功能
一篇方法论文要跨过哪些系统门槛,才有资格变成持续可交付的量产能力?
论文证明一种方法在受控数据和指标上有效,量产则要求它在固定算力、异步传感器、噪声导航、长尾交通和持续版本迭代中仍然安全可控。真正的上车路线不是把模型导出到车端,而是让方法依次通过实时性、训练与数据成本、输入退化、场景专项、规则护栏和持续验收六道门。