← 深度专题

专题 05

从论文方法到车上功能

一篇方法论文要跨过哪些系统门槛,才有资格变成持续可交付的量产能力?

论文证明一种方法在受控数据和指标上有效,量产则要求它在固定算力、异步传感器、噪声导航、长尾交通和持续版本迭代中仍然安全可控。真正的上车路线不是把模型导出到车端,而是让方法依次通过实时性、训练与数据成本、输入退化、场景专项、规则护栏和持续验收六道门。

9 个小节 · 约 17 分钟阅读

论文终点只是量产起点

论文通常回答“在某个数据集和指标上,这个结构是否比基线更好”;量产必须回答“它在目标 ODD、目标芯片、目标传感器和目标组织流程里,能否长期稳定交付”。两者的评价对象不同:论文可以固定数据、离线推理和一次性调参,车端系统必须面对模块异步、导航跳变、热降频、长尾分布、法规差异和后续版本回归。

因此每个候选方法都应形成一张上车门禁表:端到端延迟与尾延迟、峰值显存和功耗、训练与标注成本、关键输入依赖、退化模式、场景覆盖、规则边界、可观测性、回滚方案和验收基线。缺少任一项,技术评审都只完成了“模型可行性”,还没有完成“产品可运行性”。

A-08 的量产手记尤其说明,上车后的问题往往不在论文主指标里:路沿感知不准会变成静态碰撞,AR 只取 Top-1 会主动丢掉多模态,reward 修复保守加塞后又会带来过度积极。量产开发的单位不是一篇论文,而是一条可诊断、可回归、可持续收敛的能力链。

  1. 方法复现在同数据、同输入和同口径下复现论文增益,先排除训练技巧和数据差异。
  2. 系统预算测量 P50/P95/P99 延迟、显存、功耗、吞吐与传感器同步,不只报单次模型 forward。
  3. 退化设计为导航缺失、感知漏检、异步输入、低置信输出和模块超时定义显式行为。
  4. 专项收敛将长尾问题变成具名场景、数据算子、训练配比、reward 与正反测试集。
  5. 系统护栏在执行前加入过滤、约束、交通规则与控制可行性检查,并保留归因信号。
  6. 持续验收离线、仿真、道路影子和灰度车队逐级放行,线上问题永久进入回归。

实时性不是 FPS 一列

C-09 的对比给出一个直观尺度:UniAD 延迟 555.6 ms、1.8 FPS,VAD-Tiny 59.5 ms、16.8 FPS。后者通过矢量化动态和静态场景表示获得近十倍速度,才进入可讨论的车端区间。这个例子提醒团队,架构精度收益必须与系统频率一起读;规划 10 Hz 的周期只有 100 ms,还要给感知、同步、后处理、控制和通信留下预算。

Diffusion 的量产障碍更直接。A-06a 记录典型去噪需要 20–100 步,每一步运行 U-Net 或 Transformer,延迟、显存和调参成本都会随采样链增长。Truncated Diffusion 从有驾驶意图的锚点附近开始,Flow Matching 用少步 ODE 替代多步随机去噪,都是在改写计算路径;它们的代价是更依赖锚点覆盖、速度场质量和候选选择器。

大模型或 VLA 也不应硬塞进高频控制环。B-09 的快慢系统把轻量策略放在 10 Hz 以上,VLA 与世界模型约 1 Hz 处理异常和重规划;C-09 的 AsyncDriver 同样让 LLM 异步给高层指令,由快速 VectorMap Encoder 与轨迹解码器执行。两门课共同给出的不是某个固定架构,而是一条原则:慢推理只能改变目标、约束或计划,不能阻塞车辆的实时安全环。

最终预算必须按整链路和最坏情况测量。平均延迟无法覆盖 GC、显存换页、热降频、输入尺寸变化和候选数增加;量产门槛应同时规定 P99、超时行为和降级输出。

FAST LOOP

高频执行

  • 轻量感知、轨迹解码与控制
  • 固定周期和确定性超时行为
  • 输入退化时仍有最小风险输出

SLOW LOOP

低频推理

  • VLA、世界模型与复杂重规划
  • 提供语义目标、约束和异常判断
  • 异步更新,不占据主控制时钟

BUDGET

系统预算

  • P99 延迟、显存、功耗与温度
  • 候选数和采样步数的动态上限
  • 超时、置信度不足与回滚策略
实时性的对象是整条控制路径,不是论文表格中的一次模型 forward。

训练成本最终表现为组织吞吐

B-07 说明端到端多任务训练可能面对数百个 loss,不同任务数据量与梯度相互干扰,因此工业团队常采用分阶段训练:先稳定感知,再训练预测与规划,最后联合微调。二段式在现实中长期存在,不只因为精度,还因为任务解耦、已有模型资产和团队协作习惯。架构评审必须把组织能否稳定迭代算进成本。

A-08 给出另一组量级:reward 正确性约用 10 条数据做快速验证,单任务优化需要百到千条 clip,全量 RL 约 10 万 clip,而一段式预训练可能需要千万级 clip。这里的数字不是通用定律,却说明不同阶段不能共用同一个数据预算。用 10 条数据只能证明 reward 方向没写反,不能证明全量分布已经收敛。

数据规模也不能掩盖数据质量。B-08 把清洗分成基础信息正常、驾驶行为值得模仿、动作处于能力范围三层;A-08 则进一步要求多标签按层级配比,避免某些场景被重复计数。模仿学习是在选老师,训练集里的错误导航、晚变道和新手驾驶会被模型忠实复制。

Diffusion 还带来 noise schedule、loss weight、采样步数和多模态坍缩等调参维度;RL 带来 reward scale、探索冲突和仿真吞吐。选择方法时要比较每周可完成多少次可信实验、一次回归需要多久、失败能否定位,而不只比较峰值指标。

  • 把预训练、单任务修复、全量联合训练和车端部署分别计时计费。
  • 记录每次实验的数据版本、采样配比、loss/reward 配置和仿真器版本。
  • 先用小样本验证信号正确,再扩到专项和全量;不要用小样本结果替代覆盖结论。
  • 训练吞吐要包含数据生产、自动标注、人工抽检、仿真 rollout 和回归评测。
  • 模型无法稳定复现的 1 分提升,通常不如可持续迭代的 0.3 分提升。

导航不是可靠常量,而是会抖动的上游模型

A-04 把无图架构拆成 Local Map 与 SD Map:感知提供局部几何,低精导航提供从 A 到 B 的长期语义。所谓无图并非不用地图,而是不把厘米级 HD Map 用作局部定位和硬车道约束。导航仍要给推荐车道、行点、剩余距离和 maneuver prior。

量产风险在于这些输入并不稳定。SD 行点会受定位漂移、地图误差、推荐跳变和模块异步影响;Navigation Path 自身也可能抖动、偏航、弯折,且它只是“该往哪走”的确定性表达,不是可以直接控车的行为轨迹。把它单模态接入下游,会把上游跳变直接放大成轨迹抖动或决策冲突。

A-04 给出的四类增强非常接近车端故障注入:横向低频偏移模拟定位漂移,索引前后移模拟更新提前或滞后,随机丢点模拟短时不可用,当前感知配上一帧导航模拟异步缓存。它们共同逼模型在导航不可靠时回到感知,而不是过拟合 waypoint。

地图等级也必须进入产品策略。SDPro 相比 SD 增加路口内拓扑、精确车道数、车道类型和联通关系,适合环岛、主辅路分叉、公交车道和视觉难分的非机动车道。模型不应假设所有区域都有 SDPro;需要显式识别地图能力等级,并为 SD、SDPro、导航缺失三种状态定义不同约束与降级。

晚变道案例揭示了“错误老师”问题:模型沿 SD 行点学习,会把导航几何线误当成人驾轨迹,导致生硬且滞后。解决方案同时涉及数据同分布、行点缺失增强、多模态候选和 RL reward,单改网络结构通常不够。

SDPRO

车道级先验较强

  • 路口拓扑、车道数与车道类型
  • 支持超视距择道与合规约束
  • 仍需处理鲜度、定位和绑定误差

SD

道路级语义

  • 推荐方向、行点和剩余距离
  • 依赖局部感知恢复车道几何
  • 约束应更软,避免盲从跳变

NO NAV

导航退化

  • 感知与最小风险策略接管
  • 禁止高风险临时跨多车道动作
  • 恢复后需时序稳定再重新绑定
地图能力等级必须成为模型输入和系统状态,而不是部署团队口头知道的背景条件。

数据闭环要把一次修复变成复利

A-08 给出一条完整长尾闭环:人工场景库、接管数据和客户/路测反馈形成三个入口;场景按 P0/P1/P2 分级,分别走定向采集、在线挖掘和离线挖掘;数据通过准确率校验与配比进入训练;评测失败后再区分场景定义、数据质量和其他模型问题。

闭环真正产生复利的节点不是模型发版,而是数据算子进入标准流水线。课件要求算子有独立正负样本评测集、通常 95% 以上准确率门槛,并在上线后周期抽检。没有这道准入,所谓自动挖掘可能持续把错误标签放大到后续所有模型版本。

新增场景还需要先统计现有占比 r,再对照 T1/T2 决定清洗、增补或定向采集;多标签样本按 1/n 分摊,再逐层展开父子标签配比。这个细节很重要:如果一条高风险数据因为标签多被重复计数,团队看到的“场景覆盖率”就会虚高。

持续数据闭环应与验收回归共享同一个场景标识。一次线上接管从发现、定义、挖掘、训练到放行,都能沿同一 ID 追踪分母、模型变化和副作用;否则训练团队和测试团队会各自维护一套不相通的“场景”。

  1. 发现人工挑选、接管分析、路测和客户反馈进入统一场景登记。
  2. 分级P0 定向采集、P1 在线挖掘、P2 离线挖掘,按风险和响应成本分流。
  3. 算子构建正负样本,达到高准召门槛后进入流水线,并持续抽检。
  4. 配比按层级和多标签权重计算真实占比,记录训练数据版本。
  5. 训练与验收专项集、邻接反例和全量回归同时通过,才允许进入灰度。
  6. 复利问题样例、场景定义和算子长期保留,让下一版本自动重测与再挖掘。

专项不是打补丁,而是管理冲突

拥堵加塞把量产问题的三层耦合暴露得很清楚:感知层有遮挡和目标 ID 抖动,预测层是双向博弈,规划层要在安全、效率和舒适之间选风险窗口。只看碰撞会把策略推向原地等待,只奖励成功插入又可能把策略推向过度自信。

A-08 的修法不是一个万能 reward,而是一组带作用域的机制:导航变道奖励只在关键区间生效;危险换道根据侧后车速度和相对速度构造安全距离;静态偏航用纵向距离与横向偏差的双阶段 Sigmoid 平滑释放;车道锁定在绕行场景中必须禁用,避免与主动避障冲突。

碰撞专项也需要分类。TTC 前要排除非自车责任的后向追尾和正在远离的目标;VRU 要比较双方预测轨迹交点以及到达时间是否同步;绕行一旦碰撞必须清空奖励,不能让效率收益抵消事故。课件把优先级写成安全大于法规大于体感,这是量产 reward 与验收指标都应遵循的结构。

每个专项至少要有四件套:场景触发条件、模型或 reward 作用域、反向/邻接测试集、全量回归门槛。没有作用域就会污染其他任务,没有邻接反例就会在两个失效极端之间来回摆动。

TRIGGER

场景触发

  • 可观测、可复现、可统计
  • 明确入口与退出条件
  • 避免用模糊标签覆盖多个机理

OPTIMIZE

局部优化

  • reward 与规则只在作用域生效
  • 区分感知、预测、规划根因
  • 保留安全硬门与类人软目标

REGRESS

邻接回归

  • 成功与失败、让行与不让行成对
  • 专项提升不能损伤常规分布
  • 修复副作用永久进入用例库
量产专项的成熟度,不看 reward 数量,而看作用域和副作用能否被验证。

规则护栏仍然是系统的一部分

端到端描述的是信息与训练链路,不意味着执行链路没有约束。A-08 给出的量产后处理是:多模轨迹先过滤,再横纵解耦打分、时空联合 refine,最后进入控制。红绿灯也不是一个分类输出直接刹车,而是检测、识别、选灯、颜色与异常属性赋予、车道和停止位置绑定的连续工程链。

传统规控课程提供了护栏的数学来源。C-04a 的 DP 先在非凸空间生成 Feasible Tunnel 与绕行/让行决策,QP 再在可行域中优化平滑度、动力学和交通规则;C-04b 的时空语义走廊把静态障碍、动态预测、红灯和车道边界统一成 s-l-t 约束。学习式 planner 可以替换候选生成或打分,但车辆动力学、道路边界和不可违反规则仍需可验证表达。

Diffusion 也印证这一点。A-06a 明确建议它生成 N 条候选,后接 rule-based、optimization 或 RL 做排序与风险筛选。多模态只是候选覆盖,不是选择正确;Top-K 里有安全轨迹,不能掩盖 Top-1 选错。

护栏必须可观测而不是悄悄修轨迹。每次过滤、约束触发、fallback 和轨迹 refine 都应留下原因码,否则线上只看到最终轨迹,会再次落入 B-09 所说的黑盒归因困境。

  • 候选生成器、排序器、约束器和控制器分别记录输入输出与原因码。
  • 碰撞、道路边界、逆行、信号灯和动力学约束设为不可补偿门槛。
  • 后处理修改幅度过大时,不应继续伪装成模型正常输出,应触发降级和回流。
  • 规则护栏同时进入训练 reward、离线诊断和发布验收,避免三套口径互相打架。
  • 任何规则专项都要有场景隔离;任何学习专项都要有硬约束和 fallback。

最后一公里:论文讲到哪里,车上还剩多少

红绿灯是“论文终点 vs 量产终点”最干净的标本。论文层面这个问题在检测和识别两步就算解决了;A 课的量产链路是五步:Sparse4D 检测出 3D/2D 框,ShuffleNet 分类颜色,然后才是论文里没有的三步——选灯(把灯的朝向与车道、车流朝向匹配,回答“这盏灯管不管我这条道”)、属性赋予(用 HMM 处理倒计时、故障、黄闪绿闪)、绑定(斑马线加车道末端加停止线,构造刹停区域)。前两步有基准可刷,后三步只有量产团队的工程账。

轨迹侧同理。量产端到端并不直接执行模型的原始输出:多模轨迹先经过滤(融合导航与动静态信息),再横纵解耦打分,再时空联合 refine,才交给控制。AR 范式的量产三缺陷也来自这最后一公里:单步预测被上一步影响导致横向稳定性问题;“AR 学不会因果关系”;以及最实际的一条——量产阶段只选择 top1 轨迹,论文引以为傲的多模态在车上被主动丢掉了。评审任何“端到端已量产”的宣称,先问原始轨迹和执行轨迹之间隔了几层。

论文侧对车端约束的回应已经形成一条清晰的谱系,可以按“它在省什么”来读:DiffusionDrive 的截断扩散在省去噪步数(100 步到 2 步);ResAD 的惯性参考加残差在省生成空间(不让模型从零学物理);Sparse4D 的稀疏 query 在省感知算力(不铺满 BEV);FAST 的动作词元化在省序列长度(同时决定控制平滑度)。这四篇论文加起来是同一句话:评估任何生成式方案,第一个要问的都是端到端延迟。

数据流水线的门槛同样有数字。一个数据算子要进流水线,先要在正负样本各 20-30 条的评测集上做到 95% 以上准确率,上线后还要定期抽检;新增场景按占比 r 与阈值 T1/T2 三路分流——占比高走清洗配比、居中先增补、低于 T2 判为长尾走定向采集加难例微调;多标签数据按 1/n 计权逐级展开配比。一段式预训练的基数是千万级 clip。这些数字合起来说明:数据体系不是模型训练的配套,它是和模型平级的工程系统。

再往后看一步,量产的下一层约束已经列出来了:百亿参数模型的车端功耗散热与压缩蒸馏、神经网络 Planner 的形式化验证与长尾安全证明、黑盒决策下车企/供应商/芯片厂的事故责任划分。快慢系统是当下的过渡答案——System 1 蒸馏轻量策略跑 10Hz 以上的高频控制,System 2(VLA 加世界模型)做约 1Hz 的低频规划,且接管机制不是夺方向盘,而是调整目标、约束或奖励去引导 System 1。B 课的收官句是个合适的路标:“VLA 解决‘懂不懂’,World Model 解决‘敢不敢’,RL 解决‘好不好’”——而量产要解决的,是这三件事在同一台车上同时成立。

一次上车不等于完成量产

量产能力是持续接受测试,而不是一次 SOP 签字。每个模型版本都要在相同数据版本、相同仿真器、相同控制器和相同硬件预算下,与当前量产基线对照;每次严重线上问题都转成离线可重放、仿真可交互和道路可复核的三层用例。

验收需要把模型指标与系统指标并列:能力侧看安全、导航、效率、舒适、交互和恢复;工程侧看 P99 延迟、超时率、温度降频、内存峰值、输入同步、护栏触发率和 fallback 成功率。模型分数上涨但护栏接管翻倍,不应被视为能力提升。

B-09 指出百亿参数车端部署仍面临功耗、散热、压缩蒸馏和形式化验证;C-09 仍把有效闭环、长尾 benchmark 与实时部署列为开放问题。这意味着 VLA、世界模型和 RL 应按成熟度分层接入:先作为离线标注、场景生成、低频监督和候选评审,再逐步靠近主控制环,而不是因论文趋势直接改写安全架构。

最终的放行结论应是有限命题:在哪个 ODD、地图等级、天气、速度、硬件和版本条件下,通过了哪些门槛,仍有哪些已知边界。比“已量产端到端”更克制,也更有工程意义。

  1. 冻结基线固定数据、仿真、控制器、硬件和验收口径,避免版本间偷换条件。
  2. 双表验收能力指标与系统资源/护栏指标并列,任何一侧退化都需解释。
  3. 分层接入新技术VLA、世界模型、RL 先进入低风险环节,依据验证逐步提高控制权。
  4. ODD 限定放行明确地图、道路、天气、速度与已知失效边界,支持灰度和快速回滚。
  5. 问题永久化线上问题转成场景 ID、数据算子与回归用例,后续版本不得再次出现。

三门课怎么对上

同一个工程问题,三门课的观察层级不同。下面逐条标出它们是相互印证、作用域不同,还是在相同前提下保留张力——不把任何一门课单独当作行业定论。

端到端量产意味着删掉所有后处理和规则模块。

保留张力
A · 端到端早期课
A-08 p30-p34 明确给出轨迹过滤、打分、时空 refine、控制和红绿灯五段工程链。
B · 端到端一期
B-01 p17 将端到端定义为联合优化和信息无损,强调可学习能力上限,并未证明执行层可无约束。
C · 决策规划课
C-04a/C-04b 把动力学、道路边界、障碍与交通规则写成可行域和时空约束。

合并读法:概念上的端到端与系统上的无护栏不是一回事。量产通常保留可验证约束,并让学习模块替代最有收益的生成与选择环节。

论文精度领先即可进入车端主控制环。

相互印证
A · 端到端早期课
A-06a 4.1-p19 指出 Diffusion 的多步采样、显存和调参成本,要求同时审视实时性。
B · 端到端一期
B-09 p27 将高频轻量策略与低频 VLA/世界模型分工,主控制环要求 10 Hz 以上。
C · 决策规划课
C-09 p24 给出 UniAD 555.6 ms 与 VAD-Tiny 59.5 ms 的差距,p66 用 AsyncDriver 规避 LLM 阻塞实时控制。

合并读法:三门课一致把计算路径和系统频率视为独立门槛;离线精度只完成第一步。

Diffusion 能生成多条轨迹,就已经解决了最终驾驶决策。

相互印证
A · 端到端早期课
A-06a 4.1-p20 明确区分多模态覆盖与可排序、可筛选、可评估风险,并建议后接规则、优化或 RL。
B · 端到端一期
B-07 sec5 p3 将多模态规划拆成回归、分类和 coarse-to-fine,选择器是独立任务。
C · 决策规划课
C-08 p4-p12 的 Diffusion-ES 用 reward 评分和精英选择反复筛选候选,而非直接执行任意采样。

合并读法:生成器决定候选上限,排序器和约束器决定 Top-1 安全。量产评测必须分别看覆盖率和选择正确率。

无图量产可以忽略导航输入的质量和地图等级。

作用域不同
A · 端到端早期课
A-04 p9-p30 系统拆解 Local Map+SD、SD/SDPro 差异、导航增强与晚变道问题。
B · 端到端一期
B-01/B-07 把导航作为 planner 输入或训练条件,但没有展开供应商地图、行点异步与退化。
C · 决策规划课
C-04a 以 Routing 和参考线作为传统规划上游,说明全局方向与局部轨迹本就分层。

合并读法:A 课补足了 B/C 未展开的量产接口。无图只是降低 HD Map 依赖,不是取消低精导航和长期语义。

一段式模型只要数据足够多,就不需要分阶段训练和组织解耦。

保留张力
A · 端到端早期课
A-08 p7-p15 给出千万级预训练、专项 RL 和分层数据配比,显示全量与专项仍要分阶段。
B · 端到端一期
B-07 p5-p12 把多任务 loss 干扰、多阶段训练和团队协作习惯列为二段式长期存在的原因。
C · 决策规划课
C-08 p83 强调生成模型、IL、RL 各有不同成本和缺陷,需要互补而非单一路线包打天下。

合并读法:数据规模提高能力上限,但不自动消除梯度冲突、实验吞吐和组织接口。训练阶段仍需按问题拆分。

量产数据闭环等于持续收集更多日志。

相互印证
A · 端到端早期课
A-08 p11-p15 给出发现、分级、算子准入、配比、训练、评测与回流的完整闭环。
B · 端到端一期
B-08 p11-p12 强调规模之外还要按行为/场景分类,并清洗基础质量、驾驶合理性和能力范围。
C · 决策规划课
C-08 p66-p76 将真实名义数据与脚本长尾场景共同用于闭环 IL+RL,说明覆盖需要主动构造。

合并读法:三门课都否定“只堆日志”。闭环的核心是让问题可定义、可挖掘、可配比、可验证和可复用。

专项 reward 修好目标场景后即可全量发布。

相互印证
A · 端到端早期课
A-08 p17-p28 记录加塞从保守退化到过度积极,并要求场景隔离、安全优先和冲突处理。
B · 端到端一期
B-07 p5-p9 说明多任务 loss 与数据分布会互相干扰,需要分阶段与联合微调。
C · 决策规划课
C-08 p83 指出 IL 类人但规则不足、RL 守规则但类人不足,任何单目标优化都有邻接代价。

合并读法:专项提升只证明局部有效;还必须通过邻接反例、常规分布和全量回归,才能证明没有转移失效。

规则护栏会天然压低学习式 planner 的能力上限,因此应尽早删除。

作用域不同
A · 端到端早期课
A-08 p20-p34 用安全距离、Penalty Wall、TTC、reward 优先级和后处理处理模型输出的具体失效。
B · 端到端一期
B-09 p29 把神经网络 planner 的形式化验证和长尾安全证明列为尚未解决的瓶颈。
C · 决策规划课
C-04a/C-04b 展示可行域、动力学和语义边界可以用有限约束高效验证。

合并读法:护栏可能限制部分探索,但在形式化安全尚未解决时承担可审计边界。优化方向是减少不必要干预并提高可观测性,不是无条件删除。

VLA 和世界模型已经适合直接替代高频车端 planner。

相互印证
A · 端到端早期课
A-06a 4.4-p19 展示语言推理接 Diffusion Planner 的研究路线,但并未给出车端全链路实时证明。
B · 端到端一期
B-09 p27 明确 System 2 约 1 Hz、System 1 为 10 Hz 以上,p29 仍列功耗、散热和验证瓶颈。
C · 决策规划课
C-09 p65-p66 用双系统和 AsyncDriver 让大模型低频或异步介入,并把实时部署列为开放问题。

合并读法:三门课更支持渐进接入:先用于标注、场景生成、低频监督和异常处理,再依据验证提高控制权。

论文 benchmark 与量产验收可以使用同一张总分表。

作用域不同
A · 端到端早期课
A-08 围绕实际失效、输入噪声、专项修复和道路反馈组织量产指标。
B · 端到端一期
B-08 用公开数据集和统一指标提高方法可比性,但也提醒开环仅供快速迭代。
C · 决策规划课
C-09 p66 将 benchmark、实时部署和任务对齐并列为不同开放问题。

合并读法:公开 benchmark 解决外部可比性,量产验收解决本车 ODD 和系统责任。两者应互相引用,但不能互相替代。

相关术语

  • 数据闭环——从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。
  • 场景隔离——同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。
  • 导航路径——它表达的是长期路线意图(该往哪走),不是可执行轨迹,不能直接控车。
  • 导航增强——主动注入定位漂移、行点缺失、更新延迟这些真实退化,防止模型过度依赖某一种完美导航输入。
  • 导航先验编码——把 SD 行点、导航动作、限速、候选与推荐车道编码成条件 token,经 cross-attention 注入规划 query。
  • 奖励钻空子——模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。
  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
  • 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。
  • 多模态轨迹——未来不是一个确定的点,而是一个分布:可以跟车、变道、让行、绕行,模型输出多条候选来表达这种不确定性。
  • 截断扩散与锚点——不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。
  • 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。
  • 动作词元设计——「下一步」到底表示什么——不同的 token 定义会改变学习难度、噪声传播和极端场景表现。
  • 视觉-语言-动作模型——把视觉输入、语言/语义桥接和动作输出统一到一个多模态框架,适合更高层的意图和语义条件化。
  • 流匹配——不预测噪声,而是学习从噪声轨迹流向真实轨迹的连续速度场,推理时解 ODE——采样步数更少。

相关论文

材料来源

课程章节页码说明
AA-04 导航信息的量产应用p7-p15导航职责、无图三层拆分、Navigation Path 的边界与失效模式。
AA-04 导航信息的量产应用p20-p30SD/SDPro 差异、导航输入编码、四类行点增强和晚变道问题。
AA-06a Diffusion 轨迹优化4.1-p17-p26多模态未来、20–100 步推理成本、候选排序缺口、Truncated Diffusion 与 ResAD。
AA-06a Diffusion 轨迹优化4.4-p10-p18DiffusionDriveV2 的 IL+RL 修复、Flow Matching 少步采样和 Flow-GRPO。
AA-06b AR 轨迹优化4.2-p24-p31next-token 训练、量产优点、误差累积、多模态坍缩与长期回报边界。
AA-08 端到端量产经验分享p5-p15量产故障、训练数据量、开闭环取舍、数据算子准入和分层配比。
AA-08 端到端量产经验分享p17-p28加塞、危险换道、静态偏航、TTC、VRU 和 reward 冲突管理。
AA-08 端到端量产经验分享p30-p34轨迹过滤、打分、时空 refine、控制与红绿灯完整工程链。
BB-01 端到端自动驾驶概述与课程介绍p13-p20模块化到端到端的定义、联合优化收益与黑盒/数据/算力代价。
BB-07 端到端模型的训练范式p5-p12多任务复杂度、多阶段训练、二段式的组织原因和 Planning 训练。
BB-08 端到端训练数据与评测方法p11-p17数据规模与清洗、开环快速迭代、闭环安全/效率/舒适指标。
BB-09 端到端与 VLA、世界模型、RL 的关系p4-p7因果混淆、惯性、黑盒归因、训练数据凸包与监督赤字。
BB-09 端到端与 VLA、世界模型、RL 的关系p26-p30快慢系统、Data Loop 到 Training Loop、车端功耗与形式化验证瓶颈。
CC-04a 路径与轨迹规划p31-p44DP/QP、Feasible Tunnel、动力学与交通规则约束,以及解耦失效边界。
CC-04b 时空联合规划p27-p40时空语义走廊、语义边界、走廊生成与受约束轨迹优化。
CC-08 数据驱动的规划方法p4-p12Diffusion-ES 用候选评分和精英选择连接生成模型与不可微工程约束。
CC-08 数据驱动的规划方法p66-p83真实与脚本长尾场景、闭环 IL+RL、世界模型效率和生成/IL/RL 互补边界。
CC-09 数据驱动前沿算法与发展趋势p24-p36VAD 实时性、规划约束、开环评测失效和可编辑闭环仿真。
CC-09 数据驱动前沿算法与发展趋势p65-p66双系统、AsyncDriver、有效闭环、长尾 benchmark 与实时部署开放问题。
AA-08 端到端量产经验分享p5, p12-p15, p30-p34AR 量产三缺陷、数据算子准入与配比方法、红绿灯五步工程链路与轨迹后处理。
BB-09 端到端与 VLA、世界模型、RL 的关系p27-p30快慢系统频率分工、接管机制与量产剩余三大瓶颈。