术语图鉴
当你只能复述会上听到的一句话、却说不出术语名时,从这里反查。每个词条先给白话判断,再讲机制、易混点和可以追问的问题。
31 个术语
共 31 个
端到端
End-to-End· 架构让模型更直接地从传感器输入学到驾驶输出,减少中间环节的信息损失,但不等于取消工程约束。
会上可能听到:“我们这套是端到端的。——那到底哪一段到哪一段?跟以前的方案差在哪?”
两段式
Two-stage End-to-End· 架构第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。
会上可能听到:“第一段出感知结果,第二段做规划。——这算端到端吗?为什么大家都先做这个?”
一段式
One-stage End-to-End· 架构感知、预测、规划在统一表征里联合优化,直接输出轨迹——上限更高,但难 debug、难闭环验证。
会上可能听到:“一段式上限更高。——上限高在哪?我们为什么还不敢上?”
潜空间
Latent Space· 架构模型内部的压缩工作台:信息比结构化标签丰富,但人读不懂,所以出错难归因。
会上可能听到:“这些信息都在 latent 里。——那我怎么知道它到底学到了什么?”
Query 与候选轨迹
Query / Proposal· 架构query 是模型内部「带槽位的探针」,proposal 才是解码后拿出来比较的候选结果。
会上可能听到:“我们用 N 个 query 出候选。——query 就是候选轨迹吗?”
鸟瞰图表征
BEV (Bird's-Eye View)· 架构把多摄像头视角融合到统一的鸟瞰空间,降低对高精地图的依赖。
会上可能听到:“我们是 BEV 无图方案。——BEV 解决了什么,无图又是什么意思?”
占据栅格
Occupancy· 架构用空间中每一块「有没有被占据」来表达障碍,解决检测框只能识别规则形状物体的问题。
会上可能听到:“Occupancy 能识别异形障碍物。——它跟 3D 检测框是什么关系?”
视觉-语言-动作模型
VLA (Vision-Language-Action)· 架构把视觉输入、语言/语义桥接和动作输出统一到一个多模态框架,适合更高层的意图和语义条件化。
会上可能听到:“下一代要上 VLA。——它比现在的端到端多了什么?”
导航路径
Navigation Path· 导航它表达的是长期路线意图(该往哪走),不是可执行轨迹,不能直接控车。
会上可能听到:“导航把路线给到模型了。——模型是不是照着这条线开就行?”
导航增强
Navigation Augmentation· 导航主动注入定位漂移、行点缺失、更新延迟这些真实退化,防止模型过度依赖某一种完美导航输入。
会上可能听到:“导航输入我们做了增强。——增强什么?把导航搞乱了不是更差吗?”
导航先验编码
SD / SDPro Prior· 导航把 SD 行点、导航动作、限速、候选与推荐车道编码成条件 token,经 cross-attention 注入规划 query。
会上可能听到:“导航信息在一段式里怎么给模型?”
开环与闭环
Open-loop vs Closed-loop· 量产验收开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。
会上可能听到:“这版指标提升了 15%。——这是开环测出来的还是闭环?”
位移误差指标
ADE / FDE / Miss Rate· 量产验收ADE 是预测轨迹与真值逐点距离的平均,FDE 只看终点——它们衡量「像不像专家」,不等于安全或舒适。
会上可能听到:“ADE 降了 0.2。——这对用户意味着什么?”
碰撞时间与弱势交通参与者
TTC / VRU· 量产验收TTC 是碰撞时间;VRU 是行人骑行者。关键不只是轨迹会不会相交,而是会不会在接近同一时刻到达交点。
会上可能听到:“VRU 场景我们加了 TTC 惩罚。——够吗?”
场景隔离
Scenario Isolation· 量产验收同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。
会上可能听到:“加了车道锁定之后,绕行变差了。——这两个是不是打架了?”
数据闭环
Data Flywheel / Hard Case Mining· 量产验收从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。
会上可能听到:“我们有数据闭环。——具体是哪几步?多久转一圈?”
RL 数据规模直觉
RL Data Scale· 量产验收验 reward 方向约 10 条;单任务专项百到千条 clip;全量训练约 10w clip;一段式预训练可能千万级。
会上可能听到:“这个 RL 任务需要多少数据?——有没有大致的量级参考?”
奖励钻空子
Reward Hacking· 强化学习模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。
会上可能听到:“仿真里指标全绿,实车体验却很差。——模型是不是在钻我们 reward 的空子?”
奖励函数
Reward Function· 强化学习把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
会上可能听到:“我们在 reward 里加了舒适性权重。——这些权重是怎么定的?加了会不会顾此失彼?”
模仿学习与强化学习的关系
Imitation Learning vs RL· 强化学习RL 不是从零学开车,而是在模仿学习学出的基础策略上做对齐微调。
会上可能听到:“我们要上强化学习。——是要从头用 RL 学开车吗?”
PPO 与 GRPO
PPO / GRPO· 强化学习都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
会上可能听到:“这版我们从 PPO 换成 GRPO 了。——差别在哪,为什么要换?”
参考模型与 KL 约束
Reference Model / KL Penalty· 强化学习冻结的预训练策略作为锚点,用 KL 惩罚拴住新策略,别为了刷 reward 跑出原本合理的驾驶分布。
会上可能听到:“我们加了 KL 约束。——约束的是什么,加大加小有什么影响?”
RL 能解决的五类问题
What RL Is For· 强化学习长时序决策、多目标权衡、不确定交互、稀疏延迟反馈、规则写不清的灰色决策区。
会上可能听到:“这个问题上 RL 能解决吗?——什么样的问题才该用 RL?”
多模态轨迹
Multi-modal Trajectory· 轨迹生成未来不是一个确定的点,而是一个分布:可以跟车、变道、让行、绕行,模型输出多条候选来表达这种不确定性。
会上可能听到:“模型输出了好几条候选轨迹。——为什么不直接给一条?多的那些有什么用?”
扩散模型轨迹生成
Diffusion· 轨迹生成先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
会上可能听到:“轨迹生成我们用 diffusion。——它比直接回归好在哪?慢不慢?”
截断扩散与锚点
Truncated Diffusion / Anchor· 轨迹生成不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。
会上可能听到:“我们用截断扩散做到了实时。——截断掉的是什么?会不会有损失?”
自回归轨迹生成
AR (Autoregressive)· 轨迹生成把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。
会上可能听到:“AR 方案是一个 token 一个 token 出轨迹。——跟 diffusion 比各有什么取舍?”
动作词元设计
Action Token· 轨迹生成「下一步」到底表示什么——不同的 token 定义会改变学习难度、噪声传播和极端场景表现。
会上可能听到:“我们的 token 用的是 acc 和 yaw_rate。——为什么不用轨迹点?这个选择影响什么?”
逐步展开与误差累积
Rollout / Exposure Bias· 轨迹生成策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。
会上可能听到:“闭环里跑着跑着就飘了。——为什么开环测着好好的?”
流匹配
Flow Matching· 轨迹生成不预测噪声,而是学习从噪声轨迹流向真实轨迹的连续速度场,推理时解 ODE——采样步数更少。
会上可能听到:“Flow matching 比 diffusion 快。——它们本质区别在哪?”
信用分配
Credit Assignment· 轨迹生成整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 天然对齐,Diffusion 要摊回多个去噪步。
会上可能听到:“Diffusion 接 RL 比 AR 难。——难在哪?”
没有直接匹配的词条。换成会上听到的原话,或缩短关键词再试一次。