会上可能听到:“我们是 BEV 无图方案。——BEV 解决了什么,无图又是什么意思?”
它到底是什么意思
技术路线上,2021 以前靠高精地图提供强先验;2022 年 BEV 解决多视角融合,让系统不必依赖预先采集的地图;2023 年 Occupancy 补上「不规则形状障碍物」;2024 年走向端到端;2025 年是 VLA。
BEV 的核心机制:用一组 BEV query 表示鸟瞰空间,通过 spatial cross-attention 从各摄像头图像采样信息,再通过 temporal self-attention 融合历史帧提升速度和动态感知。
机制图解
- 01多路摄像头各看一个方向
- 02BEV query 采样每个鸟瞰位置主动去图像上取信息
- 03时序融合叠加历史帧,估速度
- 04统一鸟瞰图供检测 / 地图 / 规划共用
容易搞混的地方
常见误解
无图方案完全不用地图
正确理解
通常是弱依赖:复杂路口、主辅路往往还留着 SD 级导航先验
常见误解
BEV 是一种传感器
正确理解
它是一种表征方式——把多个摄像头的画面融合到统一的鸟瞰坐标系里
看懂之后可以追问
- 无图方案在哪些场景下仍然需要地图先验兜底?「无图」通常是「弱依赖地图」。路口拓扑复杂、主辅路这类场景往往还留着 SD 级先验,问清楚才能排布测试范围。
- 时序融合用了几帧历史?摄像头被遮挡或者脏了的时候表现怎么退化?BEV 的动态感知能力很依赖时序融合。传感器退化下的表现决定了雨雪天和脏污场景的可用性。
沿着主线继续
接着看
相关论文
- BEVFormer:用时空 Transformer 从多摄像头学 BEV 表征——BEV query 是空间探针
- Sparse4D:稀疏时空融合的多视角 3D 检测——稀疏 query 换效率
出处:课程学习总纲 总纲 §3.1