← 论文拆解

感知背景

BEVFormer:用时空 Transformer 从多摄像头学 BEV 表征

BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers

BEV query 是空间探针

arXiv 2203.17270 ↗

它要解决什么问题

多个摄像头各看一个方向,怎么融合成一张统一的鸟瞰图,并且利用历史帧提升动态感知。

机制拆解

  1. 用一组 BEV query 表示鸟瞰空间的每个位置
  2. spatial cross-attention:每个 query 主动去各摄像头图像上采样它需要的信息
  3. temporal self-attention:融合历史 BEV,提升速度估计和动态目标感知
  4. 输出服务于检测、地图、车道等多个下游任务

量产判断

读完应该能问

  • 时序融合对我们的速度估计提升了多少?遮挡场景下呢?

回到术语

  • 鸟瞰图表征——把多摄像头视角融合到统一的鸟瞰空间,降低对高精地图的依赖。
  • 两段式——第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。