它要解决什么问题
多个摄像头各看一个方向,怎么融合成一张统一的鸟瞰图,并且利用历史帧提升动态感知。
机制拆解
- 用一组 BEV query 表示鸟瞰空间的每个位置
- spatial cross-attention:每个 query 主动去各摄像头图像上采样它需要的信息
- temporal self-attention:融合历史 BEV,提升速度估计和动态目标感知
- 输出服务于检测、地图、车道等多个下游任务
量产判断
读完应该能问
- 时序融合对我们的速度估计提升了多少?遮挡场景下呢?
感知背景
BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers
BEV query 是空间探针
arXiv 2203.17270 ↗多个摄像头各看一个方向,怎么融合成一张统一的鸟瞰图,并且利用历史帧提升动态感知。