它要解决什么问题
传统 tracking-by-detection 需要大量手写的数据关联规则和 NMS 后处理,脆弱且难维护。
机制拆解
- 用 track query 维持已存在目标的身份,跨帧传递
- 用 newborn object query 发现新出现的目标
- 检测和跟踪在一个模型里完成,去掉手写关联逻辑
量产判断
读完应该能问
- ID 抖动率现在是多少?拥堵场景下呢?
回到术语
- 两段式——第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。
感知背景
MOTR: End-to-End Multiple-Object Tracking with Transformer
track query 维持身份
arXiv 2105.03247 ↗传统 tracking-by-detection 需要大量手写的数据关联规则和 NMS 后处理,脆弱且难维护。