本文提出 PanoPed,一个面向全球面全景行人跟踪的仿真到真实(sim-to-real)基准,旨在解决平面边界框无法准确描述球面上行人位置的问题。该基准包含两部分:PanoPed-S 提供来自固定、四足机器人及无人机相机的 108,000 帧合成数据,配有掩码、深度、相机位姿和三维行人状态;PanoPed-R 则包含 28,002 帧真实固定相机画面,其中 16,247 帧为密集标注。作者发现,等距柱状投影(ERP)矩形无法唯一确定可见行人的球面中心与角范围,但检测器的视觉查询仍蕴含相关信息。受六分仪利用角度测量定位物体的启发,他们提出 Sextant——一个即插即用的角度定位头,仅约 0.035M 参数,复用冻结检测器,不改变跟踪身份,也无需额外图像编码器。在 PanoPed-S 测试中,Sextant 将最强基线 MOTIP 的 HOTA 从 47.30 提升至 49.49,并在全部八个测试序列上均有增益;在未针对真实数据微调的情况下,合成数据训练的定位头仍使 MOTIP 和 HAT 在真实视频上提升 0.96–1.14 HOTA,且两个随机种子均在每个真实序列上取得改进。该工作为全景行人跟踪提供了新基准与轻量有效的定位方案,推动了球面感知与仿真到真实迁移的研究。
| PanoPed | 一个用于全球面行人追踪的仿真到真实基准数据集和评估框架。 |
| ERP | 等距柱状投影,一种将球面展开为平面图像的常用全景表示方法。 |
| Sextant | 受六分仪角度测量原理启发设计的即插即用角度定位头,用于提升全景行人追踪性能。 |
| HOTA | 多目标追踪的综合性评估指标,同时衡量检测、关联和定位精度。 |
| MOTIP | 一种基于视觉查询的多目标追踪方法,在PanoPed基准中被用作强基线。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅