全景行人追踪新突破:仅0.035M参数,HOTA从47.30飙至49.49!
PanoPed: Beyond Bounding Boxes for Sim-to-Real Panoramic Pedestrian Tracking
arXiv CV (cs.CV) 重要 #行人跟踪#全景视觉#仿真到真实#评测基准 🕐 今天 12:00

📖 AI 总结

本文提出 PanoPed,一个面向全球面全景行人跟踪的仿真到真实(sim-to-real)基准,旨在解决平面边界框无法准确描述球面上行人位置的问题。该基准包含两部分:PanoPed-S 提供来自固定、四足机器人及无人机相机的 108,000 帧合成数据,配有掩码、深度、相机位姿和三维行人状态;PanoPed-R 则包含 28,002 帧真实固定相机画面,其中 16,247 帧为密集标注。作者发现,等距柱状投影(ERP)矩形无法唯一确定可见行人的球面中心与角范围,但检测器的视觉查询仍蕴含相关信息。受六分仪利用角度测量定位物体的启发,他们提出 Sextant——一个即插即用的角度定位头,仅约 0.035M 参数,复用冻结检测器,不改变跟踪身份,也无需额外图像编码器。在 PanoPed-S 测试中,Sextant 将最强基线 MOTIP 的 HOTA 从 47.30 提升至 49.49,并在全部八个测试序列上均有增益;在未针对真实数据微调的情况下,合成数据训练的定位头仍使 MOTIP 和 HAT 在真实视频上提升 0.96–1.14 HOTA,且两个随机种子均在每个真实序列上取得改进。该工作为全景行人跟踪提供了新基准与轻量有效的定位方案,推动了球面感知与仿真到真实迁移的研究。

🔑 关键词速览

PanoPed一个用于全球面行人追踪的仿真到真实基准数据集和评估框架。
ERP等距柱状投影,一种将球面展开为平面图像的常用全景表示方法。
Sextant受六分仪角度测量原理启发设计的即插即用角度定位头,用于提升全景行人追踪性能。
HOTA多目标追踪的综合性评估指标,同时衡量检测、关联和定位精度。
MOTIP一种基于视觉查询的多目标追踪方法,在PanoPed基准中被用作强基线。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅