本文对当前主流的多目标跟踪算法进行了系统性的实验评估,重点量化检测与关联两个核心模块对整体跟踪性能的各自贡献。与以往偏重理论分类的综述不同,作者基于公开实现构建统一流程框架,涵盖检测跟踪与端到端深度学习两大范式,并在MOT16、MOT17、MOT20、SportsMOT、DanceTrack和CrowdTrack等标准基准上展开大量实验。关键发现包括:检测质量对跟踪性能的影响远大于关联策略,检测器改进可带来超过10%的提升,而关联策略优化不足5%;现代深度学习检测器配合专用重识别模型显著优于联合检测与嵌入的方法;基于Transformer的端到端方法对检测质量变化更具鲁棒性,但计算成本较高。该研究为跟踪系统的设计与优化提供了实证依据。
| 多目标跟踪 (MOT) | 在视频序列中同时定位并持续跟踪多个目标对象的任务。 |
| 基于检测的跟踪 (Tracking-by-Detection) | 一种先逐帧检测目标,再通过数据关联将检测结果链接成轨迹的跟踪范式。 |
| 数据关联 (Data Association) | 将当前帧的检测结果与已有轨迹进行匹配,以维持目标身份一致性的过程。 |
| 重识别 (Re-identification) | 通过外观特征匹配跨帧或跨摄像头识别同一目标的技术。 |
| 端到端深度学习 (End-to-End Deep Learning) | 使用单一神经网络直接从输入视频输出跟踪结果,无需显式分步处理的范式。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅