TrackFish3D 是一个面向鱼群多视角视频的几何驱动自监督三维跟踪框架,旨在解决遮挡频繁、个体外观相似以及身份标注长期匮乏等难题。该方法不依赖外观重识别或人工标注身份,而是将标定好的多视角几何关系转化为监督信号,通过三角化与重投影一致性生成伪关联,并借助几何编码器和全局关联变换器学习帧内跨视角的全对全对应关系。为增强身份区分能力,研究引入自监督对比目标,在嵌入空间分离共视个体,同时利用时间预测器维持身份并跨越短时遮挡。模型仅在无标注视频上训练一次,即可直接应用于未见过的测试视频,无需跨视角身份标签、时间标注、三维真值、外观特征或测试时优化。在自建基准上,三维多目标跟踪准确率由最强基线的87.7%提升至95.8%;在3D-ZeF斑马鱼基准上取得81.1%的MOTA,优于最佳几何基线的77.4%,并在真实鸟类跟踪任务上展现出跨物种泛化能力。
| TrackFish3D | 本文提出的几何驱动自监督框架,用于多相机3D群游鱼类跟踪。 |
| 自监督学习 | 利用数据自身结构(如多视角几何一致性)生成监督信号,无需人工标注。 |
| 多视角3D跟踪 | 从多个同步相机视频中重建目标的三维轨迹,并保持其身份一致性。 |
| 三角测量 | 利用多视角几何关系,从多个二维观测中计算目标三维位置的方法。 |
| MOTA | 多目标跟踪准确率,综合衡量跟踪中漏检、误检和身份切换的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅