该论文提出了一种名为MV2GF的多视角行人检测方法,旨在解决现有方法在未见相机配置下泛化能力不足的问题。传统MVPD方法通过将2D图像特征投影到3D空间进行聚合,但在训练时未见过的相机配置下,难以准确捕捉跨视角的视觉几何,且模型容易过度依赖训练时的畸变模式。MV2GF利用视觉几何基础模型,融合任务特定特征与通用几何特征,以增强对视觉几何的捕捉能力;同时,通过基础模型预测的3D点图将图像像素投影到准确的3D位置,避免模型对训练畸变模式的依赖。实验表明,MV2GF在泛化性能上优于现有方法,验证了视觉几何基础模型在多视角行人检测中的有效性。该研究为提升多视角检测系统在真实复杂环境中的适应能力提供了新思路。
| Multi-View Pedestrian Detection (MVPD) | 多视角行人检测,从多个视角图像中检测行人并生成鸟瞰图表示的任务。 |
| visual geometric foundation model | 视觉几何基础模型,一种预训练模型,能够跨视角捕获视觉几何并预测3D属性,具有强泛化能力。 |
| bird's eye view map | 鸟瞰图,从上方俯视的视角表示,用于显示地面上的物体位置。 |
| 3D pointmaps | 3D点图,由模型预测的每个像素对应的3D坐标映射,用于将图像特征投影到3D空间。 |
| camera configurations | 相机配置,指相机的数量、位置、朝向等参数设置。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅