事件相机定位新突破:MegaEvent视角变化下Recall@1达82%,领先次优方法20个点!
Multi-viewpoint Geo-localization with Event Cameras
arXiv CV (cs.CV) 重要 #事件相机#视觉定位#位置识别#机器人导航 🕐 今天 12:00

📖 AI 总结

本文针对事件相机在机器人定位中视角变化鲁棒性不足的问题,提出了一种基于事件的视觉位置识别系统MegaEvent。研究者将五个大规模地理标记数据集通过图像到事件转换生成合成事件流,用于微调预训练的事件视觉Transformer主干网络,并采用多损失函数训练,使模型学习到对视角变化稳健的位置识别特征。在三个现有事件定位数据集上,MegaEvent平均Recall@1达到82%,分别领先次优事件方法和直接应用于事件帧的帧式模型20个和8至26个百分点。作者还发布了新数据集Springfield-Event-VPR,包含3.7公里步行路线、三种相机朝向、总长11.1公里,MegaEvent在该数据集上领先最强基线9个百分点。该工作为事件相机在多视角地理定位场景中的实际应用提供了有效方案与评测基准。

🔑 关键词速览

Event Camera一种受生物启发的视觉传感器,异步输出每个像素的亮度变化事件,具有高时间分辨率和低延迟特性。
Visual Place Recognition (VPR)视觉位置识别,指通过视觉信息识别当前场景所属地点或位置的技术。
Image-to-Event (I2E) Conversion图像到事件转换,将传统帧图像转换为合成事件流的数据转换方法。
Vision Transformer (ViT)视觉Transformer,一种基于自注意力机制的神经网络架构,用于图像特征提取和识别任务。
Recall@1召回率@1,一种评估指标,表示在检索结果中排名第一的正确匹配所占的比例。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅