VPR鲁棒性翻车?AdaptVPR用16万合成样本硬刚域偏移,性能全面提升!
AdaptVPR: Route-Aware Hard Positive Generation for Robust Visual Place Recognition
arXiv CV (cs.CV) 重要 #视觉地点识别#数据增强#生成模型 🕐 09-07 12:00

📖 AI 总结

视觉位置识别(VPR)常因光照、天气、季节变化及动态遮挡等域偏移而性能下降,其根源之一是同一地点在训练数据中的外观多样性不足。为此,该研究提出AdaptVPR框架,一种基于路线感知的生成式增强方法,用于构造同地点的困难正样本以提升VPR训练鲁棒性。该框架首先利用视觉语言模型解析场景属性并评估编辑可行性,再由规则调度器依据可编辑性分数与风险约束确定生成路线。生成过程分为三条互补路径:全局外观路线改变天气、光照与时段;局部遮挡路线插入动态遮挡物;双路线则结合两者以产生更具挑战性的外观变化。每个候选样本均通过基于几何一致性与外观多样性的VPR专用验证机制筛选,以降低结构漂移风险并确保外观变化充分。基于此框架构建的AdaptCities数据集包含16万个经验证的合成困难正样本。在多个VPR基线与视觉基础模型上的实验表明,该方法在标准基准上表现稳定提升,在挑战性域偏移下R@1最高提升9.2%。

🔑 关键词速览

Visual Place Recognition (VPR)视觉地点识别,通过图像检索来识别查询图像对应的地理位置。
Hard Positives困难正样本,指与查询图像属于同一地点但外观差异大的图像,用于增强训练鲁棒性。
Vision Language Model视觉语言模型,结合视觉和文本信息理解场景属性,用于指导图像编辑。
Domain Shift域偏移,指训练和测试数据分布不一致,如光照、天气变化导致的外观差异。
Geometric Consistency几何一致性,验证生成图像与原始图像在空间结构上的一致性,防止结构漂移。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅