视觉位置识别(VPR)常因光照、天气、季节变化及动态遮挡等域偏移而性能下降,其根源之一是同一地点在训练数据中的外观多样性不足。为此,该研究提出AdaptVPR框架,一种基于路线感知的生成式增强方法,用于构造同地点的困难正样本以提升VPR训练鲁棒性。该框架首先利用视觉语言模型解析场景属性并评估编辑可行性,再由规则调度器依据可编辑性分数与风险约束确定生成路线。生成过程分为三条互补路径:全局外观路线改变天气、光照与时段;局部遮挡路线插入动态遮挡物;双路线则结合两者以产生更具挑战性的外观变化。每个候选样本均通过基于几何一致性与外观多样性的VPR专用验证机制筛选,以降低结构漂移风险并确保外观变化充分。基于此框架构建的AdaptCities数据集包含16万个经验证的合成困难正样本。在多个VPR基线与视觉基础模型上的实验表明,该方法在标准基准上表现稳定提升,在挑战性域偏移下R@1最高提升9.2%。
| Visual Place Recognition (VPR) | 视觉地点识别,通过图像检索来识别查询图像对应的地理位置。 |
| Hard Positives | 困难正样本,指与查询图像属于同一地点但外观差异大的图像,用于增强训练鲁棒性。 |
| Vision Language Model | 视觉语言模型,结合视觉和文本信息理解场景属性,用于指导图像编辑。 |
| Domain Shift | 域偏移,指训练和测试数据分布不一致,如光照、天气变化导致的外观差异。 |
| Geometric Consistency | 几何一致性,验证生成图像与原始图像在空间结构上的一致性,防止结构漂移。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅