这篇论文针对多视角异常检测中一个反直觉的现象展开研究:更多跨视角信息反而可能降低检测性能。作者指出,在基于重建的检测流程中,若简单融合多个视角,正常区域的线索会传播至解码器,导致异常区域被忠实重建,从而破坏检测所依赖的重建误差。这一现象被命名为“跨视角信息泄漏”。为此,论文提出GLAD框架,首次将视觉基础模型特征与局部及全局跨视角融合结合。其核心模块包括:多视角合并注意力(MMA)以线性复杂度实现局部融合,并引入可学习的视角权重与逐令牌门控;以及对象引导注意力(OGA)通过聚合全局类别令牌并广播回补丁令牌来捕获全局上下文。在Real-IAD和MANTA-Tiny数据集上的实验表明,GLAD在样本、图像和像素三个层面均优于现有方法,验证了有原则的信息限制是多视角异常检测的关键。
| 多视角异常检测 | 一种利用多个视角或传感器数据来检测异常的技术,旨在提高检测的准确性和鲁棒性。 |
| 跨视角信息泄漏 | 在多视角融合过程中,正常视角的信息传递给解码器,导致异常区域被错误重建,从而削弱检测性能的现象。 |
| GLAD | 全局-局部注意力驱动框架,一种结合视觉基础模型特征和局部/全局跨视角融合的多视角异常检测方法。 |
| 多视角合并注意力(MMA) | 一种局部跨视角融合模块,以线性复杂度实现,通过可学习的视角权重和逐令牌门控选择性整合信息。 |
| 对象引导注意力(OGA) | 一种全局上下文捕获模块,通过聚合类令牌并广播回补丁令牌来替换原始表示,以保持重建差距。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅