CoViT提出了一种针对视觉Transformer(ViT)的实例感知自监督学习框架,旨在解决ViT在语义理解上表现出色但难以区分不同对象实例(如两只狗产生相同嵌入)的局限。该方法通过几何引导的对比学习,利用注意力引导掩码生成实例掩膜,并构建三元组进行最难对比挖掘:选择实例内最难正样本和实例间最难负样本,以驱动对比损失压缩类内差异并扩大类间边界。实验表明,CoViT在多个实例级感知任务上以ViT为骨干稳定提升超过2个AP点,且无需额外解码器或标签,证明纯ViT可通过注意力先验和定向对比约束学习实例感知表示。该研究为提升ViT在目标检测和实例分割等任务中的适用性提供了新路径。
| Vision Transformer (ViT) | 一种基于Transformer架构的视觉模型,将图像分割为补丁序列进行处理,擅长语义理解。 |
| Contrastive Learning | 一种自监督学习方法,通过拉近相似样本(正样本)和推开不相似样本(负样本)来学习特征表示。 |
| Instance Segmentation | 一种计算机视觉任务,旨在同时检测图像中的每个对象实例并为其生成像素级掩码。 |
| Attention Map | Transformer中注意力机制产生的权重图,表示模型关注输入图像的不同区域。 |
| Hard Negative Mining | 一种训练策略,选择最难区分的负样本(即与锚点最相似的负样本)来增强模型判别能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅