视觉Transformer仅靠自监督预训练就能涌现物体绑定,但绑定是局部的,距离越远越弱!
Emergent Object Binding Has a Finite Spatial Horizon
arXiv CV (cs.CV) 重要 #ViT#物体绑定#可解释性 🕐 今天 12:00

📖 AI 总结

该研究探讨了预训练视觉Transformer中物体绑定信号的内部结构。作者发现,尽管冻结的patch嵌入能以高准确率解码出两个图像块是否属于同一物体,但这一总体准确率掩盖了信号的空间特性。实际上,物体绑定是局部的:同一物体的两个patch被判定为绑定的概率随二者距离增加而单调衰减,并最终稳定在一个非零下限,该衰减过程可用具有有限长度尺度的指数函数描述。这一规律在ADE20K和COCO数据集、三种探针家族以及DINO和CLIP骨干网络中均成立,表明它是表征本身的属性而非解码器所致。将绑定理解为有限范围的空间相干性,可解释总体分数无法说明的多种现象,如大物体上绑定减弱、同类物体区分更难、部分与整体被归组等,而遮挡在控制物体尺寸后则无影响。研究还初步观察到绑定范围与下限在DINOv2和DINOv3中组织于不同深度。

🔑 关键词速览

Object Binding指视觉系统或模型将属于同一物体的不同部分关联在一起的能力。
Vision Transformer (ViT)一种基于Transformer架构的视觉模型,将图像分割为块进行处理。
IsSameObject Signal从图像块嵌入中解码出的信号,表示两个图像块是否属于同一物体。
Spatial Horizon指物体绑定信号在空间上的有效范围,超出此范围绑定概率下降。
Self-supervised Pretraining一种无需人工标注的预训练方法,通过自监督任务学习表示。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅