本研究探讨视觉Transformer如何在训练数据缺乏直接指涉证据的条件下,为“愤怒”等抽象概念建立视觉 grounding。作者提出“转喻式 grounding”机制假说,认为抽象预测由“火”等具体、可解释的锚定概念驱动,这些锚定概念充当视觉信号与抽象语义之间的桥梁。研究对 CLIP 和 DINO 视觉编码器应用 Transcoders,恢复可与具体概念语义标签对应的中间特征,并追踪其在抽象概念识别回路中的贡献。在精心构建的图标数据集上,实验揭示了结构化的转喻回路:感知原语主导浅层,类物体锚定概念先于抽象目标出现;含渲染文字的图像则调用一条独立的感知到文本路径。因果干预进一步验证了转喻中间特征在抽象概念 grounding 中的功能参与。该工作为理解视觉模型抽象语义的形成提供了机制性解释。
| Vision Transformers | 一种将Transformer架构应用于视觉任务的模型,通过自注意力机制处理图像块序列。 |
| Metonymic grounding | 转喻基础化,指通过具体、可解释的锚概念(如“火”代表“愤怒”)将视觉信号与抽象语义连接起来的机制。 |
| Transcoders | 一种用于解释神经网络内部特征的方法,可将中间激活映射到语义标签。 |
| CLIP | 对比语言-图像预训练模型,通过联合训练图像和文本编码器实现跨模态理解。 |
| DINO | 一种自监督视觉Transformer训练方法,通过自蒸馏学习强大的视觉表示。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅