🔥 今日值得一读 ViT内部藏“世界知识”!新方法读出概念电路,自动揪出模型偏见,准确率暴涨11%!
"World Knowledge" in the Weights: Reading Concept Circuits of Vision Transformers
arXiv CV (cs.CV) 🔥 重点 #可解释性#ViT#概念电路 🕐 09-08 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助理解视觉模型内部概念关系,可用于模型调试和知识提取。

📖 摘要

用跨层转码器读取ViT概念电路,揭示世界知识内部结构。

🔑 关键词速览

Vision Transformers (ViTs)视觉变换器,一种基于自注意力机制的神经网络架构,广泛应用于图像识别等视觉任务。
Cross-Layer Transcoders (CLTs)跨层转码器,一种用于解析神经网络内部表示的工具,能够跨层提取稀疏可解释的概念。
Concept Circuit概念电路,一种有向图结构,用于描述模型中概念节点及其跨层交互,分为全局和实例两种。
Spurious Correlation虚假相关性,指模型依赖的非本质特征与标签之间的偶然关联,可能导致预测偏差。
Foundation Model基础模型,如CLIP和DINO,是在大规模数据上预训练的通用模型,可适应多种下游任务。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅