注意力蒸馏竟让ViT鲁棒性暴跌?14倍参数差、10倍数据差下的惊人真相!
What Does Attention Transfer Transfer? Attention Structure and Robustness in Vision Transformers
arXiv CV (cs.CV) 重要 #视觉Transformer#注意力机制#鲁棒性 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
直接测量注意力迁移对ViT结构的影响,揭示注意力复制与分布偏移下鲁棒性差距的根源。

📖 AI 总结

该研究系统考察了视觉Transformer(ViT)中注意力图蒸馏迁移的效果,并首次将迁移结果与注意力结构及鲁棒性直接关联。在ImageNet-100上以ViT-S为学生模型、自监督教师模型为基准,作者发现:蒸馏学生的注意力与教师接近程度比微调高约两个数量级,且训练中不会漂移,说明迁移近乎完美且持久。然而,在参数少14倍、数据少10倍的条件下,蒸馏与微调在分布偏移下的鲁棒性差距真实存在,但该差距主要源于训练不充分——鲁棒性成熟晚于准确率,被早停规则截断;补足训练后,多数种子下差距可降至预设阈值以下。进一步干预实验表明,将蒸馏与微调条件间的结构差异减半,并未引起鲁棒性响应。综合证据指向一个结论:鲁棒性缺陷源于特征层面,而非可见的注意力结构;注意力图展示的是模型“看哪里”,而非“知道什么”。

🔑 关键词速览

Vision Transformers (ViTs)视觉变换器,一种基于Transformer架构的图像识别模型,通过自注意力机制处理图像块。
Attention distillation注意力蒸馏,一种知识蒸馏方法,通过让学生模型模仿教师模型的注意力图来传递知识。
Distribution shift分布偏移,指训练数据与测试数据分布不一致的情况,常用于评估模型的鲁棒性。
Fine-tuning微调,在预训练模型基础上用特定任务数据继续训练以适配新任务。
Robustness鲁棒性,模型在面对分布偏移或扰动时保持性能稳定的能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅