该研究系统考察了视觉Transformer(ViT)中注意力图蒸馏迁移的效果,并首次将迁移结果与注意力结构及鲁棒性直接关联。在ImageNet-100上以ViT-S为学生模型、自监督教师模型为基准,作者发现:蒸馏学生的注意力与教师接近程度比微调高约两个数量级,且训练中不会漂移,说明迁移近乎完美且持久。然而,在参数少14倍、数据少10倍的条件下,蒸馏与微调在分布偏移下的鲁棒性差距真实存在,但该差距主要源于训练不充分——鲁棒性成熟晚于准确率,被早停规则截断;补足训练后,多数种子下差距可降至预设阈值以下。进一步干预实验表明,将蒸馏与微调条件间的结构差异减半,并未引起鲁棒性响应。综合证据指向一个结论:鲁棒性缺陷源于特征层面,而非可见的注意力结构;注意力图展示的是模型“看哪里”,而非“知道什么”。
| Vision Transformers (ViTs) | 视觉变换器,一种基于Transformer架构的图像识别模型,通过自注意力机制处理图像块。 |
| Attention distillation | 注意力蒸馏,一种知识蒸馏方法,通过让学生模型模仿教师模型的注意力图来传递知识。 |
| Distribution shift | 分布偏移,指训练数据与测试数据分布不一致的情况,常用于评估模型的鲁棒性。 |
| Fine-tuning | 微调,在预训练模型基础上用特定任务数据继续训练以适配新任务。 |
| Robustness | 鲁棒性,模型在面对分布偏移或扰动时保持性能稳定的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅