该研究探讨了知识蒸馏(KD)在卷积神经网络中间层应用时的效果与风险。传统KD仅在网络最终输出层进行,而中间层逐块蒸馏的潜力尚未被充分挖掘。作者提出一种学生网络设计,采用与教师网络对应的简单同质块,并在对应块间进行知识迁移。实验覆盖11个数据集,发现经典数据集上仅蒸馏最后一个块即可达到最优效果,而细粒度、样本稀缺场景则显著受益于中间层监督——即使仅增加一个蒸馏点也能大幅缩小性能差距。研究还结合注意力图、Centered Kernel Alignment和Grad-CAM进行可解释性分析,探索不同监督粒度及师生微调策略的影响。结果表明,适当引导的中间层逐块蒸馏是构建紧凑且数据高效模型的关键,可在不牺牲准确率的前提下提升模型泛化能力。
| Knowledge Distillation (KD) | 知识蒸馏,一种模型压缩技术,通过将大型教师模型的知识转移给小型学生模型来提升其性能。 |
| Intermediate block-wise KD | 中间块级知识蒸馏,在网络的中间层进行知识转移,提供更细粒度的监督。 |
| Fine-grained datasets | 细粒度数据集,类别间差异细微的数据集,通常每个类别样本较少。 |
| Centered Kernel Alignment (CKA) | 中心核对齐,一种用于比较神经网络内部表示相似性的方法。 |
| Grad-CAM | 梯度加权类激活映射,一种可视化技术,用于解释卷积神经网络的决策依据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅