本文提出自适应互惠知识蒸馏(AR-KD)方法,旨在解决教师模型与学生模型规模差距过大导致知识迁移效率低下的问题。现有方法多采用静态单向蒸馏范式,忽视了学生学习的动态性,也难以针对困难样本提供有效指导。AR-KD的核心思路是对教师模型进行互惠自适应调整,将其类相关矩阵与学生模型的关系表示对齐,从而重塑教师的预测结构以匹配学生容量,缓解因教师过度自信造成的类间暗知识坍塌,使学生获得更丰富且兼容的监督信号。研究在CIFAR-100和ImageNet-1k分类数据集上验证,AR-KD在同构与异构设置下均优于现有最先进基线,学生准确率最高提升7.13%,平均较原始知识蒸馏高出1.42%至4.15%,与其他先进方法结合时还能进一步提升。该工作为知识蒸馏中动态、双向的知识迁移提供了新思路。
| 知识蒸馏 (Knowledge Distillation) | 一种模型压缩技术,通过让轻量级学生模型模仿大型教师模型的输出或中间表示来提升其性能。 |
| 自适应互惠知识蒸馏 (AR-KD) | 本文提出的方法,通过将教师的类相关矩阵与学生关系表示对齐,实现教师对学生的互惠自适应,以改善知识迁移。 |
| 类相关矩阵 (Class Correlation Matrix) | 描述不同类别之间预测相关性或相似性的矩阵,用于捕捉类间关系知识。 |
| 暗知识 (Dark Knowledge) | 教师模型输出中关于错误类别的概率分布信息,反映了类别之间的相似性和不确定性,对学生模型学习有重要价值。 |
| 同构与异构设置 (Homogeneous and Heterogeneous Setups) | 指教师与学生模型是否属于相同架构系列;同构表示架构相同或相似,异构表示架构差异较大。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅