本文提出KVE-KD框架,旨在解决视觉语言模型知识蒸馏中现有方法对视觉token施加统一监督或依赖静态选择、导致任务相关线索与背景噪声混淆的问题。该框架以生成前最后一个文本token作为统一语义锚点,通过迭代移除视觉token贡献来定位跨模态融合层,并依据锚点条件注意力分布对视觉token排序,结合归一化熵筛选出关键视觉证据,引导学生模型聚焦对齐教师模型的任务相关视觉表征。在六个基准测试上,KVE-KD优于现有跨模态蒸馏方法,在复杂推理和细粒度视觉理解任务上提升尤为显著,且不增加推理时开销。
| 知识蒸馏 | 一种模型压缩技术,通过让小型学生模型模仿大型教师模型的行为来迁移知识。 |
| 视觉语言模型 | 能够同时处理视觉和文本信息,并执行跨模态理解与生成任务的深度学习模型。 |
| 关键视觉证据 | 在视觉标记中,与任务最相关、信息量最大的部分,用于指导蒸馏过程。 |
| 跨模态融合层 | 在视觉语言模型中,负责将视觉和文本特征进行交互与融合的特定网络层。 |
| 归一化熵 | 一种衡量注意力分布不确定性的指标,用于筛选信息量高的视觉标记。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅