🔥 今日值得一读 视觉语言模型蒸馏新突破:精准锁定关键视觉证据,推理零开销还涨点!
KVE-KD: Key Visual Evidence-Guided Knowledge Distillation for Vision-Language Models
arXiv LG (cs.LG) 🔥 重点 #知识蒸馏#视觉语言模型#模型压缩 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可在边缘设备部署VLM时使用,按任务相关视觉token蒸馏,比均匀监督更省算力且保精度。

📖 AI 总结

本文提出KVE-KD框架,旨在解决视觉语言模型知识蒸馏中现有方法对视觉token施加统一监督或依赖静态选择、导致任务相关线索与背景噪声混淆的问题。该框架以生成前最后一个文本token作为统一语义锚点,通过迭代移除视觉token贡献来定位跨模态融合层,并依据锚点条件注意力分布对视觉token排序,结合归一化熵筛选出关键视觉证据,引导学生模型聚焦对齐教师模型的任务相关视觉表征。在六个基准测试上,KVE-KD优于现有跨模态蒸馏方法,在复杂推理和细粒度视觉理解任务上提升尤为显著,且不增加推理时开销。

🔑 关键词速览

知识蒸馏一种模型压缩技术,通过让小型学生模型模仿大型教师模型的行为来迁移知识。
视觉语言模型能够同时处理视觉和文本信息,并执行跨模态理解与生成任务的深度学习模型。
关键视觉证据在视觉标记中,与任务最相关、信息量最大的部分,用于指导蒸馏过程。
跨模态融合层在视觉语言模型中,负责将视觉和文本特征进行交互与融合的特定网络层。
归一化熵一种衡量注意力分布不确定性的指标,用于筛选信息量高的视觉标记。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅