🔥 今日值得一读 视觉令牌砍掉97%!无训练剪枝让LLaVA提速还更抗噪,最高猛涨20%
Clustering and Token Denoising for Faster and More Robust VLMs
arXiv CV (cs.CV) 🔥 重点 #视觉语言模型#Token剪枝#推理加速 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
通过聚类和token去噪加速VLM推理,减少视觉token数量,无需重训练即可提升边缘部署效率。

📖 AI 总结

该研究提出了一种名为ClustRS的训练无关算法,用于加速视觉语言模型(VLM)的推理并提升其鲁棒性。该算法包含两个轻量级组件:一是基于注意力加权的聚类方法,从语义簇中选取代表性视觉token;二是残差收缩去噪步骤,对选中的token进行单次降噪处理。实验表明,在ScienceQA-IMG和MM-VET基准上,ClustRS在极端噪声和token压缩条件下(将token减少97%至16个)比基于注意力或多样性的方法性能提升最高达20%。在LLaVA-OneVision模型上,该方法在轻度噪声下仅用不到三分之一的token即可匹配基线性能。这项研究为边缘设备上的高效、抗噪VLM部署提供了一种兼顾计算效率与鲁棒性的简单有效方案。

🔑 关键词速览

ClustRS一种无训练的鲁棒令牌剪枝算法,由注意力加权聚类和残差收缩两部分组成。
Visual-Language Models (VLMs)视觉-语言模型,结合视觉和文本信息进行多模态理解的模型。
Token Pruning令牌剪枝,通过减少视觉令牌数量来降低计算成本的技术。
Residual Shrinkage残差收缩,一种对选定令牌进行去噪的步骤,增强模型对噪声的鲁棒性。
LLaVA一种流行的视觉-语言模型,通过将视觉令牌与文本结合来增强大语言模型的能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅