该研究提出了一种名为ClustRS的训练无关算法,用于加速视觉语言模型(VLM)的推理并提升其鲁棒性。该算法包含两个轻量级组件:一是基于注意力加权的聚类方法,从语义簇中选取代表性视觉token;二是残差收缩去噪步骤,对选中的token进行单次降噪处理。实验表明,在ScienceQA-IMG和MM-VET基准上,ClustRS在极端噪声和token压缩条件下(将token减少97%至16个)比基于注意力或多样性的方法性能提升最高达20%。在LLaVA-OneVision模型上,该方法在轻度噪声下仅用不到三分之一的token即可匹配基线性能。这项研究为边缘设备上的高效、抗噪VLM部署提供了一种兼顾计算效率与鲁棒性的简单有效方案。
| ClustRS | 一种无训练的鲁棒令牌剪枝算法,由注意力加权聚类和残差收缩两部分组成。 |
| Visual-Language Models (VLMs) | 视觉-语言模型,结合视觉和文本信息进行多模态理解的模型。 |
| Token Pruning | 令牌剪枝,通过减少视觉令牌数量来降低计算成本的技术。 |
| Residual Shrinkage | 残差收缩,一种对选定令牌进行去噪的步骤,增强模型对噪声的鲁棒性。 |
| LLaVA | 一种流行的视觉-语言模型,通过将视觉令牌与文本结合来增强大语言模型的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅