视觉token剪枝旨在降低视觉语言模型(VLM)的推理成本,但现有方法多聚焦于“保留哪些token”,可能保留冗余高分token,却让被剪除的证据缺乏紧密代表。为此,该研究提出训练无关的剪枝器CoverPruner,从互补的需求侧视角出发,追问“token被移除后,哪个幸存原始token能代表它”。CoverPruner将剪枝形式化为表征覆盖最大化(RCM),以查询加权需求覆盖完整投影视觉token集,并通过投影器空间覆盖与轻量级首层注意力探针实现。实验表明,在多种VLM架构和压缩率下,CoverPruner的平均准确率均优于对比方法,且在激进压缩场景下增益最大。该工作已被EMNLP 2026主会接收。
| Visual Token Pruning | 视觉token剪枝,一种减少视觉语言模型中视觉token数量以降低推理成本的技术。 |
| CoverPruner | 本文提出的剪枝方法,通过覆盖优化来保留代表性token,无需训练。 |
| Representational Coverage Maximization (RCM) | 表示覆盖最大化,一种将剪枝问题形式化为最大化覆盖所有视觉token的优化目标。 |
| Vision-Language Models (VLMs) | 视觉语言模型,处理图像和文本的联合模型,如CLIP、LLaVA等。 |
| Projector-space coverage | 投影器空间覆盖,在VLM的投影器输出空间中衡量token覆盖程度的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅