🔥 今日值得一读 视觉token剪枝新思路!CoverPruner无需训练,从需求侧出发,激进压缩下准确率提升最猛!
Who Speaks for the Pruned? Visual Token Pruning as Coverage Optimization
arXiv CV (cs.CV) 🔥 重点 #推理优化#视觉语言模型#Transformer 🕐 09-04 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可应用CoverPruner到VLM推理中,无需训练即可减少计算量,同时保持关键信息,提升效率。

📖 AI 总结

视觉token剪枝旨在降低视觉语言模型(VLM)的推理成本,但现有方法多聚焦于“保留哪些token”,可能保留冗余高分token,却让被剪除的证据缺乏紧密代表。为此,该研究提出训练无关的剪枝器CoverPruner,从互补的需求侧视角出发,追问“token被移除后,哪个幸存原始token能代表它”。CoverPruner将剪枝形式化为表征覆盖最大化(RCM),以查询加权需求覆盖完整投影视觉token集,并通过投影器空间覆盖与轻量级首层注意力探针实现。实验表明,在多种VLM架构和压缩率下,CoverPruner的平均准确率均优于对比方法,且在激进压缩场景下增益最大。该工作已被EMNLP 2026主会接收。

🔑 关键词速览

Visual Token Pruning视觉token剪枝,一种减少视觉语言模型中视觉token数量以降低推理成本的技术。
CoverPruner本文提出的剪枝方法,通过覆盖优化来保留代表性token,无需训练。
Representational Coverage Maximization (RCM)表示覆盖最大化,一种将剪枝问题形式化为最大化覆盖所有视觉token的优化目标。
Vision-Language Models (VLMs)视觉语言模型,处理图像和文本的联合模型,如CLIP、LLaVA等。
Projector-space coverage投影器空间覆盖,在VLM的投影器输出空间中衡量token覆盖程度的方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅