本文提出了一种名为 CONDUIT 的训练无关框架,用于解决视觉语言模型(VLM)中 KV 缓存复用失效的问题。当相同视觉内容以不同前缀出现时,精确前缀复用无法生效,而选择性重计算虽能恢复质量,但基于原始注意力的选择策略会浪费预算在价值范数较低的高注意力令牌或与查询无关的图像上。CONDUIT 将单图像和多图像复用统一为残差流恢复问题,通过加权注意力机制,利用缓存键查询注意力和可访问的预输出缓存值范数代理对令牌排序,并应用图像级相关性放大进行全局选择。在 10% 刷新预算下,该方法在三个 VLM 骨干网络的五个数据集上达到全预填充平均性能的 97.0%-99.5%,在 MMLongBench-Doc 延迟子集上仅使用 13.5% 的 FLOPs,并实现 2.99 倍的首令牌时间加速,且无需修改模型架构或权重。
| KV cache | 键值缓存,存储注意力计算中的键和值,用于加速推理。 |
| residual-stream restoration | 残差流恢复,一种将缓存重用视为恢复残差流中信息的方法。 |
| norm-weighted attention | 范数加权注意力,一种结合值范数来调整注意力权重的机制。 |
| visual-token budget | 视觉令牌预算,指在刷新缓存时允许重算的视觉令牌数量上限。 |
| time-to-first-token | 首次令牌时间,从输入到生成第一个输出令牌的延迟。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅