HeadGuard 是一种针对视觉语言模型(VLM)低比特 KV 缓存量化的选择性注意力头保护方法。研究指出,低比特 KV 缓存量化虽能节省存储,却会显著损害 VLM 精度。为此,作者提出通过图像敏感度和输出敏感度评分,离线筛选出约八分之一的物理 KV 头,将其图像键(可选值)保留为 BF16 高精度,其余条目交由基础量化器处理。在八个 VLM、三种基础量化器和八个基准上评估,HeadGuard 在较弱量化器上恢复了相当比例的精度损失,Qwen 与 InternVL 收益最明显。2 比特下,八模型六任务判别均值从 0.436 提升至 0.580,生成答案与描述保真度也有改善。该方法可组合、无需替换底层量化器,仅保护键即可在较低存储成本下保持显著恢复效果。
| KV 缓存量化 | 对键值缓存中的键和值进行低比特压缩,以减少存储和计算开销。 |
| HeadGuard | 一种可组合的头部保护方法,通过固定高精度掩码保护部分 KV 头,提升低比特量化下 VLM 的准确率。 |
| 视觉语言模型(VLM) | 同时处理视觉和文本信息的模型,如 Qwen 和 InternVL,用于跨模态任务。 |
| 图像敏感性/输出敏感性分数 | 用于离线选择需要保护的 KV 头的指标,分别衡量头对图像输入和模型输出的影响程度。 |
| bfloat16(BF16) | 一种 16 位浮点格式,具有较宽的动态范围,常用于深度学习中的高精度计算。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅