🔥 今日值得一读 仅保护1/8头部,低比特VLM准确率从0.436飙至0.580!
HeadGuard: Selective Head Protection for Low-Bit VLM KV-Cache Quantization
arXiv LG (cs.LG) 🔥 重点 #KV缓存#量化#多模态#推理优化 🕐 09-30 12:00
👨‍💼 主理人解读 · 为什么值得关注
部署VLM时,用它保护约1/8敏感KV头为BF16,在低比特量化下保住精度。

📖 AI 总结

HeadGuard 是一种针对视觉语言模型(VLM)低比特 KV 缓存量化的选择性注意力头保护方法。研究指出,低比特 KV 缓存量化虽能节省存储,却会显著损害 VLM 精度。为此,作者提出通过图像敏感度和输出敏感度评分,离线筛选出约八分之一的物理 KV 头,将其图像键(可选值)保留为 BF16 高精度,其余条目交由基础量化器处理。在八个 VLM、三种基础量化器和八个基准上评估,HeadGuard 在较弱量化器上恢复了相当比例的精度损失,Qwen 与 InternVL 收益最明显。2 比特下,八模型六任务判别均值从 0.436 提升至 0.580,生成答案与描述保真度也有改善。该方法可组合、无需替换底层量化器,仅保护键即可在较低存储成本下保持显著恢复效果。

🔑 关键词速览

KV 缓存量化对键值缓存中的键和值进行低比特压缩,以减少存储和计算开销。
HeadGuard一种可组合的头部保护方法,通过固定高精度掩码保护部分 KV 头,提升低比特量化下 VLM 的准确率。
视觉语言模型(VLM)同时处理视觉和文本信息的模型,如 Qwen 和 InternVL,用于跨模态任务。
图像敏感性/输出敏感性分数用于离线选择需要保护的 KV 头的指标,分别衡量头对图像输入和模型输出的影响程度。
bfloat16(BF16)一种 16 位浮点格式,具有较宽的动态范围,常用于深度学习中的高精度计算。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅