🔥 今日值得一读 实测6倍存储缩减!KV缓存量化竟能无感提速,2.0位悬崖前轻松保质量
SemKV: Semantic Mixed-Precision KV Cache Quantization Guided by the Quality Cliff for Long-Context LLM Inference
arXiv LG (cs.LG) 🔥 重点 #推理优化#KV缓存#量化 🕐 09-01 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法压缩KV缓存内存,同时保持长上下文LLM输出质量,适用于资源受限的部署。

📖 AI 总结

该论文提出了一种名为SemKV的语义混合精度KV缓存量化方法,用于优化长上下文大语言模型推理中的内存瓶颈。研究发现,均匀KV量化在分数位网格上存在“质量悬崖”现象:Llama-3.1-8B-Instruct模型在2.322位时与FP16精度统计上无差异,但在2.0位时性能骤降,且该现象在多种模型和场景中普遍存在。基于此,SemKV保留所有token,利用模型内部评分对token排序,并分配两种相邻的悬崖以上精度,实现了6.0倍的存储压缩且无统计可检测的质量损失,优于在1.5倍内存预算下的FP16 token剪枝方法。通过采用失真优化的量化器,可将无损失运行点提升至7.9倍压缩。该方法的核心策略是先测量目标部署环境的质量悬崖,再在其上方进行精度插值。

🔑 关键词速览

KV cache键值缓存,存储注意力机制中的键和值,是长上下文LLM推理的主要内存瓶颈。
quality cliff质量悬崖,指量化精度低于某个阈值时模型性能急剧下降的现象。
mixed-precision quantization混合精度量化,对不同部分使用不同位宽进行量化,以平衡精度和内存。
affine quantizer仿射量化器,一种线性量化方法,通过缩放和偏移将浮点数映射到整数。
TurboQuant-MSE一种基于最小均方误差优化的量化器,用于降低质量悬崖并提升量化性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅