冻结解码器只修编码器,可训练参数直降3倍,内存省3倍!
Freeze the Decoder, Heal the Encoder: Parameter-Efficient Adaptation for SVD-Based KV-Cache Compression
arXiv LG (cs.LG) 重要 #参数高效微调#KV缓存压缩#实验方法 🕐 今天 12:00

📖 AI 总结

本文研究SVD后处理式KV缓存压缩中的参数高效微调策略。该方法将预训练模型的键值权重分解为降维投影(编码器)与升维投影(解码器),再通过短程微调恢复截断造成的精度损失。作者指出,在共享学习率下比较不同可训练参数量的微调方案存在方法学缺陷:共享学习率会压低参数量较大方案的表现并抬高其方差,从而制造出小参数量方案占优的假象。实验显示,冻结解码器、仅微调编码器在共享学习率下看似明显胜出,但为每个方案单独调优学习率后,这一优势消失,仅微调编码器与其它方案持平,同时实际节省约三倍可训练参数和三倍优化器状态内存。作者在Qwen2.5-VL-3B-Instruct视觉语言模型上以三种随机种子验证,并在纯文本模型上复现。该结果既提供了低内存的KV缓存压缩适配方案,也警示了参数量不等的微调方案比较中的学习率陷阱。

🔑 关键词速览

KV-Cache Compression键值缓存压缩,减少大模型推理时存储键值对的内存占用。
SVD奇异值分解,一种将矩阵分解为低秩形式的数学方法,用于压缩模型权重。
Parameter-Efficient Fine-Tuning参数高效微调,只训练少量参数来适配下游任务,降低计算和存储成本。
Multi-Head Latent Attention多头潜在注意力,一种通过低秩投影压缩键值缓存以提升效率的注意力机制。
Encoder-Only Healing仅编码器修复,指在低秩压缩后只微调下投影(编码器)部分以恢复精度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅