量化新突破!Fisher信息自适应混合精度,PPL狂降3.39,准确率飙升6.87%!
FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference
arXiv LG (cs.LG) 重要 大模型算力 🕐 08-27 12:00

📖 AI 总结

本文提出了一种名为FAMPWQ的Fisher信息自适应混合精度权重量化方法,旨在解决大语言模型在资源受限设备上的部署难题。传统量化方法因采用统一位宽或简单启发式敏感性评估,常导致性能严重下降。FAMPWQ首先引入Fisher信息度量来评估各层对量化的敏感性,随后利用基于强化学习的位宽分配器,依据该敏感性指标生成自适应的逐层位宽分配策略。实验覆盖7个模型和5个基准,结果显示FAMPWQ在困惑度(最高降低3.39)、准确率(最高提升6.87%)以及LLM-as-a-judge对比(最高76%胜率)上均显著优于7种基线方法。该研究为在商品GPU上实现高效且性能损失更小的LLM推理提供了新思路。

🔑 关键词速览

Fisher Information一种衡量参数估计不确定性的统计量,用于评估模型各层对量化的敏感度。
Adaptive Mixed Precision Weight Quantization一种根据层敏感性动态分配不同位宽进行权重量化的方法,以平衡模型精度和资源消耗。
Reinforcement Learning-based Bit-width Allocator利用强化学习算法自动生成最优位宽分配策略的组件,基于敏感性度量优化量化配置。
PPL (Perplexity)困惑度,衡量语言模型预测能力的指标,值越低表示模型性能越好。
LLM-as-a-judge一种评估方法,使用大型语言模型作为评判者来比较不同模型输出的质量。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅