本文提出了一种名为FAMPWQ的Fisher信息自适应混合精度权重量化方法,旨在解决大语言模型在资源受限设备上的部署难题。传统量化方法因采用统一位宽或简单启发式敏感性评估,常导致性能严重下降。FAMPWQ首先引入Fisher信息度量来评估各层对量化的敏感性,随后利用基于强化学习的位宽分配器,依据该敏感性指标生成自适应的逐层位宽分配策略。实验覆盖7个模型和5个基准,结果显示FAMPWQ在困惑度(最高降低3.39)、准确率(最高提升6.87%)以及LLM-as-a-judge对比(最高76%胜率)上均显著优于7种基线方法。该研究为在商品GPU上实现高效且性能损失更小的LLM推理提供了新思路。
| Fisher Information | 一种衡量参数估计不确定性的统计量,用于评估模型各层对量化的敏感度。 |
| Adaptive Mixed Precision Weight Quantization | 一种根据层敏感性动态分配不同位宽进行权重量化的方法,以平衡模型精度和资源消耗。 |
| Reinforcement Learning-based Bit-width Allocator | 利用强化学习算法自动生成最优位宽分配策略的组件,基于敏感性度量优化量化配置。 |
| PPL (Perplexity) | 困惑度,衡量语言模型预测能力的指标,值越低表示模型性能越好。 |
| LLM-as-a-judge | 一种评估方法,使用大型语言模型作为评判者来比较不同模型输出的质量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅