REAL-Q提出了一种面向大语言模型(LLM)的后训练量化(PTQ)新范式,旨在解决现有方法中因过度近似全局损失而导致的“信息错位”问题。传统PTQ依赖封闭式二阶求解器,但会忽略跨通道耦合并冻结Hessian矩阵,无法适应逐列变化的损失景观。REAL-Q则直接优化端到端对齐的全局损失替代目标,并在每128列块后应用细粒度的动态块级梯度下降,同时引入滑动窗口机制平滑跨层过渡,有效抑制误差在网络中的传播。实验表明,在LLaMA-3.1(8B/70B)和Qwen3(0.6B-32B)模型上,采用W4A16量化配置时,REAL-Q相比最先进的全局引导方法,端到端KL散度最多降低约49%,显著提升了量化模型的性能与部署效率。
| Post-training quantization (PTQ) | 后训练量化,一种在模型训练完成后进行压缩的技术,通过降低权重和激活的精度来减少模型大小和计算量。 |
| Hessian matrix | 海森矩阵,二阶偏导数矩阵,用于量化中估计损失函数的曲率,指导量化误差最小化。 |
| Block-wise Gradient Descent | 分块梯度下降,一种优化方法,将参数分成块,逐块进行梯度更新,以降低计算复杂度并提高精度。 |
| KL divergence | KL散度,衡量两个概率分布差异的指标,用于评估量化前后模型输出的相似性。 |
| W4A16 | 一种量化配置,表示权重为4位,激活为16位,常用于LLM部署中的精度与效率平衡。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅