🔥 今日值得一读 LLM量化新突破!REAL-Q动态梯度下降,端到端KL散度直降49%!
REAL-Q: E2E LLM Quantization via Dynamic Gradient Descent
arXiv LG (cs.LG) 🔥 重点 #量化#推理优化#训练方法 🕐 09-02 12:00
👨‍💼 主理人解读 · 为什么值得关注
提供更精确的LLM量化方案,开发者可用其在资源受限环境下部署高性能模型。

📖 AI 总结

REAL-Q提出了一种面向大语言模型(LLM)的后训练量化(PTQ)新范式,旨在解决现有方法中因过度近似全局损失而导致的“信息错位”问题。传统PTQ依赖封闭式二阶求解器,但会忽略跨通道耦合并冻结Hessian矩阵,无法适应逐列变化的损失景观。REAL-Q则直接优化端到端对齐的全局损失替代目标,并在每128列块后应用细粒度的动态块级梯度下降,同时引入滑动窗口机制平滑跨层过渡,有效抑制误差在网络中的传播。实验表明,在LLaMA-3.1(8B/70B)和Qwen3(0.6B-32B)模型上,采用W4A16量化配置时,REAL-Q相比最先进的全局引导方法,端到端KL散度最多降低约49%,显著提升了量化模型的性能与部署效率。

🔑 关键词速览

Post-training quantization (PTQ)后训练量化,一种在模型训练完成后进行压缩的技术,通过降低权重和激活的精度来减少模型大小和计算量。
Hessian matrix海森矩阵,二阶偏导数矩阵,用于量化中估计损失函数的曲率,指导量化误差最小化。
Block-wise Gradient Descent分块梯度下降,一种优化方法,将参数分成块,逐块进行梯度更新,以降低计算复杂度并提高精度。
KL divergenceKL散度,衡量两个概率分布差异的指标,用于评估量化前后模型输出的相似性。
W4A16一种量化配置,表示权重为4位,激活为16位,常用于LLM部署中的精度与效率平衡。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅