免训练量化新突破!PRQuant平均精度超越MXFP4,推理延迟大幅降低
PRQuant: Permutation Residual Quantization for Low-Overhead Inference
arXiv LG (cs.LG) 重要 量化推理加速论文方法 🕐 今天 12:00

📖 AI 总结

本文提出PRQuant,一种免训练、低开销的量化框架,旨在解决线性层低比特量化中由少量离群值主导精度的问题。现有平滑、旋转或残差类方法虽能缓解该问题,却往往给权重引入新的精度瓶颈,且多采用在线实现,带来较高执行开销。PRQuant将通道重组与静态权重侧残差补偿相结合:在AWQ式缩放后,识别对权重量化误差贡献最大的输入通道,将其置换为连续尾部块,并离线构建对应的残差权重子张量。该连续结构使激活侧在推理时无需昂贵的在线收集操作,并将分散的残差补偿转化为规则的尾部增强GEMM,显著降低延迟。实验表明,PRQuant有效降低了下投影重建误差;消融研究确认平滑与残差补偿是数值提升的主要来源,置换则提供稳定的边际收益,更重要的是实现了硬件友好的连续布局。在五个下游基准上,PRQuant平均精度优于默认MXFP4及所评估的PTQ基线,在Qwen3-4B-Instruct-2507和Qwen3-30B-A3B-Instruct-2507上分别较MXFP4提升1.24和0.55。

🔑 关键词速览

PRQuant本文提出的免训练低开销量化框架,通过通道置换与静态残差补偿降低量化误差。
Permutation Residual Quantization置换残差量化,将高误差通道重排为连续尾部块并离线补偿残差,以提升推理效率。
AWQ-style scaling一种激活感知的权重量化缩放方法,用于抑制离群值对量化精度的影响。
MXFP4一种4比特微缩放浮点量化格式,作为本文对比的默认低比特基线。
PTQ训练后量化,在模型训练完成后直接对权重和激活进行低比特量化。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅