本文提出PRQuant,一种免训练、低开销的量化框架,旨在解决线性层低比特量化中由少量离群值主导精度的问题。现有平滑、旋转或残差类方法虽能缓解该问题,却往往给权重引入新的精度瓶颈,且多采用在线实现,带来较高执行开销。PRQuant将通道重组与静态权重侧残差补偿相结合:在AWQ式缩放后,识别对权重量化误差贡献最大的输入通道,将其置换为连续尾部块,并离线构建对应的残差权重子张量。该连续结构使激活侧在推理时无需昂贵的在线收集操作,并将分散的残差补偿转化为规则的尾部增强GEMM,显著降低延迟。实验表明,PRQuant有效降低了下投影重建误差;消融研究确认平滑与残差补偿是数值提升的主要来源,置换则提供稳定的边际收益,更重要的是实现了硬件友好的连续布局。在五个下游基准上,PRQuant平均精度优于默认MXFP4及所评估的PTQ基线,在Qwen3-4B-Instruct-2507和Qwen3-30B-A3B-Instruct-2507上分别较MXFP4提升1.24和0.55。
| PRQuant | 本文提出的免训练低开销量化框架,通过通道置换与静态残差补偿降低量化误差。 |
| Permutation Residual Quantization | 置换残差量化,将高误差通道重排为连续尾部块并离线补偿残差,以提升推理效率。 |
| AWQ-style scaling | 一种激活感知的权重量化缩放方法,用于抑制离群值对量化精度的影响。 |
| MXFP4 | 一种4比特微缩放浮点量化格式,作为本文对比的默认低比特基线。 |
| PTQ | 训练后量化,在模型训练完成后直接对权重和激活进行低比特量化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅