SCULPT是一种面向边缘视觉模型的训练方法,旨在提升模型在后训练量化(PTQ)中的表现。边缘模型在资源受限硬件上部署时,低比特量化常因激活分布的重尾和异常值导致精度下降,而现有方案如量化感知训练(QAT)或事后修复PTQ方法各有局限。SCULPT在标准FP32微调阶段引入拓扑感知正则化器,抑制不利于量化的偏度和峰度,并结合基于百分位数的稳定裁剪机制,学习可直接用于部署的激活边界。该方法无需在训练中模拟量化,也无需运行时变换,学习到的边界可直接导出至标准PTQ流程,支持INT8及W4A8等更低比特设置。该研究发表于IMVIP 2026,为低比特部署提供了一种简化且有效的训练端解决方案。
| Post-Training Quantization (PTQ) | 后训练量化,一种在模型训练完成后将其权重和激活从高精度浮点数转换为低比特表示的技术,以减少模型大小和推理延迟。 |
| Quantization-Aware Training (QAT) | 量化感知训练,一种在训练过程中模拟量化效果以提升模型量化鲁棒性的方法,但会增加训练复杂度和位宽耦合。 |
| SCULPT | 本文提出的方法,通过统计裁剪和均匀损失在训练阶段提升模型对后训练量化的就绪性,无需模拟量化。 |
| Activation Distribution | 激活分布,指神经网络中每层输出的数值分布,其形状(如重尾)会影响量化精度。 |
| Clipping Bound | 裁剪边界,量化时用于限制激活值范围的阈值,超出部分被截断,以优化量化区间利用。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅