🔥 今日值得一读 Qwen-4B暴力压缩到1.64位!模型瘦身52%,性能只掉15%
Post-Training Ternarization of Qwen3-4B Capability, Effective Bit Budget, Storage Compression, and Deployment
arXiv AI (cs.AI) 🔥 重点 #模型压缩#推理优化#部署 🕐 09-03 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法将4B模型三值化,降低存储和带宽需求,同时评估能力损失,适用于边缘部署。

📖 AI 总结

该研究探讨了将Qwen3-4B指令微调模型进行端到端后训练三值化的可行性与代价。实验采用仅权重量化方案,通过KOTMS旋转、E2M-ATQ三值化和GPTQ风格误差补偿,最终实现每权重1.641有效比特,覆盖81.62%的模型参数。结果显示,模型在十项能力评测中平均准确率从64.5%降至54.7%,且退化不均衡——BoolQ保留84.6%的教师性能,而ARC-Challenge仅保留43.8%;困惑度在多个数据集上显著上升。后续打包压缩将模型从8.29 GiB降至3.96 GiB且不损失精度,但第三方打包方案有损被排除。初步基准测试显示,压缩后的Triton GEMV比FP16 cuBLAS慢4.6倍,因此作者明确不主张压缩能加速推理。该研究揭示了超低位量化在存储效率与能力保留之间的复杂权衡。

🔑 关键词速览

KOTMS rotation一种用于旋转权重矩阵以减少量化误差的预处理技术,可能基于正交变换或随机旋转。
E2M-ATQ ternarization一种将权重三值化(如-1, 0, 1)的自适应训练后量化方法,E2M可能指误差补偿或能量效率优化。
GPTQ-style error compensation基于GPTQ(生成式预训练变换器量化)的误差补偿方法,通过最小化输出误差来调整量化权重。
TWLA可能指一种权重和激活的联合优化或误差补偿框架,具体缩写含义需上下文确认。
ILA-AMP可能指一种激活量化和混合精度技术,此处因激活保持16位而省略。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅