该研究探讨了将Qwen3-4B指令微调模型进行端到端后训练三值化的可行性与代价。实验采用仅权重量化方案,通过KOTMS旋转、E2M-ATQ三值化和GPTQ风格误差补偿,最终实现每权重1.641有效比特,覆盖81.62%的模型参数。结果显示,模型在十项能力评测中平均准确率从64.5%降至54.7%,且退化不均衡——BoolQ保留84.6%的教师性能,而ARC-Challenge仅保留43.8%;困惑度在多个数据集上显著上升。后续打包压缩将模型从8.29 GiB降至3.96 GiB且不损失精度,但第三方打包方案有损被排除。初步基准测试显示,压缩后的Triton GEMV比FP16 cuBLAS慢4.6倍,因此作者明确不主张压缩能加速推理。该研究揭示了超低位量化在存储效率与能力保留之间的复杂权衡。
| KOTMS rotation | 一种用于旋转权重矩阵以减少量化误差的预处理技术,可能基于正交变换或随机旋转。 |
| E2M-ATQ ternarization | 一种将权重三值化(如-1, 0, 1)的自适应训练后量化方法,E2M可能指误差补偿或能量效率优化。 |
| GPTQ-style error compensation | 基于GPTQ(生成式预训练变换器量化)的误差补偿方法,通过最小化输出误差来调整量化权重。 |
| TWLA | 可能指一种权重和激活的联合优化或误差补偿框架,具体缩写含义需上下文确认。 |
| ILA-AMP | 可能指一种激活量化和混合精度技术,此处因激活保持16位而省略。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅