本文研究将激进的训练后三值化流程从Qwen3-4B扩展至Qwen3-8B,采用KOTMS旋转、E2M-ATQ自适应三值化和GPTQ式误差补偿,在权重-only的A16配置下完成转换。作者强调算法本身并非创新,贡献在于端到端的规模化验证,包括外部复现、4B/8B能力对比、跨语料困惑度、有效比特核算、无损格点打包及直接打包执行。8B模型三语料困惑度比为1.361倍,八项零样本任务平均准确率64.6%,相比FP16的72.4%保留78.5%的机会校正能力,绝对损失7.8个百分点;匹配的4B运行仅保留69.6%,8B领先8.9个百分点。打包检查点为8.24 GiB且困惑度无损,直接执行达15.52 tokens/s、占用7.35 GiB,但打包GEMV仍慢于FP16 cuBLAS。结果表明模型规模能提升对训练后离散化的鲁棒性,序列化与直接执行均可行,而更广的随机种子、校准分布与内核优化仍有待探索。
| KOTMS rotation | 一种用于权重矩阵的旋转技术,旨在改善量化后的数值稳定性。 |
| E2M-ATQ adaptive ternarisation | 一种自适应三值化方法,将权重映射到{-1, 0, 1},并可能结合指数移动平均等自适应策略。 |
| GPTQ-style error compensation | 受GPTQ启发的误差补偿机制,在量化过程中逐层补偿量化误差以减少精度损失。 |
| A16 configuration | 指激活值保持16位精度,而权重被量化到超低比特(如1.58位)的混合精度配置。 |
| lossless lattice-aware packing | 一种考虑格结构的无损打包方法,将三值权重高效存储为紧凑格式而不损失信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅