🔥 今日值得一读 8B模型仅1.36倍困惑度,保留78.5%能力,8.24GiB无损打包!
Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution
arXiv LG (cs.LG) 🔥 重点 #模型量化#三值化#推理优化#Qwen 🕐 09-10 12:00
👨‍💼 主理人解读 · 为什么值得关注
想在消费级硬件跑8B模型时,可参考这套三值化流程压缩权重并保持能力。

📖 AI 总结

本文研究将激进的训练后三值化流程从Qwen3-4B扩展至Qwen3-8B,采用KOTMS旋转、E2M-ATQ自适应三值化和GPTQ式误差补偿,在权重-only的A16配置下完成转换。作者强调算法本身并非创新,贡献在于端到端的规模化验证,包括外部复现、4B/8B能力对比、跨语料困惑度、有效比特核算、无损格点打包及直接打包执行。8B模型三语料困惑度比为1.361倍,八项零样本任务平均准确率64.6%,相比FP16的72.4%保留78.5%的机会校正能力,绝对损失7.8个百分点;匹配的4B运行仅保留69.6%,8B领先8.9个百分点。打包检查点为8.24 GiB且困惑度无损,直接执行达15.52 tokens/s、占用7.35 GiB,但打包GEMV仍慢于FP16 cuBLAS。结果表明模型规模能提升对训练后离散化的鲁棒性,序列化与直接执行均可行,而更广的随机种子、校准分布与内核优化仍有待探索。

🔑 关键词速览

KOTMS rotation一种用于权重矩阵的旋转技术,旨在改善量化后的数值稳定性。
E2M-ATQ adaptive ternarisation一种自适应三值化方法,将权重映射到{-1, 0, 1},并可能结合指数移动平均等自适应策略。
GPTQ-style error compensation受GPTQ启发的误差补偿机制,在量化过程中逐层补偿量化误差以减少精度损失。
A16 configuration指激活值保持16位精度,而权重被量化到超低比特(如1.58位)的混合精度配置。
lossless lattice-aware packing一种考虑格结构的无损打包方法,将三值权重高效存储为紧凑格式而不损失信息。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅