这篇文章厘清了LLM模型格式中常被混淆的两个层面:容器与量化方法。容器决定张量在磁盘上的存储方式,如safetensors、GGUF和PyTorch pickle;量化方法则决定权重被压缩到多少比特,如GPTQ、AWQ、bitsandbytes NF4及llama.cpp的K-quants。文章指出,多数GPTQ、AWQ、EXL2模型实际仍以safetensors存储,量化信息存在于张量内容和配置文件中,而非新容器。EXL2和EXL3则较为特殊,将量化方法与存储布局绑定于特定推理库。文章还给出权重内存的估算公式:参数量乘以每权重比特数再除以8,并对比了16位与约4.5位量化下8B和70B模型的内存占用。此外,文章强调safetensors相比pickle格式消除了任意代码执行的安全风险,并介绍了GGUF作为llama.cpp生态二进制格式的由来及其采用类型化键值元数据的设计优势。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅