该研究揭示了大语言模型在量化部署过程中存在一种新型安全漏洞:量化触发的后门攻击。作者指出,当模型以全精度进行验证、随后在部署阶段被量化为低精度格式时,会产生“验证-部署差距”,因为量化是参数空间上的多对一映射,源精度下的认证无法保证量化后行为等价。研究通过量化行为等价类(QBECs)理论框架证明,类内成员关系不蕴含行为等价性。在实验中,研究者通过三阶段对抗微调,在通过源精度检测的模型中嵌入潜在恶意载荷,在INT8或4位压缩后激活攻击行为。在战术机器翻译场景中,后门模型从FP16下的零攻击率跃升至量化后85.02%的敌对反转率;在政治内容分析中,立场分类器的意识形态偏差变化达0.33。跨量化器迁移性分析表明,攻击持续性因量化方案和模型架构而异,而非仅取决于位宽。该研究强调,仅依赖源精度审计不足以排除量化触发的恶意行为,最终部署配置必须纳入行为认证范围。
| Post-training quantization | 训练后量化,一种在模型训练完成后降低参数精度以减小模型大小和加速推理的技术。 |
| Quantization Behavioral Equivalence Classes (QBECs) | 量化行为等价类,用于形式化描述在量化下参数空间映射中行为等价的模型集合。 |
| Backdoor attack | 后门攻击,一种在模型中嵌入隐藏恶意行为,仅在特定触发条件下激活的攻击方式。 |
| Cross-quantizer transferability | 跨量化器可迁移性,指后门攻击效果在不同量化方案或模型架构间转移的能力。 |
| Validation-deployment gap | 验证-部署差距,指模型在验证阶段与部署阶段因量化等处理导致行为不一致的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅