该研究探讨了在资源受限和端侧设备上部署的小型语言模型(以LLaMA-2-7B-Chat为例)的安全脆弱性问题。作者通过低秩安全子空间分析和参数级安全—效用重要性过滤两种方法,发现模型的安全敏感行为高度集中于稀疏的参数子集,其中MLP层的down_proj是最突出的安全敏感组件,o_proj贡献较小。实验表明,仅修改down_proj中0.19%的模型权重,即可使Basic ASR达到53%、GCG ASR达到56%,而tinyBenchmarks准确率仅从52.2%降至51.6%,说明安全对齐可被极少量参数扰动显著破坏,且对通用能力影响有限。这一发现揭示了端侧模型存在可被定向攻击的缩减故障面,为面向资源受限与智能体场景的针对性故障分析和选择性完整性保护提供了依据。
| LLaMA-2-7B-Chat | Meta发布的开源对话大语言模型,参数量为70亿,常用于端侧部署研究。 |
| down_proj | Transformer模型中MLP模块的下投影层,负责将中间高维特征映射回模型隐藏维度。 |
| ASR (Attack Success Rate) | 攻击成功率,衡量对抗性输入诱导模型产生不安全输出的比例。 |
| GCG (Greedy Coordinate Gradient) | 一种基于梯度的对抗性攻击方法,通过优化输入token序列来绕过模型安全对齐。 |
| tinyBenchmarks | 一种轻量级基准测试集,用于高效评估语言模型在下游任务上的准确率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅