本文提出了一种名为 NeuronFuzz 的白盒模糊测试框架,用于评估大型语言模型(LLM)的安全性。现有自动化测试方法依赖响应级反馈,需生成目标模型回复,成本高昂且对强对齐模型指导稀疏。NeuronFuzz 利用内部安全神经元作为连续执行反馈,通过 SafetyOracle 将神经元激活转化为连续安全警报分数,该分数可在预填充阶段获取,从而省去生成环节。SafetyOracle 采用模板不变的有害/良性输入和稳定性感知选择,识别紧凑的安全神经元集。由于分数可微分,NeuronFuzz 利用梯度定位安全敏感模板位置,并通过掩码语言模型生成流畅、上下文兼容的突变。在 21 个文本和多模态模型上的评估显示,对五个白盒源模型的越狱发现率达 76-100%,优于基线最多 48 个百分点;优化模板零样本迁移至开源和六个专有模型,平均攻击成功率(ASR)和集成 ASR 分别达 69.6%/92.6% 和 44.1%/60.0%。
| NeuronFuzz | 一种白盒模糊测试框架,利用内部安全神经元作为连续反馈来评估 LLM 安全性。 |
| SafetyOracle | 将安全神经元激活转换为连续安全警报分数的组件,用于指导模糊测试。 |
| Jailbreak attack | 越狱攻击,通过精心设计的提示绕过 LLM 的安全对齐机制,诱导其生成有害内容。 |
| Fuzzing | 模糊测试,一种通过生成大量变异输入来发现系统漏洞或弱点的自动化测试技术。 |
| ASR (Attack Success Rate) | 攻击成功率,衡量越狱攻击成功触发目标模型生成有害响应的比例。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅