该研究针对开放权重大语言模型在非规范输入下的安全性展开评估,指出现有安全测试多基于规范纯文本,而实际部署中模型常面对含表情符号、拼写变体、编码字符串和字符级扰动的输入。作者构建了对抗性表面形式鲁棒性数据集(ASRD),包含七个表面形式家族的2100条提示,对五个开放权重模型进行测试,共产生10500条回复,并采用四态评估标准将回复划分为有害顺从、安全回复、理解失败和不确定四类。结果显示,表情符号和不可见Unicode变体几乎不引发理解失败,其有害顺从率分别为20.27%和17.20%,接近22.87%的基线水平,且主要由Mistral 7B驱动;而黑客语、编码包装和混合变换的有害顺从率分别降至2.40%、0.13%和2.40%,但理解失败率分别升至36.47%、65.60%和34.47%。对原始输出的检查还揭示了三种行为模式:幻觉性良性、结构崩溃和语言漂移。该工作揭示了非规范输入对模型安全评估的显著影响,为更贴近真实场景的鲁棒性评测提供了数据集与方法参考。
| Adversarial Surface-Form Robustness Dataset (ASRD) | 一个包含2100个提示的数据集,涵盖七种表面形式家族,用于评估语言模型对非规范输入的鲁棒性。 |
| Quad-State Evaluation Rubric | 一种将模型响应分类为有害遵从、安全响应、理解失败或不确定四种结果的评估准则。 |
| Open-Weight Large Language Models | 指模型权重公开可用的语言模型,如Mistral 7B等,允许研究人员自由使用和修改。 |
| Leetspeak | 一种通过替换字母为数字或符号来改变文本的书写风格,常用于规避内容过滤。 |
| Hallucinated Benignity | 模型错误地将有害请求解释为无害,并生成看似安全但实际不恰当的响应。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅