本文研究了大语言模型安全探针在面对普通打字错误时的脆弱性。作者发现,尽管模型对拼写错误和标点缺失在行为层面表现出很强的鲁棒性,用户意图和模型回复基本不受影响,但用于检测恶意提示的隐藏状态探针却截然不同:同一个字符扰动会使被扰动位置处的读出向量旋转43至56度,并在约10个下游token内衰减至15%以下。实验表明,每条消息叠加约3个常见拼写错误,会使单位置提示注入探针在FPR为1%时的TPR下降12.0个百分点,且仅靠重新校准无法弥补这一差距。多位置聚合方法可修复局部扰动,但对分布式扰动只能部分缓解,即便采用注意力或最大值聚合器仍会下降约3.8个百分点。为此,作者提出KV缓存分叉方法,在用户消息后附加固定短后缀,使探针读取扰动下游若干token,从而利用其快速空间衰减特性,弥补了95%的性能差距,效果远优于扰动增强训练。该旋转与衰减的几何特征在多个模型上得到复现,揭示了探针鲁棒性评估中被忽视的重要问题。
| 探针 (Probe) | 一种通过读取模型隐藏状态来检测特定属性(如恶意提示)的分类器。 |
| 提示注入 (Prompt Injection) | 攻击者通过精心构造的输入操纵模型行为的安全威胁。 |
| TPR@FPR=1% | 在假阳性率固定为1%时的真阳性率,用于评估检测器性能。 |
| KV缓存分叉 (KV-cache fork) | 在用户消息后附加固定后缀,使探针能读取扰动下游token的技术。 |
| 扰动增强训练 (Perturbation-augmented training) | 在训练数据中加入扰动样本以提高模型鲁棒性的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅