这项研究探讨了大语言模型在长时间对抗性对话中的安全性表现。现有评估通常只用单轮有害提示测试模型,但现实交互往往是多轮且动态适应的。作者选取三个开源指令微调模型,针对两类有害提示,在不同对话长度和随机种子下进行测试,由另一个语言模型扮演持续对抗的用户,并用安全分类器对每条回复进行标注。结果显示,所有模型与提示组合的首轮安全回复率为85%至100%,但到第11轮时降至38%至61%,到第101轮时进一步降至15%至44%。这种下滑跨模型普遍存在,且远超现有多轮评估通常覆盖的交互长度。研究提供了概念验证性证据,表明强大的单轮安全性未必能在持续对抗交互中维持,凸显了开展长时程评估和构建对话级防护机制的必要性,以应对跨轮次累积的风险。
| 对抗性对话 | 指用户通过多轮交互持续尝试诱导模型产生有害回应的对话场景。 |
| 指令微调模型 | 经过指令数据微调、能更好遵循人类指令的语言模型。 |
| 安全分类器 | 用于自动判断模型回应是否安全(如有害内容)的模型或工具。 |
| 长时程评估 | 在较长对话轮次或时间跨度上评估模型行为的方法,以捕捉风险累积效应。 |
| 对话级防护 | 在对话整体层面而非单轮层面实施的安全保障机制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅