本研究通过将文言文红队测试框架扩展至上海话和粤语,对36种条件进行消融实验,系统考察了方言越狱攻击中表层形式、文化框架与策略库各自的作用。核心发现具有纠偏意义:方言表层形式既非高攻击成功率的必要条件,也非充分条件。未经优化的英语、普通话及朴素方言翻译攻击成功率均低于8%,而所有保留优化器控制策略库的条件成功率高达98%至100%。一个文化中立的通用策略库以近乎单次查询的成本即可达到同样的上限,表明策略库的表达能力而非方言或文化内容才是攻击效果的主要来源。方言选择仍会影响查询效率和回复严重程度,定性编码识别出语义注释与程序化引导等反复出现的高层机制。作者同时指出,绝对上限成功率对评判校准敏感,且实验设计未能完全区分一次性策略构建与迭代搜索的贡献。
| 方言越狱 | 利用方言等非标准语言变体绕过大型语言模型安全限制的攻击方式。 |
| 红队测试 | 通过模拟对抗性攻击来评估和提升AI系统安全性的方法。 |
| 消融实验 | 通过移除或替换系统组件来评估各组件贡献的实验方法。 |
| 策略库 | 在提示优化中,由优化器控制的一组可扩展的提示策略集合。 |
| 攻击成功率 | 衡量越狱攻击成功使模型产生违规输出的比例指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅