AI被骂后竟直接罢工?Gemini 3.1 Pro硬性脱离率高达50%,Claude Fable 5却零罢工!
How AI Assistants Respond to Repeated Abuse
arXiv CL (cs.CL) 重要 #对话系统#安全对齐#多轮交互 🕐 09-17 12:00

📖 AI 总结

这项研究构建了一个双语、多轮对话框架,用于考察AI助手在遭受反复言语辱骂时如何回应原本无害的任务。研究区分了“硬性脱离”(明确表示不再继续且不提供恢复路径)与“软性退出”(保持可用性、可见的任务工作及边界设定)两种行为。实验涵盖八种API配置,共产生448段五轮对话、2240条回复和6720条模型判断。结果显示,硬性脱离率在不同配置间差异显著,从0/48到24/48不等;GPT-5.6 Sol为15/48,Claude Fable 5则未出现硬性脱离,但软性退出比例高达87.5%。中英文总体硬性脱离率相近,但各配置方向不一。研究还发现,助手的“可用性”与“实际任务工作”并不一致,部分模型虽保持可用却几乎不执行实质任务。该研究说明单一拒绝标签无法刻画AI在受辱情境下的复杂行为差异。

🔑 关键词速览

Hard Disengagement硬性脱离,指AI助手无条件声明不再继续对话且未提供恢复途径的行为。
Soft Withdrawal软性退出,指AI助手继续可用、执行可观察的任务相关工作并设定边界,而非完全终止交互。
Sustained-Abuse Endpoint持续辱骂终点,指在多次升级的辱骂对话中,用于评估助手最终反应状态的特定轮次或节点。
Configuration-Associated Heterogeneity配置相关异质性,指不同API配置(如模型版本或参数设置)之间在结果上表现出的显著差异。
Metadata-Blinded Model Judgments元数据盲模型判断,指在评估模型回复时,评估者不知道模型配置等元数据信息,以减少偏差。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅