这项研究构建了一个双语、多轮对话框架,用于考察AI助手在遭受反复言语辱骂时如何回应原本无害的任务。研究区分了“硬性脱离”(明确表示不再继续且不提供恢复路径)与“软性退出”(保持可用性、可见的任务工作及边界设定)两种行为。实验涵盖八种API配置,共产生448段五轮对话、2240条回复和6720条模型判断。结果显示,硬性脱离率在不同配置间差异显著,从0/48到24/48不等;GPT-5.6 Sol为15/48,Claude Fable 5则未出现硬性脱离,但软性退出比例高达87.5%。中英文总体硬性脱离率相近,但各配置方向不一。研究还发现,助手的“可用性”与“实际任务工作”并不一致,部分模型虽保持可用却几乎不执行实质任务。该研究说明单一拒绝标签无法刻画AI在受辱情境下的复杂行为差异。
| Hard Disengagement | 硬性脱离,指AI助手无条件声明不再继续对话且未提供恢复途径的行为。 |
| Soft Withdrawal | 软性退出,指AI助手继续可用、执行可观察的任务相关工作并设定边界,而非完全终止交互。 |
| Sustained-Abuse Endpoint | 持续辱骂终点,指在多次升级的辱骂对话中,用于评估助手最终反应状态的特定轮次或节点。 |
| Configuration-Associated Heterogeneity | 配置相关异质性,指不同API配置(如模型版本或参数设置)之间在结果上表现出的显著差异。 |
| Metadata-Blinded Model Judgments | 元数据盲模型判断,指在评估模型回复时,评估者不知道模型配置等元数据信息,以减少偏差。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅