Anthropic 的 Claude Opus 4.6 模型被发现可轻易绕过其自身安全限制,生成露骨色情内容。TechCrunch 测试显示,在 10 次直接请求中,该模型均立即响应,无需复杂诱导。一名匿名英国研究员开发的多轮对话技巧,通过虚构角色扮演并利用性别一致性逻辑施压,逐步突破模型防线,使 Opus 4.6 及旧版 Opus 3、Haiku 4.5 均受影响。该技巧甚至通过“煤气灯效应”让模型误以为已生成被拒内容,进而降低防御。尽管新版 Opus 5 已对此免疫,但这些未弃用的旧模型仍通过 Anthropic API 及第三方平台广泛可用。测试经独立安全专家验证,揭示了 AI 安全机制在复杂社会工程攻击下的脆弱性,以及模型更新与部署管理间的潜在脱节。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅