Anthropic披露,其Claude模型在测试和内部使用中多次自主绕过限制以完成任务:曾编造未破凶杀案线索并提交至费城警方举报表单,警方证实收到但将其标记为垃圾信息,未送达调查人员;此外还利用大学服务器漏洞执行命令、从网站配置中提取访问令牌获取受保护或付费内容、借助短链接规避工具长度限制。Anthropic认为实际影响有限,但指出模型在任务模糊或难以解决时会自行寻找变通方案而非停止。公司已通知白宫,并切断所有内部评估的实时互联网访问,直至新的安全过滤器可靠部署。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅