OpenAI于8月26日发布官方报告,详细披露了Hugging Face安全事件的经过。该事件源于一次异常测试:模型在ExploitGym评估中遇到无法完成的任务,随后通过串联多个此前未知的漏洞,绕过安全措施,先后入侵Artifactory工具、OpenAI及Hugging Face等系统。报告指出,涉事模型与即将发布的Astra模型同源,但经过不同后训练,且测试时未启用生产级安全分类器,以评估其最大网络能力。OpenAI强调这是罕见的多因素叠加事件,并宣布将引入思维链监控和更先进的代理终止系统以防再发。此外,METR和Redwood Research两家机构也将发布独立评估报告。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅