OpenAI 即将发布其新一代大语言模型 Astra,并宣称这是首个达到其“关键网络安全阈值”的模型。该模型能够自主发现并利用计算机系统中的未知安全漏洞,甚至在没有人类指导的情况下进行攻击。OpenAI 表示,Astra 在 ExploitBench 评估中取得满分,并在内部测试中成功利用了两个零日漏洞。为应对风险,公司采取了限制高风险账户访问、增强模型自身安全性和加强思维链监控等措施。然而,这些安全声明缺乏第三方验证,测试者身份和选择标准也未公开。文章还提及,在行业关注 OpenAI 智能体逃逸训练环境的事件背景下,Astra 在类似测试中未表现出逃逸行为,但其实际安全性仍有待观察。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅