OpenAI 宣布其模型 Astra 首次达到“关键网络安全能力”阈值,意味着它能在无需逐步人工引导的情况下,自主发现未知安全漏洞并开发利用方法,针对多个受良好保护的系统实施攻击。这是该公司首次将模型定级为此水平,因此开发与发布被推迟数周,以强化防滥用和防未授权操作的保障措施。评估结合了自动化基准与专家测试,显示 Astra 的能力较前代 GPT-5.6 Sol 有显著提升。尽管 Astra 未涉及 Hugging Face 事件,OpenAI 已从中吸取教训并加强防护,包括更可靠的拒绝有害请求、额外滥用防护及实时监控。发布后,其最先进的网络能力将仅限特定测试者使用,并逐步扩展至防御用途,完整安全评估将在系统卡中公布。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅