OpenAI宣布其即将发布的AI模型Astra成为首个达到公司“关键”网络能力阈值的模型,这意味着它能独立发现并利用真实软件中的未知漏洞。公司计划很快公开发布Astra,但初期仅向Daybreak Blue项目的选定合作伙伴开放高级网络功能。OpenAI遵循其准备框架,在开发中暂停数周以加强安全措施,现已恢复工作,并确信能安全发布。此举正值硅谷应对前沿AI网络安全能力之际,OpenAI还引入“错位监控器”等机制,防止用户滥用,测试显示其拒绝不安全查询的成功率显著提升。尽管存在挑战,OpenAI强调多周暂停富有成效,并已实施额外控制措施,以平衡创新与安全。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅