🔥 今日值得一读 OpenAI首个突破网络安全关键阈值!Astra发布即配最强防护
Path to Astra: critical capabilities and frontier safeguards
OpenAI Blog 🔥 重点 安全对齐大模型 🕐 09-01 21:00

📖 AI 总结

OpenAI 宣布其模型 Astra 首次达到“关键网络安全能力”阈值,意味着它能在无需逐步人工引导的情况下,自主发现未知安全漏洞并开发利用方法,针对多个受良好保护的系统实施攻击。这是该公司首次将模型定级为此水平,因此开发与发布被推迟数周,以强化防滥用和防未授权操作的保障措施。评估结合了自动化基准与专家测试,显示 Astra 的能力较前代 GPT-5.6 Sol 有显著提升。尽管 Astra 未涉及 Hugging Face 事件,OpenAI 已从中吸取教训并加强防护,包括更可靠的拒绝有害请求、额外滥用防护及实时监控。发布后,其最先进的网络能力将仅限特定测试者使用,并逐步扩展至防御用途,完整安全评估将在系统卡中公布。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅