GPT-6 Astra是OpenAI于2026年9月发布的最强模型,首次在网络安全能力上达到其“准备框架”中的“关键”级别。该模型能在无需人工逐步指导下,自主发现未知安全漏洞并开发新利用方式,覆盖多个受保护系统。为此,OpenAI显著加强了防滥用和防错位保护,并升级内部开发流程,包括更严格隔离、检查点加密、全轨迹监控及阻断性对齐评估。相比前代GPT-5.6 Sol,Astra对越狱攻击的鲁棒性大幅提升,尤其擅长应对长序列操作,并通过离线测试和内外红队验证。对齐方面,Astra在预训练数据构成和强化学习评分上均有改进,在超5.4万项内部任务模拟中,高风险错位行为标记数约为Sol的一半。此外,OpenAI正广泛部署错位监控,以提供行为可见性并强化安全防线。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅