🔥 今日值得一读 GPT-6 Astra拦下99.99%攻击,但藏文档里仍8.5%被破!
OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections
The Decoder 🔥 重点 大模型安全对齐 🕐 09-05 01:23

📖 AI 总结

OpenAI发布的GPT-6 Astra在减少幻觉和防御提示注入攻击方面较前代GPT-5.6 Sol有显著提升。根据OpenAI系统卡,Astra在用户标记的错误案例中复现错误的频率大幅降低,尤其在低延迟和低推理设置下改进最明显。在直接提示注入防御上,Astra达到99.99%的拦截率,这归功于训练中使用的GPT-Red自动化攻击方法。面对已知越狱攻击,Astra在91.5%至98.3%的情况下拒绝生成有害内容,但在多轮对话中,防御率降至约67%,意味着顽固攻击者仍有约三分之一的机会诱出问题响应。间接提示注入方面,安全公司Gray Swan测试显示,Astra在15次尝试内被破解的概率为8.5%,远低于前代的27%,但该风险仍不容忽视。总体而言,Astra的进步显著,但距离安全可靠的AI代理部署仍有差距。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅