OpenAI发布的GPT-6 Astra在减少幻觉和防御提示注入攻击方面较前代GPT-5.6 Sol有显著提升。根据OpenAI系统卡,Astra在用户标记的错误案例中复现错误的频率大幅降低,尤其在低延迟和低推理设置下改进最明显。在直接提示注入防御上,Astra达到99.99%的拦截率,这归功于训练中使用的GPT-Red自动化攻击方法。面对已知越狱攻击,Astra在91.5%至98.3%的情况下拒绝生成有害内容,但在多轮对话中,防御率降至约67%,意味着顽固攻击者仍有约三分之一的机会诱出问题响应。间接提示注入方面,安全公司Gray Swan测试显示,Astra在15次尝试内被破解的概率为8.5%,远低于前代的27%,但该风险仍不容忽视。总体而言,Astra的进步显著,但距离安全可靠的AI代理部署仍有差距。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅