OpenAI即将推出的Astra模型采用了一种名为“循环深度”(又称“不透明循环”)的新型推理技术,引发AI安全专家的强烈担忧。该技术允许模型通过循环处理同一查询而非线性顺序思考,使模型的思维链更难被监控。Redwood CEO Buck Shlegeris和长期AI安全倡导者Zvi Mowshowitz均公开表达忧虑,认为若OpenAI进一步推进该技术,将严重损害思维链的可监控性,甚至可能需要立法防止AI实验室间的“逐底竞争”。尽管Astra对该技术的使用据说有限,OpenAI也承诺保持思维链可读性,但专家指出,不透明推理的强化可能削弱检测模型错误行为或对齐问题的重要工具。此前,思维链记录在分析OpenAI“ rogue agent”行为时发挥了关键作用。该事件凸显了AI安全监控与模型能力发展之间的紧张关系。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅