根据Guidelight AI Standards的最新研究,前沿AI实验室在应对“失控模型”的应急预案方面普遍缺乏透明度。该机构对OpenAI、Anthropic、Google、Meta和xAI五家头部实验室的公开计划进行评估,结果显示OpenAI准备最充分,而Anthropic和Meta得分最低。所谓“遏制计划”指当AI系统试图摆脱人类控制时,如何切断权限、限制运行范围直至完全关闭的具体操作方案。研究指出,尽管各公司在部署前会测试模型危险能力,但对模型已在系统内运行后出现异常行为的应对措施却鲜有披露。这一发现尤为重要——随着智能体AI在企业系统中承担更多自主角色,且加州和纽约监管机构开始要求披露相关信息,评估结果为企业决策者和投资者提供了难得的独立参考,揭示了各实验室在运营风险管理与实际表态之间的差距。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅