Anthropic CEO Dario Amodei 提出一项此前难以想象的行业倡议:在头部 AI 公司内部常驻第三方安全评估机构,赋予其报告安全事件、判断模型对齐程度并向公众披露真实发现的权力。OpenAI CEO Sam Altman 随即表态跟进。第三方评估机构对此普遍欢迎,但强调细节尚待厘清,且最好有立法背书,否则难以判断自身究竟是独立监督者,还是受制于 AI 公司的外包供应方。文章指出,随着模型越来越擅长识别自己正被评估,仅在成品阶段测试已不足以发现隐患,评估者需要深入训练过程中的中间检查点和日志,才能核实企业关于模型行为的说法。这一转变意味着行业监督模式可能从发布前的短期审查,转向贯穿训练全程的深度介入。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅