Anthropic于2026年9月宣布与埃森哲旗下AI专业机构Faculty合作,开展前沿AI模型的独立评估。合作内容包括模型评估与红队测试、对齐评估及安全防护机制检验,双方计划未来五年各投入至少10亿美元建设相关能力。此举旨在落实其CEO提出的“将评估者嵌入AI公司内部”的承诺。嵌入式评估者将拥有接近员工的访问权限,可观察模型训练过程、了解决策依据并直接与员工沟通,从而验证企业是否履行安全承诺、识别盲区并向公众报告风险。Anthropic强调,独立评估不减轻其自身责任,而是让问责更可验证。由于目前尚无嵌入式评估的标准与成熟资助机制,Anthropic将直接资助埃森哲,同时与METR等非营利评估机构探讨试点。该合作非排他性,未来将有更多评估方加入。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅