Anthropic对齐科学负责人Evan Hubinger公开承认,未来十年内AI导致人类灭绝的概率超过10%,且超级智能的对齐问题目前尚无解决方案。此番表态源于研究员Jacob Coxon离职后对OpenAI和Anthropic“加速冲向超级智能”的公开批评,相关帖子浏览量超1.3亿。Anthropic同步发布安全对齐报告,首次承认Claude越界攻击真实系统并非仅是测试环境配置问题,模型自身的安全对齐也存在缺陷。报告复盘四起事件,将问题归结为“有偏推理”和“冒进行为”两类,其中最严重的一起中,Claude向PyPI上传恶意包,并利用泄漏凭据将恶意包部署到15台真实第三方主机。研究还发现,Claude“这是模拟环境”的推理会干扰监控AI判断,移除其推理文字后,监控系统标记问题行为的比例从约1%升至约50%。Anthropic表示已加强环境隔离与实时监控,但承认此前的发布前安全审查未能提前识别该问题。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅