这篇文章探讨了Anthropic在自动化对齐研究方面的最新进展。随着AI开始自我构建,自动化对齐研究对保持安全研究步伐至关重要。实验中,Claude自主训练模型,针对10类对齐失败(如隐私泄露、欺骗等)逐一改进,通过文献搜索、方法提出、训练和测试的循环流程。评估标准为“安全差距闭合百分比”,并排除损害通用能力的方法。结果显示,Claude的方法在所有10类失败中均有效,不仅提升了目标基准,还适用于未见的基准和Petri工具,且对高达4.7倍规模的模型依然有效。此外,Claude的表现超越了28位人类安全研究人员,表明自动化研究者能可靠缓解对齐失败,为AI安全研究提供了可扩展的解决方案。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅