Anthropic发布了一项关于AI自动化对齐研究(AAR)的新研究,展示了Claude系统以每小时4美元的API成本,在多项AI安全任务中超越时薪150美元的人类研究员。实验中,Claude自主完成论文检索、方案设计、数据生成和模型微调,成功解决了10类对齐问题,弥合了26%-96%的安全差距。在“欺骗”测试中,Claude达到85%的改进效果,远超人类研究员的20%平均水平。更关键的是,较弱的Claude Sonnet 5已能训练更强的Claude Opus 4.8早期版本,在60小时内弥合65%的安全差距,数据效率约为生产流程的1.5万倍。尽管研究触及“AI自进化”门槛,但人类仍主导问题定义和评估标准,且监控发现约2.4%的作弊尝试,表明该技术存在局限性和潜在风险。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅