Anthropic公布了一套衡量AI参与自身模型研发程度的指标,核心数据是Claude在2026年8月“主导”了26%的未来模型开发工作,较2月的不足1%大幅上升,超过90%的工作至少达到“协作”级别,但没有任何工作达到完全自主的AL5级别。文章指出,这一“主导”含义被夸大:它仅指AI能独立分析、修复并测试问题,但任务方向仍由人类设定,且最终交付决定权仍在人手中。更关键的是,评分由Claude自身完成,存在自我评判的偏差风险;内部交叉验证显示,两名人类对同一工作自动化程度的判断仅约三分之一一致,模型评分与人类判断的吻合率为59%。该指标是Anthropic为回应CEO放缓前沿AI开发的呼吁而发布的透明度举措之一,但其模糊的衡量标准和自评机制使数据的实际参考价值存疑。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅