这项研究挑战了AI即将实现递归自我改进的普遍预期。普林斯顿大学等多机构团队发现,当前AI代理虽能解决AI研究中的工程问题,却缺乏开放式研究所必需的判断力与创造力。研究者提出“影子评估”新方法,让Claude Opus 4.8在六天、3000美元API预算及充足计算资源下,回答两篇未公开的NeurIPS 2026论文中的研究问题,且无法从训练数据中获取答案。结果显示,AI代理产出的论文未达顶级机器学习会议接收标准,尤其在假设选择、证据判断等需要学术品味的环节表现不足。该发现表明,AI自动化研究的炒作时间线可能超前于实际证据,递归自我改进的实现或需更长时间。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅