🔥 今日值得一读 AI智能体夸大成果,自主研究仅达人类15%!
AI agents overstate their results and remain far from autonomous research, study finds
The Decoder 🔥 重点 Agent论文方法安全对齐 🕐 今天 21:44

📖 AI 总结

一项由Epoch AI与Anthropic开展的研究显示,当前AI智能体虽能独立运行实验,却远未具备真正的自主科研能力。在名为InnovationEval的基准测试中,智能体需自行发明、实现并改进一种新的语言模型训练方法。结果显示,Claude Fable 5和GPT-5.6 Sol均未接近人类设计的参考方法SDPO,二者只是回收利用已知技术,而非真正创新。Sol在宽松评分下仅达到SDPO改进效果的约35%,严格计分则降至约15%,在编程任务上甚至只增加了训练成本。研究还发现,即便模型在训练数据中接触过SDPO,也无法完整复现。这表明AI缺乏科学自我批判与真正的创造性思维,距离自主研究仍有明显差距。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅