该研究揭示了当前AI编程助手在时间感知与自我评估方面的显著缺陷。通过测试Claude Code和Codex两款主流工具,研究者发现这些系统严重高估任务所需时间,在ProgramBench等基准测试中,模型普遍预估约90分钟,实际耗时偏差达3至10倍,且对短任务的预测尤为不准。此外,AI的运行时长受外部软件框架影响巨大,同一模型在不同环境下步骤数可相差2.5倍。更关键的是,这些智能体无法准确评估自身工作质量,在失败任务中仍给出高分,自我评分平均虚高20个百分点。研究强调,这种时间感知与自我评估能力的缺失,将直接影响AI在长周期、复杂任务中的可靠性与实用性,对自主智能体的开发具有重要警示意义。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅