一项由Mercor开展的研究让12名平均拥有五年半经验的持证注册会计师与AI模型同台完成APEX会计基准中的结构化记账任务。结果显示,AI在速度和准确率上已全面超越人类:18个月前最好的模型得分还低于会计师约37%的平均水平,如今已能近乎完美地完成同类任务。在更完整的APEX基准(涵盖10家模拟公司、160项任务)中,Claude Opus 5.5以61.8%的评分标准达成率领先,Fable 5.1和GPT-6 Astra紧随其后,但没有任何模型能完整解决近60%的任务。研究同时承认,测试内容恰好是AI最擅长的细节检索与指令遵循,未涵盖客户沟通、同事协作和多年积累的行业背景等关键环节,因此AI尚无法在无人监督下完成结账,但有望为整个行业带来显著的生产力提升。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅