该实验由Armature公司开展,规模涉及16893次会话、1163个prompt变体、75个代码仓库及10种语言,对比Claude Code、Codex和Cursor三款主流编程代理的实际实现能力。在筛选出的5292个有效会话中,覆盖51个代码库和18个行业,任务要求直接产出代码而非建议。研究核心发现不同工具在特定场景下的表现差异显著,但具体选型结果未在摘要中展开。实验意义在于为开发者工具选择提供大规模实证数据,同时Armature自认存在一定偏向性,提示结果需结合具体使用场景解读。该研究为理解AI编程助手的实际效能提供了重要参考。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅