一位研究大语言模型代码能力的研究者开展了一项实验,给四个前沿模型各100美元预算,让它们自主开发一款用户体验良好的开源PDF编辑器。结果显示,这些模型造出的产品几乎每一个都能在简单操作后暴露出bug。作者据此指出,编程智能体无法像人类那样与软件进行交互,这可能是其难以产出可靠可用软件的关键原因。该实验以极低成本揭示了当前AI编程代理在真实产品开发中的明显短板,对评估和推进LLM代码能力具有参考意义。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅