马里兰大学与AWS的研究团队提出LEGO-Anything项目,采用"图像到代码"方法,让编码智能体从单张照片出发,迭代编写并调试Blender程序,逐步构建可编辑、可查询的三维场景。由于输出是代码而非一次性生成的模型,场景中的物体、几何结构、布局和相机位置都被显式记录。为评估效果,团队构建了LEGO-Bench基准,包含来自104个室内外场景的208张图像和443个注册资产,图像由专业模拟器场景渲染而成,兼具真实观感与精确几何真值,可从有效性、几何精度和视觉相似度三个维度自动评分。测试显示,六种GPT配置几乎都能生成可用场景,但几何精度差异巨大:表现最佳的GPT-6 Astra在室内场景准确率为53.4%,室外仅39.6%,较弱配置仅约15%。这表明当前智能体虽能产出可运行成果,却缺乏对自身结果是否正确的判断能力,自我评估与几何准确性仍是主要瓶颈。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅