🔥 今日值得一读 单张照片秒变3D场景!GPT-6 Astra准确率53%,但智能体自评几何对错全靠抛硬币
AI agents build 3D scenes from photos but have no idea if they got it right
The Decoder 🔥 重点 Agent多模态论文方法 🕐 今天 16:31

📖 AI 总结

马里兰大学与AWS的研究团队提出LEGO-Anything项目,采用"图像到代码"方法,让编码智能体从单张照片出发,迭代编写并调试Blender程序,逐步构建可编辑、可查询的三维场景。由于输出是代码而非一次性生成的模型,场景中的物体、几何结构、布局和相机位置都被显式记录。为评估效果,团队构建了LEGO-Bench基准,包含来自104个室内外场景的208张图像和443个注册资产,图像由专业模拟器场景渲染而成,兼具真实观感与精确几何真值,可从有效性、几何精度和视觉相似度三个维度自动评分。测试显示,六种GPT配置几乎都能生成可用场景,但几何精度差异巨大:表现最佳的GPT-6 Astra在室内场景准确率为53.4%,室外仅39.6%,较弱配置仅约15%。这表明当前智能体虽能产出可运行成果,却缺乏对自身结果是否正确的判断能力,自我评估与几何准确性仍是主要瓶颈。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅