DesignAgent3D提出了一种交互式3D场景编辑框架,将传统的一次性文本生成方式重构为“规划-感知-执行”三阶段智能体范式。该框架针对现有方法在语义模糊、空间定位漂移和多视角“贴纸效应”等方面的不足,通过先与用户交互澄清设计意图,再在3D场景中精准定位目标对象,最后执行保持场景一致性的视觉修改。实验在NeRF和3D高斯泼溅两种主干网络上验证,结果表明该方法在语义意图对齐、空间定位精度和多视角渲染一致性上均显著优于现有基线。其核心贡献在于将编辑结果真正集成到底层3D表示中,支持持久化且多视角一致的新视角渲染,为3D场景编辑提供了一种更接近设计师工作流程的交互范式。
| DesignAgent3D | 本文提出的交互式多模态智能体框架,用于3D场景编辑,采用规划-感知-行动范式。 |
| Plan-Perceive-Act paradigm | 一种智能体工作流程,先规划目标,再感知环境,最后执行动作,类似设计师的思维过程。 |
| NeRF | 神经辐射场,一种基于神经网络的3D场景表示方法,用于新视角合成。 |
| 3D Gaussian Splatting | 3D高斯泼溅,一种高效的3D场景表示和渲染技术,支持实时渲染。 |
| sticker effect | 贴纸效应,指编辑后对象在多视图下不一致,像贴纸一样附着在场景表面的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅