FoldingAgent是一个从折纸演示视频中推断参数化折叠程序的智能体框架。该框架利用预训练视觉语言模型的推理能力,配备多种专用工具,使智能体能够模拟几何变换、验证物理可行性、检索比较视觉内容并评估自身预测。与预测静态折痕图案的模型不同,该智能体顺序操作并具备重新规划能力,有效缓解了多步折叠中固有的误差累积问题。研究团队定义了包含纸张几何和参数化折叠动作的参数空间,并构建了PurelandFold基准数据集,包含多样化的Pureland折纸视频及真实几何和动作标签。实验结果表明,将视觉语言模型推理与专用工具和物理模拟相结合,能够成功将非结构化视觉演示转化为可执行、物理上合理的折叠程序。这项工作弥合了人类折纸知识(主要通过非结构化视觉演示分享)与计算方法(依赖结构化参数化表示)之间的鸿沟。
| FoldingAgent | 一个智能体框架,用于从折纸演示视频中推断参数化折叠程序。 |
| Vision-Language Model (VLM) | 视觉-语言模型,能够同时处理图像和文本信息,用于理解视觉内容并生成推理。 |
| Parametric folding program | 参数化折叠程序,一种用参数化动作和几何描述折纸过程的表示方法。 |
| PurelandFold | 一个包含纯土地折纸视频的基准数据集,带有真实几何和动作标签,用于评估折纸推理方法。 |
| Crease pattern | 折痕图案,表示纸张折叠后所有折痕的静态布局,常用于折纸设计。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅