折纸视频秒变可执行程序!FoldingAgent用AI+物理模拟,误差累积问题直接解决
FoldingAgent: Inferring Parametric Origami Procedures from Demonstration Videos
arXiv CV (cs.CV) 重要 #Agent#视频理解#程序合成 🕐 09-02 12:00

📖 AI 总结

FoldingAgent是一个从折纸演示视频中推断参数化折叠程序的智能体框架。该框架利用预训练视觉语言模型的推理能力,配备多种专用工具,使智能体能够模拟几何变换、验证物理可行性、检索比较视觉内容并评估自身预测。与预测静态折痕图案的模型不同,该智能体顺序操作并具备重新规划能力,有效缓解了多步折叠中固有的误差累积问题。研究团队定义了包含纸张几何和参数化折叠动作的参数空间,并构建了PurelandFold基准数据集,包含多样化的Pureland折纸视频及真实几何和动作标签。实验结果表明,将视觉语言模型推理与专用工具和物理模拟相结合,能够成功将非结构化视觉演示转化为可执行、物理上合理的折叠程序。这项工作弥合了人类折纸知识(主要通过非结构化视觉演示分享)与计算方法(依赖结构化参数化表示)之间的鸿沟。

🔑 关键词速览

FoldingAgent一个智能体框架,用于从折纸演示视频中推断参数化折叠程序。
Vision-Language Model (VLM)视觉-语言模型,能够同时处理图像和文本信息,用于理解视觉内容并生成推理。
Parametric folding program参数化折叠程序,一种用参数化动作和几何描述折纸过程的表示方法。
PurelandFold一个包含纯土地折纸视频的基准数据集,带有真实几何和动作标签,用于评估折纸推理方法。
Crease pattern折痕图案,表示纸张折叠后所有折痕的静态布局,常用于折纸设计。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅