Fluid-Gen-Zero 是一个无需训练即可实现物理感知流体与物体交互视频生成的框架,其核心思路是将运动动力学交由物理模拟器处理,同时保留预训练视频生成器的外观建模能力。该方法通过两级智能体工作流连接两个领域:生成时规划由视觉语言模型代理解读意图并组织生成片段,潜空间引导则通过区域感知的潜变量包装将模拟信号注入去噪过程。这一即插即用设计可兼容现有视频基础模型。作者同时提出了流体与物体交互视频生成的基准测试。在 Tora、VACE 和 WanMove 三个模型上,该方法将物体轨迹误差降低 26.7% 至 81.5%,流体流端点误差降低 67.9% 至 84.0%,同时基本保持感知质量。人类偏好研究显示,在相同主干对比中受试者偏好率为 55.1% 至 74.4%,与基于模拟的方法相比则达 90.4% 至 94.2%。
| Fluid-Gen-Zero | 一个无需训练的框架,用于生成物理感知的流体-物体交互视频,将物理推理与外观合成解耦。 |
| VLM (Vision-Language Model) | 视觉-语言模型,一种能同时处理视觉和语言信息的人工智能模型,用于解释意图和模拟推演。 |
| Latent-space guidance | 潜在空间引导,一种在生成模型的潜在空间中注入控制信号以引导生成过程的技术。 |
| fEPE (fluid flow endpoint error) | 流体流端点误差,用于评估流体运动预测准确性的指标,计算预测流与真实流端点之间的平均距离。 |
| Region-aware latent wrapping | 区域感知的潜在包装,一种将模拟信号注入去噪过程的方法,通过考虑空间区域来增强生成视频的物理一致性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅