🔥 今日值得一读 视频运动也能“指哪控哪”!新方法让局部动态分离,对象级操控更精准
What Moves? Localized Motion Representations for Compositional Scene Control
arXiv CV (cs.CV) 🔥 重点 #视频表示#运动建模#组合生成 🕐 09-07 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法分离场景中不同物体的运动,提升视频编辑和生成中多实体动态控制的精度。

📖 AI 总结

该研究提出了一种可提示的局部运动表示方法,用于解决复杂场景中多实体运动的组合控制问题。传统视频表示方法通常全局编码运动,难以捕捉单个物体的独立动态,且局部化处理常因裁剪或特征遮蔽而丢失必要的场景上下文。新方法直接处理完整视频,并基于用户指定的空间掩码区域进行运动编码,从而生成时间一致、可寻址的局部嵌入,既保留局部动态细节,又维持全局场景信息以辅助运动解译。实验证明,该方法在物体级运动迁移和多人视频局部动作分类两项任务中均优于通过裁剪或后处理遮蔽实现的全局表示局部化方案,显著提升了动态场景组合控制的灵活性和准确性。

🔑 关键词速览

localized motion representation一种视频表示方法,专门捕捉场景中特定区域的运动,而非全局运动。
promptable指模型可以根据用户指定的查询(如空间掩码)动态调整其处理或输出。
spatial masks定义视频帧中感兴趣区域的二进制掩码,用于指定要分析或控制的局部区域。
motion transfer将一个对象的运动模式应用到另一个对象或场景中,以实现动态场景的合成控制。
compositional scene control对场景中多个独立实体的运动进行分别控制,以组合出复杂的动态效果。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅