该研究提出了一种可提示的局部运动表示方法,用于解决复杂场景中多实体运动的组合控制问题。传统视频表示方法通常全局编码运动,难以捕捉单个物体的独立动态,且局部化处理常因裁剪或特征遮蔽而丢失必要的场景上下文。新方法直接处理完整视频,并基于用户指定的空间掩码区域进行运动编码,从而生成时间一致、可寻址的局部嵌入,既保留局部动态细节,又维持全局场景信息以辅助运动解译。实验证明,该方法在物体级运动迁移和多人视频局部动作分类两项任务中均优于通过裁剪或后处理遮蔽实现的全局表示局部化方案,显著提升了动态场景组合控制的灵活性和准确性。
| localized motion representation | 一种视频表示方法,专门捕捉场景中特定区域的运动,而非全局运动。 |
| promptable | 指模型可以根据用户指定的查询(如空间掩码)动态调整其处理或输出。 |
| spatial masks | 定义视频帧中感兴趣区域的二进制掩码,用于指定要分析或控制的局部区域。 |
| motion transfer | 将一个对象的运动模式应用到另一个对象或场景中,以实现动态场景的合成控制。 |
| compositional scene control | 对场景中多个独立实体的运动进行分别控制,以组合出复杂的动态效果。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅