多主体视频编辑的核心难点在于,修改指定目标的同时保持非目标内容不变,往往会出现跨主体属性泄漏和遮挡边界模糊的问题。现有方法主要依赖掩码,难以区分相互重叠的主体,也难以保证生成的一致性。针对这些不足,作者提出MDN-Control,一个无需训练的框架,联合控制目标定位、遮挡几何与外观初始化:掩码引导的定位提供稳定的目标位置,深度感知的遮挡控制化解重叠主体间的边界歧义,噪声潜在提示则从噪声库中检索与提示相关的高斯初始化先验。在MSVBench上的实验表明,该方法取得了最低的CM-Err和最高的Q-Edit,同时在文本对齐和时间一致性上保持竞争力,说明融合空间、几何与潜在先验对多主体视频编辑是有效的。
| MDN-Control | 本文提出的无需训练的多主体视频编辑框架,联合控制掩码、深度和噪声先验。 |
| Mask-Depth-Noise | 指掩码引导定位、深度感知遮挡控制和噪声潜在提示三种控制信号。 |
| MSVBench | 用于评估多主体视频编辑性能的基准数据集。 |
| CM-Err | 跨主体属性泄漏误差指标,衡量编辑后主体间属性混淆的程度。 |
| Q-Edit | 编辑质量指标,评估编辑结果与目标提示的符合程度及视觉质量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅