多主体视频编辑新突破:MDN-Control无需训练,CM-Err最低、Q-Edit最高!
MDN-Control: Mask-Depth-Noise Guided Region Control for Multi-Subject Video Editing
arXiv CV (cs.CV) 重要 #视频编辑#多主体#免训练 🕐 09-16 12:00

📖 AI 总结

多主体视频编辑的核心难点在于,修改指定目标的同时保持非目标内容不变,往往会出现跨主体属性泄漏和遮挡边界模糊的问题。现有方法主要依赖掩码,难以区分相互重叠的主体,也难以保证生成的一致性。针对这些不足,作者提出MDN-Control,一个无需训练的框架,联合控制目标定位、遮挡几何与外观初始化:掩码引导的定位提供稳定的目标位置,深度感知的遮挡控制化解重叠主体间的边界歧义,噪声潜在提示则从噪声库中检索与提示相关的高斯初始化先验。在MSVBench上的实验表明,该方法取得了最低的CM-Err和最高的Q-Edit,同时在文本对齐和时间一致性上保持竞争力,说明融合空间、几何与潜在先验对多主体视频编辑是有效的。

🔑 关键词速览

MDN-Control本文提出的无需训练的多主体视频编辑框架,联合控制掩码、深度和噪声先验。
Mask-Depth-Noise指掩码引导定位、深度感知遮挡控制和噪声潜在提示三种控制信号。
MSVBench用于评估多主体视频编辑性能的基准数据集。
CM-Err跨主体属性泄漏误差指标,衡量编辑后主体间属性混淆的程度。
Q-Edit编辑质量指标,评估编辑结果与目标提示的符合程度及视觉质量。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅