🔥 今日值得一读 首个免训练无反转视频编辑框架,保真度与效率全面超越现有方法!
Edit-VAR: Taming Visual Autoregressive Model for Precise Video Editing
arXiv CV (cs.CV) 🔥 重点 #视频编辑#自回归模型#文本引导#时序一致性 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做文本引导视频编辑时,可用它基于VAR模型实现更强编辑力度,同时保持未编辑区域时序一致。

📖 AI 总结

Edit-VAR 是首个面向文本引导视频编辑的无训练、无反转框架,基于预训练的视觉自回归视频模型构建。现有无训练方法中,无反转范式因源保持引导过强而限制编辑力度,基于反转的范式则因轨迹恢复的近似误差累积导致源内容漂移和时间不一致。Edit-VAR 将源视频直接编码为多尺度离散 token,通过概率引导的条件 token 替换实现源保持,并借助注意力引导的 token 级与尺度感知调制,在编辑相关位置和生成阶段选择性地放松源约束;其尺度解耦生成以晚期尺度约束释放的方式重建运动一致的细节,减少纹理碎片化,残差引导的 token 剪枝则利用最后两个高分辨率尺度的冗余降低推理成本。大量实验与盲测用户研究表明,该方法在编辑保真度、源保持、时间一致性和推理效率上整体优于现有无训练视频编辑方法。

🔑 关键词速览

视觉自回归模型一种将图像或视频生成建模为离散标记序列预测的自回归生成模型。
免训练指无需额外训练或微调即可直接应用于下游任务的推理方法。
无反转指在编辑过程中不进行潜在轨迹反转或恢复的范式,避免近似误差累积。
尺度解耦生成一种在不同生成尺度上解耦约束的策略,通过后期释放约束来提升细节生成质量。
标记剪枝通过移除冗余的离散标记来减少计算量、加速推理的技术。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅