Edit-VAR 是首个面向文本引导视频编辑的无训练、无反转框架,基于预训练的视觉自回归视频模型构建。现有无训练方法中,无反转范式因源保持引导过强而限制编辑力度,基于反转的范式则因轨迹恢复的近似误差累积导致源内容漂移和时间不一致。Edit-VAR 将源视频直接编码为多尺度离散 token,通过概率引导的条件 token 替换实现源保持,并借助注意力引导的 token 级与尺度感知调制,在编辑相关位置和生成阶段选择性地放松源约束;其尺度解耦生成以晚期尺度约束释放的方式重建运动一致的细节,减少纹理碎片化,残差引导的 token 剪枝则利用最后两个高分辨率尺度的冗余降低推理成本。大量实验与盲测用户研究表明,该方法在编辑保真度、源保持、时间一致性和推理效率上整体优于现有无训练视频编辑方法。
| 视觉自回归模型 | 一种将图像或视频生成建模为离散标记序列预测的自回归生成模型。 |
| 免训练 | 指无需额外训练或微调即可直接应用于下游任务的推理方法。 |
| 无反转 | 指在编辑过程中不进行潜在轨迹反转或恢复的范式,避免近似误差累积。 |
| 尺度解耦生成 | 一种在不同生成尺度上解耦约束的策略,通过后期释放约束来提升细节生成质量。 |
| 标记剪枝 | 通过移除冗余的离散标记来减少计算量、加速推理的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅