该研究提出了一种基于文本到图像潜在扩散模型的零样本视频修复与增强框架,旨在解决现有零样本图像修复方法在视频应用中出现的严重时间闪烁问题。核心创新包括三方面:通过双提示调优反演与采样技术,将推理时间缩短至原来的约三分之一;引入纹理感知的视频令牌合并机制,强化帧间时间相关性以提升一致性;提出参考自注意力与参考令牌合并,支持图像参考输入。实验结果表明,该方法在恢复和增强时间一致性视频方面显著优于现有技术,为无需训练的通用视频修复提供了高效且有效的解决方案。
| Zero-shot | 零样本学习,指模型在未见过的任务上无需额外训练即可直接应用。 |
| Latent Diffusion Models | 潜在扩散模型,一种在潜在空间中生成图像的生成模型,常用于文本到图像生成。 |
| Multi-Modal References | 多模态参考,指利用多种类型(如文本、图像等)的参考信息来指导生成过程。 |
| Temporal Consistency | 时序一致性,指视频帧之间在时间上保持视觉连贯性,避免闪烁或突变。 |
| Token Merging | 令牌合并,一种减少计算量的技术,通过合并相似的令牌(如图像块)来加速处理。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅