EditStream提出了一种统一的视频生成与编辑框架,基于DiT架构,通过灵活的任务特定条件整合了文本生成视频、图像生成视频、视频到视频转换、编辑传播、参考引导编辑及相机位姿变化等多种功能。该框架采用两阶段蒸馏策略,结合速度矩匹配与自回归展开,前者在中间状态匹配条件速度矩以保持生成质量和运动表现,后者通过暴露学生模型于自身预测来增强时间稳定性,从而解决少步自回归视频生成中的过饱和、运动退化、时间不稳定及训练复杂等问题。这一方法使高质量扩散视频模型适配交互式创作流程,为视频生成与编辑的统一和实时应用提供了可扩展的实用方案。
| DiT | 基于Transformer的扩散模型,用于视频生成和编辑。 |
| Velocity Moment Matching (VMM) | 一种蒸馏技术,通过匹配速度矩来保持生成质量。 |
| Autoregressive unrolling | 一种训练策略,让学生模型接触自身预测以提高时间稳定性。 |
| Few-step autoregressive model | 一种快速生成模型,通过少量步骤生成视频。 |
| Text-to-Video | 根据文本描述生成视频的任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅