DiffVC-ONE提出了一种基于扩散模型的生成式视频压缩框架,旨在解决低码率下视频重建中时间一致性与推理成本难以兼顾的问题。该框架包含三个核心组件:统一单向潜在压缩器利用共享模型高效压缩潜在切片;基于视频扩散Transformer的单步扩散增强器以重建潜在切片为锚点,对整组画面执行单步时空感知增强;混合条件生成器则从重建内容和量化信息中提取结构、强度与语义条件,以保留真实区域、控制增强程度并补充内容感知细节。在多个标准基准上的实验表明,DiffVC-ONE在感知质量和时间一致性上达到当前最优水平,同时显著降低了推理开销,为生成式视频压缩的实际部署提供了可行方案。
| DiffVC-ONE | 本文提出的基于一步视频扩散Transformer的生成式视频压缩框架。 |
| Video Diffusion Transformer (Video DiT) | 一种基于Transformer架构的视频扩散模型,用于生成或增强视频内容。 |
| One-Step Diffusion | 扩散模型的一种推理方式,仅需单步采样即可生成结果,显著降低计算成本。 |
| Unified Unidirectional Latent Compressor | 一种使用共享模型对潜在表示进行高效均匀压缩的模块,支持单向处理。 |
| Hybrid Condition Generator | 从重建内容和量化信息中提取结构、强度和语义条件的模块,用于指导扩散增强。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅