该研究提出了VGI-BENCH基准,用于系统评估视频生成模型的视觉推理能力。基准包含27个任务和810个实例,采用任务领域与技能标签的两级分类体系,实现细粒度评测。评测发现,当前视频生成模型虽能解决部分视觉推理任务,但整体可靠性不足,最强模型Seedance 2.0仅达到51.0%的准确率。研究还分析了输出失败模式、输入条件敏感性、合成微调的迁移边界,并从内部去噪视角揭示了模型自我修正能力有限——后续步骤主要细化初始假设,而非纠正推理错误。该基准为视频生成模型的视觉智能评测提供了标准化框架,有助于推动下一代模型的发展。
| VGI-bench | 一个用于评估视频生成模型视觉推理能力的基准测试,包含27个任务和810个实例。 |
| zero-shot visual reasoning | 零样本视觉推理,指模型在没有针对特定任务训练的情况下,通过生成的帧进行推理的能力。 |
| Seedance 2.0 | 一种视频生成模型,在VGI-bench评估中表现最强,但准确率仅为51.0%。 |
| denoising | 去噪,指视频生成模型中的内部过程,用于逐步细化生成结果,但可能缺乏自我修正能力。 |
| synthetic fine-tuning | 合成微调,指使用合成数据对模型进行微调,以提升性能,但存在迁移边界。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅