HUG-VIS 是一个面向人类中心视觉智能的多模态基准,旨在统一理解与生成任务。该基准包含 8,400 段由 30 位专业演员录制的坐姿半身视频,涵盖 280 种情绪-动作-提示组合,并同步提供视频、音频、文本和 alpha 遮罩四种模态。研究在统一零样本协议下评估了多种开源与闭源模型在情绪识别、视频生成、声音克隆和视频抠图四项任务上的表现。关键发现包括:语言内容主导当前情绪识别,纯视觉情感识别最弱;视频生成与声音克隆中自动指标与人工评判总体一致但排名存在差异;运动下的边界保真度仍是视频抠图的主要挑战;任务难度随情绪、模型和指标变化,且存在跨任务相关性。该工作为多模态人类中心研究提供了统一评估基础。
| HUG-VIS | 一个用于视觉智能中以人为中心的理解与生成的统一基准,包含多模态数据和跨任务评估。 |
| 零样本协议 | 一种评估方法,模型在未见过的任务或数据上进行测试,无需额外训练。 |
| alpha遮罩 | 用于图像或视频抠像的透明度通道,表示每个像素的前景不透明度。 |
| 平均意见分数 | 一种主观质量评估指标,通过用户评分平均值来衡量生成内容的质量。 |
| 跨任务分析 | 研究不同任务之间性能相关性的方法,以发现共享的规律或瓶颈。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅