该研究针对好莱坞电影的多模态叙事理解能力构建了新的评估基准。研究者首先创建了一个包含1922至1979年间《Variety》杂志周票房数据的大规模开放数据集,并依据美国版权登记记录筛选出可能处于公共领域的影片,以规避版权限制。在此基础上,他们设计了一个聚焦叙事元素的多模态多项选择题基准,用于测试模型对电影叙事的理解能力。结果显示,许多视觉-语言模型在该任务上表现不佳,准确率接近随机水平;即便表现最好的音视频模型(利用音频辅助场景描述)也仅达到61.1%的准确率,明显低于人类水平。这一发现揭示了当前多模态模型在复杂叙事理解上的显著局限,同时为电影史和叙事演变的计算研究提供了可复用的数据资源和评估工具。
| Multimodal language models | 多模态语言模型,能够处理和理解文本、图像、音频等多种类型数据的模型。 |
| Benchmark | 基准测试,用于评估模型性能的标准任务或数据集。 |
| Public domain | 公有领域,指不受版权保护、可自由使用的作品。 |
| Multimodal MCQ benchmark | 多模态多项选择题基准,一种结合多种数据形式(如视频、音频、文本)的问答测试集。 |
| Vision-language models | 视觉-语言模型,专门处理图像和文本结合任务的模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅