本文提出 CinematicVQA,这是首个面向电影语法推理的视频理解基准,旨在评估大型视觉语言模型(LVLM)对电影摄影技艺及其叙事功能的理解能力。研究引入电影场景图(CSG)作为结构化表示,将拍摄技法与其感知效果和叙事功能相关联。对当前最先进 LVLM 的综合评测揭示了一个显著的语义鸿沟:模型在描述视觉呈现方面表现较好,但在识别底层技法时明显偏弱。令人意外的是,思维链提示未能带来稳定增益,反而使多数模型性能下降,说明现有模型缺乏足够的电影领域知识来支撑逐步推理。在 CinematicVQA-train 上微调则能带来持续提升,尤其在叙事功能和多跳推理方面。该基准既可用于严格评估,也可作为训练更具电影感知能力的视频模型的实用数据集。
| CinematicVQA | 本文提出的首个电影视频理解基准,用于评估大型视觉语言模型的电影语法推理能力。 |
| Film-Grammar Reasoning | 电影语法推理,指理解拍摄技术如何通过视觉叙事影响观众感知和情感的能力。 |
| Cinematic Scene Graph (CSG) | 电影场景图,一种将拍摄技术与其感知效果和叙事功能相连接的结构化表示。 |
| Large Vision-Language Models (LVLMs) | 大型视觉语言模型,能够同时处理视觉和文本信息并进行跨模态理解与生成的人工智能模型。 |
| Chain-of-Thought Prompting | 思维链提示,一种通过引导模型逐步推理来提升复杂任务表现的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅