多模态大语言模型受限于视觉token和计算预算,无法处理长视频的全部帧,因此需要关键帧选择方法来提升长视频理解能力。现有方案中,重训练MLLM成本过高,训练专用适配器需大量资源,而无需训练、即插即用且与模型无关的适配器(即PaP关键帧选择)计算成本最低、适用性最广。过去一年仅出现五种此类方法,但它们分别在不同基准和不同MLLM上评估,缺乏可比性。本文对五种方法进行了统一评估,使用三种MLLM和三个长视频理解基准。结果显示,QAaF在15个聚合评估设置中的13个取得最佳性能,FOCUS总体排名第二。该工作为无训练关键帧选择方法提供了共同的实验参考基准。
| MLLM | 多模态大语言模型,能够同时处理文本和视觉等多种模态信息的大规模预训练模型。 |
| PaP keyframe selection | 即插即用关键帧选择,一种无需训练、与具体MLLM无关的适配器方法,用于从长视频中选取关键帧。 |
| Adapter | 适配器,一种轻量级模块,通过少量可训练参数将预训练模型适配到特定任务,避免全模型微调。 |
| Long-video understanding | 长视频理解,指模型对时长较长的视频内容进行语义理解和推理的能力。 |
| Video question-answering benchmark | 视频问答基准,用于评估模型根据视频内容回答问题的能力的标准数据集和评测协议。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅