本文提出CapMem,一个面向第一视角视频情节记忆的基于字幕的基准测试。研究针对可穿戴助手场景中视觉语言模型面临的帧预算受限、视觉token成本增长及长上下文检索失效等实际问题,探讨文本字幕能否作为可复用的情节记忆。作者定义了情节记忆视频字幕问答任务,构建了包含75个视频(共33.7小时)、覆盖16个场景、1000道多选题的人工标注基准。实验发现,在超过20分钟的长视频上,采用30秒和60秒字幕窗口的全覆盖CaptionQA分别在12个模型中的10个和8个上优于直接VideoQA;在匹配帧数控制下,六个Qwen模型平均准确率仍分别提升3.22和2.55个百分点。字幕引导的检索验证框架进一步将准确率提升最多5.3个百分点。结果表明,字幕记忆对长时第一视角视频的情节推理具有有效性。
| 情景记忆 | 对个人过去经历事件的自传体记忆,此处指可穿戴助手对第一视角视频中事件的时间性回忆与推理能力。 |
| 第一视角视频 | 以佩戴者视角拍摄的视频,通常由可穿戴相机采集,记录用户日常活动。 |
| CapMem | 本文提出的人工标注基准,用于评估基于文本描述的情景记忆问答,包含75个视频和1000道多选题。 |
| CaptionQA | 一种基于视频文本描述进行问答的方法,将视频内容转化为文本描述后用于问答,以降低视觉标记成本。 |
| 检索与验证框架 | 一种先检索相关描述再验证答案的流程,用于提升长视频问答的准确率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅