33.7小时第一视角视频,描述记忆让长视频问答准确率最高提升5.3个百分点!
CapMem: A Benchmark for Caption-Based Episodic Memory in Egocentric Video
arXiv AI (cs.AI) 重要 多模态论文方法 🕐 09-17 12:00

📖 AI 总结

本文提出CapMem,一个面向第一视角视频情节记忆的基于字幕的基准测试。研究针对可穿戴助手场景中视觉语言模型面临的帧预算受限、视觉token成本增长及长上下文检索失效等实际问题,探讨文本字幕能否作为可复用的情节记忆。作者定义了情节记忆视频字幕问答任务,构建了包含75个视频(共33.7小时)、覆盖16个场景、1000道多选题的人工标注基准。实验发现,在超过20分钟的长视频上,采用30秒和60秒字幕窗口的全覆盖CaptionQA分别在12个模型中的10个和8个上优于直接VideoQA;在匹配帧数控制下,六个Qwen模型平均准确率仍分别提升3.22和2.55个百分点。字幕引导的检索验证框架进一步将准确率提升最多5.3个百分点。结果表明,字幕记忆对长时第一视角视频的情节推理具有有效性。

🔑 关键词速览

情景记忆对个人过去经历事件的自传体记忆,此处指可穿戴助手对第一视角视频中事件的时间性回忆与推理能力。
第一视角视频以佩戴者视角拍摄的视频,通常由可穿戴相机采集,记录用户日常活动。
CapMem本文提出的人工标注基准,用于评估基于文本描述的情景记忆问答,包含75个视频和1000道多选题。
CaptionQA一种基于视频文本描述进行问答的方法,将视频内容转化为文本描述后用于问答,以降低视觉标记成本。
检索与验证框架一种先检索相关描述再验证答案的流程,用于提升长视频问答的准确率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅