视频描述评估大变革:信息保真度新指标告别词汇匹配,细粒度分析更精准!
Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering
Apple ML Research 重要 多模态论文方法评测 🕐 09-11 08:00

📖 AI 总结

现有视频描述评估主要依赖生成文本与参考文本的匹配,但视频描述本身存在“一对多”特性,高质量描述常因用词差异或视觉重点不同而被误判,且评估维度单一,难以提供细粒度分析。为此,研究提出以信息保真度重新定义描述质量,要求描述在确保事实准确的前提下最大化覆盖显著视觉信息。研究推出CapQuiz,一种无参考基准,通过人工验证的细粒度多项选择题评估描述在回答视频问题时的实用性,涵盖描述性与推理性共10类问题、24个视频领域。同时提出复合指标CapF1,综合衡量事实性与覆盖度。实验表明,CapQuiz与人类判断的相关性显著优于现有指标,并能提供可解释的模型性能洞察。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅