该研究提出了MemeCULT-1K基准数据集,包含1000个南亚多语种梗图(孟加拉语、英语和印地语),并配有文化背景注释和人工撰写的解释,另有54个孟加拉方言梗图作为补充。研究评估了13种视觉语言模型在仅梗图和有文化背景两种条件下的表现。结果显示,提供少量文化背景信息能显著提升所有模型的性能:SBERT相似度从44.6提升至56.4,BLEURT从37.3升至42.3,LLM评分从2.57升至3.43(满分5分)。细粒度错误分析表明,闭源模型主要失败于实体和指代识别错误,而开源模型受限于更广泛的文化知识缺口,语言和音韵层面的错误对背景信息最不敏感。该研究凸显了文化背景在梗图理解中的关键作用,为未来显式文化知识整合提供了方向。
| MemeCULT-1K | 一个包含1000个南亚梗图的多语言基准数据集,用于评估视觉语言模型的文化理解和幽默能力。 |
| Vision Language Models (VLMs) | 视觉语言模型,能够同时处理图像和文本输入,用于理解多模态内容。 |
| SBERT similarity | 基于Sentence-BERT的语义相似度指标,用于衡量生成解释与参考解释的语义接近程度。 |
| BLEURT | 一种基于预训练模型的文本评估指标,用于衡量生成文本与参考文本的语义和语法质量。 |
| LLM-as-a-Judge | 一种评估方法,使用大型语言模型作为裁判,对生成内容的质量进行打分。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅