视觉问答可回答性新突破:VT-Transformer用回归任务替代二值映射,效果更稳更准!
Vision And Text Transformer For Predicting Answerability On Visual Question Answering
arXiv CV (cs.CV) #视觉问答#可回答性#Transformer 🕐 09-16 12:00

📖 AI 总结

该研究聚焦视觉问答中的可回答性预测任务,旨在判断给定图像与问题之间是否存在可回答的关系。现有方法通常将其简化为二分类映射,未能充分体现问题的本质。为此,作者将可回答性建模为回归任务,并提出VT-Transformer模型,利用Transformer架构同时提取视觉与文本特征进行预测。在VizWiz 2020数据集上的实验表明,该模型在性能与鲁棒性上均优于多个竞争基线。这项工作的意义在于重新定义了可回答性预测的建模方式,为多模态数据中图像与问题的匹配评估提供了更合理的解决思路。

🔑 关键词速览

Answerability可回答性,指判断给定图像和问题是否能够被回答的任务或属性。
Visual Question Answering (VQA)视觉问答,一种多模态任务,要求模型根据图像内容回答自然语言问题。
VT-Transformer本文提出的模型,利用Transformer架构融合视觉和文本特征来预测可回答性分数。
VizWiz 2020一个视觉问答数据集,包含由视障人士拍摄的图像和提出的问题,常用于评估VQA系统。
Regression task回归任务,指预测连续数值输出的机器学习任务,此处用于预测可回答性分数。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅