该研究聚焦视觉问答中的可回答性预测任务,旨在判断给定图像与问题之间是否存在可回答的关系。现有方法通常将其简化为二分类映射,未能充分体现问题的本质。为此,作者将可回答性建模为回归任务,并提出VT-Transformer模型,利用Transformer架构同时提取视觉与文本特征进行预测。在VizWiz 2020数据集上的实验表明,该模型在性能与鲁棒性上均优于多个竞争基线。这项工作的意义在于重新定义了可回答性预测的建模方式,为多模态数据中图像与问题的匹配评估提供了更合理的解决思路。
| Answerability | 可回答性,指判断给定图像和问题是否能够被回答的任务或属性。 |
| Visual Question Answering (VQA) | 视觉问答,一种多模态任务,要求模型根据图像内容回答自然语言问题。 |
| VT-Transformer | 本文提出的模型,利用Transformer架构融合视觉和文本特征来预测可回答性分数。 |
| VizWiz 2020 | 一个视觉问答数据集,包含由视障人士拍摄的图像和提出的问题,常用于评估VQA系统。 |
| Regression task | 回归任务,指预测连续数值输出的机器学习任务,此处用于预测可回答性分数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅