现代视觉问答模型常因训练数据中的虚假关联而产生语言偏见,导致分布外泛化能力不足。针对这一问题,该研究提出了一种增强反事实对比学习的训练框架,包含三项核心设计:用于稳定多目标优化的三阶段课程学习策略、提升特征判别力的增强批对比损失,以及分别用于优化预测空间和强化因果视觉定位的答案对比损失与梯度差异损失两个正则项。在偏见敏感的VQA-CP v2基准上,模型取得61.64%的准确率,同时在标准VQA v2数据集上保持62.80%,泛化差距仅为1.16%。该结果表明,所提方法在分布外鲁棒性与分布内性能之间实现了良好平衡,为缓解VQA中的语言偏见提供了有效思路。
| Visual Question Answering (VQA) | 视觉问答,一种结合图像和自然语言问题生成答案的多模态任务。 |
| Counterfactual Learning | 反事实学习,通过考虑反事实场景(即如果输入不同会怎样)来减少虚假关联,增强因果推理。 |
| Out-of-Distribution (OOD) Generalization | 分布外泛化,模型在训练分布之外的数据上的表现能力。 |
| Batch-Contrastive Loss | 批对比损失,一种在批次内对比正负样本以学习判别性特征的损失函数。 |
| VQA-CP v2 | 一个偏差敏感的VQA基准数据集,其中训练集和测试集的答案分布不同,用于评估模型的鲁棒性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅