该研究提出了一种名为SCoRe的结构化上下文推理框架,用于提升基于知识的视觉问答(KB-VQA)性能。研究指出,现有方法将异构视觉描述与检索知识直接拼接成非结构化长提示,容易引入过多无关上下文且缺乏关系结构,从而降低推理效果。SCoRe框架包含三个阶段:上下文获取阶段生成多样化视觉笔记并通过两阶段多模态检索策略获取显式知识;上下文选择阶段利用LLM引导筛选相关视觉、显式和隐式知识;上下文压缩阶段通过关系逻辑蒸馏将原始文本转化为实体-关系三元组,形成简洁的结构化提示用于最终答案预测。在OK-VQA和A-OKVQA基准上的实验表明,SCoRe持续优于现有最先进方法,验证了结构化关系推理对提升知识型视觉问答性能的有效性。
| Knowledge-based Visual Question Answering (KB-VQA) | 基于知识的视觉问答,一种结合外部知识与图像信息来回答问题的任务。 |
| Large Language Models (LLMs) | 大型语言模型,如GPT系列,能够理解和生成自然语言文本。 |
| Structured Context Reasoning (SCoRe) | 结构化上下文推理,本文提出的框架,通过显式和隐式关系推理来提升预测性能。 |
| Relational Logic Distillation (RLD) | 关系逻辑蒸馏,一种将原始文本转换为实体-关系三元组的技术,用于压缩上下文。 |
| In-context Learning | 上下文学习,一种通过提供示例或上下文来引导模型执行任务的方法,无需微调。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅