知识图谱离线编译一次,4亿参数超越70亿模型,最高提升4.3分!
VisKG-LM: Compiling Knowledge Graphs into Visual Memory for Multiple-Choice Question Answering
arXiv CL (cs.CL) 重要 多模态论文方法Agent 🕐 09-18 12:00

📖 AI 总结

本文提出 VisKG-LM,一种将知识图谱离线编译为可复用视觉记忆的多选题问答方法。传统做法需在每次推理时用图神经网络重新编码检索到的子图,即便图谱本身不变,也造成跨训练轮次、随机种子和评测的重复计算。VisKG-LM 将图编码与语言推理解耦:把每个候选相关子图序列化为关系标注路径,并渲染成保留路径分支结构的二维图像,离线编码一次后缓存。推理时语言模型仅凭文本理解问题与选项,最后一层再读取缓存的视觉记忆,兼顾全局布局与局部关系细节,使图信息在文本理解之后才介入。在 CommonsenseQA、OpenBookQA 和 MedQA-USMLE 上,该方法较 GreaseLM 分别提升 1.2、0.8 和 4.3 分,以约 4 亿在线参数匹配或超越 70 亿参数的 GraphVis;相比接收相同路径文本的纯文本对照,分别提升 4.2、6.5 和 5.1 分,表明视觉记忆接口本身具有超出路径文本化的额外价值,为在线图传播提供了替代方案。

🔑 关键词速览

VisKG-LM本文提出的模型,将知识图谱离线编译为视觉记忆,供语言模型在推理时读取。
Relation-Labeled Paths一种将知识图谱子图序列化为带关系标签的路径的表示方法,用于生成图像。
视觉记忆将图结构渲染为图像并缓存,作为只读存储器供模型在推理时查询。
GreaseLM一种将图神经网络与语言模型在线融合的问答基线模型。
GraphVis一个70亿参数的视觉语言模型,作为对比基线。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅