本文提出 VisKG-LM,一种将知识图谱离线编译为可复用视觉记忆的多选题问答方法。传统做法需在每次推理时用图神经网络重新编码检索到的子图,即便图谱本身不变,也造成跨训练轮次、随机种子和评测的重复计算。VisKG-LM 将图编码与语言推理解耦:把每个候选相关子图序列化为关系标注路径,并渲染成保留路径分支结构的二维图像,离线编码一次后缓存。推理时语言模型仅凭文本理解问题与选项,最后一层再读取缓存的视觉记忆,兼顾全局布局与局部关系细节,使图信息在文本理解之后才介入。在 CommonsenseQA、OpenBookQA 和 MedQA-USMLE 上,该方法较 GreaseLM 分别提升 1.2、0.8 和 4.3 分,以约 4 亿在线参数匹配或超越 70 亿参数的 GraphVis;相比接收相同路径文本的纯文本对照,分别提升 4.2、6.5 和 5.1 分,表明视觉记忆接口本身具有超出路径文本化的额外价值,为在线图传播提供了替代方案。
| VisKG-LM | 本文提出的模型,将知识图谱离线编译为视觉记忆,供语言模型在推理时读取。 |
| Relation-Labeled Paths | 一种将知识图谱子图序列化为带关系标签的路径的表示方法,用于生成图像。 |
| 视觉记忆 | 将图结构渲染为图像并缓存,作为只读存储器供模型在推理时查询。 |
| GreaseLM | 一种将图神经网络与语言模型在线融合的问答基线模型。 |
| GraphVis | 一个70亿参数的视觉语言模型,作为对比基线。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅