该研究针对大语言模型是否真正理解上下文这一核心问题展开探讨,指出传统评估方法如BLEU和困惑度仅能衡量表层表现,无法判断问答中的回答是否真正基于上下文而非记忆关联。为此,作者提出了一种基于知识图谱的评估框架,其核心是面向知识图谱的语义结构相似度度量S3KG,将结构与语义信号融合为单一评分,并配套开发了诊断分析框架,可在三元组层面识别和归类推理错误。在九个基准测试上,S3KG相较最强基线F1提升最高达7.6分,AUROC最高达0.973。该工作为评估大模型上下文理解能力提供了更细粒度的工具,有助于区分真正的语境推理与模式匹配。
| LLM(大语言模型) | 基于海量文本训练、具备强大语言生成与理解能力的深度学习模型,如GPT系列。 |
| 知识图谱(KG) | 以实体和关系构成的三元组形式结构化表示知识的数据模型,常用于知识推理与问答。 |
| S3KG(知识图谱语义结构相似度) | 本文提出的混合相似度度量,融合知识图谱的结构与语义信息,用于评估模型输出的上下文一致性。 |
| BLEU(双语评估替补) | 机器翻译等领域常用的基于n-gram重叠的自动评价指标,衡量生成文本与参考文本的表面相似度。 |
| AUROC | 接收者操作特征曲线下面积,用于评估二分类模型在不同阈值下的整体区分能力,值越高性能越好。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅