本文提出Build2SPARQL,一个面向建筑知识图谱的大规模文本到SPARQL基准数据集。建筑自动化系统正日益采用Brick和ASHRAE 223P等本体构建语义知识图谱,但自然语言查询此类图谱的研究受限于缺乏大规模基准。该数据集通过图谱驱动的流水线生成:SPARQL查询完全由图遍历代码生成并验证,大语言模型仅负责生成自然语言问题,从而确保查询正确性不受模型行为影响。流水线涵盖线性链、分支、UNION、聚合、OPTIONAL和属性过滤六类查询模式,并针对每种查询生成五种词汇风格的问题。基于201个建筑知识图谱(180个Brick、21个ASHRAE 223P),共生成6136条可执行SPARQL查询和30680个问题。人工验证显示语义保真度达98.8%,自然度98.8%,操作合理性84.0%。在三个开源模型上的检索增强评估表明,精确匹配准确率从零样本的0.2%至20%提升至三样本检索的56%至65%。该工作为建筑领域知识图谱的自然语言查询研究提供了重要基准。
| SPARQL | 一种用于查询 RDF 知识图谱的标准化查询语言。 |
| Brick | 一种用于建筑自动化系统的开源本体,用于表示建筑设备、传感器和关系。 |
| ASHRAE 223P | ASHRAE 发布的标准本体,用于描述建筑自动化系统中的语义信息。 |
| text-to-SPARQL | 将自然语言问题自动转换为 SPARQL 查询的任务。 |
| retrieval-augmented evaluation | 一种评估方法,通过检索相关示例来增强语言模型的上下文,以提高其性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅