本文提出一种以表头为中心、可解释的语义表格解释框架,用于在仅依赖元数据、单元格值缺失或不可靠的场景下进行列类型标注与数据质量评估。框架通过人工整理的词汇资源将表头映射为39种可解释的FinalFormat类型,并借助SourceKeywords保留词元级溯源信息;每种类型会激活基于数据质量问题分类体系的校验规则,可检测缺失数据、重复、领域违规、类型错误和时间不匹配等问题,并汇总为轻量级数据源质量指标HeadersIQ。研究在UCI、Prague、Kaggle、VizNet/Sato、SOTAB、T2Dv2及SemTab 2024等基准上评估,覆盖约12万表头列,显示对噪声真实元数据具有较广的实用覆盖。SemTab 2024官方严格评测结果一般,但盲审诊断表明许多不匹配源于基准粒度、别名和本体选择,而非预测本身不合理。该工作为元数据驱动的语义标注、数据源质量监控和知识图谱基准诊断提供了可复用流程。
| Semantic Table Interpretation (STI) | 语义表格解释,指自动识别表格中列、单元格等元素的语义类型和关系,以支持知识图谱构建。 |
| Column Type Annotation (CTA) | 列类型标注,为表格的每一列分配一个语义类型(如日期、地点、数值等)的任务。 |
| Data Quality Assessment (DQA) | 数据质量评估,系统性地检测和度量数据中存在的质量问题(如缺失、重复、不一致等)的过程。 |
| HeadersIQ | 本文提出的轻量级数据源级质量指标,通过聚合标题驱动的数据质量问题检测结果来量化数据源的整体质量。 |
| Metadata-to-KG | 元数据到知识图谱的映射任务,指仅利用表格元数据(如标题)将表格语义对齐到知识图谱本体(如DBpedia、Schema.org)。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅