该研究利用自然语言处理技术对古印度医学文献《妙闻集》等文本进行知识提取与主题分类,旨在解决古代医学典籍因语言复杂和格式古老而难以系统化整理的问题。研究采用命名实体识别(NER)识别疾病、治疗方式、研究人员及药用植物等关键实体,借助BERTopic模型进行主题建模以揭示潜在医学议题,并利用Neo4j图数据库构建知识图谱,实现实体间关系的语义可视化与高效检索。研究结果表明,结合图数据库、主题建模与实体识别技术,能够有效实现阿育吠陀传统医学知识的计算化组织,弥合古代文本与现代数据驱动研究之间的鸿沟。该方法对历史文本分析、医学信息学及数字人文学科具有推动作用,使古印度医学智慧更易于访问和理解。该论文发表于2025年TISS-IATLIS全国会议并获最佳论文奖。
| Named Entity Recognition (NER) | 命名实体识别,一种自然语言处理技术,用于从文本中识别出具有特定意义的实体,如人名、地名、疾病名等。 |
| BERTopic | 一种基于BERT的主题建模方法,利用预训练语言模型进行主题聚类,以识别文本中的潜在主题。 |
| Knowledge Graph | 知识图谱,一种以图结构存储实体及其关系的语义网络,用于支持复杂查询和知识推理。 |
| Neo4j | 一种流行的图数据库管理系统,用于存储和查询高度关联的数据,支持图分析和可视化。 |
| Ayurveda | 阿育吠陀,印度传统医学体系,强调身心平衡和自然疗法,具有数千年的历史。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅