该研究提出了一种名为MiNER的微调生物医学自然语言处理方法,用于从疟疾临床文本中识别疾病实体。研究团队选取并预处理了大量疟疾相关科学文献,标注了具有临床意义的实体,并利用预训练语言模型BioBERT对文本数据进行上下文感知编码。通过领域特定标注和监督学习进行微调,模型在提取生物医学命名实体方面表现出色。实验结果表明,与传统编码方法和机器学习算法相比,MiNER在精确率、召回率和准确率上均有显著提升。此外,研究团队公开了人工标注的实体与关系提取数据集,为其他健康信息学研究者训练疟疾信息提取模型提供了宝贵资源。该研究有助于从快速增长的科学文献中高效提取关键信息,支持疟疾的分子机制、流行病学和治疗干预研究。
| BioBERT | 一种基于BERT架构的预训练生物医学语言模型,专门针对生物医学文本进行优化。 |
| Fine-tuning | 在预训练模型基础上,使用特定领域的数据进行进一步训练,以适应特定任务。 |
| Named Entity Recognition (NER) | 从文本中识别出具有特定意义的实体(如疾病、药物、基因等)的任务。 |
| Biomedical Information Extraction | 从生物医学文献中自动提取结构化信息的过程,包括实体和关系提取。 |
| Context-aware Representations | 根据上下文动态生成的文本表示,能够捕捉词语在不同语境中的含义。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅