本文介绍了一种名为SNAIL的混合命名实体识别框架,用于从生物医学文献中自动识别生物信息学软件和数据库名称。研究指出,现有文献中这些资源名称的提及往往不一致,缺乏系统化的识别手段,阻碍了大规模生物医学知识提取。SNAIL结合了词汇与语义两种建模策略:词汇部分捕捉名称的拼写模式和上下文线索,语义部分则利用SciBERT等Transformer语言模型生成上下文嵌入,并通过显式token掩蔽策略增强实体相关表征。训练语料通过引用提示提取与大语言模型辅助蒸馏的混合流程自动构建。在两个独立基准数据集和真实研究文章上的评估显示,SNAIL显著优于现有方法,包括领域专用工具bioNerDS2及ChatGPT、Gemini等通用大语言模型。将该框架应用于大规模文献分析,还揭示了不同生物信息学子领域在期刊层面的工具使用偏好。研究结果表明,SNAIL为科学文本中的生物信息学资源识别提供了准确且可扩展的解决方案,并支持对工具使用模式和研究趋势的系统性元分析。
| SNAIL | 一种混合命名实体识别框架,用于自动识别生物医学文本中的软件和数据库名称。 |
| 命名实体识别(NER) | 从文本中识别具有特定意义的实体(如软件名、数据库名)的技术。 |
| SciBERT | 基于Transformer的科学文献预训练语言模型,用于生成上下文嵌入。 |
| bioNerDS2 | 一种领域特定的生物医学命名实体识别方法,作为对比基准。 |
| 大语言模型(LLM) | 如ChatGPT等通用大型语言模型,用于辅助数据蒸馏和对比评估。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅