本研究探讨大语言模型在生物医学假设生成中是否真正基于科学证据进行推理。作者整合KEGG、Rhea和UniProt三大生物数据库,构建统一生化知识图谱,并建立包含550条从酶源到罕见病终点路径的基准,在四种信息条件下由六个模型生成13200条假设,采用专家制定的五项标准量表评分。结果显示,仅提供源酶与疾病终点的模型往往产出评分最高的假设,说明模型能凭极少信息生成看似合理的想法,但这些假设的证据基础较弱;而提供完整生物路径的模型生成的假设与已知机制关系更为一致,作者称之为"证据约束推理"。通过打乱中间路径步骤而固定终点的实验,证据支撑度显著下降,证实模型确实利用了路径结构。研究表明知识图谱可从两方面支持假设生成:识别文献中缺失的生物终点对,以及以其机制路径引导模型的推理过程。
| 知识图谱 | 一种以图结构表示实体及其关系的知识库,用于整合和推理生物医学数据。 |
| 证据约束推理 | 指模型在生成假设时严格基于提供的科学证据路径进行推理,而非仅依赖参数化知识。 |
| 生物终点 | 指生物医学研究中的最终关注点,如疾病表型或临床结果,此处特指罕见疾病终点。 |
| 机制路径 | 描述生物过程中分子或通路之间因果关系的序列,如酶催化反应链。 |
| 假设生成 | 指利用计算模型自动提出新的科学假设或研究思路的过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅