该论文针对基于大语言模型的自动研究思路生成系统存在的结构性缺陷,提出了一种利用范畴论增强论文知识图谱的新方法。现有系统将论文视为扁平对象,仅依赖自由文本重组、随机配对或嵌入相似度检索,忽略了研究者实际使用的类型化问题-方法-指标-主张关系链。作者将每篇论文建模为一个小范畴,以类型化研究实体为对象、论文断言的关系为态射,跨论文桥接则通过保持对象种类和关系类别的部分函子实现。算法包含三个层次:范畴签名聚类、函子保持门控和六轴LLM合理性评估。在数万篇全文解析论文的实验中,范畴门控以约17:1的比例过滤跨领域候选,被接受思路的定量可证伪率保持在83%以上,且所有被拒候选均保留各轴理由,使门控兼具日志记录功能。
| 范畴论 | 数学分支,研究对象和箭头(态射)及其组合,用于抽象结构关系。 |
| 函子 | 范畴之间的结构保持映射,将对象映射到对象、态射映射到态射,并保持组合和恒等。 |
| 论文知识图谱 | 以论文为节点、关系为边的结构化表示,用于捕捉研究实体间的语义联系。 |
| 可证伪性 | 科学哲学概念,指一个假设或思路能被实验或观察反驳的可能性。 |
| LLM | 大型语言模型,如GPT系列,用于生成和理解自然语言文本。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅