该研究提出了一种名为SciJEPA的引文无关科学文献表示学习方法,利用论文的篇章结构进行非对称的文档内预测预训练。其核心机制是:用标题和摘要的表示预测方法部分,再用方法部分预测结论部分。在RELISH、高影响力引文预测、SciDocs及引文预测等基准上的实验表明,纯预测训练虽可行,但弱于使用相同段落对的受控对比基线。引入切片各向同性高斯正则化(SIGReg)后性能显著提升,缩小了与基线的差距。研究还发现正则化效果因任务而异:中等强度的SIGReg有助于细粒度排序,过强则会削弱局部对齐。此外,不同编码分支适用于不同的检索场景。该工作表明,在精细控制嵌入几何结构的前提下,文档内预测学习可成为科学文献表示的一种有前景的引文无关补充方案。
| SciJEPA | 一种无引用的科学文档表示学习框架,通过非对称的文档内预测进行预训练。 |
| Asymmetric Within-Document Prediction | 非对称文档内预测,指利用文档内部不同部分(如标题、摘要、方法、结论)之间的预测关系进行学习。 |
| Sliced Isotropic Gaussian Regularization (SIGReg) | 切片各向同性高斯正则化,一种用于改善嵌入几何的正则化技术,通过约束表示分布接近各向同性高斯分布。 |
| Contrastive Baseline | 对比基线,使用对比学习方法(如正负样本对)作为基准模型,用于评估预测性训练的性能。 |
| Discourse Structure | 话语结构,指论文中不同部分(如标题、摘要、方法、结论)之间的逻辑和组织关系。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅