该研究探讨了自监督预训练在分子图神经网络中的应用价值,作者将LeJEPA架构(一种免预测器的联合嵌入预测架构,辅以Sketched各向同性高斯正则化)适配到分子图编码器上,并在抗生素活性数据集和ogbg-molhiv基准上进行了系统评估。结果显示,预训练能显著改善学习到的表征质量——冻结探针在ogbg-molhiv上的ROC-AUC从随机初始化的0.665提升至0.788,但这一优势并未稳定转化为微调性能的提升,仅在特定分区下观察到显著效果。进一步分析发现,预训练嵌入的有效维度约在16-32之间,远低于摩根指纹的1024位。将截断后的嵌入与1024位摩根指纹结合,可将ROC-AUC从0.805提升至0.832,而未经训练的编码器无此增益。研究结论表明,自监督预训练提供的互补信息更适合通过特征级融合来发挥价值,而非直接依赖微调。
| LeJEPA | 一种无预测器的联合嵌入预测架构,用于自监督学习,通过正则化避免表示坍塌。 |
| SIGReg (Sketched Isotropic Gaussian Regularisation) | 各向同性草图高斯正则化,用于约束嵌入空间,提升自监督预训练的稳定性。 |
| D-MPNN | 消息传递神经网络的一种变体,基于有向边传递信息,常用于分子性质预测。 |
| ogbg-molhiv | Open Graph Benchmark中的分子数据集,用于评估分子性质预测(如HIV活性)的基准。 |
| Morgan fingerprint | 一种基于圆形拓扑的分子指纹表示方法,用于编码分子结构特征。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅