CliffRank是一个针对活性悬崖排序预测任务提出的双分支框架。活性悬崖指分子局部结构微小变化导致活性显著差异的现象,传统方法难以有效建模。该框架将绝对活性回归与排序一致性学习相结合,训练两个并行预测器,并引入成对偏好一致性损失来对齐排序关系。在三个抗菌肽数据集上,CliffRank配合ESM2-t12取得了0.5393的平均斯皮尔曼相关系数和21.4的平均Recall@50;在三个小分子数据集上,配合PNA模型取得了0.6890的平均斯皮尔曼相关系数。研究还发现,延迟激活偏好一致性损失、非对称初始化等策略对部分指标有提升,但最优配置因数据集而异。该工作为充分利用有限活性标签、提升活性悬崖预测精度提供了新思路,未来可进一步探索自适应训练策略及引入蛋白质或膜环境信息。
| Activity-Cliff Ranking | 活性悬崖排名,指预测化合物或肽段中因微小结构变化导致活性显著差异的排序任务。 |
| Pairwise Preference Consistency (PPC) | 成对偏好一致性,一种损失函数,用于在偏好概率空间中保持预测排序与真实排序的一致性。 |
| ESM2-t12 | 一种基于蛋白质语言模型ESM2的变体,t12表示使用12层Transformer结构,用于提取序列特征。 |
| PNA | Principal Neighbourhood Aggregation,一种图神经网络聚合方法,用于处理分子图结构数据。 |
| Recall@50 | 前50个预测中检索到的相关项比例,用于评估排名模型的检索性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅