本研究基于MoleculeNet血脑屏障渗透性数据集(n=2039),系统比较了Morgan指纹、RDKit理化描述符和SMILES双字符组三类分子特征在四种学习算法下的预测表现,旨在将特征化过程与模型架构的影响分离。结果显示,预测性能取决于特征表示与算法的联合作用,采用组合特征的动态随机森林取得最高平均AUC(0.970,95%置信区间0.963–0.977)。在此基础上,研究进一步以LogP中位数分割构建伪处理变量,利用广义随机森林结合双/去偏机器学习估计分子结构与血脑屏障渗透性之间的异质性关联。正交化处理后,朴素因果森林所检测到的异质性大幅减弱,经错误发现率校正后无任何条件效应显著(最小校正p值为0.082),正交化特征重要性也转向SMILES双字符组中的残差结构信息。研究表明,在充分控制已观测混杂后,尚缺乏证据支持LogP与血脑屏障渗透性的关联在化学空间中存在系统性差异,同时提示特征表示与模型架构是相互耦合的设计选择,未经正交化的因果森林可能高估真实的处理效应异质性。
| 血脑屏障通透性 | 物质穿过血脑屏障进入大脑的能力,是中枢神经系统药物开发的关键指标。 |
| Morgan指纹 | 一种常用的分子圆形指纹,通过哈希分子子结构生成二进制特征向量。 |
| 广义随机森林 | 随机森林的扩展,用于估计条件平均处理效应等异质性处理效应。 |
| 双/去偏机器学习 | 一种结合机器学习与正交化(如Neyman正交)的因果推断方法,用于减少混杂偏差。 |
| 错误发现率校正 | 多重假设检验中控制错误发现比例的方法,如Benjamini-Hochberg程序。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅