AUC冲到0.970!随机森林到广义随机森林新流程,精准预测血脑屏障通透性
Feature Space Selection and Heterogeneous Effect Estimation for Blood-Brain Barrier Permeability: A Random Forest to the Generalized Random Forest Pipeline
arXiv ML (stat.ML) 重要 #药物发现#特征选择#因果推断 🕐 今天 12:00

📖 AI 总结

本研究基于MoleculeNet血脑屏障渗透性数据集(n=2039),系统比较了Morgan指纹、RDKit理化描述符和SMILES双字符组三类分子特征在四种学习算法下的预测表现,旨在将特征化过程与模型架构的影响分离。结果显示,预测性能取决于特征表示与算法的联合作用,采用组合特征的动态随机森林取得最高平均AUC(0.970,95%置信区间0.963–0.977)。在此基础上,研究进一步以LogP中位数分割构建伪处理变量,利用广义随机森林结合双/去偏机器学习估计分子结构与血脑屏障渗透性之间的异质性关联。正交化处理后,朴素因果森林所检测到的异质性大幅减弱,经错误发现率校正后无任何条件效应显著(最小校正p值为0.082),正交化特征重要性也转向SMILES双字符组中的残差结构信息。研究表明,在充分控制已观测混杂后,尚缺乏证据支持LogP与血脑屏障渗透性的关联在化学空间中存在系统性差异,同时提示特征表示与模型架构是相互耦合的设计选择,未经正交化的因果森林可能高估真实的处理效应异质性。

🔑 关键词速览

血脑屏障通透性物质穿过血脑屏障进入大脑的能力,是中枢神经系统药物开发的关键指标。
Morgan指纹一种常用的分子圆形指纹,通过哈希分子子结构生成二进制特征向量。
广义随机森林随机森林的扩展,用于估计条件平均处理效应等异质性处理效应。
双/去偏机器学习一种结合机器学习与正交化(如Neyman正交)的因果推断方法,用于减少混杂偏差。
错误发现率校正多重假设检验中控制错误发现比例的方法,如Benjamini-Hochberg程序。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅