本文提出一种面向生物医学数据的聚类友好型数据表示框架CopDAG,旨在解决诊断错误与标签误标导致预测模型可靠性下降的问题。该方法将Copula模型与基于有向无环图(DAG)的因果结构发现(CSD)集成方法相结合:Copula用于建模非高斯、非线性的特征依赖关系,放松了多元正态性、线性依赖和对称性假设;DAG集成则识别特征间稳定的因果关系。在16个生物医学数据集上,采用K-means聚类后,CopDAG在归一化聚类准确率和调整兰德指数两项指标上均位列12种对比方法之首。该方法的优势在于无需数据标注和监督学习即可从特征关系中预测真实类别标签,同时提供聚类可视化与可解释的因果结构,为无标签生物医学数据的有效分层提供了新思路。
| Copula | 一种统计模型,用于描述多变量分布中的依赖结构,允许灵活建模非高斯和非线性关系。 |
| Directed Acyclic Graph (DAG) | 有向无环图,一种图形模型,用于表示变量之间的因果关系,其中边有方向且无环。 |
| Causal Structure Discovery (CSD) | 因果结构发现,从数据中识别变量间因果关系的计算方法。 |
| K-means | 一种常用的聚类算法,将数据划分为K个簇,使簇内数据点尽可能相似。 |
| Adjusted Rand Index (ARI) | 调整兰德指数,一种衡量聚类结果与真实标签一致性的指标,调整了随机一致性的影响。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅