本文针对深度聚类中统计可靠性难以评估的问题提出解决方案。深度聚类通过先学习低维潜在表示再进行聚类来发现高维数据中的结构,但直接在原始数据上检验已发现的聚类会引入选择偏差,使经典p值失效。选择性推断(SI)可校正此类偏差,但现有方法仅适用于直接在观测特征上进行的聚类。本文针对使用固定预训练编码器的深度聚类,构建了选择性推断框架。其核心难点在于聚类分配经由从原始数据空间到潜在空间的非线性变换确定,选择过程远比传统聚类复杂。该方法以计算可行的方式处理这一过程,支持对潜在空间中聚类间差异进行有效的统计检验。合成实验表明,该方法能控制第一类错误率,同时比有效但保守的基线方法具有更高功效;基因组学应用显示其能在适当校正选择偏差的同时识别显著的聚类差异。该框架为量化深度聚类发现结构的统计可靠性提供了原则性方法。
| 深度聚类 (Deep Clustering) | 一种利用深度神经网络学习低维潜在表示,然后在该表示上进行聚类以发现数据中潜在结构的方法。 |
| 选择性推断 (Selective Inference, SI) | 一种统计推断框架,旨在校正因数据驱动选择(如聚类)而产生的选择偏差,从而提供有效的 p 值和置信区间。 |
| 潜在空间 (Latent Space) | 通过深度神经网络将原始高维数据映射到的低维特征空间,通常能捕捉数据的关键结构信息。 |
| 选择偏差 (Selection Bias) | 当假设或模型基于同一数据选择后再进行统计检验时,导致的 p 值偏小、错误发现率升高等偏差。 |
| 第一类错误率 (Type I Error Rate) | 在原假设为真时错误地拒绝原假设的概率,即假阳性率,是统计检验中需要控制的重要指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅