本研究针对正例-未标注样本(PU)分类中SCAR假设被违反的情形,提出了一种融合聚类与过采样增强的逻辑回归方法。核心做法是:先利用SMOTE技术对训练集进行重平衡以缓解类别不平衡,再通过2-means聚类生成清洗后的标签,最后在清洗数据上训练逻辑回归,其中被识别为正例的样本用额外真实正例增强,其余视为负例。作者在13个真实基准数据集和1个合成数据集上开展实验,并与朴素方法和Spy-EM方法对比。结果表明,在SCAR条件不成立时引入SMOTE能提升分类性能,同时LassoJoint方法在该设定下表现出中等程度的稳健性。该工作为非标准采样条件下的PU学习提供了可行的技术路径。
| PU classification | 正例-未标记样本分类,一种半监督学习问题,训练数据仅包含正例和未标记样本。 |
| SCAR assumption | 选定完全随机假设,指未标记样本中的正例是随机选定的,即标记机制与特征无关。 |
| SMOTE | 合成少数类过采样技术,通过插值生成合成正例来缓解类别不平衡。 |
| Lasso regularization | Lasso正则化,一种通过L1范数惩罚实现特征选择和稀疏性的线性回归正则化方法。 |
| Spy-EM | 一种基于期望最大化的PU学习方法,通过引入间谍样本来估计正例比例。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅