SMOTE加持逻辑回归,13个真实数据集验证PU分类性能提升!
PU classification under Non-SCAR: clustering-assisted logistic model with oversampling enhancement
arXiv ML (stat.ML) #PU学习#类别不平衡#逻辑回归 🕐 09-15 12:00

📖 AI 总结

本研究针对正例-未标注样本(PU)分类中SCAR假设被违反的情形,提出了一种融合聚类与过采样增强的逻辑回归方法。核心做法是:先利用SMOTE技术对训练集进行重平衡以缓解类别不平衡,再通过2-means聚类生成清洗后的标签,最后在清洗数据上训练逻辑回归,其中被识别为正例的样本用额外真实正例增强,其余视为负例。作者在13个真实基准数据集和1个合成数据集上开展实验,并与朴素方法和Spy-EM方法对比。结果表明,在SCAR条件不成立时引入SMOTE能提升分类性能,同时LassoJoint方法在该设定下表现出中等程度的稳健性。该工作为非标准采样条件下的PU学习提供了可行的技术路径。

🔑 关键词速览

PU classification正例-未标记样本分类,一种半监督学习问题,训练数据仅包含正例和未标记样本。
SCAR assumption选定完全随机假设,指未标记样本中的正例是随机选定的,即标记机制与特征无关。
SMOTE合成少数类过采样技术,通过插值生成合成正例来缓解类别不平衡。
Lasso regularizationLasso正则化,一种通过L1范数惩罚实现特征选择和稀疏性的线性回归正则化方法。
Spy-EM一种基于期望最大化的PU学习方法,通过引入间谍样本来估计正例比例。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅