本文提出“极端二分类”这一新问题:在训练集正例数量趋于无穷时,要求分类器的假阴性率被约束在远低于单个正例量级的水平,即几乎不允许漏检。作者指出,尽管二分类研究已相当成熟,但这一以近乎零假阴性为目标的极端约束场景此前基本未被探索。针对该问题,论文提出一种基于极值理论保证的阈值自适应方法,并配合基于样本极大值置换检验的特征选择流程。在四个不同规模的真实数据集上,该方法与当前先进方法相比表现更优,并在癌症筛查数据上展示了可解释性。该工作将极值理论引入分类器阈值学习,为高代价漏检场景提供了理论支撑与实用方案。
| 极端二分类 | 一种二分类问题设定,要求分类器的假阴性率极低,几乎为零。 |
| 假阴性率 | 分类器将正例错误预测为负例的比例,是评估分类器性能的重要指标。 |
| 极值理论 | 统计学中研究极端事件概率分布的理论,用于对极端分位数进行建模和估计。 |
| 阈值自适应 | 根据数据分布动态调整分类决策阈值的方法,以优化特定性能指标。 |
| 置换检验 | 一种非参数统计检验方法,通过随机重排数据来评估特征的显著性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅