本文提出一种面向不平衡分类的密度比重打分方法(DRR)。该方法在原始类别先验下训练的分类器基础上,引入基于调查加权(raking)的对偶得分:通过对多数类样本重新加权,使其在容忍度内匹配少数类的特征矩。DRR对基础得分与对偶得分进行边际标准化,并以固定权重二分之一融合,直接使用拟合对偶进行预测,无需重采样或重新训练基础分类器。理论分析表明,在总体精确匹配且对数线性倾斜模型正确设定时,对偶得分等于对数密度比(相差一个加性常数),并给出融合能提升类别分离度的信号强度与相关性条件。在24个表格基准、30次试验和5种基础学习器上,DRR在D=128随机特征设置下于所有数据集上提升平均精度,平均增益0.034;在22个数据集上优于共享对偶的重采样方法,平均增益0.092,并在基因表达队列的全部8个一对多任务上均取得提升。结果表明,raking对偶可作为可复用得分,在保留原始先验分类器的同时改善稀有类排序。
| Density-Ratio Rescoring (DRR) | 一种通过密度比的对偶分数对原始分类器进行重评分的方法,用于提升不平衡分类中的稀有类排序性能。 |
| Survey-Raking Dual Score | 通过调查耙平技术得到的对偶分数,用于重新加权多数类样本以匹配少数类特征矩。 |
| Log-Linear Tilt Model | 一种对数线性倾斜模型,用于建模密度比,在正确指定时对偶分数等于对数密度比加上常数。 |
| Average Precision | 平均精度,一种评估排序质量的指标,尤其适用于类别不平衡场景。 |
| One-Versus-Rest | 一对多策略,将多类分类问题转化为多个二分类问题,每个类别作为正类与其他类别区分。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅