仅用固定权重二分之一融合耙平对偶分数,DRR在24个数据集上平均提升0.034,22个超越重采样器!
Density-Ratio Rescoring for Imbalanced Classification
arXiv ML (stat.ML) 重要 #不平衡分类#密度比#重加权 🕐 今天 12:00

📖 AI 总结

本文提出一种面向不平衡分类的密度比重打分方法(DRR)。该方法在原始类别先验下训练的分类器基础上,引入基于调查加权(raking)的对偶得分:通过对多数类样本重新加权,使其在容忍度内匹配少数类的特征矩。DRR对基础得分与对偶得分进行边际标准化,并以固定权重二分之一融合,直接使用拟合对偶进行预测,无需重采样或重新训练基础分类器。理论分析表明,在总体精确匹配且对数线性倾斜模型正确设定时,对偶得分等于对数密度比(相差一个加性常数),并给出融合能提升类别分离度的信号强度与相关性条件。在24个表格基准、30次试验和5种基础学习器上,DRR在D=128随机特征设置下于所有数据集上提升平均精度,平均增益0.034;在22个数据集上优于共享对偶的重采样方法,平均增益0.092,并在基因表达队列的全部8个一对多任务上均取得提升。结果表明,raking对偶可作为可复用得分,在保留原始先验分类器的同时改善稀有类排序。

🔑 关键词速览

Density-Ratio Rescoring (DRR)一种通过密度比的对偶分数对原始分类器进行重评分的方法,用于提升不平衡分类中的稀有类排序性能。
Survey-Raking Dual Score通过调查耙平技术得到的对偶分数,用于重新加权多数类样本以匹配少数类特征矩。
Log-Linear Tilt Model一种对数线性倾斜模型,用于建模密度比,在正确指定时对偶分数等于对数密度比加上常数。
Average Precision平均精度,一种评估排序质量的指标,尤其适用于类别不平衡场景。
One-Versus-Rest一对多策略,将多类分类问题转化为多个二分类问题,每个类别作为正类与其他类别区分。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅