仅用7%数据训练,CRISP在2500万行欺诈数据集上保住99.7%精度!
CRISP: Scalable Importance-Stratified Coresets for Imbalanced Tabular Learning
arXiv LG (cs.LG) 重要 论文方法效率优化 🕐 今天 12:00

📖 AI 总结

针对大规模不平衡表格数据训练梯度提升树成本高昂的问题,本文提出CRISP(基于重要性分层剪枝的核心集缩减)方法。该方法以线性时间复杂度,按代理模型得分的分位数分层分配负类样本预算,并通过样本权重校正不等 inclusion 概率。在生产欺诈数据集上,当负类样本减少95%时,CRISP仅用约170万行(原始2500万行)训练,仍保留全量数据99.7%的平均精度,总训练行数减少93.2%。在公开数据集CriteoPrivateAds上,其在90%至99.4%多数类缩减率下均取得最高平均精度;Sparkov数据集上低缩减率表现不一,但在99.2%和99.4%时领先。消融实验表明,预算分配与逆倾向加权是性能提升的主要来源。

🔑 关键词速览

Coreset核心集,从大规模数据集中选取的代表性子集,用于高效训练模型。
Importance-Stratified Pruning重要性分层剪枝,根据样本重要性分层进行剪枝以保留关键信息的方法。
Gradient-Boosted Trees梯度提升树,一种集成学习算法,通过迭代添加决策树来提升预测性能。
Average Precision平均精度,评估排序或分类模型性能的指标,尤其适用于不平衡数据。
Inverse-Propensity Weighting逆倾向加权,一种通过样本被选中的概率倒数来加权以纠正选择偏差的方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅