这篇论文对IBM Telco客户流失基准(n=7043)进行了可信度审计,揭示了高准确率背后的四类隐患。研究发现,在划分数据前使用SMOTE会使流失类F1虚高13.1个百分点,原因是约36%的合成训练点实为测试集样本的最近邻插值;TotalCharges字段几乎可由tenure与MonthlyCharges完全决定(R²=0.999),删除后准确率变化不足0.2个百分点,却仍被TreeSHAP列为第九重要特征,从而扭曲模型解释。校准审计显示等渗回归表现最稳健,而温度缩放不适用于类加权树集成。在50美元挽留成本与24个月CLV假设下,成本最优阈值比F1最优阈值低约5至10倍,每千名客户可节省约7.7万美元。作者据此提出涵盖流程披露、冗余诊断、校准审计与成本敏感阈值的四项报告清单,并发布可复现实现。
| SMOTE | 合成少数类过采样技术,一种通过生成合成样本来平衡类别分布的数据增强方法。 |
| F1分数 | 精确率和召回率的调和平均数,用于衡量分类模型的综合性能。 |
| 校准 | 调整模型预测概率以使其更准确地反映真实概率的过程。 |
| 成本最优决策阈值 | 在考虑不同决策错误成本的情况下,使总成本最小化的分类阈值。 |
| CLV | 客户生命周期价值,衡量客户在整个关系期间为企业带来的总利润。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅