零售长尾数据下,分层法让通胀误差狂降116倍!
Selection Bias Correction in Retail Intelligence
arXiv AI (cs.AI) #偏差校正#零售分析#模拟研究 🕐 08-28 12:00

📖 AI 总结

该研究通过400次蒙特卡洛模拟,系统评估了零售情报中长尾商品分布下的选择偏差校正方法。研究比较了五种逆概率加权(IPW)规格与不同分层数目的分层法在四种数据生成场景中的表现。结果显示,分层法在三种场景中表现更优,即便在边界与总体断点刻意错位时,中位误差仍低于0.04个百分点,较IPW优势达116倍。然而,在平滑多项式关系场景下,采用样条倾向模型的IPW胜出(中位误差0.007pp对0.013pp)。关键发现是,即便使用具备完美结构知识的“神谕”IPW规格,在阶跃函数场景中误差仍达6.06pp,远高于分层法的0.008pp。研究指出,这一现象源于正性假设的违背——当选择概率差异悬殊(90%对1%)时,加权方法超出其理论适用范围。结论建议,在存在严重正性违背的零售长尾分布中,分层法是更稳健的工程选择。

🔑 关键词速览

Selection Bias选择偏差,指样本选择过程中系统性地排除某些群体,导致估计结果偏离真实值。
Inverse Probability Weighting (IPW)逆概率加权,一种通过加权调整样本以消除选择偏差的方法,权重为选择概率的倒数。
Stratification分层,一种将总体划分为多个子组(层)并分别估计的方法,以减少偏差。
Positivity Assumption正性假设,因果推断中要求每个个体都有非零概率接受处理或选择,否则加权方法失效。
Long-tail Distribution长尾分布,指大量小众或低频项目构成的长尾部分,在零售中常被忽略但可能影响整体指标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅