高分竟是幻觉?北京空气质量档案中交互项占预测得分91.4%!
When a High Score Is an Illusion: Certifying Genuine versus Repackaged Forecasting Skill
arXiv ML (stat.ML) 重要 #评测基准#预测评估#统计检验 🕐 09-18 12:00

📖 AI 总结

这篇论文研究预测模型评估中一个容易被忽视的问题:当评估所用的观测数据被重复用于比较时,即使预测结果本身不变,预测排名与结果排名之间也会产生虚假的关联,从而让模型看起来具备实际并不存在的预测能力。作者从理论上刻画了在何种条件下这种关联能够被保持,证明对每一对映射而言,加权参考重叠为零是唯一且充分的条件,并据此构建了无偏的三轨迹核估计方法,可在有限样本下给出下界。在北京市空气质量数据的实证中,这种交互效应解释了七个已学习预测模型预期共享得分的91.4%至94.5%;在匹配的类别对照零实验中,采用不同参考集后,1000个面板中的拒绝数从402降至41。该研究为区分真实预测能力与被包装出来的高分提供了可操作的检验框架,对模型评估与基准比较的可靠性具有直接意义。

🔑 关键词速览

排名对比比较预测排名与结果排名之间差异的统计量,用于评估预测技能。
轨迹在时间序列或序列预测中,指一个完整的观测序列或路径。
U统计量一种无偏估计量,用于估计可交换样本的函数,常用于非参数统计。
共享基线在比较多个预测时共同使用的参考基准,用于计算相对排名。
类别拟合误差在分类任务中,模型预测类别与真实类别之间的差异度量。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅