稀有事件爆发预测最优分配:等量抽样竟超比例抽样,效率提升无参数化!
Optimal Stratified Allocation for Rare-Event Onset Forecasting in Dependent Sequences
arXiv ML (stat.ML) #统计学习#抽样设计#稀有事件 🕐 09-07 12:00

📖 AI 总结

本文研究依赖序列中罕见事件发生预测的分层抽样最优分配问题。作者在有限总体框架下,考虑类别加权损失,推导了无放回类别条件抽样下加权风险估计量的精确方差,并求解最优分配方案。核心发现是:类别乘数会放大正类离散度,但失衡比在最优分配中相互抵消,使得等量分配而非比例分配成为自然默认选择。简单随机抽样被显式层间项支配;精确偏差恒等式表明聚类代表选择缺乏通用无偏性保证;Serfling界将分配结果推广至有限候选集的选择误差。作者用350只美国股票2004-2011年数据验证理论,预测的四种设计排序成立,10日预测窗口的五个设计点排序与理论完全一致(Spearman rho=1,精确p=0.0167),但跨预测窗口的π依赖关系未获支持,作者识别了设计论证之外的干扰渠道。

🔑 关键词速览

Stratified Allocation分层分配,指在抽样设计中将样本量分配到不同层(如正类和负类)的策略。
Rare-Event Onset Forecasting稀有事件爆发预测,指预测罕见事件(如价格机制爆发)发生的时间点。
Class-Conditional Sampling类别条件抽样,指在抽样时分别从每个类别(层)中独立抽取样本的方法。
Phillips-Shi-Yu Procedure一种用于事后识别金融时间序列中泡沫或爆炸性价格区间的统计方法。
Serfling Bound一种概率不等式,用于限制有限总体抽样中估计误差的尾部概率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅