稀疏模型下尺度不变最优子采样,预测误差直降,效率翻倍!
Scale-invariant Optimal Sampling for Rare-events Data with Sparse Models
arXiv ML (stat.ML) 重要 #采样方法#大数据#稀疏模型 🕐 08-25 12:00

📖 AI 总结

该研究针对稀有事件大规模数据中的子采样问题,提出了一种尺度不变的最优子采样方法。现有最优子采样概率依赖于数据尺度,不恰当的缩放变换可能降低采样效率,尤其在存在非活跃特征时问题更为突出。作者在稀疏模型框架下,以预测误差最小化为目标定义最优子采样函数,并采用自适应lasso作为估计方法。研究首先建立了稀有事件数据下自适应lasso估计量的oracle性质,验证了子采样的有效性;随后推导出尺度不变的最优子采样函数,使逆概率加权自适应lasso的预测误差最小化;最后提出基于最大采样条件似然的估计量以进一步提升效率。模拟和真实数据实验均验证了所提方法的性能优势。

🔑 关键词速览

Subsampling子采样,从大规模数据集中选取一部分样本以降低计算成本的方法。
Scale-invariant尺度不变,指方法或函数不受数据尺度变换影响的性质。
Adaptive Lasso自适应Lasso,一种加权L1正则化方法,用于变量选择和参数估计。
Oracle properties预言性质,指估计器在理论上具有与已知真实模型相同的渐近性质。
Inverse probability weighted (IPW)逆概率加权,一种用于处理非随机样本的统计技术,通过权重调整样本代表性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅