模型选择难题被攻破!新框架让强依赖下的选模又快又稳,风险界还超准
A Unified Descriptive-Complexity Framework for Model Selection under Correlated Designs
arXiv ML (stat.ML) 重要 #模型选择#统计学习 🕐 08-28 12:00

📖 AI 总结

该论文提出了一种统一的描述复杂性框架,用于解决强预测变量依赖和模型类别不确定下的模型选择问题。作者引入描述复杂性信息准则(DCIC),通过Kraft可接受码长对大规模候选模型集合进行正则化。在次Weibull噪声条件下,该框架无需RIP类条件即可实现选择一致性,并提供在模型误设下仍有效的非渐近风险界。该编码原理还能以较小的类别识别成本将异质模型类置于统一复杂性尺度上,实现类别-模型恢复和跨类别风险适应。此外,论文开发了复杂度引导的搜索路径,明确计算与统计之间的权衡:较大惩罚可高概率保留多项式规模的搜索区域,较小惩罚则优化风险基准。数值实验表明,该方法在强依赖和模型类别不确定下具有稳定的支持恢复和良好的估计性能。

🔑 关键词速览

Descriptive-Complexity Information Criterion (DCIC)一种基于描述复杂度的信息准则,用于在模型选择中通过码长正则化大型候选模型集合。
Kraft-admissible code lengths满足Kraft不等式的码长分配,确保可唯一解码,用于模型正则化。
sub-Weibull noise一类重尾噪声分布,其尾部行为受Weibull分布控制,用于放宽对噪声的假设。
RIP-type conditions受限等距性质类条件,常用于压缩感知,此处被避免以放宽假设。
oracle risk bounds与理想oracle模型(已知真实模型)风险相关的上界,用于评估估计性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅