高维小样本下SVM竟不收敛!新方法SC-SVM让分类一致,样本量必须涨!
Asymptotic Properties of Support Vector Machines in High-Dimension, Low-Sample-Size Settings under a Spiked Model
arXiv ML (stat.ML) #支持向量机#高维统计#渐近理论 🕐 今天 12:00

📖 AI 总结

本文研究高维低样本量(HDLSS)情形下支持向量机(SVM)在尖峰模型(spiked model)中的渐近性质。作者指出,现有HDLSS理论依赖的几何表示要求协方差矩阵特征值不占主导地位,而该条件在尖峰模型下不再成立。研究发现,HDLSS数据的Gram矩阵依分布收敛于一个随机矩阵,数据收敛到由尖峰数量决定的有限维空间中的随机构型,导致SVM的误分类率不趋于零,即SVM不具备一致性。偏置校正SVM(BC-SVM)在此情形下同样表现不佳,因为偏置项本身需要修正。为此,作者提出尖峰校正SVM(SC-SVM),证明当样本量趋于无穷时该分类器具有一致性,并指出样本量增长是本质性的——任何基于投影的方法在样本量固定时均会失效。最后通过数值模拟验证了各分类器的性能。

🔑 关键词速览

尖峰模型 (spiked model)一种协方差矩阵模型,其中少数特征值显著大于其余特征值,常用于高维数据分析。
高维小样本 (HDLSS)指数据维数远大于样本量的设定,是现代高维统计中的典型场景。
支持向量机 (SVM)一种常用的监督学习分类器,通过寻找最大间隔超平面来分离数据。
一致性 (consistency)指随着样本量增大,分类器的误分类率趋于零的性质。
尖峰校正SVM (SC-SVM)本文提出的改进SVM方法,通过校正尖峰模型的影响,在样本量增长时具有一致性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅