本文研究高维低样本量(HDLSS)情形下支持向量机(SVM)在尖峰模型(spiked model)中的渐近性质。作者指出,现有HDLSS理论依赖的几何表示要求协方差矩阵特征值不占主导地位,而该条件在尖峰模型下不再成立。研究发现,HDLSS数据的Gram矩阵依分布收敛于一个随机矩阵,数据收敛到由尖峰数量决定的有限维空间中的随机构型,导致SVM的误分类率不趋于零,即SVM不具备一致性。偏置校正SVM(BC-SVM)在此情形下同样表现不佳,因为偏置项本身需要修正。为此,作者提出尖峰校正SVM(SC-SVM),证明当样本量趋于无穷时该分类器具有一致性,并指出样本量增长是本质性的——任何基于投影的方法在样本量固定时均会失效。最后通过数值模拟验证了各分类器的性能。
| 尖峰模型 (spiked model) | 一种协方差矩阵模型,其中少数特征值显著大于其余特征值,常用于高维数据分析。 |
| 高维小样本 (HDLSS) | 指数据维数远大于样本量的设定,是现代高维统计中的典型场景。 |
| 支持向量机 (SVM) | 一种常用的监督学习分类器,通过寻找最大间隔超平面来分离数据。 |
| 一致性 (consistency) | 指随着样本量增大,分类器的误分类率趋于零的性质。 |
| 尖峰校正SVM (SC-SVM) | 本文提出的改进SVM方法,通过校正尖峰模型的影响,在样本量增长时具有一致性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅