本文提出了一种名为SPINE的原型约简方法,用于将训练集压缩为更小的表示形式。与传统方法返回离散点集不同,SPINE为每个类别构建一个嵌入的一维复形作为模型,其初始边集来自类条件Mapper图,由数据决定局部簇的连接方式;后续阶段在分类目标下拟合顶点,观测样本被分配给距离最近的复形所属类别,从而使图段本身参与决策规则而非仅用于拟合。作者在十七个基准数据集上采用分层十折交叉验证,与七种原型约简方法在相同预算下进行比较。结果显示,SPINE取得最高平均准确率和最佳平均排名,在Wilcoxon符号秩检验(Holm校正)下显著优于七种竞争者中的五种。预算扫描表明,完整图段的决策规则在原型稀缺时贡献最大,而整体方法在中等预算下表现最佳。构建成本方面,SPINE与判别式方法相当,并在十七个数据集中的十四个上快于广义学习矢量量化。
| 原型约简 | 用少量代表性样本替代原始训练集以降低计算和存储开销的技术。 |
| 1-复形 | 由顶点和边组成的一维拓扑结构,可表示数据簇之间的连接关系。 |
| Mapper图 | 一种基于拓扑数据分析的图结构,通过连续映射和聚类揭示数据的连通性。 |
| Wilcoxon符号秩检验 | 一种非参数统计检验,用于比较两组配对样本是否存在显著差异。 |
| 广义学习矢量量化 | 一种基于原型的分类算法,通过优化目标函数学习代表点。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅