SVM泛化误差新突破:训练样本m个,风险上界竟收紧到C/m!
Sharp margin-based generalization bounds for realizable SVM
arXiv ML (stat.ML) 重要 #SVM#泛化界#间隔理论#统计学习 🕐 09-17 12:00

📖 AI 总结

本文研究可实现情形下硬间隔支持向量机(SVM)的泛化误差界。作者考虑在实希尔伯特空间上、由独立同分布样本训练得到的精确最小范数单位间隔分离器,证明了一个尖锐的高概率界:当经验间隔为正时,真实风险以约 C/m 乘以 K_m 与对数置信项之和为上界,其中 K_m 由最大训练半径与间隔之比决定。证明的核心是一个确定性删除问题:在单位球内的向量集合中删除部分约束后,满足保留约束的最近点若范数平方不超过 k,且被删向量在该点下得分非正,则规模为 q 的删除集族大小至多呈指数增长。作者借助 KKT 表示得到精确恒等式,将分离器的均方离散度转化为得分亏欠的加权和,进而通过熵归纳与幽灵样本恒等式导出最终界。该结果在可实现设定下给出了依赖间隔的紧致泛化保证,推进了 SVM 的理论理解。

🔑 关键词速览

支持向量机 (SVM)一种监督学习模型,通过寻找最大间隔超平面进行分类。
泛化界描述学习算法在未见数据上性能的理论保证。
间隔 (margin)数据点到分类超平面的距离,间隔越大分类置信度越高。
KKT条件优化问题中刻画最优解的必要条件,常用于支持向量机。
幽灵样本一种理论工具,通过引入虚拟样本简化泛化误差分析。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅