仅需每类一个样本,新方法竟能稳定超越随机猜测!
Extreme classification: beating chance with one training example from each class
arXiv ML (stat.ML) #极端分类#最近邻#统计学习理论#小样本 🕐 今天 12:00

📖 AI 总结

本文研究一个极简分类问题:给定来自两个未知分布P和Q的各一个独立标记样本,以及一个等概率来自P或Q的独立目标Y,能否在P≠Q时以严格优于随机的准确率对Y进行分类。作者发现,最近邻规则对均值不同但协方差矩阵相同的多元高斯分布总能成功,但对实数轴上某些光滑密度甚至可能严格劣于随机猜测。为此,他们构造了一个固定随机核规则,其期望准确率恰为1/2加上核最大均值差异平方的四分之一,并从可数族可测二值问题中导出可数生成可测空间上的特征核。作者进一步证明,实数轴上的确定性次序规则对任意两个不同Borel概率测度均能优于随机,并通过可测编码将该结论推广到所有可数生成可测空间,特别是可分度量空间。最后,他们证明在类别先验未知且不平衡时不存在通用规则,且在自适应目标类别选择下,除公平硬币外的任何规则对某些有限支撑分布对都严格劣于随机。

🔑 关键词速览

最近邻规则一种分类方法,将目标样本归类为与其最近训练样本相同的类别。
MMD_k^2最大均值差异的平方,一种基于核的分布差异度量,用于衡量两个分布之间的距离。
特征核一种核函数,其对应的再生核希尔伯特空间中的均值嵌入能够唯一确定概率分布。
可数生成可测空间一个可测空间,其 sigma-代数由可数个集合生成。
Borel 概率测度定义在 Borel sigma-代数上的概率测度,通常用于实数集及其子集。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅