半监督分类新突破!威布尔混合模型让缺失标签也“开口说话”,误差率大幅下降
Semi-Supervised Classification with Informative Missing Labels in Weibull Mixture Models
arXiv ML (stat.ML) #半监督学习#混合模型#缺失数据 🕐 09-02 12:00

📖 AI 总结

该研究探讨了基于两分量威布尔混合模型的部分标记数据半监督分类问题。核心创新在于将标签缺失概率建模为分类不确定性的函数,形成一种特征依赖的缺失机制,使缺失标签指示器本身携带分类器相关信息。研究发现,在威布尔形状参数相同时,贝叶斯决策边界至多一个且唯一;形状参数不同时可能出现两个边界。作者推导了调整缺失模型干扰参数后的Fisher信息量,并给出了期望错误率的决策边界展开式,得到单边界和双边界情形下分类特定的渐近相对效率公式。结果表明,Fisher信息量的正定增加是降低一阶期望错误率的充分但非必要条件。基于硬盘故障数据的数值实验和半合成分析验证了建模特征依赖标签缺失可有效降低期望错误率并改进决策边界估计。

🔑 关键词速览

Weibull Mixture Models威布尔混合模型,一种由多个威布尔分布组合而成的概率模型,用于描述异质性数据。
Semi-Supervised Classification半监督分类,一种利用少量标记数据和大量未标记数据进行分类的机器学习方法。
Missing-at-Random (MAR)随机缺失机制,指数据缺失的概率仅依赖于已观测变量,而不依赖于未观测变量。
Bayes' Rule贝叶斯规则,在分类中指基于后验概率最小化期望损失的决策规则。
Fisher Information费舍尔信息,衡量参数估计中数据携带的信息量,用于评估估计量的渐近方差。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅