🔥 今日值得一读 半监督新突破!不确定性缺失标签竟能提升分类精度,费舍尔分解揭示信息增益秘密
Learning from Uncertainty-dependent Missing Labels for Semi-supervised Classification
arXiv ML (stat.ML) 🔥 重点 #半监督学习#缺失标签#分类 🕐 08-26 12:00
👨‍💼 主理人解读 · 为什么值得关注
利用缺失模式作为信号,改进分类器训练,适合标签稀疏且缺失机制相关的场景。

📖 AI 总结

该论文研究半监督分类中一种特殊的标签缺失机制:标签缺失概率依赖于观测特征的后验分类不确定性。作者指出,在这种设定下,缺失指示器不仅是未观测标签的记录,更是与分类器机制相关的可观测信号。论文构建了基于似然的信息理论框架,推导出Fisher信息分解,将部分标注成分与非负机制曲率项分离;在模型误设情形下,给出了Godambe-Eicker-Huber-White敏感性和三明治协方差分解。关键发现是:有利的缺失机制可相对于完全标注或预算匹配的非信息性标注基线增加信息量,但不会超过同时观测标签和机制指示器的增强实验。对插件分类器,作者将信息分解与基于间隔的过量风险界关联,在双组分混合模型中达到参数化n⁻¹速率。高斯混合计算和医学诊断实例表明,不确定性依赖的标注机制能在固定标注预算下提升估计与分类性能。

🔑 关键词速览

半监督分类一种利用少量标记数据和大量未标记数据进行分类的机器学习方法。
缺失标签在数据集中某些样本的标签未被观测到,导致信息不完整。
费舍尔信息分解将费舍尔信息量分解为不同组成部分,以分析参数估计的信息贡献。
Godambe--Eicker--Huber--White敏感性在模型误设下,用于估计参数协方差矩阵的稳健统计方法。
过量风险分类器在特定数据分布下的期望损失与最优分类器之间的差距。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅