该论文研究半监督分类中一种特殊的标签缺失机制:标签缺失概率依赖于观测特征的后验分类不确定性。作者指出,在这种设定下,缺失指示器不仅是未观测标签的记录,更是与分类器机制相关的可观测信号。论文构建了基于似然的信息理论框架,推导出Fisher信息分解,将部分标注成分与非负机制曲率项分离;在模型误设情形下,给出了Godambe-Eicker-Huber-White敏感性和三明治协方差分解。关键发现是:有利的缺失机制可相对于完全标注或预算匹配的非信息性标注基线增加信息量,但不会超过同时观测标签和机制指示器的增强实验。对插件分类器,作者将信息分解与基于间隔的过量风险界关联,在双组分混合模型中达到参数化n⁻¹速率。高斯混合计算和医学诊断实例表明,不确定性依赖的标注机制能在固定标注预算下提升估计与分类性能。
| 半监督分类 | 一种利用少量标记数据和大量未标记数据进行分类的机器学习方法。 |
| 缺失标签 | 在数据集中某些样本的标签未被观测到,导致信息不完整。 |
| 费舍尔信息分解 | 将费舍尔信息量分解为不同组成部分,以分析参数估计的信息贡献。 |
| Godambe--Eicker--Huber--White敏感性 | 在模型误设下,用于估计参数协方差矩阵的稳健统计方法。 |
| 过量风险 | 分类器在特定数据分布下的期望损失与最优分类器之间的差距。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅