本文研究部署后数据分布发生变化时保形预测的覆盖性问题,允许输入分布及其与结果的关系同时改变。作者采用指数倾斜重加权对齐方法估计结构化分布偏移,并比较两种校准策略:仅使用估计权重进行加权校准,以及在加权基础上进一步对源预测分布进行倾斜调整。理论分析表明,在真实权重下两种方法均能达到目标覆盖,在估计权重下具有共同的覆盖上界;但识别计算与评分同权重估计误差的交互分析揭示了二者性能差异的来源。合成回归实验显示,当模型假设与数据生成过程匹配且目标输入对偏移具有信息量时,倾斜调整可使平均集合长度减少约30%,两种方法覆盖均接近名义水平;但在合成分类任务以及目标输入对响应偏移信息不足的回归场景中,倾斜可能导致覆盖显著下降。真实数据实验也未显示一致收益。研究表明,加权校准的良好覆盖并不能保证额外倾斜调整仍保持覆盖,如何仅凭源标签和目标输入判断是否应施加该调整仍是待解问题。
| 共形预测 | 一种提供预测集合且具有有限样本覆盖保证的不确定性量化框架。 |
| 指数倾斜重加权对齐 (ExTRA) | 一种通过指数倾斜重加权来估计结构化分布偏移的方法,最初用于分类任务。 |
| 分布偏移 | 训练数据与部署数据之间联合分布的变化,包括输入分布和条件分布的变化。 |
| 覆盖性 | 预测集合包含真实结果的经验频率,是共形预测的核心性能指标。 |
| 预测倾斜 | 在共形校准中额外调整源预测分布,以应对分布偏移的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅