本文提出了一种名为“反事实边缘化”的测试时评估框架,用于衡量分类模型对人口统计学或采集相关等干扰变量的鲁棒性。该方法借助反事实图像生成器,对年龄、性别等干扰父变量进行干预,为每张测试图像生成反事实版本,并在目标干预分布上对预测结果取平均,从而在保留患者个体潜在信息的同时边缘化人口统计学影响。基于这些干预感知预测,作者定义了反事实风险、校准度、稳定性及最坏情况敏感度等指标。该框架为定量评估模型鲁棒性提供了实用工具,有助于识别模型依赖捷径特征的问题。
| 反事实边缘化 (Counterfactual Marginalisation) | 一种测试时评估方法,通过对干扰变量进行干预并平均预测,以评估模型对干扰变量的鲁棒性。 |
| 干扰变量 (Nuisance Variables) | 与目标预测无关但可能影响模型预测的变量,如人口统计学或采集相关因素。 |
| 反事实图像生成器 (CF Image Generator) | 一种生成反事实图像的模型,能够对指定变量进行干预并生成对应的图像版本。 |
| 干预感知预测 (Intervention-aware Predictions) | 通过在目标干预分布上平均预测得到的预测结果,旨在消除干扰变量的影响。 |
| 最坏情况敏感性 (Worst-case Sensitivity) | 衡量模型在干预分布下预测性能最差情况的指标,反映模型的鲁棒性下限。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅