多站点数据缺失不用插补,FUSHAP让Shapley归因MSE直降3-8倍!
Shapley Value Estimation for Multi-Site Data with Blockwise-Missing Features
arXiv ML (stat.ML) 重要 #Shapley值#缺失数据#特征归因 🕐 09-15 12:00

📖 AI 总结

本文针对多站点研究中普遍存在的块状缺失特征问题,研究了Shapley值(SV)估计方法。作者首先指出,现有群体级Shapley估计器通常假设评估联盟博弈的观测数据在统一特征空间下完全观测,而这一假设在生物医学、社会科学和环境监测等多站点场景中经常被违背——不同机构按不同协议记录不同特征,导致系统性的块状缺失。文章证明,在计算Shapley值前对缺失特征进行标准插补会引入系统性的、依赖于联盟结构的偏差。为此,作者提出FUSHAP方法,利用部分观测的辅助站点降低单站点Shapley估计的方差,且无需插补;同时通过基于置换的筛选步骤检测并排除与目标总体分布不兼容的站点。合成实验表明,FUSHAP的均方误差比单站点估计器低3至8倍,比插补基线低2至3倍,且不引入插补偏差;筛选程序在中等错位下达到82%的检验功效,强错位下达到100%。在多站点空气质量数据和多中心临床数据上,FUSHAP将MSE相对单站点估计器降低约3至7倍,而在临床应用中,标准插补甚至会使MSE高于单站点基线。该工作为异构多源数据下的特征归因提供了无插补、抗分布错位的稳健估计框架。

🔑 关键词速览

Shapley值 (Shapley Value)一种源自合作博弈论的概念,用于公平分配每个特征对模型预测的贡献。
块状缺失 (Blockwise Missingness)数据缺失的一种模式,其中某些特征在部分数据源中整体缺失,形成块状结构。
FUSHAP本文提出的方法,利用部分观测的辅助站点数据,在不插补的情况下降低单站点Shapley估计的方差。
插补 (Imputation)用估计值填充缺失数据的过程,但本文指出在Shapley值计算前插补会引入偏差。
均方误差 (MSE)衡量估计值与真实值之间差异的常用指标,值越小表示估计越准确。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅