🔥 今日值得一读 条件Shapley新方法搞定特征相关误归因,500样本下覆盖率稳达91%以上!
Semiparametric Inference for Conditional Shapley Feature Importance
arXiv ML (stat.ML) 🔥 重点 #可解释性#Shapley值#半参数推断#特征归因 🕐 09-14 12:00
👨‍💼 主理人解读 · 为什么值得关注
让特征重要性带置信区间且更准确,开发者可用它做更可靠的可解释性分析与模型诊断。

📖 AI 总结

本文研究条件 Shapley 特征重要性中的半参数推断问题。针对现有 Shapley 值估计器多只给出点估计、缺乏不确定性量化,且常从边际分布采样 coalition 外特征、在特征相关时导致重要性误判的缺陷,作者采用条件形式,在真实条件分布下积分掉 coalition 外特征,目标为结合条件价值函数与 SAGE 式损失聚合的全局损失型重要性。方法上提出一步估计器,结合 K 折交叉拟合与平方损失的 U 统计量校正,消除朴素代入的蒙特卡洛偏差,在双稳健速率条件下具有根号 n 相合性与渐近正态性,Wald 区间达到名义覆盖率;并用 Pinsker 型界量化工作 copula 类误设带来的偏差,以 vine copula 保持条件采样可行。n=500 的高斯设计实验中,各特征 95% 区间经验覆盖率介于 0.91 至 0.96,检验第一类错误率保持 0.05,中等信号下功效达 1;在 UCI Concrete 与 California Housing 数据上以 Bonferroni 控制显著性识别出条件信息特征。

🔑 关键词速览

Shapley值一种源自合作博弈论的特征归因方法,通过计算特征在所有可能联盟中的平均边际贡献来分配重要性。
条件Shapley特征重要性在特征相关时,将联盟外特征在其真实条件分布下积分掉,以正确归因重要性的Shapley值变体。
一步估计器一种基于影响函数和插件估计构建的估计量,通过一步校正达到渐近有效性和正态性。
双稳健速率条件要求 nuisance 函数的估计误差乘积可忽略的条件,常见于因果推断和半参数估计中。
藤Copula一种高维依赖建模工具,通过将多元分布分解为一系列二元Copula,使条件采样变得可行。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅