基于树模型(如随机森林)的变量重要性评分存在系统性偏差,倾向于高估连续预测变量而低估分类变量,这一问题在混合数据类型中尤为突出。该研究从理论层面分析了这一偏差的成因,并提出了一种简洁的纠正方法:对每个分类预测变量添加少量噪声。作者在多种模拟数据集和真实数据集上验证了该方法的有效性,并将其与集成路径稳定性选择相结合,实现了混合数据场景下具有错误发现率控制的变量选择。这项工作为树模型变量重要性的公平评估提供了理论依据和实用工具,对依赖变量重要性进行特征筛选的研究具有直接的方法论意义。
| 变量重要性 | 衡量每个预测变量对模型预测结果贡献大小的指标,常用于特征选择。 |
| 基于树的方法 | 一类以决策树为基础的机器学习算法,如随机森林、梯度提升树等。 |
| 混合数据 | 同时包含连续型和分类型预测变量的数据集。 |
| 集成路径稳定性选择 | 一种通过集成多组子样本的变量选择路径来提高选择稳定性的方法。 |
| 错误发现控制 | 在多重假设检验或变量选择中,控制错误发现率(即假阳性比例)的统计技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅