🔥 今日值得一读 PACE即插即用嵌入让二分类AUC飙升0.077!
PACE: Plug-and-Play Contextual Embedding for Feature Screening with Pretrained Tabular Foundation Models
arXiv ML (stat.ML) 🔥 重点 #特征筛选#表格基础模型#高维学习 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
即插即用增强现有特征筛选规则,开发者可在高维表格建模前用它剔除无关特征。

📖 AI 总结

本文提出PACE(即插即用上下文嵌入)方法,针对高维表格学习中特征筛选的局限——直接对原始数值打分容易忽略非线性与分布结构。PACE在现有特征评分规则前插入一个冻结的表格基础模型列编码器,将每个特征扩展为高维上下文表示,从而以较小的额外编码开销提升对复杂非线性依赖的筛选能力。在TALENT数据集上的实验显示,PACE-DC使二分类AUC提升0.077,多分类宏平均AUC提升0.064,十种学习器上的归一化RMSE中位改善为0.063。随机权重与随机特征对照实验表明,其增益来自预训练结构而非单纯的维度扩展。PACE在性能与时间权衡上也优于任务拟合选择器和基于归因的方法,说明预训练列几何可作为表格学习中可复用的上游基础组件。

🔑 关键词速览

PACE一种即插即用的上下文嵌入方法,在特征评分前插入冻结的表格基础模型列编码器,将特征扩展为高维上下文表示。
表格基础模型(TFM)在大规模表格数据上预训练的基础模型,能够为表格列生成通用的上下文表示。
特征筛选在模型拟合前移除无关特征的过程,旨在降低维度并提升学习效率。
TALENT 数据集一个用于评估表格学习方法的基准数据集集合,涵盖二分类和多分类等任务。
归一化 RMSE均方根误差的归一化版本,用于在不同尺度下比较回归模型的预测误差。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅