本文提出PACE(即插即用上下文嵌入)方法,针对高维表格学习中特征筛选的局限——直接对原始数值打分容易忽略非线性与分布结构。PACE在现有特征评分规则前插入一个冻结的表格基础模型列编码器,将每个特征扩展为高维上下文表示,从而以较小的额外编码开销提升对复杂非线性依赖的筛选能力。在TALENT数据集上的实验显示,PACE-DC使二分类AUC提升0.077,多分类宏平均AUC提升0.064,十种学习器上的归一化RMSE中位改善为0.063。随机权重与随机特征对照实验表明,其增益来自预训练结构而非单纯的维度扩展。PACE在性能与时间权衡上也优于任务拟合选择器和基于归因的方法,说明预训练列几何可作为表格学习中可复用的上游基础组件。
| PACE | 一种即插即用的上下文嵌入方法,在特征评分前插入冻结的表格基础模型列编码器,将特征扩展为高维上下文表示。 |
| 表格基础模型(TFM) | 在大规模表格数据上预训练的基础模型,能够为表格列生成通用的上下文表示。 |
| 特征筛选 | 在模型拟合前移除无关特征的过程,旨在降低维度并提升学习效率。 |
| TALENT 数据集 | 一个用于评估表格学习方法的基准数据集集合,涵盖二分类和多分类等任务。 |
| 归一化 RMSE | 均方根误差的归一化版本,用于在不同尺度下比较回归模型的预测误差。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅