NVIDIA 发布了 Kumo Tabular 系列表格基础模型,涵盖 Small、Medium、Large 三个版本,参数量约 2800 万至 2.15 亿,支持分类与回归任务。该模型采用上下文学习方式,将带标签的行作为上下文,在单次前向传播中直接预测新行,无需训练、超参数调优或特征工程。模型通过 NVIDIA 开源的 structured-data-models 库运行,权重以允许商用的 OpenMDW-1.1 许可发布,代码采用 Apache-2.0。其架构基于 Transformer,引入列、行与上下文注意力机制,分单元格嵌入、行嵌入和上下文学习三阶段,缺失值无需插补,回归任务输出 999 个分位数。该库还集成 TabICLv2、TabFM 等模型,统一了表格数据的上下文学习接口。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅