据MarkTechPost报道,NVIDIA发布Kumo Tabular,一个用于分类和回归的表格基础模型系列。它把带标签的行作为上下文,在一次前向传播中预测新行,无需训练、超参数调优或特征工程。模型分Small、Medium、Large三档,参数约2800万至2.15亿,通过NVIDIA开源的结构化数据模型库SDM运行。权重以OpenMDW-1.1许可发布,允许商业使用;SDM代码采用Apache-2.0,需要Python 3.11+和PyTorch 2.7+,示例面向CUDA GPU。

SDM是面向结构化数据基础模型和预处理的GPU原生库,还包含TabICLv2、Google的TabFM以及用于多表数据的KumoRelational。它们共享基于TableTensor容器的上下文学习接口,并支持预处理、集成学习和多类别预测。

Kumo Tabular是围绕表格结构构建的Transformer,使用列、行和上下文注意力。其流程分三阶段:单元嵌入中,数值和分类值经过可学习傅里叶特征,缺失值无需插补;行嵌入中,列注意力采用诱导自注意力,成本随行数线性增长,带旋转位置的行注意力学习特征交互,4个可学习[CLS]令牌压缩每行;上下文学习阶段,最终Transformer运行在行嵌入上,上下文行彼此注意,查询行只注意上下文行,因上下文不见查询,其键和值只计算一次并复用。输出头给出类别概率,回归输出999个分位数。Softmax注意力在键数增长时会变平,模型用随键数对数增长的温度缩放查询,系数按注意力头学习。

Kumo Tabular完全在来自结构因果模型的合成表格上预训练。随机因果图通过线性映射、小型神经网络、树或高斯过程连接隐藏变量,生成器还注入缺失值、高基数类别、重尾目标和冲突重复行。训练分三阶段,上下文从1024行增至60000行,最多100列。Small、Medium、Large分别看到约3500万、7100万和1.37亿张人工表格。分类和回归为独立模型。NVIDIA称训练配方和数据生成器将很快发布。

默认设置下,Kumo Tabular在TabArena总排名第一,Elo为1950;NVIDIA团队称其在单张RTX 6000 Pro上比LimiX-2快17倍,三个规模均位于准确率与推理时间帕累托前沿。BeyondArena排名第一,Elo为1418,Improvability为7.78%。TALENT总排名居首。ScoringBench中Large和Medium平均排名分列第一、第二。

竞品中,TabICLv2由Inria SODA开发,TabPFN-3由Prior Labs开发,LimiX-2由Stable AI开发,TabFM由Google Research开发。权重许可上,Kumo Tabular为OpenMDW-1.1,TabICLv2为BSD-3-Clause,TabPFN-3为TABPFN-3 License v1.0,LimiX-2和TabFM为非商业许可。商用权重方面,Kumo Tabular和TabICLv2允许,TabPFN-3需付费许可,LimiX-2和TabFM不允许。报道称,许可差异是关键区分点,Kumo Tabular和TabICLv2是更宽松选择,而NVIDIA报告的基准中Kumo Tabular领先。

使用上,可安装structured-data-models库,按模型卡将DataFrame传入TableTensor,再调用sdm.models.KumoTabular。