据量子位报道,9月16日,中国团队稳准智能发布400M参数结构化数据基础模型LimiX-2,在TabArena、TALENT、BCCO三个国际主流基准测试的二分类、多分类和回归等任务中位列第一,超过谷歌TabFM、TabPFN、TabICL、Mitra等模型。此前一天,德国软件巨头SAP刚发布TabPFN-3.5。LimiX-2的登顶,让结构化数据基础模型(LDM)这条此前由海外巨头密集布局的赛道再度升温。

LimiX-2由稳准智能联合清华团队研发,团队由清华博士组成。稳准智能首席科学家为清华大学计算机系教授崔鹏,他长期研究结构化数据与因果智能,也是LDM理念提出者之一。去年,该团队发布的国内首个结构化数据基础模型LimiX曾在一段时间内位居国际榜单前列。团队此后没有追着榜单改进,而是继续投入底层技术和模型储备。

LDM即结构化数据基础模型,目标是让基础模型直接学习不同结构化数据中的变量关系、条件关系和生成机制。与处理文本、代码、图像等已经语义化数据的大语言模型不同,LDM面对的是工业生产、科学研究等场景中的高维结构化数据。以制造业为例,温度、压力、转速、原料配比、设备状态、能耗等变量同时变化,其中大量关键规律未必被提前总结为规则或公式,产业更关心变量之间的稳定关系,以及一个变量变化后系统如何响应。将这类数据转写成文本再交给大语言模型处理,会经历一次信息压缩,被压缩掉的细粒度差异可能直接影响预测精度、良率和风险判断。

技术路线上,LimiX-2与TabPFN等PFN路线不同。PFN以目标预测为中心,给定上下文和目标,让模型快速适应一张新表并预测Y。LimiX-2把面向变量关系建模前置为核心目标,学习跨变量、跨样本的联合依赖结构。团队提出上下文机制网络CMNs,把结构化数据建模从以目标变量为中心的预测问题,推进为面向全变量联合依赖和数据生成机制的关系建模问题;同时提出上下文条件掩码建模CCMM,通过不断遮住和预测不同变量,训练模型学习变量之间的条件依赖和联合结构。底层表示则下沉到Cell-Level,以单元格为基础表示单元,保留列身份、具体取值和缺失状态,并支持跨变量、跨样本的信息交互。分类、回归、缺失值填补等任务可统一为对同一数据模型的不同查询,也为后续结构发现乃至因果骨架发现提供基础。团队还升级了大规模自动化合成数据引擎,覆盖更多分布、交互关系和噪声类型。

在TabArena评测中,按Elo排名,LimiX-2分类任务四项指标均居第一,Elo达到1917,领先TabFM 143分;回归任务四项指标均居第一,Elo达到2206。除分类和回归等预测任务,LimiX-2在Sachs、UF、Causal Chamber等公开数据集上领先多种传统因果发现方法。

海外巨头也在加快布局。谷歌今年发布TabFM,将表格数据基础模型纳入其Foundation Model版图;亚马逊推出Mitra,探索预训练模型跨不同表格、不同任务迁移;SAP先推出SAP-RPT-1,又收购TabPFN背后Prior Labs,并投入超过10亿欧元扩建结构化数据AI研究团队。TabPFN-3.5 Plus已进入SAP AI Core,用于现金流预测、付款延迟、供应商风险、客户流失等企业核心决策任务。随着AI进入复杂决策场景,LDM正成为基础模型体系中越来越重要的一块能力拼图。