据雷峰网报道,9月16日,稳准智能联合清华大学计算机系崔鹏教授发布新一代数据大模型LimiX-2,模型参数规模提升至400M。在TabArena、BCCO、TALENT三个国际主流结构化数据基准中,LimiX-2总体Elo分数分别达到1935、1432和1506,均位于榜单第一,超过Google、SAP、Amazon等国际大厂的同类模型。

Elo是衡量模型综合能力的排名指标。TabArena、BCCO、TALENT覆盖多类任务,用于评估模型在不同数据集上的泛化能力和预测性能,已成为当前结构化数据基础模型竞争的重要评价依据。LimiX-2在TabArena上的回归、二分类、多分类Elo均为最优。

此次模型能力升级主要沿三条技术路线推进:上下文机制网络CMNs,将建模重点从预先指定的目标变量转向变量之间的相互关联;预训练阶段升级自动化合成数据的生成引擎;进一步Scaling,将模型参数规模扩大至400M。

LimiX团队提出上下文机制网络,从目标预测走向结构发现。传统PFNs以指定目标的预测分布为核心,CMNs则将上下文数据的全变量联合依赖作为建模对象,关注变量如何相互关联并构成内在结构。模型通过上下文条件掩码建模CCMM,在不同观测模式下组织跨变量监督,将变量关系推断确立为预训练目标,不再仅为某个指定结果学习信息。网络采用单元格级建模,保留列身份、具体取值和缺失状态,支持跨变量、跨样本的信息交互。分类、回归、缺失值填补等任务被统一为对同一数据模型的不同查询,联合关系建模也为因果骨架发现提供统计基础。

在训练数据上,LimiX-2升级大规模自动化合成数据生成引擎。结构化数据多存于企业内部系统,难以像互联网文本一样大规模公开获取,TabPFN、Mitra等表格基础模型也普遍使用合成数据预训练。LimiX-2可自动生成线性、非线性、多变量交互、周期变化和噪声扰动等不同分布数据,让模型在进入真实企业前接触更多数据结构和变量关系。

继去年11月稳准智能发现并提出结构化数据基础模型遵循Scaling Law之后,此次新模型再次沿这一技术路线,进一步将模型参数规模提升到400M。参数增至400M,将让LimiX所选技术路线在更大规模和尺度上得到验证,获得更强的泛化能力,因果关系规律的挖掘和稳定表达优势也能得到进一步发挥。

除各项榜单体现的分类、回归等预测能力外,LimiX-2在因果发现方面也展现出技术突破性。传统因果发现方法依赖专家先验或严格的统计假设,难以应对高维企业数据。LimiX-2采用上述创新性技术路线后,在Sachs、UF、Causal Chamber等多个因果发现公开标准数据集上显著领先传统因果发现方法。

截至2026年世界人工智能大会,上一代LimiX已完成800余个跨行业、跨场景的公开数据集验证,并实现60余个真实场景落地。此前在多个真实场景的验证中,LimiX把过去一项任务训练一个专用模型的传统机器学习方式,转变为由一个基础模型跨场景、跨数据集的通用预测能力。工艺参数优化、设备故障预测、电力预测、能耗优化和材料科学,是目前较典型的应用方向。

稳准智能首席科学家崔鹏表示,LimiX-2的发布和此次Benchmark成绩,是团队在结构化数据大模型方向持续探索的重要阶段性成果。团队仍将长期坚持这一技术路线,并不断提升模型对数据规律和变量因果关系的理解能力。未来将继续推动模型在因果智能方向上的发展,助力人工智能更快速地从预测走向决策。

技术报告标题为LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence,报告地址为https://arxiv.org/abs/2609.17488,Github地址为https://github.com/limix-ldm-ai/LimiX,Huggingface地址为https://huggingface.co/stable-ai/LimiX-2,model scope地址为https://modelscope.cn/models/stable-ai/LimiX-2。