AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢
LimiX让模型理解数据背后的因果机制
梦瑶 发自 凹非寺量子位 | 公众号 QbitAI
这两年,AI赛道越来越热。
大语言模型LLM(Large Language Model)在卷得飞起的同时——
另一条结构化数据侧的AI路线LDM,也突然开始涌进各类型头部玩家。
LDM(Large Data Model),即结构化数据基础模型,其瞄准的是生产侧的核心痛点:即如何让基础模型直接学习不同结构化数据中的变量关系、条件关系和生成机制。
到底有多火呢,这么说吧!
像咱熟悉的美国Google、Amazon,德国企业软件巨头SAP等玩家纷纷下场布局~
不过,谁成想呢,巨头们刚涌进LDM抢位,一支中国团队已经先把榜首坐成了「固定席位」。
9月15日,德国软件巨头SAP抢发TabPFN-3.5,几小时后(9月16日),一支由清华博士组成的团队,用一个400M参数的结构化数据基础模型——
直接拿下了TabArena、TALENT、BCCO三个国际主流基准测试中二分类、多分类、回归等各项任务的「第一」,呈现断层领先:
△官方TabArena榜单
不卖关子,这个把谷歌等一众大厂按在地上摩擦的,就是「稳准智能」刚刚发布的:LimiX-2。
值得一提的是,这也不是稳准智能第一次把LDM做到国际头部了。
去年他们发布的国内首个结构化数据基础模型LimiX已经上演过很长一段时间的霸榜大戏,但此后团队也没有追着榜单追赶,而是继续往底层技术和模型储备里扎。
然后这次,直接给海内外主流选手再来了个措手不及~
在这家中国团队看来,真正重要的,从来不是拿下一次第一,而是每到关键节点,都有能力重新回到第一。
而作为国内首个结构化数据通用大模型,LimiX啃下的,正是数据背后最值钱也最难找的「因果规律」。
相比TabPFN这类偏目标预测的行级建模路线,LimiX-2把面向变量关系建模前置为核心目标,学习跨变量、跨样本的联合依赖结构。
此外,其还自建了一套高质量自动化数据合成引擎,先让模型见过足够复杂的数据世界,再去处理真实任务。
过去几年,LLM已经吃透了文本、语音、视频,但一碰到工业生产、科学研究等应用侧真正拿来做决策的场景,对因果关系、准确性和稳定性的要求会陡然提高,这也让LDM的价值开始越来越清晰。
当前就在这条越来越热的赛道中,稳准智能联合清华已然率先把成果跑进了行业头部位置。
LLM啃不动的数据分析硬骨头,LDM开始接手了
大语言模型,这两年能力边界一路狂飙。
但热闹归热闹,随着AI真正往产业深处走,一个此前很容易被模型能力增长掩盖的问题,也开始变得越来越清晰——
那就是现实世界,远比语言世界「更大」。
要知道今天的大语言模型能力,很大程度上建立在一个极其庞大的语义世界之上。
文本、代码、论文、数学公式,甚至经过标注和描述的图像、视频,其中承载的知识都有一个共同特点,那就是它们已经经过了人类的一次理解、筛选和抽象。
LLM做的事情,就是把这些已经进入人类知识体系的信息编码成Token,通过海量语料学习上下文关系,再进一步形成知识、推理和生成能力。
所以从信息论和建模对象来看,LLM所处理的,更多是已经完成「语义化」的现实。
△AI生成
但问题是,在产业系统里,另一类数据是长期存在于这个语义层「之外」的。
以制造业为例,温度、压力、转速、原料配比、设备状态、能耗等几十、几百甚至上千个变量会同时变化,共同构成一个持续演化的高维数据空间。
其中大量关键规律,可能并没有被人类提前总结成规则、公式或文本知识。
更重要的是,产业真正关心的,往往也不是单个变量是什么,而是变量之间存在什么稳定关系,哪些关系可以跨环境成立,以及一个变量变化之后,系统整体会如何响应。
如果先把这类数据转写成文本,再交给LLM处理,中间天然会经历一次「信息压缩」。
但在生产系统中,那些被压缩掉的细粒度差异,恰恰可能直接决定预测精度、良率和风险判断,在语义空间里看似可以忽略的信息,到了生产空间里可能恰恰是最值钱的信息。
这恰恰构成了「结构化数据建模」与「语言建模」之间最本质的差异——
如果说LLM主要学习人类已经表达出来的世界,那么LDM更希望直接进入真实世界留下的高维数据空间,从变量关系本身出发理解规律。
二者面对的是不同的信息空间,也因此更接近两条平行、互补的基础模型路线~
能往生产深处扎,也能补足LLM对真实数据世界理解不足的那一块儿缺口,确实有前景啊。。。
随着AI越来越多进入复杂决策场景,LDM也正成为基础模型体系中越来越重要的一块能力拼图。
于是乎,这两年,海内外玩家也开始接连入场,结构化数据基础模型的竞争,正在明显《提速》。
今年Google直接发布TabFM,把表格数据基础模型正式纳入自己的Foundation Model版图。
Amazon也推出Mitra,专门探索一个预训练模型如何跨不同表格、不同任务直接迁移。
SAP动作更猛,先做SAP-RPT-1,今年又直接收购TabPFN背后的Prior Labs,投入超过10亿欧元扩建结构化数据AI研究团队。
就在几天前,最新的TabPFN-3.5 Plus又正式进入SAP AI Core,直接开始做现金流预测、付款延迟、供应商风险、客户流失这些企业核心决策任务。
从Google、Amazon一路到SAP,结构化数据基础模型已经从学术圈里的新方向,迅速变成全球科技巨头集体押注的一块基础能力。
重做底层技术范式,LimiX让模型理解数据背后的因果机制
LDM赛道开始升温,崔鹏和团队多年押注的方向,也终于走到聚光灯下。
稳准智能首席科学家、清华大学计算机系崔鹏教授,长期研究结构化数据与因果智能,也是LDM理念的提出者之一。
很长一段时间里,这支团队都在啃一些更底层的问题:Scaling规律能否延伸到结构化数据,CMNs能否进一步打开因果建模的能力上限。
这些偏离传统因果研究路径的探索,当时并不轻松。
如今,LimiX、LimiX-2连续冲上国际Benchmark前列,也让这条当初看起来更冒险的技术路线,开始得到模型效果的直接验证。
跟赛道升温相比,一个更值得注意的变化是:大家底层技术其实并不那么一样。
比如TabPFN为代表的PFN路线,核心目标很明确:给定上下文和目标,让模型快速适应一张新表,并把Y预测准。
这条路线非常适合分类、回归等任务,也推动了Tabular Foundation Model快速发展。
但当结构化数据模型继续往更深处走,一个问题开始冒出来:如果我们想知道的,已经不止是「Y等于多少」呢?
毕竟生产侧真正关心的,往往还包括变量之间是什么关系,一个变量发生变化之后,其他变量会怎么动。
到了这一步,传统以目标变量为中心的PFN路线,其能力边界就逐渐显出来了——
对于不少PFN类模型而言,数据通常会先被压缩成更高层的表示,再用于完成目标预测,这样做有利于快速适配任务,但问题是部分变量级的细粒度信息,也可能在表示过程中被折叠。
当问题继续从「预测结果」往「理解变量关系」推进时,模型需要保留和利用的信息粒度,也随之发生变化!!
△AI生成
而稳准智能这次在LimiX-2上真正动刀的,则是结构化数据模型最底层的「技术范式」。
作为较早用机器学习方法研究变量关系和因果规律的团队之一,崔鹏团队长期关注的问题,就是如何让模型超越表面相关性,找到那些跨环境依然稳定的关系。
因此到了LimiX-2,稳准没有继续沿着传统预测范式往上堆能力,而是直接改了模型「学什么」——
团队创造性提出上下文机制网络Contextual Mechanism Networks(CMNs),把结构化数据建模从以目标变量为中心的预测问题,推进为面向全变量联合依赖和数据生成机制的关系建模问题。
先来说说上下文机制网络(CMNs)。
如果说PFN仍然是在给定目标下学习怎么预测得更准,那么CMNs想回答的问题,已经变成了X、Y和其他变量放在一起,到底是怎么共同构成这份数据的。
换句话说,LimiX-2没再把变量关系当成服务于预测的中间信息,而是直接把它变成模型要学习的核心对象。
这种底层范式的切换有点类似大语言模型从BERT走向GPT,真正变化的核心,不只体现在参数规模和Benchmark上,更在于模型学习目标和组织信息的方式被重新定义了。
△AI生成
当然,CMNs这个新的学习目标,听起来很理想,真正做起来却没那么简单。
既然想让模型搞清楚变量之间到底是什么关系,训练时就不能永远给它一道「固定」的题。
所以稳准团队联合清华在LimiX-2做的一件重要的事,便是通过提出上下文条件掩码建模(CCMM),并升级自动化合成数据的生成引擎,不断给模型换题——
通过不断遮住-预测不同变量,逼着模型从预测单一目标,转向学习变量之间的条件依赖和联合结构。
反复训练后,模型掌握的也就不只是某一道题怎么答,而是逐渐理解:这些变量彼此如何作用。
预测目标不断变化,模型也就没法只围着某一个Y死磕,而得慢慢把整张表里变量之间的关系摸清楚。
此外在底层技术层面,LimiX还进一步将建模粒度下沉到Cell-Level,以单元格作为基础表示单元,保留列身份、具体取值和缺失状态,并支持跨变量、跨样本的信息交互。
这样一来,从数据表示到训练目标,再到网络计算,整套设计都围绕联合依赖建模展开。
在这套框架下,分类、回归、缺失值填补等任务,都可以进一步统一为对同一个数据模型的不同查询;而对联合关系的持续建模,也为后续的结构发现乃至因果骨架发现提供了基础。
由此,整个底层技术能力也就形成一个逻辑闭环——
CMNs先把「目标」改成学关系,CCMM负责让模型真正去「学关系」,Cell-Level负责保留各种细粒度「特征」,三者共同构成一套从学习目标、训练机制到数据表示的技术范式。
中国LimiX-2研发团队成果到底有多强?
一套新技术范式真正有价值的时刻,往往发生在它开始改写能力边界之后。
对LDM来说,比再刷一张AI榜单更重要的,是它能不能把这些能力真正带进生产环境。
而在走进真实场景之前,LimiX-2已经先在主流Benchmark上把这条路线跑到了行业头部。
在TabArena、TALENT、BCCO等国际主流Benchmark中,LimiX-2在二分类、多分类和回归任务上均位居第一,超过Google TabFM、TabPFN、TabICL、Mitra等模型。
先看「分类」。
分类任务解决的是「它到底属于哪一种状态」的问题,比如设备会不会故障、客户会不会流失、一笔交易是否存在风险,本质上都要求模型从大量变量中找出真正影响结果的信号。
在TabArena评测中,按Elo排名,LimiX-2四项指标均居第一,Elo达到1917,领先TabFM+143分。
另一个考验模型底层建模能力的指标,是「回归任务」。
回归要求模型进一步理解连续变量之间的依赖关系,并最终把这种关系压到一个足够准确的数值预测上。
在TabArena回归任务中,按Elo排名,LimiX-2四项指标均居第一,Elo达到2206,位列第一。
换句话说,LimiX-2的优势已经不只体现在「分得对」,也开始体现在对连续关系建模得更细、更准。
值得一提的是,LimiX-2的提升也来自训练数据这一侧。
CMNs把学习目标进一步扩展到变量关系建模,对训练数据的多样性也提出了更高要求。
因此,LimiX-2升级了大规模自动化合成数据引擎,覆盖更多分布、交互关系和噪声类型,让模型提前见过更丰富的数据结构,从数据侧支撑能力维度的扩展。
不仅如此,除了分类、回归等预测能力,LimiX-2也开始把能力进一步推向因果发现。
面对高维复杂数据,传统方法往往受专家先验和统计假设限制;而在Sachs、UF、Causal Chamber等公开数据集上,LimiX-2已经领先多种传统因果发现方法。
分类、回归和跨数据泛化,都是企业的日常任务。这类榜单真正检验的,是模型面对真实数据时能否稳定预测、迁移并支撑决策。
而这背后指向的,正是LDM更长期的能力路径——
从Prediction走向Relationship、Causality、Intervention、Decision,让AI进一步理解真实世界中的变量关系、生成机制和变化规律,直达通用因果智能。
而这些,恰恰也是生产侧智能化下一阶段最值得关注的方向之一。
2020年,GPT-3问世。
它让行业第一次清晰看到,基础模型一旦跨过能力临界点,AI就可能从解决单点任务,走向更通用的智能。
六年后的今天,AGI已经从一个遥远概念,越来越接近一条可以被实现的愿景。
但当AI继续向前,它终究还要进入一个比语言世界复杂得多的空间:真实世界本身。
理解变量如何彼此作用、因果如何层层传导,以及一个微小变化,最终会把整个系统推向哪里。
而LDM这块竞争场域所指向的,恰恰就是这块仍处早期、却可能决定AGI下一阶段能力的GPT-3时刻——
让大模型从理解人类已经表达出来的知识,进一步走向理解世界运行本身。
就在这个可能决定下一阶段AI能力上限的赛道上,显然已经有中国团队走到了行业头排。
参考链接:
[1]技术报告标题:LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
[2]技术报告地址:
https://arxiv.org/abs/2609.17488
[3]Github:https://github.com/limix-ldm-ai/LimiX
[4]Huggingface:https://huggingface.co/stable-ai/LimiX-2
[5]model scope: https://modelscope.cn/models/stable-ai/LimiX-2
- 从“会回答”到“会办事”,vivo如何解AI手机这道题?2026-09-17
- 端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装2026-09-14
- 这个世界模型训练完就“退场”,机器人反而更能干了2026-09-05
- 陶哲轩吐槽GPT-6孪生素数新突破:令人无语的一幕2026-09-05




