模型路线趋同之后,Physical AI的胜负手变了
物理AI新瓶颈已出现
杰西卡 发自 凹非寺
量子位 | 公众号 QbitAI
新的物理AI瓶颈出现了。
过去一年多,VLA、世界模型、基座模型、数据闭环等等,几乎都是头部智驾和具身智能公司频频提及的热词。
越来越多AI公司开始尝试让模型进入真实世界,让机器具备理解环境、预测变化和执行行动的能力。
不同技术路线各有侧重,最终穿透到技术底层,指向的问题却越来越趋同——
那就是AI如何从真实世界获取数据,如何形成对环境的理解、把理解转化为行动,又如何根据行动结果继续学习。

这个问题,并不是今天才出现。
而当路线逐渐收敛,真正的瓶颈也开始浮出水面。
物理AI路线图收敛,暴露「断裂层」
智能驾驶兴起至今,研究对象曾历经多次变迁。简单梳理下来可分为三个阶段:
早期的驾驶系统,是一套高度模块化的软件系统。感知负责识别车辆、道路和行人,预测负责推测其他交通参与者的运动,规划和控制再决定车辆的具体行动。
每个模块解决一个相对明确的问题,也拥有相对独立的指标。
端到端模型盛行后,行业开始减少人工规则和模块接口,让模型直接从传感器输入生成轨迹或控制信号。

△图片由AI生成
直到物理AI热潮席卷,又把研究对象向前推进了一步。
在这一目标下,行业逐渐分化出了不同的主流技术表达,当前已大致收敛成两条明线加一条暗线。
两条明线中,其一是VLA(视觉—语言—动作),把视觉信息、语义理解和行动生成放进同一个模型体系,让AI看到环境、理解场景,直接作出行动。理想、小鹏都押在这一路线上。
另一条明线以世界模型为核心,重点学习环境如何随时间和动作发生变化。
世界模型进入场景生成、闭环仿真、数据生产和模型评测等环节,既可以帮助模型学习物理世界的演化规律,也能为其他行动模型提供训练和验证环境。

△图片由AI生成
华为WEWA、蔚来NWM都是世界模型路线的代表。
而在VLA和世界模型之外,还有一条暗线是物理AI基座。
基座模型通过大规模物理世界数据预训练,学习环境变化、物体关系和世界运行规律,再通过少样本或后训练的方式适配不同任务。

△图片由AI生成
基座模型严格来说,与VLA、世界模型并不并列,而是两条明线共同奔赴的方向。
两条明线的边界肉眼可见地趋于模糊,二者间的关系已从路线选择走向能力协同。

△图片由AI生成
但结合现状来看,整合起来绝非易事。
当前,行业已经拥有这条链路中的大部分技术组件,然而各环节之间却还存在几层“断裂”。
第一层“断裂”发生在模型与数据之间。
物理AI需要海量真实数据,但数据规模扩大并不会自动产生对世界的理解。模型需要从数据中学习空间关系、时间变化、行为规律和行动后果。
模型在真实环境中暴露出什么能力缺口,又会决定下一轮需要收集、筛选或生成什么数据。
因此,数据与模型之间需要持续反馈,由模型发现问题,数据系统补充相应场景,训练系统重新学习,再通过评测和真实环境确认模型是否获得了新的能力。

△图片由AI生成
第二层“断裂”发生在视觉与行动之间。模型看见一个场景,甚至理解其中的关系,也不代表它能够形成稳定行动。
物理AI区别于传统AI最明显的一点,也正是视觉与行动之间的关系。
假设车辆识别出前方行人正在靠近路口,并判断对方可能横穿道路,接下来还有一系列问题需要解决,比如应该在什么位置开始减速,减速幅度多大,是否需要提前变道,周围车辆可能怎样响应,整个动作又能否在实时算力下平稳执行等等。
这一过程中,视觉和语义理解需要转化为连续、实时、可验证的动作。
VLA承担了连接认知与行动的任务,但这条连接仍然需要未来预测、策略训练、闭环评测和真实验证共同支撑。
第三层“断裂”位于模拟与真实之间。
世界模型和仿真系统可以低成本生成大量场景,用于训练、测试。
理论上,模型可以在虚拟环境中经历无限次测试,学习各种复杂情况,但真实世界的情况始终更加复杂。
交通参与者的行为往往具有不确定性,传感器会受到天气、光照和遮挡影响,大量长尾事件很难被仿真系统完整建模。另外,模型在虚拟环境中的提升,未必能够等比例转化为真实表现。
物理AI必须要建立起一条双向链路:真实世界中的问题进入仿真和训练,仿真中获得的能力再回到真实环境验证。
这些横亘在数据、认知、行动和真实世界之间的断裂层,横跨数据、算法、仿真、Infra、产品和工程团队,看似属于不同技术方向,实际上都指向同一个问题——物理AI需要一套能够持续学习和进化的系统。
这已经很难由某一个独立模型解决。
由此,技术问题开始越过技术部门边界,延伸到技术如何被组织,放进同一个闭环。
弥合断裂层,消除接缝构建闭环
现下,物理AI公司的当务之急,就是如何弥合断裂层,把整条链路放进同一个研究闭环。
不过在建立闭环之前,还需要解决研发体系中的两层「摩擦」。
第一层摩擦发生在技术之间。
模型暴露出的不足,需要能够反馈给数据系统;真实环境中的问题,需要能够进入仿真和训练流程;训练后的能力,也需要重新回到现实场景接受检验。
真正的难点在于,这些环节并不是彼此独立存在的。任何一个环节连接不畅,投入再多的数据、算力和模型规模,也可能只带来局部指标的提升。
第二层摩擦体现在研发组织内部。
通常来说,一家公司的基础模型、VLA或世界模型、数据、仿真和AI Infra等内容会由不同团队负责。
每个团队拥有自己的专业目标和工作节奏,但矛盾就在于,完整闭环要求所有环节围绕同一个模型问题快速反馈。
现实中,这几个环节往往很难天然对齐。
所以,技术闭环说到底,最终需要对应的还是组织闭环。
在这一行业困局下,国内首个面向物理世界基础能力研究的AI Lab——Superfluid Lab,出现了。
实际上,Superfluid Lab并非师出无名,而是来自国内头部AI玩家、以智驾技术起家的深圳公司元戎启行,且由前DeepSeek核心成员、元戎启行首席科学家阮翀带队。

实验室的名字其实很有意思。“Superfluid”意为超流体,是一种完全没有黏性的奇特物质状态,可以理解为一种“无视”摩擦力的流体。
由于完全没有摩擦力,超流体可以在环状容器中永无止境地流动,而不会损失任何能量;也可以零阻力穿过极其微小的缝隙。
最先让Superfluid Lab出圈的,实际是元戎在7月29日发布的一篇名为《对话Superfluid》(以下简称《对话》)的文章。里面提到了名字两层意思:
其一,是信息零阻力流动,协作零内耗。
其二,是进入物理世界的智能,同样需要一种零摩擦的底层架构。
这恰恰对应研发闭环所需面对的两层摩擦。
据知情人士透露,Superfluid Lab今年5月就已在元戎内部成立,目前完成了基础设施重构等早期工作。实验室以基座模型为研究核心,重点探索VLA模型,同时推进世界模型和多模态理解。
在首次公开Superfluid Lab时,元戎也同步为实验室发起招聘,将岗位招聘分成三个方向:
- 大模型算法方向,重点研究视觉、语言与动作的结合,让AI形成面向物理世界的能力;
- 仿真算法方向,涉及物理规律建模、环境交互和仿真到真实的迁移;
- AI Infra方向,则负责构建支撑大模型训练的新一代基础设施。

从招聘方向来看,Superfluid Lab覆盖了模型、仿真和训练基础设施。
这里能大致推测出Superfluid的基本技术结构来——
基座模型从物理世界数据中形成认知,VLA模型负责把认知转化为行动,世界模型推演行动结果并提供仿真环境,AI Infra支撑大规模训练和高频实验,最终再由真实世界完成验证。
在《对话》中,元戎把研究重点概括为三组关系:
模型与数据之间的流畅性,视觉与行动之间的衔接,模拟与真实之间的迁移。
实验室要做的第一步,是定义问题,再进入研究和解决过程。
基座模型因此被放到了闭环的中心位置,阮翀甚至将其称为“一种信仰”。
这里的“信仰”,并非是说某种技术已经拥有确定答案,而是指向研究周期和目标:持续挑战模型的能力上限,让模型解决越来越复杂的问题。
基座模型的特殊之处,在于它改变了过去AI研发以单点能力优化为中心的方式。
因此,基座模型竞争的背后,并不只是算法竞争,也是一套围绕模型持续迭代的研发体系竞争。
这套技术闭环也提出了相应的组织要求。
招聘信息显示,Superfluid Lab强调开放的研究环境、相对扁平的协作方式和较少的固定工作边界。不同方向的研究人员,围绕同一个模型展开工作,并共同对最终模型能力负责。
这是一种新的组织范式。
与传统研发围绕车型、版本和功能迭代不同,Superfluid Lab并不以某一款产品节点作为研究终点,而是围绕基础模型能力建立长期路线,更像一个持续循环过程。
其研究单位开始由独立模块转向持续演进的模型,评价目标也从局部指标扩展到模型最终能力。
当然,这种组织方式是否能够真正提升物理AI的研发效率,仍需要时间验证。
Superfluid Lab本身也更像一次探索,在尝试通过改变研发组织方式,建立更高效的能力积累路径。
而这背后对应的是整个行业正在发生的变化。
物理AI竞争迈入新阶段
回看智能驾驶过去几年的发展,可以发现,行业竞争的核心正在发生变化,技术竞争正在进入新的阶段。
从自动驾驶到物理AI,技术竞争的演进路径,大致可以提炼为三个阶段:
第一阶段是产品竞争。行业比较的是功能覆盖、用户体验、量产规模和商业化效率;技术价值主要通过可交付的产品能力体现。
第二阶段是模型竞争。端到端、VLA模型和世界模型相继成为新的比较对象,数据规模、模型参数、训练算力和迭代速度,也开始影响公司之间的技术差距。
第三阶段则是基础能力与组织竞争。企业需要把人才、数据、算力、模型、仿真、工程和真实世界反馈,组织成一套能够长期进化的系统。

△图片由AI生成
从这一趋势看,Superfluid Lab可以视为元戎提前进入第三阶段的一次尝试。
据接近元戎的人士介绍,元戎内部从创立之初,就把自己定义为一家AI公司。
实际上,元戎也是最早以“物理AI”定位自身的公司,时间大致可以追溯到2025年3月,比行业整体的物理AI浪潮提前了近一年。
之所以早期选择从智驾行业入手,是因为辅助驾驶上积累的真实数据、工程能力和开放道路场景,几乎是行业内普遍认可的物理AI能力“试金石”。
而随着基座模型、多模态等技术逐渐成熟,这些积累开始具备向更广泛物理世界能力延伸的可能。
Superfluid Lab正是在这一背景下成立,依托驾驶产生的数据和工程反馈,可以更专注于把研究目标指向物理世界的通用基础能力。
在这一过程中,元戎启行也逐步从提供辅助驾驶技术的公司,走向成为一家生产物理世界基础能力的公司。
这种变化,与十年前OpenAI的思路存在某种相似性。
2015年末,OpenAI刚刚成立,彼时人工智能已经拥有大量应用和研究成果,但行业仍缺少一套能够持续提升智能能力的基础体系。OpenAI选择围绕更底层的通用智能问题,建立长期研究组织,随后推动了基础模型时代的发展。
几年后,随着大模型技术突破,基础模型成为AI产业的重要底座,大量应用开始建立在这一能力之上。
如今,物理AI也正在经历类似的阶段。自动驾驶、机器人等应用已经开始快速发展,但行业仍缺少一套能够理解物理世界、预测环境变化,并通过真实反馈持续进化的基础能力体系。
只不过,当时OpenAI探索的是数字世界智能的底层能力,而今天物理AI领域正在寻找的,则是一套面向物理世界的智能底座。
Superfluid Lab就是在这一背景下的一次探索。
但不得不说,这一定位目前仍需长期结果支撑。
相较于过去用新模型、新参数和新纪录衡量进步,第三阶段的周期更长,也更难在短期内证明价值。
然而,连接数据、研究、工程和真实世界的能力,往往也只能在更长时间里沉淀。
阮翀对这种长期投入有一个更直接的解释:“快的东西,往往也很快被替代。慢的东西,一旦建成,会成为很多快的东西的底座。”
而真正的长期主义,始终是去做那些难而正确的事。
- 萝卜快跑抢跑无人车右舵:香港率先全无人,伦敦直面Waymo2026-07-29
- 文远发布物理AI大模型WITT:让每一公里都变成模型能力2026-07-17
- 理想L6换代24.98万开卖!L9同款自研芯片中控屏下放,一个版本配置拉满不涨价2026-07-16
- 马斯克也开始L4降维L2了!FSD正式进入反转时刻2026-07-15



