物理AI遭遇新的瓶颈。过去一年多,VLA、世界模型、基座模型、数据闭环等词汇,几乎成了头部智驾和具身智能公司频频提及的热点。越来越多的AI公司开始尝试让模型进入真实世界,赋予机器理解环境、预测变化和执行行动的能力。虽然不同技术路线各有侧重,但穿透到底层,指向的问题却越来越趋同——即AI如何从真实世界获取数据,如何形成对环境的理解,如何将理解转化为行动,以及如何根据行动结果持续学习。这个问题并非今天才出现,随着技术路线逐渐收敛,真正的瓶颈也开始浮出水面。
01、物理AI路线图收敛,暴露“断裂层”
智能驾驶的兴起至今,研究对象经历了多次变迁。简单梳理可分为三个阶段:早期的驾驶系统是一套高度模块化的软件。感知负责识别车辆、道路和行人,预测负责推测交通参与者的运动,规划和控制负责决定车辆的具体行动。每个模块解决相对明确的问题,拥有独立的指标。端到端模型盛行后,行业开始减少人工规则和模块接口,让模型直接从传感器输入生成轨迹或控制信号。直到物理AI热潮席卷,研究对象再次推进。在此目标下,行业分化出不同的主流技术表达,目前已大致收敛成两条明线加一条暗线。
两条明线中,其一是VLA(视觉—语言—动作),将视觉信息、语义理解和行动生成放入同一模型体系,让AI看到环境、理解场景并直接作出行动。理想和小鹏押注于此。另一条明线以世界模型为核心,重点学习环境随时间和动作的变化。世界模型进入场景生成、闭环仿真、数据生产和模型评测等环节,既帮助模型学习物理世界的演化规律,也为其他行动模型提供训练和验证环境。华为WEWA和蔚来NWM是代表。而在VLA和世界模型之外,还有一条暗线是物理AI基座。基座模型通过大规模物理世界数据预训练,学习环境变化、物体关系和世界运行规律,再通过少样本或后训练适配不同任务。基座模型严格来说与VLA、世界模型并不并列,而是两条明线共同奔赴的方向。两条明线的边界肉眼可见地趋于模糊,二者关系已从路线选择走向能力协同。但结合现状看,整合绝非易事。
当前行业已拥有链路中的大部分技术组件,但各环节间仍存在几层“断裂”。
第一层“断裂”发生在模型与数据之间。物理AI需要海量真实数据,但数据规模扩大不会自动产生对世界的理解。模型需从数据中学习空间关系、时间变化、行为规律和行动后果。模型在真实环境中暴露的能力缺口,将决定下一轮需要收集、筛选或生成什么数据。因此,数据与模型之间需要持续反馈:由模型发现问题,数据系统补充场景,训练系统重新学习,再通过评测和真实环境确认模型是否获得新能力。
第二层“断裂”发生在视觉与行动之间。模型看见场景、理解关系,不代表能形成稳定行动。物理AI区别于传统AI最明显的一点,正是视觉与行动的关系。假设车辆识别出前方行人正在靠近路口,并判断对方可能横穿道路,后续还需解决在何位置开始减速、减速幅度多大、是否需要变道、周围车辆如何响应等一系列问题。这一过程中,视觉和语义理解需转化为连续、实时、可验证的动作。VLA承担了连接认知与行动的任务,但这条连接仍需未来预测、策略训练、闭环评测和真实验证共同支撑。
第三层“断裂”位于模拟与真实之间。世界模型和仿真系统可低成本生成大量场景用于训练测试。理论上模型可在虚拟环境中经历无限次测试,但真实世界情况更复杂。交通参与者行为具有不确定性,传感器受天气、光照、遮挡影响,大量长尾事件难以被仿真系统完整建模。此外,模型在虚拟环境的提升未必能等比例转化为真实表现。物理AI必须建立一条双向链路:真实世界的问题进入仿真和训练,仿真中获得的能力回到真实环境验证。
这些横亘在数据、认知、行动和真实世界之间的断裂层,跨越了数据、算法、仿真、基础设施、产品和工程团队,看似属于不同技术方向,实则指向同一个问题——物理AI需要一套能够持续学习和进化的系统,而这很难由某一个独立模型解决。由此,技术问题开始越过技术部门边界,延伸到技术如何被组织,放进同一个闭环。
02、弥合断裂层,消除接缝,构建闭环
现下,物理AI公司的当务之急是弥合断裂层,把整条链路放进同一个研究闭环。但在建立闭环之前,还需解决研发体系中的两层“摩擦”。
第一层摩擦发生在技术之间。模型暴露的不足需反馈给数据系统;真实环境的问题需进入仿真和训练流程;训练后的能力需回到现实场景检验。难点在于,这些环节并非独立存在。任何一个环节连接不畅,投入再多数据、算力和模型规模,也可能只带来局部指标提升。
第二层摩擦体现在研发组织内部。通常,一家公司的基础模型、VLA或世界模型、数据、仿真和AI基础设施等内容由不同团队负责。每个团队拥有自己的专业目标和工作节奏,但矛盾在于完整闭环要求所有环节围绕同一个模型问题快速反馈。现实中,这些环节往往难以天然对齐。所以,技术闭环说到底,最终需要对应的还是组织闭环。
在这一行业困局下,国内首个面向物理世界基础能力研究的AI Lab——Superfluid Lab出现了。该实验室来自国内头部AI玩家、以智驾技术起家的深圳公司元戎启行,由前DeepSeek核心成员、元戎启行首席科学家阮翀带队。实验室名字颇有深意,“Superfluid”意为超流体,是一种完全没有黏性的奇特物质状态,可理解为“无视”摩擦力的流体。由于完全没有摩擦力,超流体可以在环状容器中永无止境地流动而不损失能量,也能零阻力穿过极其微小的缝隙。
最先让Superfluid Lab出圈的,是元戎在7月29日发布的一篇名为《对话Superfluid》的文章。里面提到了名字两层意思:一是信息零阻力流动,协作零内耗;二是进入物理世界的智能,同样需要一种零摩擦的底层架构。这恰恰对应研发闭环所需面对的两层摩擦。据知情人士透露,Superfluid Lab今年5月已在元戎内部成立,目前完成了基础设施重构等早期工作。实验室以基座模型为研究核心,重点探索VLA模型,同时推进世界模型和多模态理解。
在首次公开Superfluid Lab时,元戎也同步为实验室发起招聘,岗位分为三个方向:大模型算法方向,重点研究视觉、语言与动作的结合,让AI形成面向物理世界的能力;仿真算法方向,涉及物理规律建模、环境交互和仿真到真实的迁移;AI基础设施方向,则负责构建支撑大模型训练的新一代基础设施。从招聘方向看,Superfluid Lab覆盖了模型、仿真和训练基础设施。这大致推测出Superfluid的基本技术结构:基座模型从物理世界数据中形成认知,VLA模型负责把认知转化为行动,世界模型推演行动结果并提供仿真环境,AI基础设施支撑大规模训练和高频实验,最终再由真实世界完成验证。
在《对话》中,元戎将研究重点概括为三组关系:模型与数据之间的流畅性,视觉与行动之间的衔接,模拟与真实之间的迁移。实验室要做的是定义问题,再进入研究和解决过程。基座模型因此被放到了闭环的中心位置,阮翀甚至将其称为“一种信仰”。这里的“信仰”并非指向某种拥有确定答案的技术,而是指向研究周期和目标——持续挑战模型的能力上限,让模型解决越来越复杂的问题。
基座模型的特殊之处在于,它改变了过去AI研发以单点能力优化为中心的方式。因此,基座模型竞争的背后,不仅是算法竞争,也是一套围绕模型持续迭代的研发体系竞争。这套技术闭环也提出了相应的组织要求。招聘信息显示,Superfluid Lab强调开放的研究环境、相对扁平的协作方式和较少的固定工作边界。不同方向的研究人员围绕同一个模型展开工作,并共同对最终模型能力负责。这是一种新的组织范式。与传统研发围绕车型、版本和功能迭代不同,Superfluid Lab并不以某一款产品节点作为研究终点,而是围绕基础模型能力建立长期路线,更像一个持续循环过程。其研究单位开始由独立模块转向持续演进的模型,评价目标也从局部指标扩展到模型最终能力。当然,这种组织方式是否真能提升物理AI的研发效率,仍需时间验证。Superfluid Lab本身更像一次探索,在尝试通过改变研发组织方式,建立更高效的能力积累路径。而这背后对应的是整个行业正在发生的变化。
03、物理AI竞争迈入新阶段
回看智能驾驶过去几年的发展,行业竞争的核心正在发生变化,技术竞争进入新阶段。从自动驾驶到物理AI,技术竞争的演进路径大致可提炼为三个阶段:第一阶段是产品竞争,比较功能覆盖、用户体验、量产规模和商业化效率;第二阶段是模型竞争,端到端、VLA模型和世界模型成为比较对象,数据规模、模型参数、训练算力和迭代速度开始影响技术差距;第三阶段则是基础能力与组织竞争,企业需要把人才、数据、算力、模型、仿真、工程和真实世界反馈组织成一套能够长期进化的系统。
从这一趋势看,Superfluid Lab可视为元戎提前进入第三阶段的一次尝试。据接近元戎的人士介绍,元戎内部从创立之初就把自己定义为一家AI公司。实际上,元戎也是最早以“物理AI”定位自身的公司,时间大致可追溯到2025年3月,比行业整体的物理AI浪潮提前了近一年。之所以早期选择从智驾行业入手,是因为辅助驾驶上积累的真实数据、工程能力和开放道路场景,几乎是行业内普遍认可的物理AI能力“试金石”。而随着基座模型、多模态等技术逐渐成熟,这些积累开始具备向更广泛物理世界能力延伸的可能。Superfluid Lab正是在这一背景下成立,依托驾驶产生的数据和工程反馈,更专注于把研究目标指向物理世界的通用基础能力。在这一过程中,元戎启行也逐步从提供辅助驾驶技术的公司,走向成为一家生产物理世界基础能力的公司。这种变化与十年前OpenAI的思路存在某种相似性。2015年末,OpenAI刚刚成立,彼时人工智能已拥有大量应用和研究成果,但行业仍缺少一套能够持续提升智能能力的基础体系。OpenAI选择围绕更底层的通用智能问题,建立长期研究组织,随后推动了基础模型时代的发展。几年后,随着大模型技术突破,基础模型成为AI产业的重要底座,大量应用开始建立在这一能力之上。如今,物理AI也正在经历类似的阶段。自动驾驶、机器人等应用已经开始快速发展,但行业仍缺少一套能够理解物理世界、预测环境变化,并通过真实反馈持续进化的基础能力体系。只不过,当时OpenAI探索的是数字世界智能的底层能力,而今天物理AI领域正在寻找的,则是一套面向物理世界的智能底座。Superfluid Lab就是在这一背景下的一次探索。
但不得不说,这一定位目前仍需长期结果支撑。相较于过去用新模型、新参数和新纪录衡量进步,第三阶段的周期更长,也更难在短期内证明价值。然而,连接数据、研究、工程和真实世界的能力,往往也只能在更长时间里沉淀。阮翀对这种长期投入有一个更直接的解释:“快的东西,往往也很快被替代。慢的东西,一旦建成,会成为很多快的东西的底座。”而真正的长期主义,始终是去做那些难而正确的事。
