从渲染器、模拟器、规划器,到理解、想象、行动的闭环,中美 AI 实验室正在构建通往 AGI 的两套坐标体系。2026 年,「世界模型」是人工智能领域争议最大的术语之一。一段能够连续生成的视频被称为世界模型,一个随键鼠操作实时变化的数字环境被称为世界模型,甚至潜空间预测未来状态的系统以及直接输出机器人动作的策略,同样使用了这个名字。

这些模型都在处理世界的信息,但能力边界却相去甚远。生成视频的画面可以足够逼真,却可能违背真实的物理规律;机器人能够完成一次抓取,可能仅熟悉实验室里的物体、机位和动作轨迹。仅靠 Demo 很难回答一个系统究竟学到了视觉相关性、物理结构,还是行动与结果之间的关系。这种概念上的混乱增加了技术判断的难度,画质、几何精度、预测能力和任务成功率被混在一起比较,不同团队看似争夺同一赛道,实际回答的可能是不同问题。

因此,世界模型的研究开始回归一个基本问题:模型需要具备哪些能力,才能从生成内容走向理解并改变世界?李飞飞和 World Labs 按功能将世界模型分为渲染器、模拟器和规划器,分别输出像素、世界状态与动作。LeCun 则主张在抽象潜空间中学习可预测的世界结构,让模型保留对理解、推理和规划有用的信息。清华大学朱军给出了第三个角度。早在去年 12 月 Motus 发布时,他就公开阐述「通用世界模型」的整体构想,今年 3 月,他又将其定位为连接数字世界与物理世界的基础。几个月后,朱军及团队在论文《General World Models from First-Principles》中进一步完善这套框架,从基本原理定义核心能力,并给出一张五级进化路线图。

论文将通用世界模型的核心能力归纳为理解、想象和行动。模型需要从历史观测中形成对当前世界的判断,推演不同选择可能产生的未来,采取行动,再用新观测修正自身。沿着这一框架,视频生成、实时交互、潜空间预测和机器人控制可被视为同一条能力路线上的不同阶段。世界模型距离通用智能还有多远,也被转化成更具体的问题:它能否维持一个连贯的世界?能否预测干预带来的后果?能否从真实反馈中学习?又能否逐渐形成目标并组织更复杂的行动?

世界模型的基本原理很多人都有过学自行车的经验。刚开始时,身体总会摇摇晃晃。看到车把偏向一侧,感觉身体重心开始下沉,人会随即调整方向,再根据新的反馈继续修正。随着练习增加,大脑逐渐学会预判某个动作将带来什么结果。这正是世界模型最朴素的含义。1943 年,Kenneth Craik 提出,人类会在头脑中形成关于现实的「小尺度模型」,借此推演不同行动可能带来的结果。强化学习中的 POMDP 进一步描述了这个过程,智能体接收局部观测,估计世界状态,采取动作,再根据新观测更新判断。朱军团队将这一逻辑概括为通用世界模型的三项核心能力,它们相互衔接,构成持续更新的闭环:

* **理解**:把视觉、语言、声音、触觉或机器人传感器等信息,整合成对当前世界的内部判断;
* **想象**:从当前状态推演多个可能未来,尤其是「如果我采取动作 A,而不是动作 B,结果会怎样」;
* **行动**:把预测变成对数字或物理环境的干预,并让行动后的新观察反过来检验、修正模型。

通用世界模型的三项核心能力形成一个闭环:理解负责推断当前状态,想象负责预测可能的未来,行动则改变世界,并为下一轮理解提供新的证据。这也是为什么,视频生成不等于世界模型的全部。视频模型可以回答接下来画面可能是什么样,但要走向通用世界模型,它还需要回答「如果我改变这个条件、移动这个物体、施加这个动作,世界会如何不同?」这类带有行动条件的预测,才触及了因果、反事实和可执行决策。

为描述世界模型如何演进,朱军团队进一步提出五级路线,即从 L1 生成世界、L2 交互世界和 L3 在世界中行动,逐步走向 L4 自主世界智能体与 L5 世界组织者。用一只被推到桌边的玻璃杯来理解,会更直观。L1 的模型可以生成杯子滑落、撞击、碎裂的连续画面;L2 的模型可以在用户改了视角、改变推动方向后继续演化这个世界;到了 L3,模型需要判断杯子是否要掉落、预测伸手是否来得及,并输出机器人真正可以执行的抓取动作。只有行动后,它才会知道自己对杯子的重量、摩擦和抓取时机判断得是否正确。再往上,L4 不再只等人给指令,它要能发现风险、主动观察、补充信息,并在失败后修正策略。L5 则进一步面对多主体协作,比如谁去抓杯子、谁去避障、谁来调配工具,如何在环境变化后重排任务。

这条路线的意义在于,它把「世界模型」从一个名词,变成了一组可以逐级检验的问题。L1 看生成轨迹是否连贯,L2 看世界能否持续响应,L3 看模型能否改变物理环境,L4 看系统能否主动探索和持续学习,L5 看它能否组织开放环境中的多主体协作。

通用世界模型(GWM)五级路线图的形式化建模目标与习得能力。按照论文给出的判断,现有系统已经触及前三个层级,L4 和 L5 仍是开放问题,主要缺口包括因果与物理接地、持久记忆、在线学习、高效部署和安全控制。评测也要比较预测与真实结果,考察模型在陌生任务、环境和本体上的迁移能力。

世界模型的难处,并不只在算法。互联网视频规模巨大,记录了广泛的物体、人物、场景和运动,模型可以从中学习空间结构、物体持续性、人类行为以及事件通常如何发展,但视频很少同步记录造成变化的动作、力量和意图。机器人轨迹能够连接观测、动作和结果,采集成本却更高,也容易绑定具体硬件和任务。朱军团队提出的路径,是把这两类数据放入一座由观察走向行动的数据金字塔。底层是互联网规模的视频,用来获得世界知识和动态先验,向上依次是领域视频、多视角人类视频、带有动作记录的人类示范,顶层是真实机器人交互数据。越往上,数据越稀缺、成本越高,但动作、任务与机器人本体的对应关系也越清楚。这就解释了为什么生数科技会同时推进视频生成与具身智能:视频提供世界知识的广度,机器人数据完成行动接地。

在数字世界一侧,Vidu 系列持续探索对视觉世界的生成与交互。视频不是世界模型的终点,却是重要的起点,它让模型在大规模时空变化中学习对象、场景、运动与事件如何演化。Vidu S1 则进一步把一次性生成推进到实时响应,让用户输入可以持续改变后续内容,测试模型是否能在交互过程中保持状态连续。在物理世界一侧,Motus 与 Motubrain 将环境理解、状态预测与机器人动作接入同一条链路。模型需要看清环境,预测干预的后果,再将判断转化为能够执行的动作,并接受真实结果的检验。实现 L1 至 L3 的现有代表性系统。两条产品线由此形成对同一个世界模型假设的两次验证。数字环境检验模型能否理解并想象世界,物理环境检验这些知识能否支持行动,并在反馈中得到修正。

要让两类验证共享底层能力,图像、视频、语言和机器人动作需要围绕同一个世界状态协同计算,传统模块化系统逐级传递信息,容易在接口处损失几何、时间和不确定性信息。所有模态完全共享参数,也可能造成训练冲突,让海量视频数据压制稀缺的机器人信号。朱军团队提出的 MoT(Mixture-of-Transformers)架构,尝试在两者之间取得平衡。不同模态保留各自的专家参数,再通过共享注意力机制交换上下文。视觉告诉模型环境中发生了什么,语言提供目标和约束,动作带来对环境的干预,三类信息共同更新模型对世界的判断。MoT 提供了统一计算的基础,物理规律、跨本体迁移、实时推理和安全控制仍需依靠数据、训练与系统工程解决。其指向的目标十分明确,通用世界模型需要一个能被不同模态共同读写、持续更新的世界状态。

**Motus2:让机器人在动手之前先在自己的世界里试一遍**

如果说 Motus 与 Motubrain 将生数的世界模型探索推进到 L3,使机器人能够根据环境理解和未来预测生成动作,那么近期提出的 Motus2 则进一步加入结果评估与策略反馈,尝试让行动闭环具备自我改进能力。Motus2 没有把动作生成、未来模拟和结果评估做成三套彼此独立的系统。相反,它以一套共享参数的视频 — 动作模型,暴露出三种控制接口:

* **策略**:提出可以执行的候选动作;
* **模拟器**:预测这些动作在视觉世界中可能造成的后果;
* **评估器**:判断哪一种结果更接近任务目标,并把这一判断用于选择和改进。

可以把它想成一次真正的「先心灵,再手巧」。机器人不再只是看到物体后直接给出一个动作,而是先提出几种候选方案,在模型中预演各自会带来的画面与任务进度,再选择更好的那一步。执行以后,成功、失败和不那么理想的结果也不再只是数据废料,而会成为下一轮动力学建模与价值学习的证据。动作、预测、评估、反馈和再行动由此进入同一个决策与学习回路,这也是 Motus2 所强调的闭环自进化。

在数据侧,Motus2 采用分层训练路径,从单目多视角视频扩展到同步双目多视角数据,再通过机器人数据完成本体适配。其训练使用约 13 万小时的人类多视角记录,以及超过 100 小时的机器人轨迹和人机对齐数据。这一路径是先让模型累积一份关于人如何与世界互动的共同经验,再让它通过机器人数据学习这具身体如何把理解变成动作。在执行侧,Motus2 还通过独立的轻量触觉专家,对即将执行的短动作进行细化,并预测接触后的力反馈。视觉擅长看清物体在哪里、世界大致如何变化,触觉则补上接触发生时最难的「最后一厘米」,让模型在「看得见」之外,对压、碰、抓、旋等细腻操作多一层即时校正。

Motus2 仍处于从 L3 向 L4 延伸的阶段。当前验证主要集中在特定机器人和操作任务,自主目标形成、持久记忆、开放环境泛化、长期在线学习与安全控制仍有待探索。它的主要进展,是将策略生成、未来模拟、价值评估和触觉反馈放入同一套系统,让机器人能够在行动前预演后果,在行动后利用结果改进策略,为走向 L4 自主世界智能体提供一条可检验的路径。

**从概率学习到世界智能:一条中国技术路径**

通用世界模型(GWM)的框架,也延续了朱军及清华 TSAIL 长期积累的研究方向。朱军教授长期研究贝叶斯方法、概率机器学习、生成模型与强化学习,分别处理不确定性、数据分布、未来生成和行动决策。TSAIL 也培养和影响了一批进入全球前沿团队的研究者。宋飏本科阶段曾与朱军合作贝叶斯学习研究,宋佳铭本科期间也参与相关工作,后来分别在得分生成模型和 DDIM 方向产生重要影响。从概率建模到生成与决策,这条学术脉络也映照出 AGI 发展的两类入口。一类从语言出发,逐步增强推理、工具调用和任务执行能力;另一类从视觉与动态世界出发,继续走向实时交互和具身行动。放在中国 AGI 产业版图中,智谱与生数可以视两条路径的代表。智谱从语言模型出发,持续增强推理、Coding 和 Agent 能力;生数则从视频生成出发,进一步进入实时交互、具身行动与策略优化。两条路线正在相互渗透。语言 Agent 需要视觉反馈和环境模型,世界模型也需要语言表达目标、规则与计划,不同入口最终都指向对语言、世界状态和行动的共同建模。

**结语**

世界模型的竞争,最终会从 Demo 的震撼程度,转向系统经受反馈的能力。画面可以制造可信的印象,几何和物理决定这个世界能否被反复使用,行动则把模型的判断带进现实。一次预测是否成立,要等干预发生后才能确认;一次任务是否成功,也要放到陌生场景、长期运行和持续变化中检验。朱军团队的论文没有替世界模型之争写下最后答案,却提供了一组可以继续检验的问题:模型理解了什么,能够想象多远,行动之后能否修正自己。过去十年,AI 最重要的进展来自学习语言和数据中的规律。下一阶段,模型还要面对持续变化的环境。当模型能够在这样的环境中不断形成判断、承担行动后果并持续学习,世界模型才会从一个拥挤的技术名词,逐渐成为通向通用智能的基础。

最新快讯

2026年09月11日

14:21
《科创板日报》9月11日讯,云端AI芯片厂商燧原科技正式登陆科创板,标志着科创板算力芯片板块矩阵的进一步扩容。此次上市不仅完善了覆盖通用GPGPU、领域专用DSA架构,兼顾训练、推理及训推一体化的完整产业集群,也为硬科技板块带来了新的估值维度与产业叙事。 燧原科技董事长、董事会秘书赵立东在IPO路演中表示,此次上市是公司发展征程中的重要里程碑,也是面向未来、...
13:51
午间收盘数据显示,市场整体表现疲软。中证500指数下跌3.2%,中证2000指数下跌3.4%,中证1000指数下跌3.7%,创业板中盘200指数下跌3.8%,科创100指数跌幅最大,达到4.6%。与此同时,据同花顺iFinD数据统计,中证1000ETF易方达(159633,联接基金A/C:016630/016631)近一周资金净流入超过1亿元,在市场调整中呈...
13:51
截至午间收盘,中证人工智能主题指数下跌1.9%,中证科创创业人工智能指数下跌2.3%,上证科创板人工智能指数跌幅达到3.0%。 同花顺iFinD数据显示,截至昨日,人工智能ETF易方达(159819)及联接基金(A/C类:012733/012734)连续2个交易日获资金加仓,累计金额超5000万元。 消息面上,2026中国算力大会今日正式启幕。本届大会创新推...
13:50
鼓狮财经9月11日讯,据美国方面消息,美军已向沙特部署逾百名军事顾问,旨在强化沙特打击也门胡塞武装的情报与目标定位能力。 据悉,这批顾问隶属于近期新成立的联合部队指挥部。美方将为沙特军方提供实时的战场目标定位工具,并协助进行“地理空间”目标定位,以支持空袭行动。不过,美方此次支援设定了严格界限,仅限于情报共享和技术辅助,不直接参与战斗,也不提供战机加油等作战...
13:42
2026 年政府债发行进度相对滞后,市场对年内能否完成预算发行额度存在一定担忧。复盘 2021 年以来的发行情况,我们发现“宽财政”紧迫性的下降与当年政府债发行偏慢具有较强的相关性。今年财政支出节奏较慢,预计政府债实际发行达到年初预算目标的难度不大,但动用结存限额的可能性相对较低。 截至 9 月初,一般国债发行进度约为 80%;新增一般债和专项债的发行进度分...
13:41
9 月 10 日欧洲交易时段,国际铜价突然掉头向下。LME 三个月期铜盘中最低触及每吨 14147 美元,跌幅接近 4%,COMEX 铜最大跌幅 5.4%,下探至每磅 6.516 美元。(伦铜昨夜大幅下跌;新浪财经)前一天,LME 铜刚摸到每吨 14875 美元的历史新高,COMEX 12 月合约结算价也创下每磅 6.8885 美元的纪录。9 月 11 日,...
13:17
截至午间收盘,国证价值100指数与国证自由现金流指数分别下跌0.8%和0.9%,跌幅相对温和;相比之下,国证成长100指数跌幅显著,达到3.9%。同花顺iFinD数据显示,易方达成长ETF(159259,联接基金A/C:027858/027859)在半日交易中净申购份额达1.04亿份。
13:17
据鼓狮财经9月11日报道,阿联酋外交部于10日发表声明,希望阿尔及利亚方面将断绝外交关系的决定视为暂时的,旨在维护两国人民间的深厚情谊。声明中,阿联酋重申了对与各国关系的重视,承诺致力于深化双边合作,以实现共同利益、增进理解并促进繁荣。此外,阿联酋对阿尔及利亚人民表达了赞赏,并表示珍视两国人民的紧密联系,将持续致力于巩固双边关系。
13:10
在训练 27B 大模型的过程中,上海原点星辉科技有限公司(StartLux)展示了一个惊人的数据:约 70% 的研发工作可以完全交给 AI 完成。在其本地 Agent 模型 StartLux-V1.0-27B-Preview 的后训练阶段,AI 不仅负责生成或筛选数据,还能自主提出实验假设、启动训练、进行评估分析,并根据结果决定下一轮的实验方向。人类研究员的...
12:44
截至上午9点35分,上证科创板芯片设计主题指数下跌1.7%,中证半导体材料设备主题指数跌幅为1.4%。同花顺iFinD数据显示,截至昨日收盘,科创芯片设计ETF易方达(589030)已连续两个交易日获得资金净流入,累计金额近1000万元。 消息面上,国产AI芯片企业燧原科技已于9月11日在科创板上市。该公司发行价为142.18元/股,发行约4303.52万股...
12:44
截至2026年9月10日收盘,红利低波50ETF南方(515450)交投平稳,换手率为0.62%,成交额达1.25亿元。其跟踪的标普中国A股大盘红利低波50指数当日逆势上涨0.36%,在市场普跌的背景下表现突出。 当前红利资产的配置逻辑持续强化,主要体现在三个方面:首先,无风险利率处于历史低位,红利资产股息率与国债收益率的利差扩大,类固收替代价值显著;其次,...
12:44
截至2026年9月10日收盘,新能源ETF南方(516160)成交额为0.68亿元,换手率为1.90%,其跟踪的中证新能源指数(399808.SZ)下跌0.67%。受市场普跌影响,当日指数随市回调。尽管短期有所调整,但产业基本面依然稳健有力:光伏装机规模已首次超越煤电,跃居国内第一大电源。上半年,我国动力与储能电池累计销量达979.4GWh,同比增长48.6...