想象这样一个场景:你对机器人发出指令,让它去拿衣服晾晒。机器人先是观察舱门,规划好手臂开合的轨迹,缓缓打开。然而,它发现衣物缠在一起,于是停顿思考,重新调整策略,将缠绕的衣物逐一抽出并整理好。这个场景之所以令人兴奋,并非因为它“做到了”,而是因为它“想到了”。它是在理解世界、预测后果并调整行动。这正是世界模型所追求的境界——让机器像人一样,在行动前在脑海中推演“我这么做是否符合物理规律”。

2026年被视为具身智能的部署元年。在2026世界人工智能大会上,具身智能企业不再像过去那样展示机器人的“舞蹈功底”,而是将真实的产线搬到了展台。那么,机器人如何感知环境、理解任务、执行动作并在反馈中持续进化?世界模型和物理AI的“ChatGPT时刻”还有多远?业界对于“终点前的最后一段路该怎么走”有着不同的见解。

数据困境:如何翻越“三道墙”

世界模型的本质是什么?“能够理解物理世界运行规律的AI系统”。智元机器人合伙人姚卯青认为,其核心功能是“预测世界的下一步状态”。他提出,世界模型需要掌握三项关键能力:多模态融合理解(准确感知环境变化)、物理规律认知(涵盖动力学及时空理解)以及因果推理(具备长时序推理能力)。从“看到了什么”到“世界会怎样变化”,再到“如果我这么做会怎样”,构成了完整的智能链条。

然而,训练这样一个模型所需的数据与现实能提供的数据之间存在巨大鸿沟。在“智启具身论坛2026:迎接物理AI智能涌现”分论坛上,姚卯青坦言,语言模型头部团队已使用100万亿Tokens的语料,约合100亿小时的人类说话时长。而具身智能所需的物理世界数据,信息密度远低于语言,目前差距达万倍以上。这是物理智能规模化必须突破的第一道“数据墙”。

此外,姚卯青指出,理解物理AI需回归智能的两条主线:表征与闭环。目前跨任务、跨场景、跨本体的统一物理表征尚未形成,这是“表征墙”;真实试错代价昂贵、反馈缓慢,难以规模化,这是“闭环墙”。

针对数据来源,企业给出了不同解法。Sunday Robotics联合创始人赵子豪介绍了低成本、无本体差异的UMI(通用操作接口)数据采集方式,认为这是短期提升智能最有效的手段。Physical Intelligence研究科学家任至意则坚持真机数据的不可替代性,认为只有真机采集的数据才能完整复现任务。Dyna Robotics联合创始人马也骋提出了“数据金字塔”方案,将互联网视频、第一人称数据、真机数据和部署回流数据分层处理。这场讨论暗示了一个事实:没有任何单一来源能解决物理AI的数据饥渴难题。

模型争辩:VLA已死,WAM是未来?

尽管大模型智能程度越来越高,但不少从业者发现,直接将大模型路径平移到物理AI领域或许行不通,甚至出现了“VLA(视觉-语言-动作模型)已死,World Action Model(WAM)当立”的言论。

任至意回应称,截至目前,没有看到哪家能做到比Physical Intelligence发布的π0.7更亮眼的演示,所以VLA还没有死。但他也承认,VLA和WAM并不冲突,未来需要训练一个原生理解context、知道如何生成未来的模型。这种表态暗示了与其争论路线,不如先做出行业公认的成果。π0.7仅通过在ARX机械臂上训练,就能零适配地在UR5双臂机器人上完成同款操作,实现了跨本体迁移的突破。

马也骋则基于实战经验认为,Dyna已从VLA切换到WAM架构,因为在部分强调高成功率和少数据效率的任务中,WAM比VLA更高效。这是Dyna在餐巾折叠等真实商业场景中“逼”出来的“生存智慧”:通用模型不够可靠,专用模型不够可扩展,他们选择了一条中间路线,用世界模型的预测能力驱动高频执行,用低频推理模型处理高层认知。

腾讯首席科学家张正友的视角更为宏观。他认为具身智能尚处于早期阶段,尚未像大语言模型的Transformer那样收敛出统一框架。“假如具身智能真正是一个智能体,怎么可能只有3B、4B的模型就能解决所有问题?”他提出认知系统、感知行动系统、底层反应系统三层架构,信息在层间双向传递,更像一个完整的Agent系统。他认为,要达到AGI级别智能,具身智能不能只靠几百B的模型直接控制运动。

姚卯青认为,VLA与WAM两条路线都需要持续演进并走向统一,下一代模型将是WRAM(世界推理动作大模型)。为此,智元推出了自研GO-2基座模型、Act2Goal世界模型、GE-Sim2.0等多款模型,搭配SOP(标准操作流程)和Genie Evolver百台级分布式真机强化学习体系,从算法、仿真、真机训练层面打通规模化迭代闭环。

场景验证:最快两年迎来“ChatGPT时刻”

如何将数据、训练、部署串成一个持续运转的系统,是验证世界模型落地的核心命题。训练效率是首要瓶颈。传统强化学习依赖单台机器人试错,周期长、成本高。智元提出“预训练—后训练—持续学习”三阶段架构。其在嘉兴搭建的Genie Evolver系统,实现了超过100台机器人同时在线迭代训练,云端更新权重后可在2秒内下发,将训练周期压缩至“分钟级”。

无界动力选择了“隐空间世界模型+强化学习”双轮驱动路径,以隐空间模型建立“世界观”,认知物理规律与因果关系;以强化学习塑造“价值观”,沉淀执行策略。大晓机器人发布的开悟世界模型3.1,在端侧实现了125毫秒的推理延迟,无需依赖云端算力即可完成“理解—推演—执行—反思”闭环。蚂蚁灵波则展示其在消费级显卡上达到90至150赫兹的推理效率。

部署验证是最后一块拼图。智元机器人在江西南昌3C产线实现99.99%成功率并稳定运行数月;Dyna Robotics在马萨诸塞州餐厅完成餐巾折叠商业验证,24小时无人干预折叠超过850个餐巾,成功率99.4%;大晓机器人采取“先ToB后ToC”策略,其“晓满”一体化履约方案已进入烧卖购、快客达等零售场景。

论坛上,业界对“ChatGPT时刻”的时间预测不一:姚卯青认为最快两年,任至意、马也骋判断约四年,张正友估计三至五年。

评测标准:行业缺少一把标准尺子

如果说数据、模型、场景是物理AI的“内功”,评测标准就是行业的“度量衡”。在“六小龙”巅峰论坛上,多位嘉宾认为当前缺乏公平、统一的世界模型评测基准,大多仍停留在视频生成类指标,与机器人所需的“物理因果推演能力”存在本质错位。

针对这一痛点,具身物理智能统一评测基准平台Physical IQ物智亮相。这是国内首个具身原生、面向多场景、多本体、多任务的评测基准。平台以统一协议贯通零售、工业、家居等场景,不限定硬件形态或底层算法。重点考察双臂协作、移动与操作协同、长程任务规划、3D空间推理等维度,如零售场景的货架整理、外卖打包,工业场景的精细分解、工具使用等。这些任务直击业务痛点。该平台吸引了智元、辉羲、蚂蚁灵波等企业参与,正在构建覆盖产学研用的完整生态。

最新快讯

2026年07月21日

22:49
鼓狮财经7月21日消息,东晶电子发布公告称,公司股票将于2026年7月22日开市起停牌一天,并于7月23日开市起复牌。自2026年7月23日起,公司将撤销退市风险警示,证券简称由“ST东晶”变更为“东晶电子”,证券代码保持002199不变。撤销风险警示后,公司股票交易的日涨跌幅限制仍维持10%。
22:49
7月21日,鼓狮财经报道,万润科技发布公告称,公司及相关下属控股公司近日收到湖北省武汉市中级人民法院送达的应诉通知书。据悉,国通信托有限责任公司已对公司提起民事诉讼,涉案金额包括未支付的股权转让款及可再生能源补贴款共计1.78亿元,以及相关逾期付款违约金约754.91万元。
22:49
鼓狮财经7月21日电,受消息面利好提振,美股比特币概念股今日集体走高。比特币价格强势突破6.6万美元关口,现报66694美元,涨幅超过2.3%。 截至发稿,Coinbase(COIN.US)涨超12%,领涨板块;Strategy(MSTR.US)涨超5%;Robinhood(HOOD.US)及Circle(CRCL.US)均涨超7%。 消息面上,美国总统特朗...
22:18
据鼓狮财经7月21日报道,杉杉股份(600884.SH)召开第十二届董事会第一次会议,并发布公告。会议选举朱胜利为公司新任董事长,并组建了董事会各专门委员会。同时,公司完成了管理层的聘任:聘任庄巍为总经理,李凤凤、朱志勇、张炯为副总经理,陈莹为董事会秘书,李克勤为财务总监,汪鸿为总经理助理,乐健为财务副总监,林飞波为证券事务代表。
22:18
鼓狮财经7月21日讯,晶科能源发布公告称,基于当前市场环境变化及对公司价值的判断,为提振投资者信心并结合公司实际经营管理情况,公司拟对回购股份的用途进行调整。具体而言,公司将把原计划用于员工持股计划或股权激励的2972.13万股已回购股份,改为用于注销,从而相应减少注册资本。
22:18
鼓狮财经7月21日援引移远通信(603236.SH)公告称,公司董事会近日收到董事长钱鹏鹤关于2026年度中期利润分配方案的提议。根据该提议,公司2026年度中期利润分配金额将不低于2026年半年度归属于上市公司股东净利润的30%。
22:18
鼓狮财经7月21日电,美国政府誓言将对加拿大的牛奶、冰球装备、啤酒、水泥及胶合板商品征收50%的新关税。受此消息冲击,加拿大木材、造纸、乳制品及水泥板块股票应声下跌。在多伦多市场,West Fraser Timber跌幅最为显著,达到3%;Cascades紧随其后,下跌2.3%;KP Tissue下跌0.9%。此外,CRH股价下跌1.6%,Saputo In...
22:06
当地时间7月21日周二,微软宣布向法国人工智能初创公司Mistral投入数十亿美元资金,旨在支持其在欧洲建设算力基础设施,并将Mistral的AI技术纳入微软的云服务和软件生态,以扩大商业应用。 根据协议,未来微软Azure客户将能够利用位于法国的Mistral数据中心进行软件开发。这不仅有助于增强微软在欧洲的算力储备,也为受严格监管的行业提供了一种区别于美...
21:45
如何让交互式 Agent 能像人类一样学会“事后复盘”,更好地处理长程任务? 如今,强化学习(RL)已经成为重要的后训练范式。然而,在长程 Agentic 学习中,基于结果的 RL 仍存在监督缺口: 失败轨迹可能包含有用行为,一条成功轨迹也可能包含可复用策略,但基于结果的强化学习只能判断任务成败,难以指出哪些中间观察、动作或工具调用应该...