想象这样一个场景:你对机器人发出指令,让它去拿衣服晾晒。机器人先是观察舱门,规划好手臂开合的轨迹,缓缓打开。然而,它发现衣物缠在一起,于是停顿思考,重新调整策略,将缠绕的衣物逐一抽出并整理好。这个场景之所以令人兴奋,并非因为它“做到了”,而是因为它“想到了”。它是在理解世界、预测后果并调整行动。这正是世界模型所追求的境界——让机器像人一样,在行动前在脑海中推演“我这么做是否符合物理规律”。
2026年被视为具身智能的部署元年。在2026世界人工智能大会上,具身智能企业不再像过去那样展示机器人的“舞蹈功底”,而是将真实的产线搬到了展台。那么,机器人如何感知环境、理解任务、执行动作并在反馈中持续进化?世界模型和物理AI的“ChatGPT时刻”还有多远?业界对于“终点前的最后一段路该怎么走”有着不同的见解。
数据困境:如何翻越“三道墙”
世界模型的本质是什么?“能够理解物理世界运行规律的AI系统”。智元机器人合伙人姚卯青认为,其核心功能是“预测世界的下一步状态”。他提出,世界模型需要掌握三项关键能力:多模态融合理解(准确感知环境变化)、物理规律认知(涵盖动力学及时空理解)以及因果推理(具备长时序推理能力)。从“看到了什么”到“世界会怎样变化”,再到“如果我这么做会怎样”,构成了完整的智能链条。
然而,训练这样一个模型所需的数据与现实能提供的数据之间存在巨大鸿沟。在“智启具身论坛2026:迎接物理AI智能涌现”分论坛上,姚卯青坦言,语言模型头部团队已使用100万亿Tokens的语料,约合100亿小时的人类说话时长。而具身智能所需的物理世界数据,信息密度远低于语言,目前差距达万倍以上。这是物理智能规模化必须突破的第一道“数据墙”。
此外,姚卯青指出,理解物理AI需回归智能的两条主线:表征与闭环。目前跨任务、跨场景、跨本体的统一物理表征尚未形成,这是“表征墙”;真实试错代价昂贵、反馈缓慢,难以规模化,这是“闭环墙”。
针对数据来源,企业给出了不同解法。Sunday Robotics联合创始人赵子豪介绍了低成本、无本体差异的UMI(通用操作接口)数据采集方式,认为这是短期提升智能最有效的手段。Physical Intelligence研究科学家任至意则坚持真机数据的不可替代性,认为只有真机采集的数据才能完整复现任务。Dyna Robotics联合创始人马也骋提出了“数据金字塔”方案,将互联网视频、第一人称数据、真机数据和部署回流数据分层处理。这场讨论暗示了一个事实:没有任何单一来源能解决物理AI的数据饥渴难题。
模型争辩:VLA已死,WAM是未来?
尽管大模型智能程度越来越高,但不少从业者发现,直接将大模型路径平移到物理AI领域或许行不通,甚至出现了“VLA(视觉-语言-动作模型)已死,World Action Model(WAM)当立”的言论。
任至意回应称,截至目前,没有看到哪家能做到比Physical Intelligence发布的π0.7更亮眼的演示,所以VLA还没有死。但他也承认,VLA和WAM并不冲突,未来需要训练一个原生理解context、知道如何生成未来的模型。这种表态暗示了与其争论路线,不如先做出行业公认的成果。π0.7仅通过在ARX机械臂上训练,就能零适配地在UR5双臂机器人上完成同款操作,实现了跨本体迁移的突破。
马也骋则基于实战经验认为,Dyna已从VLA切换到WAM架构,因为在部分强调高成功率和少数据效率的任务中,WAM比VLA更高效。这是Dyna在餐巾折叠等真实商业场景中“逼”出来的“生存智慧”:通用模型不够可靠,专用模型不够可扩展,他们选择了一条中间路线,用世界模型的预测能力驱动高频执行,用低频推理模型处理高层认知。
腾讯首席科学家张正友的视角更为宏观。他认为具身智能尚处于早期阶段,尚未像大语言模型的Transformer那样收敛出统一框架。“假如具身智能真正是一个智能体,怎么可能只有3B、4B的模型就能解决所有问题?”他提出认知系统、感知行动系统、底层反应系统三层架构,信息在层间双向传递,更像一个完整的Agent系统。他认为,要达到AGI级别智能,具身智能不能只靠几百B的模型直接控制运动。
姚卯青认为,VLA与WAM两条路线都需要持续演进并走向统一,下一代模型将是WRAM(世界推理动作大模型)。为此,智元推出了自研GO-2基座模型、Act2Goal世界模型、GE-Sim2.0等多款模型,搭配SOP(标准操作流程)和Genie Evolver百台级分布式真机强化学习体系,从算法、仿真、真机训练层面打通规模化迭代闭环。
场景验证:最快两年迎来“ChatGPT时刻”
如何将数据、训练、部署串成一个持续运转的系统,是验证世界模型落地的核心命题。训练效率是首要瓶颈。传统强化学习依赖单台机器人试错,周期长、成本高。智元提出“预训练—后训练—持续学习”三阶段架构。其在嘉兴搭建的Genie Evolver系统,实现了超过100台机器人同时在线迭代训练,云端更新权重后可在2秒内下发,将训练周期压缩至“分钟级”。
无界动力选择了“隐空间世界模型+强化学习”双轮驱动路径,以隐空间模型建立“世界观”,认知物理规律与因果关系;以强化学习塑造“价值观”,沉淀执行策略。大晓机器人发布的开悟世界模型3.1,在端侧实现了125毫秒的推理延迟,无需依赖云端算力即可完成“理解—推演—执行—反思”闭环。蚂蚁灵波则展示其在消费级显卡上达到90至150赫兹的推理效率。
部署验证是最后一块拼图。智元机器人在江西南昌3C产线实现99.99%成功率并稳定运行数月;Dyna Robotics在马萨诸塞州餐厅完成餐巾折叠商业验证,24小时无人干预折叠超过850个餐巾,成功率99.4%;大晓机器人采取“先ToB后ToC”策略,其“晓满”一体化履约方案已进入烧卖购、快客达等零售场景。
论坛上,业界对“ChatGPT时刻”的时间预测不一:姚卯青认为最快两年,任至意、马也骋判断约四年,张正友估计三至五年。
评测标准:行业缺少一把标准尺子
如果说数据、模型、场景是物理AI的“内功”,评测标准就是行业的“度量衡”。在“六小龙”巅峰论坛上,多位嘉宾认为当前缺乏公平、统一的世界模型评测基准,大多仍停留在视频生成类指标,与机器人所需的“物理因果推演能力”存在本质错位。
针对这一痛点,具身物理智能统一评测基准平台Physical IQ物智亮相。这是国内首个具身原生、面向多场景、多本体、多任务的评测基准。平台以统一协议贯通零售、工业、家居等场景,不限定硬件形态或底层算法。重点考察双臂协作、移动与操作协同、长程任务规划、3D空间推理等维度,如零售场景的货架整理、外卖打包,工业场景的精细分解、工具使用等。这些任务直击业务痛点。该平台吸引了智元、辉羲、蚂蚁灵波等企业参与,正在构建覆盖产学研用的完整生态。
