7月19日,生数科技联合创始人、首席执行官骆怡航在2026世界人工智能大会“启明创投·创业与投资论坛”上发表主旨演讲,题为《通用世界模型:打通虚实边界,筑基物理智能》。
骆怡航回顾了生成式AI的发展脉络,从2024年的多模态音视频生成,到2025年视频模型在内容产业的技术突破与商业化落地,再到2026年视频模型边界的进一步释放。他认为,世界模型当前尚未达到完全收敛,仍处于技术和产业的迭代阶段。基于此,他分享了生数科技对世界模型的理解与实践,探讨了其从何而来,以及未来三年的发展方向。
骆怡航指出,人类智能除了语言交流外,大脑中还运行着一个指导行动决策的“世界模型”。无论是骑车还是运动,人脑都在不断进行感知、预测和执行。因此,人工智能的目标是打造一个接近甚至超越人类智能的完全智能模型。世界模型的核心在于处理人与世界的所有交互,它需要像人一样感知、思考并采取行动,形成感知、预测与行动的动态闭环。这与单纯的视频生成、3D重建或视觉行动模型有本质区别,后者缺乏完整的闭环和动态反馈机制。
此外,骆怡航强调世界模型必须是通用的,而非局限于特定场景。只有具备足够的泛化性,才能支撑规模化落地。生数科技据此构建了通用世界模型基座,提出了一套具身智能的统一架构。该架构将理解、感知、预测和行动统一建模,利用同一套基座模型在不同空间进行解码:在数字空间表现为生成模型,在物理空间表现为行动模型。同时,生数科技通过“具身数据金字塔”结构,从互联网视频数据到仿真、本体相关及不完美数据,分层消化各类数据,以突破物理世界数据瓶颈,实现效果的快速飞跃。
在应用层面,生数科技于今年4月发布了基于通用世界模型的“具身大脑”及Motor Brain模型。该模型实现了“一脑多人”,能在极短时间内通过少量数据适配多个本体,完成原子任务拆解、协作及长程任务规划。在Robot、World Arena等评测中,Motor Brain指标大幅提升,展现出强大的泛化能力。同时,WeDo世界生成模型在音画同出、智能运镜等方面持续迭代,WeDo S1版本进一步实现了实时感知与交互。
骆怡航总结道,生数科技的目标是构建WeDo Q、WeDo S和Motor Brain三大模型,打通数字与物理世界。他展望未来,通用世界模型将成为物理世界机器人和数字世界Agent的核心驱动力,实现像人类一样的自主规划、执行与创作,最终推动人机交互的终极愿景。
