科幻寓言《平面国》中,主角生活在二维世界,直到被三维球体带入空间国,才意识到高度的存在。如今,人工智能似乎也正迎来类似的认知突破。9月2日,“AI教母”李飞飞创立的World Labs发布了其最新成果——Atlas。这不仅仅是一个能生成图片或文字的模型,而是全球首个多模态世界模型,致力于让AI真正理解并模拟3D世界的物理法则与几何结构。
Atlas的核心创新在于用“空间上下文”替代了传统的“文本上下文”。不同于大模型处理文本,Atlas采用多模态自回归扩散Transformer架构,将输入的每一张图片和视频都锚定在三维空间的精确坐标中,并附有相应的相机位姿和深度信息。这相当于为模型提供了一个带有坐标轴和比例尺的三维草稿本,让AI在理解世界时拥有了明确的几何和物理参考。
Atlas展现出了多项突破性能力:首先是像素级相机控制,只需1到6张图片,就能生成最长1分钟的高清视频,用户可像导演一样规划相机的运动轨迹;其次是“少即是多”的空间重建能力,在DTU等数据集测试中表现优异,仅需2到25张地面照片,即可重建斯坦福大学主方庭并生成高空俯瞰视频;此外,它还能通过多视角视频生成“子弹时间”特效,或根据文本描述生成360度全景图及丰富风格的图像。
李飞飞将Atlas视为团队里程碑式的成果,认为它是通往“具身智能”的关键一步。这意味着AI将像人类一样用3D视角看待时空,这将极大地推动物理AI场景的落地。
Atlas的应用前景广阔:在视觉特效领域,它能降低运镜和特效制作的门槛;在机器人领域,它解决了真实数据匮乏的难题,通过生成逼真的3D仿真环境来训练机器人,大幅提升训练效率;在3D内容生成方面,未来或许只需几张照片就能重建复杂场景,为游戏和AR/VR行业带来新可能。
当然,Atlas目前并非成熟的通用世界模拟器。它擅长构建几何连贯的静态空间,但在处理物体碰撞、复杂动力学等物理法则时仍显稚嫩。此外,对于未拍摄区域的生成依赖先验知识,可能存在局部几何漂移或纹理闪烁的现象。
目前,Atlas已进入早期访问阶段,仅向部分合作伙伴开放,未来将用于驱动World Labs自家的Marble产品。
