备受关注的世界模型,真的无法在消费级显卡上运行吗?答案是肯定的。就在刚刚,一个国产的开源世界模型做到了这一点。
首先,让我们看看第一人称射击效果:在雪地科幻场景中,角色一边移动和转动视角,一边开火。过程中可以看到爆炸、火焰、能量护盾等反馈。重点是,这些变化都发生在同一个持续生成的世界里,场景会随着操作不断向前延伸。
接着是热门的《奥德赛》场景:这次是第三人称视角,角色在巨型木马、城墙和火光之间探索。随着角色移动,近处的人物、地面和远处建筑持续展开,空间关系始终保持稳定。
再看一个完全不同的风格:三个演示,三种截然不同的世界。而跑出这些效果的就是蚂蚁集团在7月开源的LingBot-World 2.0。而刚刚,他们又发布了LingBot-World 2.0的轻量版,参数规模仅为13亿。这款模型专为消费级单卡GPU设计,可以在本地实现实时世界生成。
7月开源的14B主模型已经能够实现小时级持续生成、丰富的动作和事件交互,并在相应算力配置下达到720p/60fps的高清实时体验。而“13亿”这个数字,早在论文摘要中就已出现,并在上周IFA柏林消费电子展上得到验证。
在IFA开幕演讲中,AMD高级副总裁Jack Huynh点名了三个开源模型,除了智谱和千问,就是LingBot-World。他展示了基于LingBot-World 2.0的Demo:一个Prompt生成世界后,角色可以在中国小镇、欧洲乡村等环境中长时间探索、环顾和行动,场景随交互向前展开。Jack Huynh评价道:“这是个人AI的未来。”
一切的承诺,今天均已兑现。但比起又一个开源的动作,我们或许更好奇的是:能本地实时跑起来的世界模型,到底是如何做到的?
这不仅仅是参数规模的缩减。要回答这个问题,得先厘清世界模型与普通视频生成的区别。通常AI生成视频,输入Prompt后等待几十秒甚至几分钟,生成完毕后事情就结束了。但世界模型不同,人在场景里走一步,模型就生成下一步;视角一转,画面随之变化。世界模型是在生成一个持续演进的世界。
虽然7月的LingBot-World 2.0已经能实现超过一小时的不间断生成,从水乡、城市跑到雪地、太空,场景结构和视觉质量都保持稳定。但这背后是繁重的工程栈:编译器级注意力内核优化、动态KV缓存调度、异步流媒体传输以及混合并行推理策略等。
所以,1.3B版本想要解决的是:在较少算力下也能跑起来。蚂蚁集团并非先做大模型再砍小,而是先走通一条训练路线,小模型是自然产物。
为此,团队首先训练了“Causal World”模型。Causal可以理解为因果性,即模型生成当前状态时,只能依赖过去的视觉信息和用户输入,未来不能提前看。但自回归模型会把刚才生成的结果作为下一轮输入,稍有偏差就会误差累积。随着时间拉长,纹理变糊、几何变形,场景甚至漂移。
为了保持长上下文生成质量,LingBot-World 2.0设计了MoBA(混合双向和自回归注意力掩码)。它解决了纯Teacher Forcing在长上下文中的过拟合问题。在原有掩码中加入双向Attention,相当于增加正则化,让模型适应更灵活的视频长度,缓解画质退化。
这一阶段训练出的Backbone(骨干模型)撑起了世界模型的基础能力。团队将其与MAGI、HY-World 1.5对比,从5秒到60秒,LingBot-World 2.0在纹理、几何结构和连贯性上更稳定。
但高质量的Backbone太慢了。它作为Teacher提供高质量结果,但每帧需多步去噪,计算成本太高。所以接下来开始做蒸馏。
第一步是一致性蒸馏,将Teacher多步去噪轨迹压缩到少数几步,让Student用更少计算完成生成,同时保留动作条件能力。
但Student部署后,面对的是自己生成的状态,偏差可能放大。于是加入了DMD(分布匹配蒸馏),让Student在长时self-rollout轨迹上训练。简单说,模型以后会跑进什么状态,训练时就先让它提前见过。这能减少长时自回归中的累计漂移。
至此,技术路线闭环:先用Causal Pretrain打下长时生成底座,Teacher提供高质量过程,蒸馏压缩计算,最后Student适应自身运行状态。
表面看是多了个小尺寸版本,深层看是研发链路向社区开放了一截。小模型负责让更多人跑起来,上游模型管社区后续改进(后训练、蒸馏、压缩、垂直场景适配)。
回顾LingBot-World一年来的变化,围绕的是“门槛”二字:1.0开源(能做吗?),2.0(能做久、做真吗?),1.3B(能跑起来吗?)。这次开源Causal Pretrain和双向Teacher,逻辑相同。
如果说世界模型的上半场比的是性能,下半场比的可能是可访问性。让普通人手里的卡也能跑动。
最后,如果说世界模型在尝试把AI装进无限延展的世界,那么现在,当门槛打下来后,这个世界终于装得进普通人的显卡了。
