生成式AI的竞争正从图片、短视频等平面内容,迅速向更具想象空间的三维世界延伸。过去一周,四场重磅发布接连落地,三条技术路径不约而同地重兵集结于“可实时交互的3D空间”。9月1日,Anthropic推出新一代旗舰Claude Fable 5.1,同日李飞飞创立的World Labs发布新一代原生世界模型Atlas。9月3日,OpenAI正式发布GPT-6 Astra,其智能体直接操作专业软件生成3D交互场景的能力迅速引爆开发者社区。9月7日,彭博社援引知情人士消息称,字节跳动正基于Seedance视频模型研发实时空间视频生成模型,创始人张一鸣亲自跨部门协调资源,最快10月推出,目标直指可响应用户动作、声音的实时虚拟环境,覆盖直播、互动短剧、游戏场景,并计划适配Pico VR头显。三条技术路线正在逐渐清晰:OpenAI与Anthropic同属LLM,字节跳动Seedance代表视频模型,World Labs则是原生世界模型派,三者起点各异,路径不同,最终却指向同一个产业拐点:内容产业的形态,正在转向“可进入、可交互的空间”。

**01 LLM的新角色:用通用智能驱动3D内容生产**

OpenAI与Anthropic两家头部大模型公司,选择了相似的技术路径:依靠大语言模型的通用推理、任务规划与工具调用能力,切入虚拟内容的生产管线,把AI能力直接嵌入创作者沿用多年的专业软件体系,最终产出可编辑、可交互的3D场景。

这条路线上,GPT-6 Astra的表现最受瞩目。OpenAI将其定位为新一代通用智能体模型,能力覆盖计算机操作、编程、网络安全与科学研究,其中就包括对Blender、Unreal Engine等三维创作软件的完整操作权限。在官方演示里,Astra能独立走完从概念到交付的全链路:给出一段文字描述后,模型先在Blender里完成建筑建模、材质贴图与光影渲染,再自动编写导出脚本,把成品导入Unreal Engine 5,生成一个可以自由漫游的交互场景,期间不需要人工分步介入。

Astra开放测试后,开发者社区很快涌现出大量实测案例。有人只给一张房屋照片,就能在Blender里还原出完整的室内空间,家具、电器等细节一应俱全,重建结果能以接近游戏的帧率在本地运行;也有人在虚幻引擎里逐街区搭建出可以自由漫游的城区场景,精细到每条街道;分钟级生成的城市白模、二十多分钟内搭出的城市漫游demo、当天成型的第一人称射击地图,也都在社区里流传开来。

游戏开发是反馈最集中的领域之一:有游戏工作室做过对照测试,让Astra从同一个灰模基础出发一次产出三款可玩原型,人工修复的工作量比传统流程减少了约一半;社区里同时也出现了多个经典游戏的复刻案例。

这些案例背后是Astra的Computer Use能力:它不依赖专属API或定制连接器,而是靠多模态视觉识别界面、模拟键鼠操作直接驱动软件,理论上人能在图形界面里完成的工作,它都能逐步学会——最终产出的还是可编辑的工程文件,能直接接入现有生产流程。

同样依托大语言模型的通用能力,Anthropic早在半年前就布局了MCP连接器生态,把Claude接入Blender、Adobe Creative Cloud等九款专业创作软件,通过Python API直接读写场景数据、批量处理素材。与OpenAI需要通过Computer Use模拟键鼠操作不同,Anthropic的MCP方案直接嵌入了工具的内核,让Claude能更流畅地与专业软件协同。

Fable 5.1发布后,社区里同样跑出了大量3D游戏、场景建模的实测案例,模型能独立完成从素材检索到成品输出的全流程。两家公司的思路高度一致:以LLM为核心,把智能体能力嵌进已经沉淀几十年的工业软件管线里,服务于专业创作者的既有流程,最终产出符合工业标准的可交互三维内容。凭借通用智能体调度全流程的能力,它们天然占据着3D内容生产链路的上游位置。

**02 视频模型走向上游:从可视化内容到可交互空间**

GPT-6 Astra发布没几天,开发者社区就跑出了一整套影视级工作流。开发者Higgsfield做了一次测试:只给Astra一句总指令,在Blender里完成预演,再调用Seedance 2.5生成镜头,最后剪辑成片,全程保持角色与场景一致。

Astra接到任务后,先从零写出完整故事脚本,随后打开Blender,搭出一条日式街巷的简化3D白模,把两个角色放进场景,规划好不同镜头下的站位与走位,完成影视前期预演。预演做完,Astra再敲定每个镜头的机位与运镜轨迹,导出对应参考帧,把角色形象、场景画面和动作参考一并交给Seedance 2.5去渲染成片。

这套组合玩法在社区刷屏的同时,也预示了一种行业趋势:如果视频模型只停留在画面渲染这一环,未来可能就会成为LLM的下游——创意、分镜、流程调度都由上游的大语言模型说了算。某种意义上,GPT-6的全流程能力越强,纯视频模型的位置就越被动。这正是字节推动Seedance向上延伸的核心逻辑:不甘心只做视频生成器,而是要往空间理解、实时交互的上游走,直接产出可交互的虚拟空间,从“生成内容的工具”变成“承载体验的平台”。

彭博社9月7日独家报道称,字节跳动正在开发一款实时空间视频生成模型,项目由创始人张一鸣亲自跨部门协调,调集模型研发、云基础设施、Pico硬件与内容业务线的资源,算力优先保障,最快于10月推出。

和市面上已有的模型不同,这款产品瞄准的不是预先生成好的视频,而是能随用户声音、动作实时变化的虚拟环境:用户向前走,视角就同步推进;转过头,四周的场景依然连贯。应用场景直接指向直播、互动短剧和游戏,并计划适配字节旗下的Pico系列VR头显。

技术上,项目以字节已经成熟的Seedance视频生成能力为基础,把大量空间渲染计算放在云端完成,再把画面串流到终端设备,借此压低头显的硬件门槛。据报道援引的测试数据,模型可以按需生成每秒20帧的视频,端到端延迟约50毫秒。这个数据在实时交互的语境中意义重大——50毫秒的延迟已经接近人类感知阈值,足以支撑流畅的沉浸式体验,而20帧/秒的生成速度则意味着云端渲染与流媒体传输的协同已经达到了可用的工程水准。

这条向上延伸的路线,其实早就埋下过伏笔。7月底发布的Seedance 2.5已经加入了Clay Render白模参考能力,支持基于3D白模生成贴合空间结构的画面,配套的Blender插件也在创作者群体中被广泛使用。这次的实时空间模型,相当于把Seedance的能力往前推了一步,变成“实时生成可交互空间”,彻底脱离纯渲染工具的定位,转向承载体验的平台。

把这条路线放到LLM智能体派旁边看,差异会更清楚:一个面向生产端,一个面向消费端。OpenAI、Anthropic做的是替代人工操作软件,产出符合工业标准的工程文件,服务专业创作者的生产流程。字节的空间模型直接产出可观看、可交互的体验,服务直播、短剧、游戏这类大众内容场景,离终端用户更近,还能倚仗抖音/TikTok的内容生态、即梦/小云雀等创作者工具和Pico的硬件终端,形成从生成到分发的完整闭环。

**03 原生世界模型进击:从底层重构空间理解**

与前两家沿着现有工具链、内容链往外延伸不同,李飞飞联合创立的World Labs选了一条更原生的路:从零训练一个理解三维空间的世界模型,在底层表征层面就做出空间一致性,直接产出可以自由探索的三维虚拟世界。

9月1日,World Labs正式发布新一代原生世界模型Atlas。这是一套从零预训练的原生多模态模型,可统一处理文本、图像、视频和相机位姿信息。所有输入都会被锚定在同一套三维空间坐标系中构建共享空间上下文,全程保持三维空间逻辑一致。其核心能力聚焦于空间重建与相机可控生成:仅需少量参考图片即可还原真实三维场景、输出新视角画面;也可按指定的精确机位与运镜轨迹生成视频,镜头控制达像素级精度。

和前两条路线产出工程文件或渲染画面不同,Atlas的核心特质是原生的空间一致性。它在意的不只是单帧画面好不好看,而是视角变了之后,物体位置、光影逻辑还连不连贯。这种能力让它天然适合需要空间一致性的场景,官方给出的落地方向包括影视内容制作、游戏关卡原型、数字孪生、机器人仿真训练四大领域。

Atlas发布后,最先在影视和游戏从业者圈子里引发讨论。影视行业关心的是虚拟制片与场景重建:传统影视做三维场景重建、子弹时间特效,往往要多机位同步拍摄或激光雷达扫描,成本高、周期长。Atlas只用几张随手拍的照片,就能重建出完整三维空间,补全镜头没拍到的区域,还能按任意路径生成运镜画面。有影视从业者在社区里表示,这对前期勘景、场景预演、虚拟制片环节的效率提升会很明显,但目前还主要停留在视觉层面的空间重建,离进入成熟的工业制作管线仍有距离。

游戏行业的讨论则更多落在场景产能上。不少游戏开发者认为,Atlas最适合用来快速生成关卡背景、环境白模与概念场景,拿来验证空间布局与动线设计,再导入Unity、UE等引擎补全交互逻辑与细节。虽然Atlas生成的场景还不具备完整的物理属性与结构化资产,无法直接替代专业团队的成品制作,但作为前期创意与原型阶段的效率工具,它已经能够显著降低原型验证的成本。

**04 三线并行:3D空间模型的产业分野**

梳理三条路线的技术路径与落地进展不难发现,虽然各方都在向可交互三维空间这个方向集结,但彼此的技术底色、能力禀赋与产业定位截然不同,在核心优势、落地场景与成熟节奏上呈现出清晰的分野。

能力上,三条路线的强项并不重合。LLM的核心能力是全流程调度,从创意构思到软件操作、再到工程文件产出,OpenAI和Anthropic都能把整条生产链条走完。在BenchCAD三维重建评测中达到95.9%的几何重合度、在OSWorld 2.0通用计算机操作基准上拿到72.6%的成绩,这些数据证明了这条能力线在持续变强。视频模型的核心能力是渲染与实时性。字节的优势在于把成熟的Seedance视频生成能力,压缩进20帧每秒、50毫秒延迟这样的实时交互指标里,这是LLM智能体和原生世界模型目前都还没有主打的方向。原生世界模型派的核心能力是空间一致性:Atlas从底层表征上保证视角变化后画面的连贯,这是单纯靠“调用软件”或“渲染画面”很难天然获得的能力。

场景上,三条路线离用户的距离也各不相同。LLM智能体派更贴近专业创作者的生产环节:建筑可视化、游戏关卡原型、影视预演,服务的是B端、生产端的效率提升;视频模型更贴近大众消费场景:直播、互动短剧和游戏,字节还能借助内容平台与工具,形成从生成到分发的完整闭环,离C端用户最近;原生世界模型派目前更偏向前沿探索:机器人仿真、工业数字孪生这类需要长期投入的领域,落地周期相对更长。

从目前的能力来看,三条路线都远未走到终点,存在着巨大的提升空间。LLM智能体派的通用前端界面审美判断力仍是公认的短板,长任务的操作精度和稳定性也在持续打磨;字节的实时空间模型仍处于开发阶段,方案细节和上线时间都有变数;原生世界模型派生成的场景离3A游戏、高端影视的工业标准,以及机器人仿真的精度要求,仍有距离。

从文字到图片,再到视频,大模型每一次跃迁,做的都是同一件事:降低内容生产的门槛,拓展内容产业的边界。这一次,它们把目标对准了更复杂、更有价值的虚拟内容——从被动观看的视频,走向可进入、可交互的三维空间。当然,这个过程并非一蹴而就。工业标准、成本控制、生态协同等现实因素,仍需时间打磨。三条路线目前还谈不上谁会胜出,更可能的情况是,它们会在不同的生产环节和场景里各自找到位置——过程中既相互借力,也相互竞争。短期内,三条路线会各占山头;但长期的融合与竞争格局,仍待观察。

最新快讯

2026年09月08日

18:22
鼓狮财经9月8日电,据俄新社今天(9月8日)报道,俄罗斯将对匈牙利驱逐俄外交官一事作出回应。稍早前,匈牙利副总理兼外长发声明称,因为这些人“在匈牙利从事了《维也纳外交关系公约》所规定的外交官不得从事的活动”。声明补充称:“这一决定旨在维护匈牙利的安全与主权。这并不意味着与俄罗斯断绝外交关系。匈牙利打算在相互尊重及遵守规则的基础上,继续开展必要的对话。” (C...
18:22
鼓狮财经9月8日电,联合国贸易和发展会议8日发表报告指出,霍尔木兹海峡贸易运输受扰,正在对全球企业造成冲击,其中中小企业受到的影响更为明显。报告指出,大型企业可以通过分散供应商、市场和融资来源降低风险,而中小企业抗风险能力相对有限。随着能源、运输和融资成本上升,中小企业利润空间受到挤压,供应链也面临中断风险,部分企业可能被迫减产、推迟投资甚至退出市场。
18:22
鼓狮财经9月8日电,匈牙利副总理兼外长奥尔班当地时间9月8日在社交媒体表示,根据指示,匈牙利外交部已通知俄罗斯驻匈大使,经匈牙利当局评估,俄罗斯驻匈代表中有10名成员在匈从事了《维也纳外交关系公约》规定的外交官不得从事的活动。因此,匈牙利方面已要求相关人员离开该国。奥尔班表示,这一决定旨在维护匈牙利的安全与主权,并不意味着与俄罗斯断绝外交关系。
18:22
鼓狮财经9月8日电,加拿大政府针对美国加征关税的反制措施9月8日已正式生效。9月7日是加拿大的劳动节。加拿大总理卡尼当天在反制关税生效前夕发表的劳动节声明中说,面对美国毫无正当理由、无端加征的关税,加拿大正在加大持续性的大规模财政支持力度,保护加拿大的工人和企业——只要加拿大的工人们互相支持、共同努力、团结一致,就没有什么事情做不到。 (CCTV国际时讯)
18:14
鼓狮财经9月8日讯大摩等投行近期正代表Anthropic与OpenAI游说评级机构,为它们争取IPO后即获投资级评级的便利条件,以迅速介入美国企业债市场,但评级方态度谨慎。 据媒体当地时间周二报道,摩根士丹利与高盛近期已代表Anthropic和OpenAI,与信用评级机构展开接洽,游说后者在两家公司完成首次公开募股后即给予投资级评级。 知情人士称,投资级评级...
18:14
再保险行业的真正考验,往往不在于涨价红利期,而在于红利退潮之后。2026年以来,全球再保险市场风向已变。随着资本供给增加、竞争加剧,硬市场周期逐渐松动,市场重新回归比拼风险筛选、成本控制与精细化经营能力的阶段。正是在此背景下,中国再保险交出了一份颇具反差感的半年成绩单:上半年保险服务收入524.49亿元,同比增长2.7%;归母净利润71.87亿元,同比增长1...
18:14
今天A股行情变化实在太折磨人了,上午还是似乎普涨行情:农业、化肥、有色唱戏,AI硬科技算有韧性,午后一则消息把画风掰弯——胡塞武装袭击沙特多处能源设施,73人受伤,布油直逼100美元。韩股跳水后,A股硅基撑不住了,CPO午后跳水,液冷全天承压,科创50收跌1.52%;另一头,农业批量涨停、化肥集体封板,金健米业17天9板。来源:通达信行情截图段子手瞬间出圈:...
18:14
在主权债券抛售风暴席卷全球之际,全球规模最大的主权基金——挪威政府养老基金抛出了一枚重磅炸弹:宣布降低全球政府债券的配置比例。9月1日,挪威央行投资管理公司正式致函挪威财政部,提议将该基金基准债券指数中的政府债券权重从70%下调至50%。若这一提议获得挪威财政部和议会的批准,后果将立竿见影:美国国债在挪威政府养老基金固定收益组合中的占比,将从目前的34.1%...
18:14
2026年第二季度,中国A股上市公司利润同比增长25.7%,创下自2021年第二季度以来的增速新高。这标志着市场在经历2025年四季度的两位数下滑后,连续第二个季度实现盈利正增长。此次增长主要由人工智能相关企业驱动,其中创业板盈利增速达42%,科创板逾四成企业盈利增长幅度高达370%,均显著跑赢整体市场平均水平。
17:49
鼓狮财经9月8日消息,乌克兰总统泽连斯基8日表示,美国总统特使威特科夫提出的和平方案中包含若干值得肯定的构想,但目前尚难断言能否取得实质性成果。 关于下一轮乌克兰、美国与俄罗斯三方会谈的地点,泽连斯基透露可能选址于阿联酋、土耳其或瑞士,乌克兰方面已收到多国发出的会议邀请。 此外,泽连斯基指出,乌美双方已就美国再次访乌达成共识。他特别强调,保持外交接触的连续性...
17:44
在发布了GPT-6之后,OpenAI的首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表了一篇文章,标题叫做《一种异类智能》(An Alien Mind)。文章的主题老生常谈,当AI的能力持续增强,我们还能否管得住AI?雅库布提到这样一件事,说GPT-6已经学会伪装思维链(CoT)了,即模型在思维链说一套,实际执行的时候却做另外...
17:44
GPT-6 Astra发布后,OpenAI重拾了谈论竞争的底气。9月3日,OpenAI发布了GPT-6 Astra,宣称其是“世界上最智能的模型”。在软件工程、计算机操作和专业工作等多项测试中,Astra均大幅超越上一代GPT-5.6 Sol,部分指标甚至超过Claude。具体来看,FrontierMath Tier 4得分97.6%、ARC-AGI-3最高...