**Karpathy 揭示 Opus 5 的新边界**

过去,人们常拿一个有趣的问题来测试大模型:“请生成一张鹈鹕骑自行车的可缩放矢量图。” 下面这张图就是 ChatGPT 给出的结果。这道题看似简单,实则考验了模型对自行车结构、鹈鹕形态以及两者空间关系的理解,需要通过坐标、路径和图形元素进行组合。模型画出的鹈鹕究竟是坐在车上、悬浮在空还是与自行车融为一体,往往能直观暴露其空间推理能力。

但现在,Andrej Karpathy 认为,评价前沿模型的方式或许需要再次升级。8月2日,Karpathy 在社交平台 X 上公布了一项实验。他将《指环王》第一章的开头文字交给 Claude Opus 5,投入约100万 Token 的推理预算——按他估算相当于10美元——并要求模型利用 Three.js 将这段故事渲染成一个三维场景。这条帖子浏览量已超280万。Opus 5 运行了约两小时,最终生成了约5500行代码。成品虽被 Karpathy 称为“有些粗糙,但很好玩”,但真正让他感到不可思议的是:一个语言模型需要自行决定场景中的角色、房屋、道路和植被,将各种多边形资产放入三维坐标系,编写动画、镜头和时间轴逻辑,最终竟真的完成了一个能在浏览器中运行的作品。

这不是简单地将文本交给图像或视频生成模型后得到一段像素画面。Opus 5 走的是一条更接近传统游戏开发的路线:通过代码创建几何体、材质、灯光、摄像机和动画,搭建一个显式存在的三维场景。在这样的系统中,一棵树不只是画面中的一团绿色像素,而是场景树中的一个对象;道路、房屋和角色都有对应坐标;镜头何时靠近、角色从哪里走到哪里、字幕在什么时间出现,都需要被写入程序。Anthropic 在7月24日的 Opus 5 发布公告中也将视觉输出列为这一代模型的主要提升之一,并展示了模型生成的交互式风洞和细胞结构。官方将 Opus 5 定位为适合长时间、多步骤任务的模型,强调其能够反复检查结果、建立测试工具,并在复杂任务中持续迭代。

Karpathy 的实验则把这种能力推向了一个更开放的场景:没有明确的功能列表,没有现成的美术资源,也没有逐个给出对象坐标,模型必须自己判断“一段小说应当如何变成一个可运行的3D叙事”。Karpathy 尤其关注的是背后的经济性变化。按照传统流程,为一段小说开头单独制作一个3D动画,需要编剧拆分场景、美术制作资产、程序员搭建交互与动画。即便最终只供一个人观看,这套成本也不会明显降低。由于需求过于定制化,绝大多数类似想法根本不会进入制作阶段。大语言模型改变的首先不是作品质量,而是“是否值得开始”。模型不在乎任务是否琐碎,也不在乎5500行代码最终只被播放一次。只要推理成本足够低,过去因为过于个性化、投入产出比太低而无人制作的内容,都可能被临时生成出来。Karpathy 将其描述为一种“按需生成的临时版GTA”:用户可以指定任何小说、历史事件或虚构设定,让模型临时搭出一个世界;玩家既可以作为旁观NPC进入故事,也可以成为其中一个角色,甚至改变原本的叙事走向。这意味着,生成式AI正在把内容定制从“更换角色名字、调整几张图片”推进到结构层面:场景、交互规则、角色关系和故事进程都可以根据单个用户即时生成。

用游戏测试模型,网友早就玩嗨了。Opus 5 发布后,X 上的开发者迅速把三维游戏和物理模拟变成了一种非正式压力测试。开发者 Matt Shumer 展示了一款由 Opus 5 生成的第一人称射击游戏“Claude of Duty”。据他介绍,项目从场景到贴图均由代码生成,没有使用任何外部美术资产。Alex Ermolov 则让 Opus 5 制作了一段滑雪板体验。他评价称,在自己测试过的模型中,Opus 5 处于领先位置,第一次生成的版本就没有明显视觉故障,滑行的物理反馈也相对自然。另一位用户 ChrisGPT 把一年前 Claude 4 Opus 的输出与 Opus 5 进行了对比。同样是生成一辆行驶在泥路上的汽车,旧版本主要由简单色块组成,而 Opus 5 已经开始自动加入车辙、植被、阴影和分层光照。更极端的测试来自 Pankaj Kumar。他让 Opus 5 重建《我的世界》,最终得到一个包含15种生物群系、创造与生存模式的程序化世界,图形、纹理和声音都在运行时生成。不过,这次任务使用了约2500万 Token,也说明随着世界规模扩大,成本和代码复杂度仍会快速增长。atomic.chat 还让多款模型分别生成龙卷风、摆锤撞击建筑等物理场景。按照该团队自己的测试结论,Opus 5 是少数能够同时处理多个场景的模型之一。需要说明的是,这类演示通常没有统一的提示词控制、运行次数和评分标准,因此更适合被视为开发者实验,而不是严格的模型基准。这些作品的共同之处是,都告别了依赖传统游戏资产库,让模型直接把几何体、纹理、物理和交互写成代码。相比单张图片,测试对象开始变成长时间运行的系统:角色能否移动、对象会不会穿模、碰撞是否正确、几十秒后场景状态是否仍然一致。

尽管看起来像一个生成式世界,Karpathy 的实验与谷歌 DeepMind 的 Genie 等世界模型仍有明显区别。Opus 5 生成的是一套显式程序。场景中的对象、坐标和行为由 Three.js 代码决定,开发者可以阅读、修改和复用代码。其优势是结构清晰、控制性较强,但模型只能生成自己能够用程序表达出来的对象和规则。Genie 3 采取的则是生成式视频路线。根据谷歌 DeepMind 的介绍,它可以根据文本实时生成720p、每秒24帧的可交互环境,并在几分钟内保持一定视觉一致性。它不需要显式创建每一个三维模型,而是直接根据玩家操作预测下一帧画面。两条路线解决的是不同问题。代码生成世界更像“AI自动编写一个小型游戏引擎和关卡”,结果可编辑、可调试,但视觉上容易粗糙;神经世界模型更像“实时生成一个可以进入的视频”,画面表现可能更丰富,却缺少传统游戏引擎中明确的对象、状态和规则。未来的产品也可能融合两者:LLM负责规划任务、设计规则和生成代码,世界模型负责画面、物理直觉与环境反馈。

这次实验最值得注意的部分,是 Opus 5 检查这些代码的方式。Karpathy 指出,模型不能高效、原生地观看连续视频,也不能像真人测试员一样进入游戏,持续移动、碰撞、回头观察,再判断哪里出现问题。它只能运行程序,在若干时间节点截取静态画面,然后根据截图修改代码。这个循环既缓慢,又很容易漏掉只在运动过程中出现的问题。例如,角色可能在某一帧看起来位置正确,却在几秒后穿过地面;摄像机在单张截图中没有问题,运动时却可能突然转向;碰撞、速度和操作手感更难通过几张图片判断。因此,画面中仍然留下了不少错位和粗糙之处。Karpathy 由此认为,视频理解、连续状态感知以及真正“玩游戏”的能力,仍是当前大模型明显不足的原始能力。这暴露出一个正在变得越来越重要的矛盾:模型生成内容的能力,正在快于它验证内容的能力。对于普通代码,模型可以运行单元测试、查看错误日志、比较文本输出;但面对动画、游戏、机器人和复杂用户界面,正确性不再只存在于文字和数值中,而是分布在连续时间、视觉状态和交互反馈里。如果模型无法亲自体验自己生成的系统,就很难形成完整的“生成—执行—观察—修正”闭环。

从鹈鹕骑自行车,到《指环王》三维世界,大模型评测正在发生一个微妙变化。过去的问题是:模型能不能写出代码、画出图片、生成一个可以运行的页面。现在的问题逐渐变成:它能不能连续工作两小时甚至更长时间,组织数千行代码,保持对象、任务和目标的一致性;完成之后,它能不能主动进入系统,发现那些没有出现在错误日志中的问题。Opus 5 生成的还不是一款真正的《指环王》游戏,约10美元也只是 Karpathy 给出的 Token 预算估算,并不包含人工设计、运行环境、验收、修改和正式制作成本。但这个实验依然意味着一个重要变化:以前因为“太麻烦、太小众、没有人愿意做”而不存在的软件和内容,现在可能只需要一句描述和一笔很小的推理预算。模型已经开始具备建造临时世界的耐力。接下来的关键,是它什么时候能够真正看见、进入并理解自己建造的世界。

最新快讯

2026年08月03日

18:42
鼓狮财经8月3日电,宏景科技(301396.SZ)公告称,公司董事会审议通过回购股份方案,拟以自有资金通过集中竞价方式回购股份,资金总额不低于3000万元且不超过5000万元,回购价格不超过260元/股,用于未来实施员工持股计划或股权激励。
18:42
鼓狮财经8月3日电,胜蓝股份(300843.SZ)公告称,公司拟使用自有资金及自筹资金以集中竞价方式回购公司股份,回购资金总额不低于1亿元且不超过2亿元,回购价格不超过195.18元/股。回购股份将用于股权激励或员工持股计划、可转债转股。
18:42
鼓狮财经8月3日电,豫光金铅(600531.SH)公告称,公司收到控股股东豫光集团转发的济源产城融合示范区国资局批复,原则同意公司向特定对象发行股票预案,发行数量不超过3.63亿股,募集资金总额不超过18.39亿元,并同意豫光集团以现金参与认购。该事项尚需公司股东会审议、上交所审核及证监会同意注册。
18:42
据鼓狮财经8月3日报道,当地时间8月3日,以色列议会外交和国防委员会投票通过了政府提交的延期申请,决定将军队紧急动员令延长两个月,有效期至今年9月30日。根据该决议,以色列国防军获准最多可征召24万名预备役军人。据悉,自2023年新一轮巴以冲突爆发以来,此类延长紧急动员期限的申请已多次获得批准。
18:10
究竟还有没有便宜又好用的模型?就在刚刚,阿里巴巴突袭发布了新一代基座大模型 Qwen3.8-Max。用四个字概括就是「能打」、「便宜」。总参数量达到2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景上的表现直接跃升了一个档次。 在今天最新放榜的权威第三方榜单 Arena 中,Qwen3.8-Max 一路冲到全球大模型第一梯队,表现直逼 Anthrop...
18:05
导语:绿的谐波的业绩与马斯克能否兑现承诺紧密相连。加州弗里蒙特与江苏苏州,直线距离超过一万公里。但在即将到来的具身智能时代,这两地极有可能因一款产品而产生紧密联动。目前,特斯拉弗里蒙特工厂已拆除了原有的汽车生产线,转而开始组装人形机器人Optimus。市场普遍认为,作为总部位于杭州的机器人供应商龙头,绿的谐波将因此受益。这家企业在国内谐波减速器市场占据20%...
18:05
投资界传来重磅消息,全栈开源双足人形机器人项目RoboParty(萝博派对)近期已连续完成近5亿元的天使++轮和Pre-A轮融资。其中,Pre-A轮由宁德时代独家领投。这在业内并不多见,因为宁德时代通常通过其投资部门进行投资,而此次是直接以集团战略投资主体的身份下注,信号意义不言而喻。 这位备受瞩目的创始人是22岁的黄一,一位几乎满足了VC所有想象的“天才少...
18:05
两百多年前,英国纺织工人拿起锤子砸向机器。两百多年后,类似的情绪又出现在了韩国的一座汽车工厂里。今年 7 月,现代汽车韩国工会连续发动部分罢工。表面看,这仍然是一场熟悉的劳资谈判:加薪、绩效奖金、退休年龄都在工会诉求之中。但今年多出来了一项颇具时代感的内容——AI 与机器人时代的就业保障。早在 6 月的罢工投票阶段,现代汽车工会便提出,希望获得针对先进机器人...
18:05
6月下旬以来,全球AI板块经历了一轮显著的回调。这究竟是短暂的技术性调整,还是周期见顶的信号?这是一个极具价值的问题。摩根士丹利于7月27日发布了一份长达120页的深度报告《Playing the AI Infrastructure Dip》,对此进行了深入探讨。报告给出了明确的判断:此次回调的主要驱动力在于技术面因素,包括仓位拥挤度的消化、保证金融资的去杠...
18:05
长久以来,硅谷厂商主导着全球大模型的定价权。DeepSeek 凭借性能与价格的双重优势,在海外开发者市场形成了显著的挤压效应。这几天,社交媒体上一张 AI 漫画图广为流传,虽然人物是梁文锋,但经过漫画化处理后,其形象酷似超人,被海外网友戏称为“海外开发者眼中的梁文锋”。这幅漫画所表达的深意在于,就在上周末,DeepSeek V4 Flash 正式上线,以极致...
18:05
**瑞·达利欧深度访谈:AI 泡沫的生成机制、投资策略及未来展望** **编者按:** 桥水基金创始人瑞·达利欧近期接受了知名商业播客节目 The Diary Of A CEO 的深度专访,深入探讨了 AI 泡沫、80 年周期迭代以及比特币等议题。在访谈中,达利欧揭示了 AI 泡沫的生成机制,列举了泡沫破裂的三大征兆,并分析了 AI 变革中资本家与普通人的命...
18:05
过去两年,几乎所有AI公司都在讲述同一个故事:把重复劳动交给AI,人类就能腾出时间去从事更有创造性的工作。这套理论听起来无懈可击。让AI整理资料、处理表格或撰写会议纪要,人则专注于战略和创意,仿佛是一次完美的社会分工。然而,它掩盖了一个前提:重复劳动与创造性工作并非泾渭分明。历史给出的答案并不干脆。许多真正的创造并非发生在重复劳动之后,恰恰发生在重复、失败和...