昨晚刷到 Andrej Karpathy 的一条帖子,我愣了好几秒。他给 Opus 5 下的指令很简单:用 Three.js 渲染《指环王》的开篇,成本约 10 美元。机器轰鸣了两个小时,吐出了 5500 行代码,将文字中的中土世界硬生生变成了一个 3D 游戏。
这不是简单的贴图,而是纯粹的代码构建——树木的位置、岩石的形状,全靠代码“画”出来并驱动动画。打开网页,河流蜿蜒,丘陵起伏,树木点缀其中。虽然画面有些粗糙,但这毕竟是一个能跑通的 3D 世界。体验地址:https://karpathy.ai/lotr-movie/
往昔,打造这般作品需要团队、预算,耗时数月;如今,十美元足矣。Karpathy 指出,正常人没耐心写这种定制代码,但 LLM 拥有无限的耐心。那些曾经“不值得做”的项目,现在 AI 成本趋近于零。定制游戏、专属的一次性体验、专属剧情的虚拟世界——AI 都能一句话搞定。
Karpathy 的想法更进一步:将玩家投入这个即时生成的世界,让他们作为旁观 NPC 参与剧情,或直接扮演角色。他称之为“按需生成的临时 GTA”。凭借 Opus 5 吐出 5500 行代码的能力,这完全可实现。
闲聊两句八卦。一年前,马斯克在 X 上喊话 Karpathy:“安德烈,我失散多年的兄弟,让我们再次并肩作战吧!”结果今年 5 月,这位“兄弟”加入了 Anthropic。而在 Karpathy 用 Anthropic 的模型做出这番壮举后,马斯克仅回复了一个“Yah”。
闲聊到此为止,回到正题。最让我陷入沉思的,是 Karpathy 最后提到的观点。他直言,这暴露了 LLM 的一个致命弱点:无法高效审查自己的工作。它们既无法原生感知视频,也无法走进自己生成的场景去体验。Opus 5 虽然造出了一个中土世界,却无法进入其中。整整两个小时,它只能用最笨的办法检查:在不同位置截屏,看几张静态图,然后靠猜。中间搞砸了好几次,那些粗糙和 Bug 就是这么来的。看着有点心酸,就像一个闭着眼睛干活的装修师傅,手艺好、速度快,却无法后退一步看看整面墙到底刷平了没有。
细想之下,这极其荒唐:模型有能力从零构建一个 3D 世界,却无法沉浸式地走进去体验。这不仅仅是 3D 渲染的问题。如今前沿模型写代码、写文章、做分析的速度惊人,十美元就能干完以前一个团队的活。但问题是——“做出来之后呢?”它自己不知道做得好不好。写代码的能力飙升了,但验证代码的能力还停留在原地。这是一种诡异的悖论:一头是近乎无限的耐心和产能,另一头却是无法感知成果。
所以,接下来的关键在于谁能实现 AI 的自我审查。写到这,我顿悟了:这不就是递归自我进化(RSI)吗?嘿,这事儿真有意思。
参考资料:https://x.com/karpathy/status/2083749667410727319
