在经历了一轮人才流失与产品延期后,Google一项最早需至2028年才能面世的秘密计划终于浮出水面。据The Information援引知情人士透露,Google正研发代号“Frozen v2”的服务器芯片,专攻Gemini模型。据参与项目员工介绍,该芯片在每瓦特能生成的Token数量上,有望达到Google最新TPU的6至10倍。“Frozen”之名,正源于其核心构想——将Gemini的部分结构永久“刻”入芯片。
要理解Frozen v2,必须回溯传统芯片的运作逻辑。1945年,宾夕法尼亚大学莫尔学院启动了EDVAC的设计,这是早期“存储程序”计算机的雏形。在此之前,修改计算机程序往往意味着繁琐的插线与开关操作。数学家冯·诺依曼作为顾问,在《First Draft of a Report on the EDVAC》中系统阐述了“存储程序”概念,即指令与数据一同存入存储器,由处理器逐条读取执行。此后,以他命名的冯·诺依曼架构成为通用计算机的核心蓝图。指令集作为“共同语言”,让软件能通过加减法、跳转等指令指挥处理器。同一颗芯片通过更换程序,即可胜任表格计算、游戏或视频剪辑。这种通用性是过去八十年的主流。然而,通用往往意味着低效。
大模型每生成一个Token,都需反复读取权重与中间数据,核心无非是矩阵乘法与注意力机制等少数几种操作。但通用处理器必须保留服务无数程序的控制逻辑与数据通路,其中大量数据在推理时实为冗余。加之处理器与内存分离,数据需反复往返,当运算速度超越数据读写速度时,便撞上了“内存墙”。过去几十年,行业虽通过GPU和NPU/TPU试图缓解这一问题,但为了兼容多种模型,这些专用芯片在设计上仍保留了一定通用性。而Google决定采取一种更为颠覆的方案:正在秘密研发的Frozen v2芯片,将围绕Gemini的固定结构来部署计算单元、存储位置与数据流。通过让硬件预先知晓后续大概率发生的运算需求,从而极大提升效率。
Google计划在芯片中“刻”下Gemini的架构层。一个模型大致可拆解为架构与权重两大部分:架构规定了信息如何流动,宛如一副骨架;权重则源自训练,决定了模型的回答方式。据报道,Frozen v2将固化更多的架构信息,同时保留权重更新能力。芯片依然执行指令、读取内存,但部分计算路径已提前确定。Frozen芯片项目由Google首席科学家Jeff Dean推动。第一代Frozen曾设想过将模型权重也固化进芯片,但代价是一颗芯片仅能对应一个版本的Gemini,待流片部署完成时,对应模型可能已过时,导致项目一度搁置。Frozen v2吸取了这一教训,保留了权重更新能力。只要下一代Gemini沿用相近的底层架构,芯片便能继续服役。换言之,这也是Google长期押注Gemini的有力证据。
不久前,OpenAI已展示了“模型参与芯片设计”的现实案例。2026年6月,OpenAI与Broadcom公布自研推理芯片Jalapeño,团队根据ChatGPT等模型的真实负载设计芯片,OpenAI的模型也被用于加速设计与优化。该项目从设计到流片仅用九个月,工程样片已跑通模型负载。Anthropic、DeepSeek等公司也纷纷传出自研芯片的消息。尽管各家专用程度不同,但方向一致:掌握模型的公司正将每日重复的计算规律交给硬件。显然,我们已进入“模型定义芯片”的时代。
为何主流大模型公司都在押注自研芯片?答案不言自明:为了降低算力成本。以Google公开的旗舰模型Gemini 3.1 Pro Preview为例:20万Token以内,输入每百万Token定价2美元,输出每百万Token定价12美元。假设一次较重请求输入5000Token、输出1000Token,单次调用成本约2.2美分。若此类调用每天发生1亿次,日支出即达220万美元,年支出约8亿美元。考虑到Gemini应用月活已超9亿,再微小的算力支出乘以近10亿规模,都是一笔天文数字。因此,降低算力费用是所有大模型公司的立命之本。
这场硬件下注,正发生在Google AI业务反复起伏的关口。2022年11月,ChatGPT横空出世,三周后Google管理层拉响“红色警报”,Sundar Pichai亲自接管AI战略。彼时的Google虽拥有Transformer、搜索和庞大数据中心,却被OpenAI拔得头筹,抢先定义了生成式AI的入口。三年后,局面一度逆转:Gemini 3发布,Nano Banana刷屏,Google收复了不少失地,一度成为离AGI最近的科技巨头。然而最近几个月,Google内部又发生剧烈动荡——Gemini联合负责人Noam Shazeer离职加入OpenAI,John Jumper与多名研究员转投Anthropic,原定6月推出的Gemini 3.5 Pro被曝延期数月,编码能力未达内部目标,Alphabet股价也因此接连重挫。这些顶级研究员的离职,与争取不到足够的算力资源不无关系。The Information称,算力短缺甚至迫使Google Cloud拒绝部分外部客户订单,即便在内部,算力资源也极为紧张。
但Google手里握着一张对手难以复制的底牌——从Gemini模型到TPU芯片,再到Google Cloud数据中心与庞大的生态产品,整条链路均掌握在同一家公司手中。模型与硬件可围绕同一套需求进行设计。研究员可能被挖走,旗舰模型也可能延期,但Google积累十年的TPU、编译器和数据中心体系不会因一次人才跳槽而消失,这是AI时代Google最大的底牌之一。
但风险同样巨大。据悉,Frozen v2芯片最早要到2028年才会部署,时至今日,Google仍在决定该在芯片上固化多少信息。这也是“Frozen”名字的第二层含义:Google准备冻结一部分Gemini,来换取芯片级的高效率。将大模型刻进芯片里,究竟是否为最优解?或许要等到两年后才能见分晓。可留给Gemini追赶的时间,已经不多了。
