不是哥们,DeepSeek要自己搞芯片???

事情是这样,前段时间,路透社报道说浓眉大眼的DeepSeek已经悄摸做了一年的AI芯片了,正在接触芯片设计、晶圆代工和存储厂商。

但这消息出来没几天,OpenAI就把自己和博通搞的Jalapeño芯片集群端了出来。完事儿同样也在这段时间,Anthropic也说要开始组建自己的芯片团队了。。。

不是你们一个个的,一边疯狂买英伟达产能,一边又公开表示也要下场搞芯片。难道老黄卖给他们的GPU不香了吗?

经过一番研究我发现,还真是不香了。。。

而这一切都是因为:推理芯片。

这个所谓的推理芯片,其实也不是啥新词。很多年前谷歌*代TPU就在研究推理了,前几年各种研究推理芯片的初创公司也不少,像什么Groq、Cerebras、SambaNova,这些可以说是各有绝活。

但是之所以大家现在感到陌生,原因也是显而易见:这个行业在前几年一直都是不温不火,属于大厂们鸟都不鸟的领域。

那么问题来了,前几年大厂对此不甚上心,今年偏说婉婉类卿,为啥突然间大伙都夏侯惇坐飞机,高看一眼了呢?

因为划不来啊。。。这事在当年还没谱。

众所周知,大模型是个发展很快的行业,今天爆火的模型、技术方向,可能过两个月就无人问津了。今年的OpenCLaw小龙虾现在在哪发财咱都不知道,更别说前两年的大模型厂商了。

毕竟那时候旗帜鲜明反对LLM的都大有人在(你小杨哥YannLecun)。。。大模型能走多远都不好说,所以模型厂商们更不可能专门为推理造芯片了。

毕竟英伟达的卡又不是不能用,训练起来也嘎嘎好使,花时间研究推理芯片那不是闲的嘛。*搞推理的谷歌TPU,最开始也不是为大模型准备的,因为那时候大模型都还没出生呢。

但事情的转机,发生在两年前的这个时候。

2024 年 8 月,Google DeepMind 团队发表了一篇里程碑式论文,他们发现只要延长思考时间,模型的正确率就会直接暴涨。

9月开始,OpenAI 的o 系列就开始让原子弹爆炸了;翻过年,DeepSeek-R1 等深度思考模型又给了世界一顿中国震撼。

然后从去年到今年,大家逐渐认识到,AI Agent、多 Agent 协作集群、几十万字的超长上下文分析,已经成了大模型落地工作的标配。深度推理和 Agent 这套技术路线,基本得到了整个行业的确认。

随着技术路线的确认和发展,压力*的除了前端兄弟,还有 GPU。。。。

随便打开一个AI对话框,我们在这里输入文字,AI就会返回文字,这看起来非常自然丝滑。

但从AI的视角看,你告诉AI“扮演一个猫娘”,它需要先理解“这句话到底说了个啥?”这一步就被称为Prefill。而AI读懂以后,开始学猫娘说话输出给你的过程,叫Decode

在Prefill阶段,AI要把一整句话拆成一个个token,然后分别理解这些tokens的含义,这个过程和AI的训练阶段非常相似。

模型怎么才能判断这些token的含义呢,这就涉及到了矩阵。

而纵观天下硬件,最适合算矩阵的算中之霸,就是GPU。

然鹅,对GPU来说,发送问题的Prefill阶段,和输出回答的Decode阶段,计算过程却完全不同。。。

在Prefill阶段,我们一次性提供了数据,GPU可以自己切分、所有核心一起并行计算,这就很舒服。

用下面图片中的简化公式感受一下:假设我们输入的token需要一个4096参数的矩阵,那么计算出来每从内存搬运 1 个字节的数据,GPU 就可以用这笔数据,执行上千次运算。

但一进入 Decode 阶段,形势就出了问题。

众所周知,现在的大模型都是自回归的,说白了就是要知道上一个词才能算出来下一个词。所以原本Prefill阶段4096行的输入矩阵,到了Decode阶段,会暴跌成只有1行。

经过同样的计算,每搬运 1 个字节的数据,GPU就只能算一次。。。

这下就坏菜了。。。

在芯片内部,两个数据相乘的能量消耗非常少。但要把一个数据从显存搬到GPU里,消耗的能量和时间往往是前者的几十倍甚至上百倍。

所以要把一颗芯片的算力拉满,理想的情况一定是,搬一次数据进核心,然后在本地反复算上几万次。最忌讳的就是搬一次算一次,下次要用再临时去搬。

所以在Decode阶段,一个 70B参数140GB 权重的大模型,每向用户输出一个 Token,芯片就必须把这 140GB 从 HBM 显存里完整读入一遍,再吐一个字又重读一遍。

哪怕用上 3 TB/s带宽的*显存,输出速度也只有每秒21个token。。。

换句话说,老子花这么多钱买显卡,结果芯片有 80% 的时间在发呆等数据传过来,这nm谁受得了。

更要命的是,除了推理时间变长,为了记住前面几十万字的思考过程,模型必须把所有历史 Token 的特征全部缓存在显存里,每多思考一步,显存里要搬运的数据量(KV Cache)也跟着爆炸。(这就是为啥显存和内存都纷纷涨价)

过去显存还算够用的时候,各大厂商还能靠纯软件手段来轻松绷住。

比如搞连续批处理,把几十个用户的请求攒起来摊薄搬运成本;还有梁圣的潜在多头注意力机制,压缩 KV Cache来减少GPU的搬运量。

但这些都治标不治本。。。GPU 在本质上是通用芯片而不是推理芯片,它就不是给来Decode的啊!

实际上,谷歌在很多年前就发现了这个问题。他们当时想到的办法非常简单粗暴,既然通用 GPU 这么拉,那我为什么不专门造一颗只为推理的芯片?

于是,*代 TPU就诞生了。它用来解决数据搬运问题的核心技术,叫作脉动阵列(Systolic Array)。

把芯片内部比作一个工厂,HBM显存是厂外的中央仓库,SRAM是流水线旁的小筐,计算核心就是打螺丝工位。普通的 GPU 算矩阵,就像一个工人每拧一颗螺丝,就要回显存仓库里拿一个零件,拧完再送回仓库。

而谷歌的脉动阵列,就是把打螺丝的过程变成了流水线,而且是个二维的流水线。

他们把上万个乘法计算单元(PE)焊成一个方阵,矩阵的权重数据一旦进了流水线,就像接力棒一样在工位之间横向传递计算,算出来的结果再依次传到下一层计算。

由于数据在相邻的核心之间直接传递,数据每进一次核心,就会在里面连续传递、复用几十上百次,根本不需要退回外部显存,压根就不需要中途再去搬运数据。

所以TPU的这波杀招也成了谷歌能摆脱英伟达卡脖子,在Gemini2.5时代一秒就能脉动回来的关键之一。(当然现在Gemini又拉了)

以前技术路线没定,TPU这种专用方案在大模型上没显出太大优势,大家也就继续买GPU。

而当现在深度推理让推理负载暴增,TPU的思路开始真正香了起来,包括谷歌都开始把TPU专门分出来训练版和推理版。

于是各大模型厂在这段时间都纷纷觉醒:是时候砸钱做专用的推理芯片了。

当然,吃够了英伟达卡脖子窒息play的大模型厂们,这一次没人愿意再当被动的买家。。。

比起每年把几十上百亿美元ATM给老黄,你还得看人家脸色,有这钱养一个芯片团队开销简直就洒洒水。

不过真要自己做了,大家也没有只按谷歌的 TPU 的路线去抄。毕竟模型都是自家的,怎么也得自己调教开发才能找到最适合的硬件啊!

拿 Anthropic 来说,脉动阵列虽然快,但大量的杂活就不能脉动回来了。所以 Anthropic不仅搞脉动流水线,还选择跟AWS深度合作了Trainium(另一方面A社自己也宣布要自研),拿着 Claude 模型运行的真实工序数据,反向写进底层编译器。

而投奔了英伟达的Groq,他们的思路就是极端流水线派,认为普通芯片把显存的数据搬来搬去完全是浪费。所以直接把HBM 显存给砍了,然后把整颗芯片塞满SRAM,相当于所有货都放在流水线旁边的小筐,随用随取。

相比极端派,国内的阿里就正好反过来。如果底层架构写死,到时候大模型架构变了咋办?所以他们选择拼一刀,让大量灵活通用的标准加工岛,一起拼同一套缓存SRAM。

至于OpenAI嘛,如果说前面几家都还在生产线上下功夫,他们相当于把整个工业园区重建了一遍。OpenAI的Jalapeno推理集群跟博通合作,把芯片、HBM、本地缓存、芯片间网络一起设计,靠让特定用户的 KV Cache 记忆档案和特定的算力集群绑定来减少搬运。

于是这么看下来,模型厂和硬件厂之间就形成了一个类似汽车行业的格局,比方谷歌就像比亚迪,从TPU 到 Gemini 全栈自研;OpenAI + 博通就类似吉利,放出图纸和需求来让能力最强的制造商落地;

而Anthropic + 亚马逊 AWS就有点像鸿蒙智行。

当然英伟达、Groq就还是那个卖铲子的人。无论上层算法风向怎么变,买老黄这套东西永远是最稳妥的选择。

最后再说说DeepSeek。

由于咱们目前能查到的信息只有DeepSeek说要搞推理芯片,但具体怎么个搞法,目前还没有信息出来。

不过,2025年梁圣写过一篇文章,点名下一代AI硬件最需要解决的问题就包括低精度计算、内存容量、计算效率、芯片间互联和低延迟通信。再加上DeepSeek模型的特点,咱们也可以脑补一下。

设计上大概率也是根据模型适配来设计芯片,但因为DeepSeek本身对KV Cache压缩,以及MoE的相关技术,可能会有更大的内存容量但优化算力,或者专门对通信路由做优化,比如降低数据精度来进一步压缩,留出专用数据通路等等。

当然最终还是以DeepSeek自己的技术论文为准,咱就不多bb了。

讲到最后,其实大伙可能会发现,AI厂商其实在这一波过程中和英伟达的关系似乎出现了一些微♂妙的变化。

以前大家都是让AI模型适应芯片,拿到什么卡,就研究怎么切分模型、压缩KV Cache、调教通信,恨不能直接变成H200的形状。

但现在,不是所有环节都必须要GPU了。以后不再是GPU厂商制约AI厂商,而是AI厂商可以主动选择适合自己的软硬件,以及上下游配套。

这样一来,模型公司就不用看硬件厂商的脸色适配了,翻身把歌唱属于是。

那么可想而知,以后在这条时间线上很有可能发生如下画面:

模型公司终于可以对芯片团队说,我的模型很大,你忍一下。

图片、资料来源

OpenAI:Jalapeño’s first results show industry-leading speed and efficiency in AI inference

OpenAI:Trading Inference-Time Compute for Adversarial Robustness

Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures

introl:AI Inference vs Training Infrastructure: Why the Economics Diverge

Ironwood: The first Google TPU for the age of inference

Google research:In-Datacenter Performance Analysis of a Tensor Processing Unit

reuters:China’s DeepSeek developing its own AI chip, sources say

Dwarkesh:TPU competition, why we should sell chips to China, & Nvidia’s supply chain moat

Groq Inference Tokenomics: Speed, But At What Cost?

DeepSeek、NVIDIA等,部分图源网络

最新快讯

2026年09月02日

15:35
鼓狮财经9月2日电,大量资金涌入土耳其里拉资产,令政策制定者陷入困境:既要抑制投机性短期资本流入,又不能切断本币的重要资金支撑来源。土耳其37%的基准利率吸引外资,估计已有750亿美元流入高收益货币衍生品与货币市场基金。政府正考虑对货币市场基金收益征税,以此防范资金快速外流、避免汇率剧烈波动,该税种将同时影响国内外机构投资者。
15:35
鼓狮财经9月2日电,孟买证券交易所(BSE)一名高管周三透露,交易所正与高频交易机构及其他市场参与者沟通,这类机构一直未参与印度新近推出的收盘集合竞价机制。孟买证券交易所首席执行官桑达拉曼・拉马穆尔 thy 在接受采访时表示:“流动性是收盘集合竞价机制取得成功的关键。目前该机制发展不及预期,散户与高频交易机构均未参与。”拉马穆尔 thy 称,如果两家交易所能...
15:20
公募基金最新中报持仓披露完了。公募基金的审美彻底变了。曾经牢牢占据基金重仓榜的白酒、消费、医药、金融,这一次几乎集体淡出。主动权益基金最新前20大持仓里,没有一家传统意义上的“老登股”,取而代之的,是光模块、AI芯片、半导体设备、PCB、先进封装等一批科技公司。过去公募基金重仓榜上的“茅指数”,正在变成一张国产算力产业链名单。公募基金2026年中报于8月31...
15:05
鼓狮财经9月2日讯,据农业农村部监测,今日农产品市场批发价格指数如下: 农产品批发价格200指数报116.16点,较昨日上涨0.06点;“菜篮子”产品批发价格指数报116.79点,较昨日上涨0.07点。 在肉禽蛋方面,猪肉平均价格为16.40元/公斤,环比上涨1.2%;牛肉69.33元/公斤,环比下跌0.3%;羊肉66.03元/公斤,环比下跌0.1%;鸡蛋1...
15:05
据鼓狮财经9月2日电,俄罗斯总统普京于当地时间9月1日在上合组织比什凯克峰会闭幕后的记者会上发出强硬声明。他指出,乌克兰境内的所有军事设施,无论其来自英国还是其他国家,均被视为俄军的合法打击目标。针对记者关于英国本土相关设施是否构成“红线”的追问,普京未予正面回应,仅以相关内容属于“军事机密”为由予以回避。
15:05
据鼓狮财经9月2日报道,国内商品期货市场收盘呈现涨跌分化态势。能化板块表现活跃,多数品种高开低走,涨幅居前,其中原油领涨,涨幅超过8%,乙二醇涨近6%,甲醇及燃料油涨幅均超4%,纯苯涨逾3%,LU燃油与苯乙烯涨近3%,液化气、集运欧线及对二甲苯涨幅均超2%,PTA、短纤、沥青和纸浆涨幅亦超过1%。 跌幅方面,贵金属与部分工业品回调明显,钯金跌近5%,沪银、铂...
15:05
鼓狮财经9月2日讯,持有奢侈品股票如今几乎成了一种逆向投资。然而,随着消费者信心与企业盈利增长逐渐触底,这一板块有望迎来转机。摩根大通策略师指出,当消费者信心处于低位时,消费类股票往往能在未来12个月内跑赢大盘,而奢侈品股通常会是其中表现最佳的板块。尽管整体消费周期股仍处于风暴中心,面临盈利预警频发和业绩指引谨慎的困境,但未来表现预计将有所改善。数据显示,在...
15:05
据鼓狮财经9月2日报道,法国兴业银行分析指出,韩国散户投资者的投资重心正从杠杆型交易所交易基金(ETF)转向半导体股票相关的结构化产品。这一转变折射出投资工具偏好的调整,而非投资需求的整体降温。 策略师拉贾特・阿加瓦尔团队在研报中表示:“尽管过去六周单只股票杠杆ETF的资金流入有所放缓,但普通股票买盘依旧坚挺,结构化产品发行规模亦持续攀升。这表明,这仅仅是投...
15:05
据鼓狮财经9月2日报道,全球债券市场虽因抛售潮推高收益率至多年高位,但此次波动幅度远小于2022年末。数据显示,全球政府债券收益率在20日滚动周期内累计上行17个基点,而2022年同期仅为62个基点。这种相对温和的波动令经验丰富的市场观察人士感到宽慰。部分人士甚至认为,在当前收益率水平下,寻求收益的投资者不妨开始布局债券资产。
14:51
一台接入现有电脑的桌面智能体,正将“自进化”从实验室的课题转变为普通人触手可及的产品。近日,Violoop正式完成了亿元级的天使轮及Pre-A轮融资。联想创投、中金保时捷、蓝驰创投、元生资本、启赋资本和清科控股共同参与了投资,向阳资本担任独家财务顾问。目前,Violoop已获得全球约1.2万人的预订,产品计划于9月正式上线。 比巨额融资更引人注目的是,Vio...