一觉醒来,关于 OpenAI 的消息真是满天飞。

先是 X 用户 Leo@synthwavedd *声称:OpenAI 已完成一次新的预训练,代号「Bel」,参数规模据称超过 10 万亿,或是 Doug 的继任者,可能成为 Astra /GPT-6 的基础模型……

一圈搜索下来发现,并没有准确的消息。但确凿无疑的是,OpenAI 的*自研推理芯片出成绩了。

就在刚刚,OpenAI 公布了*自研推理芯片 Jalapeño 的最新测试结果:取得了重大突破,这款芯片专为大语言模型推理设计,通过全新的架构设计,它能够同时提升吞吐量,并降低延迟,在保持高能效的同时,实现两者兼得。并在多个模型测试中超过 NVIDIA GB200、GB300 系统的效率表现。

随即,OpenAI CEO Sam Altman 也在 X 上表示:「我们制造了一款芯片,它的速度很快。」

需要注意的是,作为 OpenAI *自研推理芯片,Jalapeño 并不是用于训练下一代 GPT 模型的芯片,而是针对模型上线后的运行阶段进行优化。

简单来说:训练阶段是让模型学会能力,而推理阶段是让模型快速回答用户请求。Jalapeño 则主要解决的是第二个问题。

OpenAI 表示,传统硬件系统往往需要在两个指标之间做取舍:

更高吞吐量(throughput):单位时间处理更多请求;

更低延迟(latency):让用户更快得到响应。

例如,大规模批处理可以提升整体效率,但可能增加单次请求等待时间;而追求极低延迟,又可能牺牲资源利用率。Jalapeño 的目标,是在一个架构中同时优化两者。

而在具体性能方面,OpenAI 表示,在多个大模型推理测试中,Jalapeño 要优于 NVIDIA GB200 和 GB300 系统。其中测试模型包括:OpenAI GPT-OSS 120B; DeepSeek R1 670B; Moonshot AI Kimi K2.5 1T。

尤其引人注意的是 DeepSeek R1 和 Kimi K2.5 的出现,这似乎是在说明:Jalapeño 并不是只针对 OpenAI 自家模型优化,而是能够适配不同的大模型工作负载。

有意思的,Jalapeño 可被翻译为「墨西哥辣椒」,而在此消息一经发布后,也是立即引起了各路网友的调侃与热议。

「你打算用辣椒的名字来命名你的芯片吗?迫不及待想体验了。」

而对于 OpenAI 来说,Jalapeño 的推出,表明 OpenAI 正在尝试打通「模型 — 软件 — 芯片 — 数据中心」的一整条链路。

另外值得一提的是,此次 OpenAI 的 Jalapeño 芯片,在硬件上是与 Cerebras 进行的合作。

Tibo 发文称:「这一能力得益于我们与 Cerebras 建立的深度合作,以及他们独特的硬件架构。未来,这种合作还将进一步推动「超快速」体验的边界。

我非常期待双方继续合作,在 Cerebras 平台上不断突破极限,探索如何以最快速度运行我们能力最强的模型,并将这种体验带给对性能要求最高的客户。」

其实,OpenAI 并不是*家走向自研芯片的 AI 公司。此前很多 AI 大厂也早已纷纷下场造芯。比如 Google 推出了 TPU; Amazon 开发 Trainium、Inferentia; Microsoft 推进 Maia; Meta 也布局自研 AI 加速器……

背后的逻辑非常类似:通用 GPU 足够灵活,但并非针对所有 AI 工作负载优化。对于每天运行海量 AI 请求的公司来说,如果能够针对自身模型、软件系统和服务方式设计芯片,就有机会进一步降低成本……

下面我们来具体看一看 Jalapeño 的能力。

更快,更省电

Jalapeño 的核心优势,是在相同功耗下完成更多 AI 工作,同时更快返回响应。现有系统通常需要在吞吐量和延迟之间取舍,而 Jalapeño 试图用同一套架构同时实现更高吞吐量和更低延迟。

OpenAI 强调,这种优势不仅出现在自家模型上,也覆盖外部开发的模型,证明 Jalapeño 是一套更通用的推理架构。

在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个公开模型上,Jalapeño 在峰值吞吐量下实现了 1.5~1.9 倍的每瓦 AI 工作量,端到端延迟降低至对比系统的 1/1.7~1/3.6;对于高度交互式的工作负载,性能优势达到 2.1~4.1 倍。

在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上,Jalapeño 的峰值每瓦吞吐量分别达到现有*系统的 1.9 倍、1.7 倍和 1.5 倍。

其中,在规模*的 Kimi K2.5 上,Jalapeño 的峰值每瓦性能约提升 1.5 倍,端到端延迟降低约 3.4 倍。

在 Kimi K2.5 1T 上,随着单用户解码速度提高,Jalapeño 相比 GB300 的每瓦吞吐量优势从峰值的 1.5 倍扩大至最高 56.1 倍。

OpenAI 没有只比较单颗芯片的峰值性能,而是更关注一个指标:在满足用户和交互式 Agent 延迟要求的情况下,每单位电力能够完成多少有用的 AI 工作。

原因也和 Agent 有关。Agent 往往需要连续完成多个步骤,一次请求中看似不大的延迟,会在整个任务执行过程中不断累积。

这也是 Jalapeño 在低延迟区间表现最明显的地方。以 DeepSeek R1 为例,在对比系统此前* TBT 对应的条件下,Jalapeño 每千瓦吞吐量达到 12,258 mixed TPS/kW,对比 GB300 的 118,相差约 104.3 倍。

在 DeepSeek R1 670B 上,Jalapeño 峰值每瓦吞吐量约为 GB300 的 1.7 倍;在相同解码速度下,优势最高扩大至 104.3 倍。

OpenAI 使用 SemiAnalysis 的公开基准 InferenceX 进行测试,并与目前*的商用系统比较。从高吞吐量服务到高度交互、低延迟场景,Jalapeño 在三个公开模型上都实现了更好的每瓦性能和延迟组合,位于 Pareto frontier(帕累托前沿)。

在 DeepSeek R1 670B 的不同运行点上,Jalapeño 在每瓦吞吐量与交互速度、端到端延迟之间形成更优组合,处于 Pareto frontier(帕累托前沿)。

Jalapeño 的额定功耗为 700W,不过在此次测试的工作负载中,实际持续功耗始终保持在 550W 或以下。

为 Agent 而生

Jalapeño 从一开始就是围绕现在及未来大语言模型,尤其是交互式 Agent 设计的。

LLM 推理的不同阶段有不同瓶颈:Prefill 更依赖计算能力,Decode 更受内存带宽限制,核心和芯片之间的数据移动也会增加延迟。

因此,OpenAI 将芯片、内存、网络、软件和机架级系统协同设计。包括 KV Cache 在内的模型状态可以被明确放置并尽可能留在本地,让 Jalapeño 同时适应 Prefill 和 Decode,并随两者工作量的变化进行调整。

OpenAI 认为,这正是 Agent 工作负载的关键特征。

有意思的是,AI 不只是 Jalapeño 要服务的对象,也直接参与了这颗芯片的开发。

借助不同阶段的模型,OpenAI 团队从最初设计到 Tape-out(流片设计定稿)只用了 9 个月。模型被用于探索不同实现、缩短设计、测量和验证周期,还参与优化芯片的算术电路。

Jalapeño 同样被设计成一个对人类和模型都清晰、可预测的编程目标。使用 GPT-Astra 驱动的 Codex,团队只用了 2 个月,就让三款原本不在 Jalapeño 初始生产计划中的开放权重模型实现了高性能运行。

在部分 GPT-OSS Attention 和 MoE 模块中,Codex 生成的实现甚至比原有人类专家手写版本快 1.5~1.8 倍。

年底部署,二代三代已经在路上

OpenAI 计划在 2026 年底前开始将 Jalapeño 部署到自己的计算基础设施中。目前团队仍在进行生产验证、完善软件、为大规模运行做准备,并继续在更多模型上验证性能。

后续的产品也已经启动,Gen 2 已经进入深度开发阶段,Gen 3 也已经开始成形。

OpenAI 将 Jalapeño 带来的效率变化总结成了三个档位:Ultra-fast 模式,可以达到过去只有 Fast 模式才有的效率;Fast 模式,可以达到过去只有 Batch 模式才有的效率;Batch 模式本身则进一步提高效率。

不过,自研芯片并不意味着 OpenAI 准备摆脱 NVIDIA。

OpenAI 明确表示,满足不断增长的 AI 需求,需要来自所有可用来源的更多算力,公司仍将继续大规模部署 NVIDIA 和其他合作伙伴的加速器,同时覆盖训练和推理工作负载。

最新快讯

2026年08月26日

09:31
鼓狮财经8月26日电,中证商品期货系列板块指数今天(26日)正式对外发布。该板块指数以工业板块、农畜板块为首,共40条指数。系列指数既可精准、客观表征各商品期货细分板块价格运行趋势,又可以反映商品板块期货投资的收益走势,为投资者开展投资收益评价、业绩对标提供公允基准。同时,将助力稳步提升我国在全球大宗商品领域的定价话语权与国际影响力。
09:31
据鼓狮财经8月26日消息,国内商品期货开盘多数走低,能化板块领跌。其中,燃料油跌幅接近7%,原油、乙二醇及BR橡胶跌幅均超5%;集运欧线跌幅逾4%,纯苯、苯乙烯、液化气跌幅超3%,焦炭、PTA、沥青及短纤跌幅超2%。反观涨势,菜粕与不锈钢涨幅均超过1%。
09:30
2026年8月20日,莫德纳与默沙东合作开发的mRNA个性化肿瘤疫苗在III期临床试验中取得积极结果。这一消息迅速引发市场关注,云顶新耀股价盘中一度飙升89%,累计四个交易日涨幅达54.79%。尽管市场反应看似剧烈,实则体现了理性的价值重估。随着全球最具确定性的mRNA技术路线得到验证,拥有同源技术平台的中国企业自然受到重新审视。过去几年,市场过度聚焦于云顶...
08:57
鼓狮财经8月26日报道,OpenAI此前曾大举从Salesforce引进人才以推广企业级AI产品,然而近期部分销售人员选择回流,进一步加剧了OpenAI企业销售团队的动荡。据知情人士透露,前Slack首席客户官彼得·杜兰于今年4月加入OpenAI,现已接受Offer重返Salesforce;负责美洲地区销售业务的凯琳·沃斯也已同意离职OpenAI并重新加入S...
08:57
据美国官员透露,美国总统特朗普已将美沙两国于7月签署的核能合作协议提交国会审议。特朗普方面强调,批准该协议的前提条件依旧不变,即要求沙特与以色列实现关系正常化。 此举预计将在国会引发持续数月的激烈辩论,讨论焦点将集中在如何平衡促进美国核工业发展与遏制中东地区大规模杀伤性武器扩散的问题上。 7月22日,美沙两国能源部门曾联合宣布签署了和平利用核能的合作协议。然...
08:57
鼓狮财经8月26日讯据媒体周二援引知情人士报道,Claude聊天机器人开发商Anthropic 或将向投资者表示,其总可寻址市场(TAM)超过30万亿美元。 这一数据将超越SpaceX此前给出的28.5万亿美元的TAM估算,写下新的记录。 这个数字有多惊人?据媒体援引FactSet的数据,标普1500指数中191家科技公司去年的营收之和为2.4万亿美元。而A...
08:57
鼓狮财经8月25日讯,美东时间周二,摩根士丹利发布首份针对英伟达的信用评级报告,给予中性评价。报告指出,这家芯片巨头利用资产负债表为庞大的AI生态系统提供资金支持,这种做法引入了传统财务指标难以衡量的一系列新风险。 大摩科技行业信用研究分析师Lindsay Tyler表示:“鉴于英伟达将超常增长转化为战略性的AI融资工具,虽然增强了资产负债表实力,但也带来了...
08:56
美联储主席沃什本周五将在杰克逊霍尔央行年会上发表主题演讲。鉴于美债长端利率高企及回购公告效力短暂,此次演讲成为近期市场为数不多的潜在交易锚点。这不仅是检验沃什沟通能力的试金石,中信证券认为,他也将借此机会修复自身信誉,可能需要调整此前“全面模糊”的沟通策略。我们将重点观察其在政策透明度方面的表态,这比传统的“偏鹰”或“偏鸽”更为关键。 市场对本周即将举行的杰...
08:56
加拿大政府宣布,自9月8日起将分三档对700多种美国商品征收反制关税,涉及进口总额约276亿加元(折合199亿美元),该金额基于2024年的进口数据统计。 具体商品分类如下: * **50%最高税率**:主要针对钢铝制品、牛奶及乳制品(如奶油、乳清等)、蜂蜜、糖蜜及麦芽提取物、香水及美容产品、胶合板、服装、智能手机、显示器及视频游戏机、摩托车、家具及灯具...
08:23
全球*的开源AI社区正在寻找买家。8月24日,美国《商业内幕》报道称,全球*的开源AI社区Hugging Face正在评估整体出售,潜在估值至少130亿美元(约合人民币874亿元)。2016年,三个法国“80后”克莱芒·德朗格、朱利安·肖蒙和托马斯·沃尔夫创办Hugging Face。最开始,Hugging Face做一个面向青少年的聊天机...
08:23
Ilya Sutskever 的首款模型,可能真的要来了。昨天,a16z 合伙人 Martin Casado 突然发出预告:「刚刚获得了一个新模型的访问权限。这将是今年最重要的模型发布,甚至可以去掉‘之一’。」虽然 Casado 没有透露模型名称,但短短十几个小时内,更多消息开始涌现。零散的线索纷纷指向同一个答案:Ilya Sutskever 的新模型。 发...
08:23
最近,OpenAI和谷歌接连宣布API降价或降低Token价格,就连Anthropic也冻结了原有的涨价计划。反观中国,Kimi K3较上一代已事实上涨价,DeepSeek也预告近期将大幅涨价。曾经,OpenAI、谷歌、Anthropic凭借先发优势和算力垄断,高投入坐享高溢价。而中国的AI大模型,没有H100集群堆砌,靠MoE架构、缓存命中和工程打磨,不豪...