OpenAI在发布说明里点明,这次上线是一整套全新系统首次在真实生产环境中整体运转,为此团队正在调集大批计算资源、扩充推理能力。

两天之内,三场前沿发布,最快的一次反超只用了五小时。

9月4日,OpenAI宣布开始分批次发布GPT-6 Astra,优先向全部Plus用户开放,官方口径是稳妥与速度并重,整个发布预计数天内完成。而就在两天前,9月2日,谷歌与Meta同日各放一款新模型。谷歌端出Gemini 3.8 Flash,这是它六周内第三款Flash;Meta端出Muse Spark 1.3,这是它五个月内第四款Spark。Meta新模型上线数小时后,即在Artificial Analysis智能指数上反超谷歌同日新品。两场发布之间,只隔了四十八小时。

放在两年前,一款旗舰发布足以占据一周头条。如今,前沿模型的保鲜期被压缩到以小时计。这并非某一家公司的困境,而是一个更冷的信号。大模型智能本身,正在变成一种可以被快速复制、快速刷新的商品。谁先发布、谁更便宜、谁更垂直,正在取代“谁最强”,成为更值钱的三个问题。

两条路线,同榜撞车

先看谷歌。Gemini 3.8 Flash每百万token输入0.75美元、输出3.75美元,与三周前的3.7 Flash持平。但TestingCatalog的日报标注得更准确,这是12月31日前的入门价,不是永 久定价。谷歌没有把低价当成长期承诺,而是当成换取市场份额的限时筹码。

按谷歌官方自测表,3.8 Flash在每一项都压过3.7 Flash。长周期软件工程测试DeepSWE v1.1从65.3%升至73.7%,终端基准Terminal-bench 2.1从85.8%升至89.4%,OSWorld-2.0从50.6%跳到59.0%,金融智能体基准Vals Finance Agent v2从59.0%升至61.4%,HLE-Verified从53.6%升至54.9%。单看这一串数字,这是一次标准而全方位的分数抬升。

更具参照价值的是它同旗舰级模型的对比。谷歌自测表里,3.8 Flash在DeepSWE v1.1上拿到73.7%,距Claude Opus 5的74.0%仅差0.3个百分点;HLE-Verified的54.9%,压过Opus 5的54.4%和GPT-5.6 Sol的54.5%。而Opus 5每百万token输出价25美元,是3.8 Flash的近七倍。一款Flash档模型,在数个硬核基准上逼近甚至追平售价25美元输出价的旗舰,这才是这条新闻真正的分量。

再看Meta。Muse Spark 1.3在Artificial Analysis智能指数上拿到62分,仅次于Claude Fable 5.1(66分)与Claude Opus 5(63分),位居全场第三。这个62分来自其max变体,目前仅对Meta的合作伙伴限量开放;真正现在就能用的xhigh变体拿61分,与GPT-5.6 Sol(max)、Grok 4.6(high)、Claude Opus 5(high)并列。相比一个月前1.2的57分涨了4分,相比7月1.1的53分涨了8分。Meta将曾被视为“跟跑”的Spark系列,一举推入第 一梯队。

两条路线在此分岔。谷歌打“高频小步”,以六周三款的节奏打磨快船,价格钉死在入门档,靠节奏换空间;Meta打“单点爆发”,五个月放出四款,每一款都试图在指数榜上直接冲击前三。9月2日,两条路线在同榜撞车,几个小时后Meta赢了。而四十八小时后,OpenAI带着新款旗舰入场,这场胜负还没来得及被市场消化,就变成了旧闻。

OpenAI的第三条路线:规模压顶

如果说谷歌赌的是节奏,Meta赌的是高度,OpenAI赌的则是规模。

9月4日开始的GPT-6 Astra发布,把这场竞赛从开发者社区拉向大众市场。它不再只对Pro、Business和Enterprise开放,而是向全部Plus用户铺开,官方口径是“以尽可能谨慎且快速的方式推进”,发布本身需要数天滚动完成。一句话,OpenAI对这款模型的信心,足以支撑它在最 大范围的用户群上首日开跑。

规模之外,是算力的大举投入。OpenAI在发布说明里点明,这次上线的不是单个模型,而是一整套全新系统首次在真实生产环境中整体运转,为此团队正在调集大批计算资源、扩充推理能力,确保全部Plus用户都能顺畅用上。翻译成行业语言,GPT-6 Astra不是一次参数微调,而是一次基础设施的大规模扩容

但规模路线也有软肋,分数开始变得暧昧。ARC Prize的分析显示,GPT-6 Astra在ARC-AGI-3上以62.7%的Standard框架分数居首,换用新的Provider Adapter框架后却升至99.9%,并在96%的关卡上超过人类表现。同一个模型,两种测量框架,差出37个百分点。62.7%说明它还没摆脱智能体的笨拙,99.9%又像是宣告ARC-AGI-3已被打穿。这种分裂恰恰印证了行业的共识,当测量框架本身开始影响结论,所谓的“登顶”就只剩下修辞意义。

如果只看分数,这些发布似乎都在宣告“又变强了”。但把分数摊开看,一个更令人不安的事实浮出水面。最前沿的几家实验室,智能水平正在不可逆地趋同,而测量分数的尺子本身,也开始松动。

HLE-Verified是最能说明问题的数字。Gemini 3.8 Flash为54.9%,Claude Opus 5为54.4%,GPT-5.6 Sol为54.5%。三家实验室,分数紧咬在小数点后一位。DeepSWE v1.1同样如此,73.7%对74.0%,差距不足一个百分点。当几款模型在“人类最后一场考试”这种终 极难度基准上只差0.5个百分点时,“碾压”“吊打”的叙事已失去依据。

这种分裂在GPT-6 Astra身上被放大到极 致,同一模型在ARC-AGI-3上,标准框架只有62.7%,换用Provider Adapter框架却冲到99.9%。分数可以因尺子而大幅摆动时,所谓“登顶”就只剩下修辞意义。ARC-AGI-3接近饱和,某种意义上不是模型的胜利,而是测量框架的胜利。

谷歌在发布中承认,3.8 Flash“工作得更努力”,即执行了更多推理步骤与工具调用,在高思考档下可能消耗更多token。翻译过来,分数上涨的代价不是“更聪明”,而是“更用力”,用更多计算与更多轮次堆出零点几个百分点的提升。OpenAI那边是同一个逻辑,GPT-6 Astra的发布说明里写着“多个全新系统将首次大规模运行,团队正带来大量算力”。当智能提升从“范式突破”退化为“算力堆叠”,前沿模型的军备竞赛便沦为边际收益递减的内卷。0.3个百分点的DeepSWE提升,背后是多少额外token、多少额外推理时间,账面上无法精确核算。智能正在从“稀缺品”变为“耐用品”,稀缺性快速蒸发。

单位智能成本,才是新的度量衡

如果智能趋同,下一场战争的胜负手便落在“每一分智能要花多少钱”上。一个指标正在取代传统benchmark排名,成为投资人、开发者与云厂商真正紧盯的数字,是cost per task,即单任务成本。

Artificial Analysis给Muse Spark 1.3 xhigh算出的单任务成本是0.55美元,而同处61分档的Grok 4.6要0.94美元,GPT-5.6 Sol要0.95美元,Claude Opus 5要1.23美元。也就是说,Meta仅以对手45%到59%的成本,便购得同档智能。再往下看,Gemini 3.8 Flash单任务成本0.58美元,指数分59,紧贴Meta。整个行业的性价比前沿正被这两家重新刻画,而Anthropic旗舰则据守在智能更高、成本也更贵的另一端。

价格崩塌是全局性的。就在几个月前,DeepSeek将V4-Pro价格永 久下调75%,输出价砍到每百万token约0.87美元,缓存命中的输入价低至每百万token约0.0036美元。现在连谷歌都开始用12月31日到期的入门价锁定客户。当巨头把限时降价当成获客手段,“高价闭源”这套商业模式的根基便开始晃动。

这里藏着一个反直觉的转折。通常我们说“便宜没好货”,但在这条赛道里,最 便 宜的那批模型恰恰在侵蚀最贵那批的地盘。Gemini 3.8 Flash用3.75美元的输出价,去对标Opus 5卖25美元的同一个基准;Meta用0.55美元的单任务成本,去对标对手0.94美元甚至更高的同样分数。价格战打到这个阶段,比的已不是谁能赚钱,而是谁能在“智能趋同”前提下,把单位成本压到让对手的定价失去合理性。

当通用智能的边际收益越来越薄,前沿实验室开始把差异化押在“专用”上。谷歌这次最被低估的动作,不是3.8 Flash本身,而是随它一起发布的Gemini 3.8 Flash Cyber,一款网络安全专用模型。

它与普通版最 大的区别不在架构,而在“谁有资格用”。Cyber仅通过谷歌的Fairwind计划开放,面向受信政府机构、关键基础设施运营方与软件维护者,普通开发者拿不到。这是前沿实验室第 一次把“防守专用”做成一条有准入门槛的产品线。谷歌内部基准里,Cyber在漏洞发现基准上成功率达71.0%,在CWE-Bench补丁修复上的pass@1为47.2%,逼近Claude Fable 5的47.8%;它修复Chrome漏洞的正确补丁数量是最 大商用模型的2.6倍,在Wiz渗透测试基准上召回率高7.5到9.7个百分点、成本低2.3到5.2倍。

这个动作的分量,不在那47.2%的分数,而在于它把“安全”从一句宣传口号,变成一个可以收费、可以圈地、可以设置准入门槛的垂直市场。网络安全是天然的卖方市场。漏洞在增长,攻击在自动化,能看懂代码又懂攻防的工程师永远短缺。把一个Flash档模型微调成“只服务防守方”的专用工具,谷歌实际上是在通用智能趋同的泥潭之外,开辟一块别人短期进不来的高地。安全,成为智能商品化时代里最不易商品化的生意。

谁会赢,谁危险

Meta这边,藏着一个更微妙的反转。过去几年,Meta在大模型世界一直扮演“开源旗手”,Llama系列是开源权重阵营的精神图腾,Epoch AI的研究还专门量化过“开源模型普遍落后闭源约一年”这一规律。然而Muse Spark,这个如今替Meta在指数榜上抢下第三的旗舰,恰恰是一款闭源模型。它是Meta在2026年4月推出的第 一款专有闭源模型,从诞生那天起就锁着权重。

这意味着什么?曾经高举“开源普惠”大旗、靠开源权重撬动生态与人才的Meta,如今在最能打的旗舰上选择了闭源。这不能简单理解为“背叛”。更接近真相的解释是,当智能趋同、价格崩塌,开源策略能换来生态,却换不来前沿榜上的座次,也换不来每任务0.55美元这种被精确计算的成本优势。闭源给了Meta对推理成本与迭代节奏的完全掌控,而这两样,正是当下军备竞赛里比“开放”更硬的货币。

这也让整个行业格局变得前所未有的矛盾。最贵的Anthropic在高价闭源,最 便 宜的中国选手在极限降价,曾经的开源旗手在闭源,曾被诟病“只会刷版本”的谷歌在疯狂刷版本,同时用一款门控的安全模型去挖垂直护城河。没有谁还守着一条纯粹的路,所有人都在“智能趋同、成本为王”的同一条赛道上,各自找一个还没被踩烂的角落。

把这两天三场发布放回更大的棋盘,值得记住的判断有三条。

榜单的时效性已短到失去参考价值。Muse Spark 1.3上线五小时反超Gemini 3.8 Flash,四十八小时后OpenAI又启程一轮新发布,而GPT-6 Astra的分数还随测量框架在62.7%与99.9%之间摆动。在一个“发布即落后”的市场里,任何基于“某模型登顶”的长期押注都显脆弱。投资人该看的不是谁今天第 一,而是谁能把“低成本高频迭代”这台机器持续转下去。

高价闭源的账越来越难算。当一款3.75美元输出价的Flash模型,在DeepSWE和HLE上逼近25美元输出价的旗舰,价格锚就被彻底打穿。但也要把话说全,Flash并非全面追平,在长周期通用智能体与计算机操作上仍被甩开。Terminal-bench 4.0只有19.1%,Opus 5达51.8%;OSWorld-2.0为59.0%对75.4%。Anthropic和OpenAI并非没有护城河,这些尚未被Flash攻下的山头仍在,只是“我们更强所以卖更贵”的逻辑已经失效,剩下的只能是“我们更贵,但能办成别人办不成的事”。

垂直专用与准入壁垒,将成为下一阶段的护城河。Gemini Cyber的Fairwind计划是个样本。用安全资质筛选客户、用专用基准证明价值、用门控机制挡住平替。当通用智能平民化,真正值钱的就不再是“智能”本身,而是围绕智能搭起的那套只能由特定人使用的门槛。

对开发者而言,最实际的建议只有一条。别再为“最新最强”支付溢价,改按cost per task与任务成功率做采购决策,同时警惕那些用“更多推理步骤”换分数、却隐性推高token账单的模型。你买的不是“智能”,而是单位成本下真正能落地的那一份。

两天,三场发布;五小时,一次反超;四十八小时后,新一轮发布已经启程。当模型发布的速度终于快过人们读完一篇评测的速度,这个行业真正被争抢的,已不再是“谁最聪明”。聪明正在变成水电煤,真正值钱的,是闸门、管线,以及那张决定谁有资格开灯的门禁卡。

最新快讯

2026年09月04日

15:23
《科创板日报》9月4日讯。在人形机器人行业热度攀升、本体发布节奏加快的当下,产业链的焦虑焦点已悄然从“造机器人”转向了“喂数据”。在北京人形机器人创新中心的数据与训练基地,一场关于数据质量的探讨正在展开。面对行业普遍存在的“千万小时”等宏大叙事,该基地负责人直言,数据量的多少并非关键,真正有价值的“高质量”数据才是核心命题。 这座占地6000余平方米的基地,...
15:09
鼓狮财经9月4日消息,工业和信息化部办公厅近日印发《人工智能中小企业创业支持计划(2026-2028年)》。该计划提出,需建强孵化载体以拓展创业空间。具体而言,鼓励各地建设一批人工智能科技型企业孵化器、特色孵化空间及中小企业公共服务示范平台,旨在提升孵化服务能力。 计划同时引导孵化载体突破传统办公租赁模式,将智能算力供给、行业数据共享及应用场景对接纳入核心服...
15:08
9月4日早盘,市场板块分化明显,云计算板块表现活跃。截至午间收盘,中证云计算与大数据主题指数上涨0.1%,而中证芯片产业指数和中证半导体材料设备主题指数则分别下跌1.3%和1.6%。 同花顺iFinD数据显示,截至昨日,云计算ETF易方达年内获得近10亿元资金净流入,在同类产品中净流入额领跑。消息面上,当地时间9月3日,OpenAI发布了GPT-6 Astr...
15:08
9月4日早盘,A股三大指数高开后震荡回落,涨幅有所收窄。全市场半日成交额录得12472亿元,较上一交易日同期放量1336亿元,上涨个股超过4100只。 在板块题材方面,AI应用、猪肉、农业及房地产板块表现活跃,而贵金属、电子化学品、光刻机、半导体以及存储芯片板块则整体低迷。 港股主要指数亦集体收涨,农牧渔、媒体、软件开发及云计算板块涨幅居前。 截至午间收盘,...
15:08
鼓狮财经9月4日电,知名投资人、电影《大空头》原型迈克尔·伯里重申对Veeva Systems的看多立场,但同时表示,在该股近期大幅上涨后,他已进行了减持。此外,伯里还批评Snowflake估值过高。伯里于今年4月披露持有Veeva头寸,作为其软件板块反弹策略的一部分,并于5月进一步加仓,当时称“Veeva仍然便宜”。而在股价快速攀升至关键阻力位附近后,他于...
14:52
9月4日,短剧概念板块迎来集体爆发。作为板块龙头的阅文集团(0772.HK)表现尤为抢眼,盘中股价强势拉升,放量上涨近14%,最终收报22.88港元,单日成交额激增至近3亿港元。 消息面上,阅文集团与国内头部动画企业艺画开天宣布达成深度合作。双方将依托各自资源优势,正式启动《赛博英雄传》AI精品长番项目。该作品改编自阅文集团起点中文网作家吾道长不孤的同名小说...
14:49
随着用户对本地运行AI智能体的需求激增,各大科技巨头正加速将算力重心从云端向桌面端转移。英伟达宣布了一项重磅消息:专为内容创作者、游戏玩家及AI代理设计的RTX Spark Windows PC将于今年10月正式出货。 英伟达持续加码设备端AI。周四,该公司宣布宏碁和联想将于10月推出首批搭载RTX Spark芯片的Windows PC。在最近的IFA 20...
14:39
鼓狮财经9月4日电,消息人士称,截至8月底,苹果折叠屏iPhone目前初期日产量仅 “数百台”,主因执行极为严苛的品控标准。苹果正全力提高产量,不过目前产能爬坡速度较慢。此前报道称,苹果今年的折叠屏iPhone目标产量为800万至1000万部。业内高管称,按照原定生产目标,折叠屏iPhone正常情况下每天需要生产数万部。
14:38
鼓狮财经9月4日讯,据农业农村部监测,当日农产品市场行情显示,农产品批发价格200指数为116.47点,较昨日上涨0.30点;“菜篮子”产品批发价格指数为117.18点,上涨0.36点。 肉类价格方面,全国农产品批发市场猪肉平均价格为16.35元/公斤,较昨日下跌0.5%;牛肉均价为69.99元/公斤,上涨0.7%;羊肉均价为66.17元/公斤,上涨1.0%...
14:19
资本市场评判医疗服务机构,通常关注收入的规模与质地。前者反映扩张能力,后者决定估值中枢。在诸多质地指标中,客户黏性和收入的可持续性最为关键,而这恰恰是多数医疗服务连锁企业面临的痛点。固生堂2026年上半年的成绩单揭示了一个值得关注的趋势:会员收入占比已达46.8%,较2025年同期的41.3%提升了超过5个百分点。这意味着一家中医连锁将近一半的收入建立在会员...