Gemini似乎正在逐渐演变成一个“大号豆包”。昨夜,万众期待的Gemini 3.5 Pro并未现身,谷歌却端上了三道“配菜”。

首先是Gemini 3.5 Flash-Lite。它定位高吞吐、低延迟,速度达到每秒350个token,输入成本0.3美元、输出成本2.5美元/百万token。与3月发布的3.1 Flash-Lite相比,Terminal-Bench 2.1准确率从31%提升至54%,长文本理解基准GDM-MRCR v2从60.1%提升至72.2%,真实任务执行力GDPval-AA v2更是从642飙升至1140。跑分表现相当亮眼。

其次是Gemini 3.5 Flash Cyber。据DeepMind使用Chrome V8 JavaScript引擎进行测试,采用“多智能体套路”反复提问取交集,成功找出55个独立确认的漏洞,比3.5 Flash(47个)和Claude Opus 4.6(36个)都要多,其中10个是其他模型完全未能发现的。不过,这款产品目前仅向政府机构和“受信任合作伙伴”开放试点,普通用户暂无法使用。

最后是Gemini 3.6 Flash。相比3.5 Flash,在Artificial Analysis Index的测量下,输出token消耗减少了17%;在DeepSWE基准上,token消耗甚至能降低65%。硬性指标也有所提升:SWE-Bench Pro从55.1%涨至58.7%,MLE-Bench从49.7%提升到63.9%,OSWorld-Verified从78.4%提升到83.0%,GDPval-AA v2从1349涨到1421。价格也有所下调:每百万输出token从9美元降至7.5美元,输入维持1.5美元不变,并增加了上下文缓存读取功能(0.15美元/百万token)。总的来说,听上去感觉都不错。

然而,这三款产品的风评却呈现出完全不对称的局面。Flash-Lite被公认是真正的升级,Flash Cyber走专业路线也没什么争议,本该挑大梁的3.6 Flash,却遭到了大量差评的淹没。

这种评价或许有些过分,但有一点不得不承认:谷歌正被架在火上烤。

这次雷声大雨点小的发布会,是当下AI竞赛的一个缩影。行业确实形成了新的共识:重心从“卷参数、卷跑分”转向“卷效率、卷单位成本”,用更少的算力干等量甚至更多的活。3.6 Flash和Flash-Lite主打token效率提升、推理步骤精简,本质上是几乎所有大厂都在做的事。Flash Cyber针对具体高价值场景(如网络安全漏洞挖掘)单独调优、利用多智能体协作摊薄成本。这种打法部署更快、成本更低,未来大概率也会被更多企业复制。

但也不能因为这样,就完全忽视了模型能力的升级。那么,3.6 Flash到底出了什么问题?为了强行降低输出Token的成本,谷歌极大概率在后训练和RLHF阶段,粗暴地剪枝了模型生成冗余结构标签的倾向。结果就是,模型直接省略了必要的包裹层和样式重置代码。你以为它变快了,其实是变傻了。据昨夜多位知名开发者的连夜测试数据,3.6 Flash在生成带有超过3个层级嵌套的React/Vue组件时,标签闭合错误率高达42%。Artificial Analysis给出的智能指数上,3.6 Flash只拿了50分,与3.5 Flash完全打平,排在Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra等一大票对手后面;反倒是Flash-Lite涨了11分。虽然价格降了一点,但有人算了一笔账,它每token的使用成本比GPT-5.6 Sol medium还贵,智能程度却更低。Flash模型的特点就是性价比,你既贵又笨是怎么回事?这就很尴尬。

按理说,谷歌这种巨头,内部测试流程极其严格,为什么会发布这样一个有明显缺陷的新模型?最核心的原因,谷歌官方可能已经说出来了:我们已经开始了迄今为止最雄心勃勃的预训练任务,Gemini 4。翻译一下就是,算力全部调去跑Gemini 4的预训练了。彭博社援引爆料信息,3.5 Pro内部测试未能达到既定目标,短板主要集中在编码能力上,迟迟达不到发布标准。谷歌6月底曾专门针对性更新训练数据想补齐编码短板,但效果不尽如人意。而与此同时,对手一点没闲着:OpenAI已经发布GPT-5.5并开始推送GPT-5.6,还官宣给付费用户重置使用额度;Anthropic则接连推出Claude Opus 4.8、Claude Sonnet 5,并扩大了Fable 5的开放范围。自家旗舰迟迟不来,对手却接连上新抢占市场,谷歌总得拿出点动静证明自己没有躺平。只能把原本只是测试分支的3.6 Flash和Lite版本拿出来凑数。其次,财报的压力。谷歌今晚就要交出Q2财报,市场预期营收1169亿美元、每股收益2.90美元,Cloud业务增速预计在64%左右。真正左右市场方向的,是云业务增长曲线和管理层有没有给3.5 Pro一个更靠谱的时间表,而不是用户对3.6 Flash的吐槽热度。

之前的Grok 4.5发布时,我们已经讨论过。目前,AI行业的叙事逻辑已经发生了巨大变化。模型有多强不再是唯一的指标,更重要的是能不能赚钱。谷歌云的销售团队,需要更便宜、速度更快、Token消耗更少的模型,去跟微软Azure和AWS打价格战。为了实现降本目标,研发团队被迫使用了极端的多专家混合网络路由剪枝策略和高损的KV Cache压缩。结果就是,前端生成和空间推理这种需要高度注意力机制的全量在线复杂任务,成为了成本优化的牺牲品。所以,尽管在用户社区上骂声一片,但摩根士丹利、摩根大通、高盛等机构依然维持看多评级,理由是谷歌在算力基建、Cloud和Workspace分发渠道上的护城河依然坚固。昨夜,谷歌股价仅仅微跌1.38%,也远不及前几周因人才和跳票消息造成的暴跌。目前的真实情况是:谷歌不是没有牌可打了,而是打法太乱。一手基建和分发的好牌,但旗舰迟迟不到位、核心人才不断被挖角、发布节奏被对手牵着鼻子走的窘境,凑在一起显得格外拧巴。

Gemini 3.6 Flash这次发布即被群嘲,只是谷歌今年AI故事里的一个小插曲。它的大企业病症状,已经明显成为竞争中的障碍。至少表现在两个方面。

第一,内斗不断。虽然早在几年前谷歌就将Google Brain和DeepMind合并为了Google DeepMind,但强扭的瓜根本不甜。3.6 Flash就是个典型的例子。模型底层优秀的Token吞吐能力,显然是底层工程团队(原Brain系)优化的功劳;而极度糟糕的视觉-空间融合,暴露了多模态训练团队在资源争夺上的失败。负责模型基座的团队和负责多模态视觉微调的团队,似乎根本没有好好沟通。导致视觉Encoder传过来的特征向量,跟语言大模型的输入空间之间,存在着巨大的语义鸿沟。更糟糕的是,没人愿意为之负责,所有人都只想完成任务赶紧交差。

谷歌AI团队结构第二,创新者窘境。即我们常说的船大难掉头。归根结底,谷歌所有的AI动作,都笼罩在保护其万亿市值基石——搜索广告业务的阴影下。比如,为什么Gemini始终在Agent操作UI这件事上显得畏手畏脚?因为如果一个AI能够完美地理解网页结构,帮你买东西、帮你查资料,谁还会去看谷歌搜索结果页面上的广告?这根本就不是技术上的问题,而是战略上无法让AI接管UI。Google Search一年创造数千亿美元广告收入。任何AI战略都必须考虑,“如果AI替代搜索,会不会砍掉自己的利润?”这是非常现实的问题。谷歌确实需要AI成为一个强大的辅助工具(所以它推GitHub Copilot接入、推文档处理工具),但它更恐惧能够完全替代用户浏览网页的Agent。过去,谷歌拥有搜索入口、Android入口、浏览器入口、YouTube入口、云入口,是全球互联网最豪华的生态。如果AI真的成为下一代入口,谷歌最大的恐惧不是输掉一个模型,而是输掉下一代计算入口。所以我们最终看到的结果:谷歌明明拥有顶尖的研究能力,商业执行速度却总是慢一拍。可惜,时间不等人。此时此刻,OpenAI在下注,Anthropic在下注,开源社区在下注,中国AI公司也在下注……几年之内,互联网行业很可能迎来前所未有的重新洗牌。而谷歌能不能完成从“搜索巨头”到“AI基础设施巨头”的转型,将决定它未来十年的生态位。

最新快讯

2026年07月23日

09:58
Google再次发布新模型,却并非万众期待的3.5 Pro。谷歌一口气推出了三款新品:Gemini 3.6 Flash、3.5 Flash-Lite,以及一款名为Cyber的网络安全特供版。这三款产品全属Flash系列,主打低成本、高速度以及适合规模化部署Agent。然而,两个月前在Google I/O大会上,皮查伊当着众多开发者的面信誓旦旦地承诺:再给一个...
09:58
如果要问最近一段时间哪家AI最火?相信所有人一定会不约而同地说出“Kimi K3”的名字,铺天盖地的Kimi让人不禁想起了当年DeepSeek的红火,然而就在Kimi K3席卷全球的时候,其出品商月之暗面却笑不起来了,甚至紧急发布了暂停订阅的消息,这到底是怎么回事?01、Kimi K3火了据界面新闻的报道,7月19日晚,月之暗面宣布,由于算...
09:46
鼓狮财经7月23日消息,韩国股市全线走强,基准指数Kospi一度大涨3.6%,实现连续第三个交易日上涨。受Alphabet计划增加资本支出消息提振,内存芯片制造商SK海力士和三星电子股价显著上扬,分别录得5.7%和4.8%的涨幅。韩国创业板Kosdaq指数也一度飙升3.4%。市场方面,近期外资抛售潮有所缓和,海外投资者重新恢复对韩国Kospi指数成分股的净买...
09:46
7月23日,国家发展改革委与国家能源局联合印发《可再生能源发展“十五五”规划》。该规划明确了未来五年及2030年的主要发展目标与技术重点。 **一、 主要发展目标** **1. 总量目标** 到2030年,可再生能源消费总量预计达到约18亿吨标准煤。 **2. 发电目标** 到2030年,可再生能源发电总装机容量将达35亿千瓦左右,年发电量约6万亿千瓦时。其...
09:14
资本永不眠,但成为超级天才的机会只有三次。而马斯克这三次都成功抓住了机会。2026年6月,SpaceX以1.77万亿美元估值完成IPO,刷新人类商业史纪录。媒体狂欢,投资者沸腾,“太空+AI”叙事如日中天。同一时间,马斯克两家上市公司账面上合计超过1500亿美元现金,安静地看着这一切。这是他的第三次在泡沫最高峰拿到融资,全身而退。要知道,今天的OpenAI和...
09:14
122关税将于7月24日到期,301关税或成为主要替代手段。中信证券分析认为,这本质上是关税框架的“换轨”与接替,而非全面升级。随着《国际紧急经济权力法》(IEEPA)的关税权力被最高法院推翻,特朗普政府正试图建立一套新的常规贸易权力框架,即“一套模式、三种手段”。这与此前“大开大合”式的“对等关税”打法有所不同。整体来看,新一轮关税调整对全球的冲击预计有限...
09:14
**特朗普:美国政府预计9月将停摆** 当地时间7月22日,美国总统特朗普在佐治亚州发表演讲时表示,由于共和党与民主党在支出优先事项上存在分歧,美国联邦政府预计将在9月份陷入“停摆”。同日,特朗普在社交媒体发文警告伊朗。他表示,一旦伊朗在霍尔木兹海峡向船只开火,无论使用何种武器(包括导弹、火箭弹、无人机等),美国都将采取报复行动,摧毁伊朗境内的桥梁或发电厂。...
09:14
在港股市场,大多数公司的日常融资行为通常不会对外公告,只有当交易规模触及上市规则的披露门槛时才需要披露。7月21日,粤港湾智算(01396.HK)披露了一笔融资租赁安排:其附属公司深圳鸿睿与浦银金融租赁签署了两笔售后回租协议,合计金额约为11.85亿元。由于合并适用百分比率超过5%,触发了强制披露义务。公告中特别提到,此次披露仅因合规要求达到门槛,并不代表集...
09:14
据鼓狮财经7月23日报道,特朗普政府正在研究在联邦管辖海域建设核能项目的可行性。当地时间7月22日周三,政府宣布将评估在联邦水域建设核能项目,作为扩大国内能源生产及加速先进核技术部署计划的一部分。 据悉,美国内政部下属的海洋矿产管理局已与美国核管理委员会达成合作协议,旨在协调对潜在近海核电项目的监管,并评估水下核电站落地的合规性。海洋矿产管理局指出,目前联邦...
08:50
刚刚落幕的世界人工智能大会(WAIC)上,“超节点”成为了全场焦点,其热度甚至盖过了备受瞩目的大模型。所谓“超节点”,指的是在物理上由多个计算节点——如AI加速卡、NPU或GPU——通过高效互联协议紧密连接,从而具备“一台计算机”特征的计算系统。随着AI大模型对算力需求的爆发式增长,算力架构正从传统的“单机八卡”向“万卡”乃至“十万卡”的集群模式演变。在算力...
08:42
华裔科学家、哈佛大学教授刘如谦团队近期在《自然》杂志发表最新研究成果。该团队证明,通过人工智能驱动的蛋白质重新设计结合实验室连续进化技术,可以获得针对非天然靶点、同时具备高稳定性、高催化效率和高特异性的蛋白酶。 论文链接:https://www.nature.com/articles/s41586-026-10820-0 具体而言,研究团队首先利用 AI 蛋...
08:42
最近与多家 AI 实验室和数据公司交流时,我们明显感觉到一个趋势:real-world data,也就是企业真实工作流中产生的数据,正在成为新的训练需求。相比于已经被充分挖掘的互联网数据,这仍是一座尚未开采的矿藏,淘金者才刚刚进场。这个市场的有趣之处在于,数据和利用数据的能力恰好分布在两端:模型公司通常是 MLE(机器学习工程师)过剩,而数据稀缺;企业则完全...