如果你从去年就开始使用 Gemini,那种感觉就像是看着自家兄弟慢慢患上了阿尔茨海默症。这是最近网友对这款 AI 助手的一句流行调侃。按理说,一家公司发布新模型,通常是用来打脸这种调侃的。然而,就在刚刚,Google 一口气发布了三个新模型,网友非但没有收回这句话,反而笑得更大声了。这多少给人一种他们都不看好你,可偏偏你最不争气的既视感。

三个模型分别是 3.6 Flash、3.5 Flash-Lite,还有一个专门搞网络安全的 3.5 Flash Cyber。官方博客的措辞也相当眼熟,“更高效”、“更聪明”、“为大规模 AI agent 而生”,一句不落。只不过,实际体感却冰火两重天。

主角登场,3.6 Flash 到底强在哪?
先说头牌,3.6 Flash。官方给的定位就两个字——“主力”,干活模型。它是今年 5 月 I/O 大会上发布的 3.5 Flash 的小版本迭代。最大的卖点是省 token。根据 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 少用 17% 的输出 token,在 DeepSWE 这类场景上甚至能省到 65%。官方还说它跑多步任务时,推理步数和工具调用都更少。也就是说,干同样的活,废话更少,绕路更少,账单更薄。价格也确实降了,输入 1.5 美元/百万 token,输出 7.5 美元/百万 token——上一代 3.5 Flash 的输出是 9 美元,这波直接砍到 7.5。又快又省,单个 agent 任务的成本就压下来了。

基准测试上,官方摆出了一整排数据。代码能力是重点,DeepSWE 从 37% 提升到 49%,官方说法是多余的代码改动更少、执行循环也更短,生成的代码更贴近生产环境要求。机器学习研究方向的 MLE Bench 提升更明显,从 49.7% 拉到了 63.9%。计算机操作能力也有长进,OSWorld-Verified 从 78.4% 升到 83%。并且,“计算机操作”也成了 Gemini API 和企业版的内置工具,主打一个开箱即用。知识工作方面,GDPval-AA v2 从 1349 涨到 1421。Hebbia、Harvey 等客户反馈,它在文档解析、图表数据分析、报告起草这类多模态任务上表现尤其突出。Figma、JetBrains 也都出面背书了一番。哦对了,还有个不起眼但挺实在的更新:知识截止日期终于从 2025 年 1 月推进到了 2026 年 3 月。安全这块,官方说 3.6 Flash 上了升级版的 Frontier Safety 防护,重点盯着 CBRN(化学、生物、放射性、核)和网络攻击这两类滥用,抗越狱能力更强了,同时又尽量不误伤正常需求、少乱拒绝。

以小博大,便宜大碗的 3.5 Flash-Lite 也能更换推理档位了
第二个是 3.5 Flash-Lite,定位比 3.6 Flash 还低一档,主打“快”和“便宜”,专治高吞吐、低延迟的任务,比如 agent 搜索、文档处理。它是 3.5 系列里最快的,按 Artificial Analysis 的测量是每秒吐 350 个 token。价格更是白菜——输入 0.3 美元、输出 2.5 美元每百万 token。官方说质量比 3 月发的 3.1 Flash-Lite 好一大截。有个设计挺灵活:它支持调“推理档位”。低配活儿就开最低档,图个快和省;碰上要多步拆解的子任务,就把思考档位往上拨。电脑操作这次也做成了内置工具。跟前代比,提升相当明显:代码和 agent 任务的 Terminal-Bench 2.1,从 31% 干到 54%;长上下文的 GDM-MRCR v2,从 60.1% 提到 72.2%;真实任务执行的 GDPval-AA v2,更是从 642 飙到 1140。最有意思的是,这个“小弟”在不少 agent 和代码任务上,居然反超了辈分更高的 3 Flash。比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。以小博大,属实有点东西——等于说跑 3 Flash 的活儿,现在有了个更快更强的平替。官方还举了几个用法:从海量电商数据里抽产品特征、给 3.6 Flash 当副手一口气生成 25 个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。Ashler、Palo Alto Networks、Ramp 这几家客户也来夸了它“速度、智能、成本三合一”。

最后一个 3.5 Flash Cyber,画风突变,专门用来找和修代码里的安全漏洞。Google 的逻辑挺有意思:现在 AI 找漏洞的速度,已经比现有系统修漏洞的速度快了。既然漏洞越堆越多,那干脆用便宜高效的 Flash 来批量补锅。这个模型是在 3.5 Flash 基础上微调出来的,搭配自家的 CodeMender 工具用。CodeMender 里跑的是好几个 Flash Cyber agent,协同工作、最后汇总成一份报告。在业内有名的 CyberGym 基准上,官方称它摸到了第一梯队的水平,还比更大的模型更省 token。不过这模型我们暂时也用不上。考虑到“找漏洞”这种能力是把双刃剑,浓眉大眼的 Google 也学 Anthropic 玩起了安全叙事。把它锁得死死的——只对“可信合作伙伴”限量开放,走内测。目的是给一线防守方争取时间,赶在漏洞被人利用前先修掉,同时防着有人拿它去干坏事。

说好的 3.5 Pro 呢?
看到这儿你可能会问:发了一堆 Flash,那真正的旗舰 3.5 Pro 去哪了?官方口径是“正在和合作伙伴测试,准备好就上”。但这套说辞背后的故事,可能没那么体面。据彭博社等媒体报道,3.5 Pro 的代码生成能力一直没达到内部预期。Google 6 月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google 干脆推翻了原来的训练方案,从零开始重训。而 Google AI 宣传委员 Logan Kilpatrick 更是索性在舆论上直接跳过 3.5 Pro,将预告的重点放在了 Gemini 4,声称他们已经启动了史上最雄心勃勃的 Gemini 4 预训练,还放话说进展让人兴奋。听着虽然挺提振人心,但把它放在“旗舰跳票”的背景下看,多少有点转移视线、画饼续命的味道。

除了这些内幕,光看今天刚刚发布的 Flash 模型本身,网友们也并不全然买账。第三方评测机构 Artificial Analysis 表示:两个新模型确实把单任务耗时砍半、token 效率也提升了,Flash-Lite 的智能指数涨了 11 分——但 3.6 Flash 的智能水平,相比 3.5 Flash 基本原地踏步。价格没有便宜到足以忽略能力差距,能力也没有高到能够解释它的成本。X 网友吐槽道:3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一样的分,还不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 这一票对手,直呼简直烂透了。吐槽的还不止一个。网友 Angel 则直接从性价比入手:Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 还高,可智能程度反而更低。又贵又笨,这组合属实有点尴尬——毕竟 Flash 系列立身的根本就是“性价比”,结果被人当场指出性价比不如对手,等于自砸招牌。作为对比,OpenAI 的 Tibo 刚刚也发话了:由于周活跃用户达到 1000 万,新的一天,Codex 和 ChatGPT Work 的付费用户迎来新一轮额度重置,尽情享用。这对比,这落差,还有人记得大明湖畔的 Google Gemini 3?

实测派也来补刀。网友 Balder 更是直接开团:这三个模型性能全比之前的 3.5 Flash 差。他甩出自己的测试吐槽,说问题包括但不限于——基础解码就有毛病、中文选词经常很离谱;生成的图片视频质量极差、跟指令对不上还限额严重;经常记忆混乱、调用完全错误的工具。而且他还上了个阴谋论,认为 Google 之所以这么搞,是为了把算力腾出来卖给 Anthropic,还阴阳了一句这就是皮查伊想要的“Cloud First”。此外,X 网友 Conor Dart 用 Google 自家的 Antigravity 跑了个 AI 生成游戏的测试,结果没有出乎意料,木头纹理更差了,大理石看着差不多但还是不能用。他直言这又是一次翻车,表示自己还是等 Gemini 3.5/3.6 Pro 吧。

简言之,你别问新模型强不强,你就说 Flash 不 Flash 就完事了。一边是官方更高效、更便宜、更省 token 的漂亮账本,一边是大多数网友的当场差评,以及模型背后的旗舰跳票、大牛出走、市值缩水等一连串糟心事。这很难不让人好奇是不是 Google 这次真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个 Flash 稳住场子?反正 Gemini 4 的预训练都开跑了。这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。

最新快讯

2026年09月23日

17:33
据鼓狮财经9月23日报道,经合组织最新预测显示,2026年全球经济增速预计将达到2.9%,较今年6月的预测值上调了0.1个百分点;2027年增速预计为3.0%,较6月预测值下调0.1个百分点。关于通胀,报告指出二十国集团国家的总体通胀率今年将小幅攀升至4.1%,预计2027年伴随能源价格回落,整体通胀率将降至3.6%,但核心通胀的下行速度依然较慢。此外,报告...
17:33
据鼓狮财经9月23日报道,知情人士透露,Anthropic正与数据中心开发商Stream Data Centers(隶属于阿波罗全球管理)进行初步谈判,计划租赁最高1吉瓦的算力资源。此举被视为Anthropic降低对云厂商依赖的重要战略举措。 据悉,Anthropic正探讨直接成为Stream项目的租户,并在机房内部署博通与谷歌联合设计的张量处理单元(TPU...
17:20
孙正义与软银的账面上,即将多出一笔高达110亿美元的高息债券,但这笔资金大概率只会停留两天,随后便需全额汇给奥特曼。9月21日,多家媒体报道称,软银计划发行约100亿美元的美元债和10亿欧元的欧元债,期限在3.5年至7.5年之间。募集资金将主要用于支付10月到期的OpenAI投资款,同时置换此前的部分短期贷款。若交易顺利,这笔融资将超越2021年7-Elev...
17:20
AI圈真是喘口气的时间都不给留。北京时间9月23日,Anthropic刚把Claude Opus 5.5端上桌。2小时后,OpenAI立马祭出GPT-6 Sol和Luna迎战。Opus 5.5比上一代Opus更强了,输入、输出单价也比上一代低了20%。而GPT-6 Sol两项单价只有Astra的五分之一;Luna更夸张,每百万输出Token...
17:03
据鼓狮财经9月23日报道,德国当地时间9月22日,德国正式加入《联合国海洋法公约下国家管辖范围以外区域海洋生物多样性的养护和可持续利用协定》(以下简称《海洋生物多样性协定》)。德国环境部长卡斯滕·施耐德在纽约联合国总部提交了批准书。 《海洋生物多样性协定》于2023年6月19日通过,计划于2026年1月17日正式生效。该协定是首个为保护国家管辖范围以外海域(...
17:02
据鼓狮财经9月23日报道,知名“大空头”迈克尔·伯里近期大幅加码做空美光科技等科技股。此举反映出,他对半导体及人工智能(AI)热潮的长期可持续性依然持怀疑态度。 9月22日,伯里在Substack平台上发文透露,他已增持对存储芯片巨头美光科技、云计算服务商Nebius、iShares半导体ETF以及数据分析公司Palantir的空头头寸,并强调此次操作的规模...
17:02
9月23日,港股市场全线回调,恒生指数失守25000点关口,科技股成为主要拖累。截至收盘,恒生指数跌幅1.01%,报24834点;国企指数跌1.06%,报8273点;恒生科技指数跌1.33%,报4379点。 盘面上,大型科技股普遍下挫,成为拖累大盘的核心力量。阿里巴巴跌幅最大,达4.36%,小米跌3.75%,腾讯跌2.35%,百度跌1%,美团、京东收跌。现货...
16:48
作为一个热衷于浏览体育资讯的网民,我经常光顾网易、头条和腾讯的体育板块。虽然我偶尔也想看直播,但受限于时间,我更倾向于通过新闻来了解赛场动态,并阅读相关的评论。然而,随着我刷得越来越多,一种违和感愈发强烈。 最近几天,我连续读到好几篇分析英超的文章,内容令人匪夷所思。有的信誓旦旦地宣称曼城主帅是瓜迪奥拉,且“瓜迪奥拉的球队今年能否夺回阔别两年的英超冠军,还要...
16:48
只要Meta有足够的耐心,总能贡献出一些新鲜事。这不,路透社9月22日的报道揭示,Meta正在内部测试一项名为“真人礼宾”的新功能。原本属于AI范畴的Muse应用,现在允许将部分电话请求转交给真人去处理。虽然目前这仅限于内部测试,尚未对外公开,但消息一出便引发了轩然大波。在巨大的舆论压力下,Meta不得不紧急叫停了该计划。毕竟,这从原本极具未来感的AI软件,...
16:48
最近,一个叫Jev的新模型突然火了。它来自TypeSafe AI。这支有OpenAI背景的团队没有继续卷生成和推理,而是换了个方向:让AI直接做判断。他们甚至把口号直接写成:Decisions, not strings(要决策,不要文本)。Jev的走红,也让“Decision”(决策)重新成为AI圈的热门词。但如果把时间线往前拨几个月,会发...
16:32
《科创板日报》9月23日讯 近日,马斯克接受专访时指出,未来15年全球人形机器人或达到100亿台;未来20年可能达到1000亿台。 在他看来,每个人都能拥有专属机器人,它们可以照料年迈的父母,看护孩童,还能担任孩子的一对一私教,承担各类工作。未来世界,一个人可以操控成百上千台,甚至上万台实体机器人和数字智能体。 这并非马斯克针对人形机器人首次“画饼”:就在本...
16:31
9月23日,A股市场迎来了一场久违的板块狂欢,科学仪器板块在“VNA矢量分析仪”这一新概念的驱动下全线爆发。优利德、普源精电双双录得20%涨停,电科思仪、创远信科涨幅超12%,东方中科、鼎阳科技、坤恒顺维、同惠电子等个股亦纷纷涨超9%。 推动这波行情的并非业绩利好,而是产业供需矛盾与券商研报的“共振”。据机构消息,高频高速矢量网络分析仪(VNA)目前面临供货...