如果你从去年就开始使用 Gemini,那种感觉就像是看着自家兄弟慢慢患上了阿尔茨海默症。这是最近网友对这款 AI 助手的一句流行调侃。按理说,一家公司发布新模型,通常是用来打脸这种调侃的。然而,就在刚刚,Google 一口气发布了三个新模型,网友非但没有收回这句话,反而笑得更大声了。这多少给人一种他们都不看好你,可偏偏你最不争气的既视感。

三个模型分别是 3.6 Flash、3.5 Flash-Lite,还有一个专门搞网络安全的 3.5 Flash Cyber。官方博客的措辞也相当眼熟,“更高效”、“更聪明”、“为大规模 AI agent 而生”,一句不落。只不过,实际体感却冰火两重天。

主角登场,3.6 Flash 到底强在哪?
先说头牌,3.6 Flash。官方给的定位就两个字——“主力”,干活模型。它是今年 5 月 I/O 大会上发布的 3.5 Flash 的小版本迭代。最大的卖点是省 token。根据 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 少用 17% 的输出 token,在 DeepSWE 这类场景上甚至能省到 65%。官方还说它跑多步任务时,推理步数和工具调用都更少。也就是说,干同样的活,废话更少,绕路更少,账单更薄。价格也确实降了,输入 1.5 美元/百万 token,输出 7.5 美元/百万 token——上一代 3.5 Flash 的输出是 9 美元,这波直接砍到 7.5。又快又省,单个 agent 任务的成本就压下来了。

基准测试上,官方摆出了一整排数据。代码能力是重点,DeepSWE 从 37% 提升到 49%,官方说法是多余的代码改动更少、执行循环也更短,生成的代码更贴近生产环境要求。机器学习研究方向的 MLE Bench 提升更明显,从 49.7% 拉到了 63.9%。计算机操作能力也有长进,OSWorld-Verified 从 78.4% 升到 83%。并且,“计算机操作”也成了 Gemini API 和企业版的内置工具,主打一个开箱即用。知识工作方面,GDPval-AA v2 从 1349 涨到 1421。Hebbia、Harvey 等客户反馈,它在文档解析、图表数据分析、报告起草这类多模态任务上表现尤其突出。Figma、JetBrains 也都出面背书了一番。哦对了,还有个不起眼但挺实在的更新:知识截止日期终于从 2025 年 1 月推进到了 2026 年 3 月。安全这块,官方说 3.6 Flash 上了升级版的 Frontier Safety 防护,重点盯着 CBRN(化学、生物、放射性、核)和网络攻击这两类滥用,抗越狱能力更强了,同时又尽量不误伤正常需求、少乱拒绝。

以小博大,便宜大碗的 3.5 Flash-Lite 也能更换推理档位了
第二个是 3.5 Flash-Lite,定位比 3.6 Flash 还低一档,主打“快”和“便宜”,专治高吞吐、低延迟的任务,比如 agent 搜索、文档处理。它是 3.5 系列里最快的,按 Artificial Analysis 的测量是每秒吐 350 个 token。价格更是白菜——输入 0.3 美元、输出 2.5 美元每百万 token。官方说质量比 3 月发的 3.1 Flash-Lite 好一大截。有个设计挺灵活:它支持调“推理档位”。低配活儿就开最低档,图个快和省;碰上要多步拆解的子任务,就把思考档位往上拨。电脑操作这次也做成了内置工具。跟前代比,提升相当明显:代码和 agent 任务的 Terminal-Bench 2.1,从 31% 干到 54%;长上下文的 GDM-MRCR v2,从 60.1% 提到 72.2%;真实任务执行的 GDPval-AA v2,更是从 642 飙到 1140。最有意思的是,这个“小弟”在不少 agent 和代码任务上,居然反超了辈分更高的 3 Flash。比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。以小博大,属实有点东西——等于说跑 3 Flash 的活儿,现在有了个更快更强的平替。官方还举了几个用法:从海量电商数据里抽产品特征、给 3.6 Flash 当副手一口气生成 25 个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。Ashler、Palo Alto Networks、Ramp 这几家客户也来夸了它“速度、智能、成本三合一”。

最后一个 3.5 Flash Cyber,画风突变,专门用来找和修代码里的安全漏洞。Google 的逻辑挺有意思:现在 AI 找漏洞的速度,已经比现有系统修漏洞的速度快了。既然漏洞越堆越多,那干脆用便宜高效的 Flash 来批量补锅。这个模型是在 3.5 Flash 基础上微调出来的,搭配自家的 CodeMender 工具用。CodeMender 里跑的是好几个 Flash Cyber agent,协同工作、最后汇总成一份报告。在业内有名的 CyberGym 基准上,官方称它摸到了第一梯队的水平,还比更大的模型更省 token。不过这模型我们暂时也用不上。考虑到“找漏洞”这种能力是把双刃剑,浓眉大眼的 Google 也学 Anthropic 玩起了安全叙事。把它锁得死死的——只对“可信合作伙伴”限量开放,走内测。目的是给一线防守方争取时间,赶在漏洞被人利用前先修掉,同时防着有人拿它去干坏事。

说好的 3.5 Pro 呢?
看到这儿你可能会问:发了一堆 Flash,那真正的旗舰 3.5 Pro 去哪了?官方口径是“正在和合作伙伴测试,准备好就上”。但这套说辞背后的故事,可能没那么体面。据彭博社等媒体报道,3.5 Pro 的代码生成能力一直没达到内部预期。Google 6 月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google 干脆推翻了原来的训练方案,从零开始重训。而 Google AI 宣传委员 Logan Kilpatrick 更是索性在舆论上直接跳过 3.5 Pro,将预告的重点放在了 Gemini 4,声称他们已经启动了史上最雄心勃勃的 Gemini 4 预训练,还放话说进展让人兴奋。听着虽然挺提振人心,但把它放在“旗舰跳票”的背景下看,多少有点转移视线、画饼续命的味道。

除了这些内幕,光看今天刚刚发布的 Flash 模型本身,网友们也并不全然买账。第三方评测机构 Artificial Analysis 表示:两个新模型确实把单任务耗时砍半、token 效率也提升了,Flash-Lite 的智能指数涨了 11 分——但 3.6 Flash 的智能水平,相比 3.5 Flash 基本原地踏步。价格没有便宜到足以忽略能力差距,能力也没有高到能够解释它的成本。X 网友吐槽道:3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一样的分,还不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 这一票对手,直呼简直烂透了。吐槽的还不止一个。网友 Angel 则直接从性价比入手:Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 还高,可智能程度反而更低。又贵又笨,这组合属实有点尴尬——毕竟 Flash 系列立身的根本就是“性价比”,结果被人当场指出性价比不如对手,等于自砸招牌。作为对比,OpenAI 的 Tibo 刚刚也发话了:由于周活跃用户达到 1000 万,新的一天,Codex 和 ChatGPT Work 的付费用户迎来新一轮额度重置,尽情享用。这对比,这落差,还有人记得大明湖畔的 Google Gemini 3?

实测派也来补刀。网友 Balder 更是直接开团:这三个模型性能全比之前的 3.5 Flash 差。他甩出自己的测试吐槽,说问题包括但不限于——基础解码就有毛病、中文选词经常很离谱;生成的图片视频质量极差、跟指令对不上还限额严重;经常记忆混乱、调用完全错误的工具。而且他还上了个阴谋论,认为 Google 之所以这么搞,是为了把算力腾出来卖给 Anthropic,还阴阳了一句这就是皮查伊想要的“Cloud First”。此外,X 网友 Conor Dart 用 Google 自家的 Antigravity 跑了个 AI 生成游戏的测试,结果没有出乎意料,木头纹理更差了,大理石看着差不多但还是不能用。他直言这又是一次翻车,表示自己还是等 Gemini 3.5/3.6 Pro 吧。

简言之,你别问新模型强不强,你就说 Flash 不 Flash 就完事了。一边是官方更高效、更便宜、更省 token 的漂亮账本,一边是大多数网友的当场差评,以及模型背后的旗舰跳票、大牛出走、市值缩水等一连串糟心事。这很难不让人好奇是不是 Google 这次真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个 Flash 稳住场子?反正 Gemini 4 的预训练都开跑了。这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。

最新快讯

2026年09月22日

16:15
鼓狮财经9月22日电,加拿大外交部长阿妮塔·阿南德当地时间21日表示,加拿大可能就从该国太平洋沿岸出口液化天然气与法国开展合作。阿南德当天出席联合国大会间隙接受媒体记者采访时说,“完全可想象”加拿大用从西海岸出口的液化天然气与一个欧洲国家开展能源合作,“法国就很合适”。加、法两国领导人刚于20日举行会晤,讨论了能源合作等议题。 (央视新闻)
16:15
鼓狮财经9月22日电,法国总统马克龙近日致信欧盟委员会主席冯德莱恩,呼吁欧盟立刻采取放松燃料质量标准等措施,以压低能源价格。
16:14
持续的地区冲突与外部军事压力,正在重创伊朗经济。伊朗统计中心9月20日披露的数据显示,波斯历一季度(2026年3月21日-6月20日)伊朗国内生产总值(GDP)同比下降了10.1%。这一下滑正值伊朗与美国和以色列交战之际,作为伊朗重要经济支柱的石油和天然气行业受到巨大的打击。从行业数据来看:石油和天然气:同比下降26.4%,跌幅最大。工业和采矿业:萎缩14....
16:14
9月22日,A股主要指数涨跌互现,截至收盘,沪指涨0.06%报3952.13点,深证成指跌0.05%,创业板指涨0.01%,北证50跌1.07%,科创50指数涨0.46%。全市场成交额21537亿元,较上日放量1055亿元,全市场超3000只个股下跌。 盘面上,半导体股普涨,先导基电、博通集成、瑞芯微涨停;AI应用方向集体上涨,南威软件2连板,智度...
16:14
你见过会撒娇、能卖萌、还擅长社交的毛绒玩偶吗?最近,小红书上,一个名为 Fuzozo(芙崽) 的毛绒玩具火了,它不是泡泡玛特的盲盒,也不是传统的玩偶,而是一个会聊天、有性格、能“长大”的 AI 玩具。数据显示,Fuzozo 非常受欢迎,上线仅一年多时间售出 30 万件,销售额超 1.2 亿元。有人称它“AI版Labubu”,因为它...
16:14
过去半个月,月之暗面接连落子:先是传出与微软、亚马逊、谷歌谈判分成,开启开源模型的海外“收租”模式;紧接着又以FDE模式(前线部署工程师)启动企业合作伙伴计划,由合作的IT服务商和集成商前往客户现场,协助企业将AI部署至核心业务。上周,月之暗面又推出一套金融行业解决方案,整合面向金融行业的产品能力,以及机构级的数据建模和报告交付能力。 单看每一箭,都不算新鲜...
16:14
仅仅一个月,人工智能就给数学界带来了巨大的震撼。9月22日,OpenAI宣布成立专门的数学家顾问小组,旨在应对AI在数学领域的惊人进化速度。公告指出,此前曾解决过“千禧年难题”的内部模型,在短短22个工作日内,横跨数学大多数领域解决了100多个长期开放问题。回顾9月初,该模型通过启用约1万个并发Agent,仅用88小时就攻克了七大千禧年难题之一的“纳维–斯托...
16:14
随着 GPT-6 的问世,通用人工智能的发展速度远超预期。其强大的基础通用模型能力有目共睹,大模型的 RSI 指数更是惊人。行业呈现出几家欢喜几家愁的局面。在此之前,谁也没想到这个基础模型能在具身智能领域掀起如此巨浪。GPT-6 Astra 发布次日,Robocurve 便将其接入机器人执行任务,结果令人惊叹。GPT-6 Astra 在控制机器人方面强悍至极...
16:14
刚刚,马斯克旗下的xAI正式发布了全新主力模型Grok 4.7。其核心卖点主打“同样的价格和速度,提供超强性能”。马斯克第一时间宣称,Grok 4.7让xAI在智能体编程领域跃居第三,仅次于Anthropic和OpenAI。凭借速度快、价格低,Grok 4.7成为了个人进行生产力工作的首选。官方将其定位为“史上最强Grok”,专为编程和知识工作而生。在编程和...
15:26
周二午后,创业板新股中塑股份上演了惊险一幕,盘中两度临时停牌,两次停牌时间仅间隔35秒。复牌后,股价一路飙升,最高触及580元,较55.28元的发行价暴涨逾949%。若按中一签500股计算,账面浮盈可达约26.24万元。 当日新股板块整体涨势凶猛。北交所的世纪数码同样两度临停,股价最高摸至150元,较15.67元的发行价上涨逾850%。此前9月新股首日涨幅均...
15:26
在人工智能时代,开发者应如何应对技术的快速迭代?亚马逊 CTO Werner Vogels 用二十多年的职业生涯给出了答案。作为 S3、EC2、Lambda 等无数技术架构的幕后推手,他的年度 re:Invent 演讲一直是行业风向标。虽然他宣布将在 2025 年后不再担任 re:Invent 的主舞台演讲人,但他将于今年 10 月 13 日带着对 2026...
15:26
9 月 21 日,当 Meta 的个人 AI 助手 Muse 在亚马逊商城尝试购物时,屏幕上弹出了警告:「未经授权的 AI Agent 继续访问,将违反亚马逊的使用条款。」这一幕距离 Muse 正式上线,仅仅过去了 13 天。Meta 将 Muse 定义为「全球首款为所有人打造的个人 AI Agent」,它不仅能回答问题,还能浏览网页、登录邮箱、填表订票,甚...