如果你从去年就开始使用 Gemini,那种感觉就像是看着自家兄弟慢慢患上了阿尔茨海默症。这是最近网友对这款 AI 助手的一句流行调侃。按理说,一家公司发布新模型,通常是用来打脸这种调侃的。然而,就在刚刚,Google 一口气发布了三个新模型,网友非但没有收回这句话,反而笑得更大声了。这多少给人一种他们都不看好你,可偏偏你最不争气的既视感。

三个模型分别是 3.6 Flash、3.5 Flash-Lite,还有一个专门搞网络安全的 3.5 Flash Cyber。官方博客的措辞也相当眼熟,“更高效”、“更聪明”、“为大规模 AI agent 而生”,一句不落。只不过,实际体感却冰火两重天。

主角登场,3.6 Flash 到底强在哪?
先说头牌,3.6 Flash。官方给的定位就两个字——“主力”,干活模型。它是今年 5 月 I/O 大会上发布的 3.5 Flash 的小版本迭代。最大的卖点是省 token。根据 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 少用 17% 的输出 token,在 DeepSWE 这类场景上甚至能省到 65%。官方还说它跑多步任务时,推理步数和工具调用都更少。也就是说,干同样的活,废话更少,绕路更少,账单更薄。价格也确实降了,输入 1.5 美元/百万 token,输出 7.5 美元/百万 token——上一代 3.5 Flash 的输出是 9 美元,这波直接砍到 7.5。又快又省,单个 agent 任务的成本就压下来了。

基准测试上,官方摆出了一整排数据。代码能力是重点,DeepSWE 从 37% 提升到 49%,官方说法是多余的代码改动更少、执行循环也更短,生成的代码更贴近生产环境要求。机器学习研究方向的 MLE Bench 提升更明显,从 49.7% 拉到了 63.9%。计算机操作能力也有长进,OSWorld-Verified 从 78.4% 升到 83%。并且,“计算机操作”也成了 Gemini API 和企业版的内置工具,主打一个开箱即用。知识工作方面,GDPval-AA v2 从 1349 涨到 1421。Hebbia、Harvey 等客户反馈,它在文档解析、图表数据分析、报告起草这类多模态任务上表现尤其突出。Figma、JetBrains 也都出面背书了一番。哦对了,还有个不起眼但挺实在的更新:知识截止日期终于从 2025 年 1 月推进到了 2026 年 3 月。安全这块,官方说 3.6 Flash 上了升级版的 Frontier Safety 防护,重点盯着 CBRN(化学、生物、放射性、核)和网络攻击这两类滥用,抗越狱能力更强了,同时又尽量不误伤正常需求、少乱拒绝。

以小博大,便宜大碗的 3.5 Flash-Lite 也能更换推理档位了
第二个是 3.5 Flash-Lite,定位比 3.6 Flash 还低一档,主打“快”和“便宜”,专治高吞吐、低延迟的任务,比如 agent 搜索、文档处理。它是 3.5 系列里最快的,按 Artificial Analysis 的测量是每秒吐 350 个 token。价格更是白菜——输入 0.3 美元、输出 2.5 美元每百万 token。官方说质量比 3 月发的 3.1 Flash-Lite 好一大截。有个设计挺灵活:它支持调“推理档位”。低配活儿就开最低档,图个快和省;碰上要多步拆解的子任务,就把思考档位往上拨。电脑操作这次也做成了内置工具。跟前代比,提升相当明显:代码和 agent 任务的 Terminal-Bench 2.1,从 31% 干到 54%;长上下文的 GDM-MRCR v2,从 60.1% 提到 72.2%;真实任务执行的 GDPval-AA v2,更是从 642 飙到 1140。最有意思的是,这个“小弟”在不少 agent 和代码任务上,居然反超了辈分更高的 3 Flash。比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。以小博大,属实有点东西——等于说跑 3 Flash 的活儿,现在有了个更快更强的平替。官方还举了几个用法:从海量电商数据里抽产品特征、给 3.6 Flash 当副手一口气生成 25 个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。Ashler、Palo Alto Networks、Ramp 这几家客户也来夸了它“速度、智能、成本三合一”。

最后一个 3.5 Flash Cyber,画风突变,专门用来找和修代码里的安全漏洞。Google 的逻辑挺有意思:现在 AI 找漏洞的速度,已经比现有系统修漏洞的速度快了。既然漏洞越堆越多,那干脆用便宜高效的 Flash 来批量补锅。这个模型是在 3.5 Flash 基础上微调出来的,搭配自家的 CodeMender 工具用。CodeMender 里跑的是好几个 Flash Cyber agent,协同工作、最后汇总成一份报告。在业内有名的 CyberGym 基准上,官方称它摸到了第一梯队的水平,还比更大的模型更省 token。不过这模型我们暂时也用不上。考虑到“找漏洞”这种能力是把双刃剑,浓眉大眼的 Google 也学 Anthropic 玩起了安全叙事。把它锁得死死的——只对“可信合作伙伴”限量开放,走内测。目的是给一线防守方争取时间,赶在漏洞被人利用前先修掉,同时防着有人拿它去干坏事。

说好的 3.5 Pro 呢?
看到这儿你可能会问:发了一堆 Flash,那真正的旗舰 3.5 Pro 去哪了?官方口径是“正在和合作伙伴测试,准备好就上”。但这套说辞背后的故事,可能没那么体面。据彭博社等媒体报道,3.5 Pro 的代码生成能力一直没达到内部预期。Google 6 月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google 干脆推翻了原来的训练方案,从零开始重训。而 Google AI 宣传委员 Logan Kilpatrick 更是索性在舆论上直接跳过 3.5 Pro,将预告的重点放在了 Gemini 4,声称他们已经启动了史上最雄心勃勃的 Gemini 4 预训练,还放话说进展让人兴奋。听着虽然挺提振人心,但把它放在“旗舰跳票”的背景下看,多少有点转移视线、画饼续命的味道。

除了这些内幕,光看今天刚刚发布的 Flash 模型本身,网友们也并不全然买账。第三方评测机构 Artificial Analysis 表示:两个新模型确实把单任务耗时砍半、token 效率也提升了,Flash-Lite 的智能指数涨了 11 分——但 3.6 Flash 的智能水平,相比 3.5 Flash 基本原地踏步。价格没有便宜到足以忽略能力差距,能力也没有高到能够解释它的成本。X 网友吐槽道:3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一样的分,还不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 这一票对手,直呼简直烂透了。吐槽的还不止一个。网友 Angel 则直接从性价比入手:Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 还高,可智能程度反而更低。又贵又笨,这组合属实有点尴尬——毕竟 Flash 系列立身的根本就是“性价比”,结果被人当场指出性价比不如对手,等于自砸招牌。作为对比,OpenAI 的 Tibo 刚刚也发话了:由于周活跃用户达到 1000 万,新的一天,Codex 和 ChatGPT Work 的付费用户迎来新一轮额度重置,尽情享用。这对比,这落差,还有人记得大明湖畔的 Google Gemini 3?

实测派也来补刀。网友 Balder 更是直接开团:这三个模型性能全比之前的 3.5 Flash 差。他甩出自己的测试吐槽,说问题包括但不限于——基础解码就有毛病、中文选词经常很离谱;生成的图片视频质量极差、跟指令对不上还限额严重;经常记忆混乱、调用完全错误的工具。而且他还上了个阴谋论,认为 Google 之所以这么搞,是为了把算力腾出来卖给 Anthropic,还阴阳了一句这就是皮查伊想要的“Cloud First”。此外,X 网友 Conor Dart 用 Google 自家的 Antigravity 跑了个 AI 生成游戏的测试,结果没有出乎意料,木头纹理更差了,大理石看着差不多但还是不能用。他直言这又是一次翻车,表示自己还是等 Gemini 3.5/3.6 Pro 吧。

简言之,你别问新模型强不强,你就说 Flash 不 Flash 就完事了。一边是官方更高效、更便宜、更省 token 的漂亮账本,一边是大多数网友的当场差评,以及模型背后的旗舰跳票、大牛出走、市值缩水等一连串糟心事。这很难不让人好奇是不是 Google 这次真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个 Flash 稳住场子?反正 Gemini 4 的预训练都开跑了。这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。

最新快讯

2026年09月17日

11:20
今日科技成长板块震荡修复,CPO、PCB、半导体板块集体爆发,截至收盘,国证成长100指数上涨3.7%。同花顺iFinD数据显示,成长ETF易方达(159259,联接基金A/C:027858/027859)今日获3.46亿份净申购,已连续17日获资金净流入。有关分析指出,成长100指数的编制机制进一步放大了本轮修复的弹性:指数的一致预期与盈利质量前瞻选样、季...
11:20
截至收盘,国证价值100指数下跌0.4%,中证红利指数下跌0.6%,国证自由现金流指数下跌0.6%,中证红利低波动指数下跌0.8%。同花顺iFinD数据显示,红利低波ETF易方达(563020,联接基金A/C/Y:020602/020603/027261)昨日逆势获4900万元资金净流入。当前红利类资产在市场风格再平衡中吸引力增强,万联证券认为,进入下半年后...
11:20
截至收盘,中证消费电子主题指数上涨3.6%。有分析指出,苹果、华为、小米、荣耀等主流手机厂商密集上调主力机型售价,消费电子逐步进入传统旺季,行业迎来旗舰产品集中发布周期,2nm芯片、折叠屏、端侧AI成为产业核心创新看点,产业投资逻辑正从过去单纯依赖换机周期,逐步转向多元业务与AI浪潮共同驱动的新增长逻辑。
11:20
鼓狮财经9月17日电,美国国际贸易委员会(ITC)当地时间9月16日宣布,已对某些配备特定音频技术的电子设备展开专利侵权调查。调查对象包括三星电子及其美国子公司、苹果公司和谷歌公司。但启动调查本身不构成专利侵权的认定,法官将举行听证会作出初步认定,然后经过ITC审查并作出最终决定。
10:49
上海报业集团界面财联社16日举行创新成果发布暨生态合作大会,来自学界专家、头部金融机构、上市公司及金融科技企业代表齐聚现场,共探媒体转型与金融信息服务产业新路径。成立12年来,界面财联社坚持移动化、数据化、智能化发展,始终聚焦财经垂类主责主业,坚持内容与科技双轮驱动,成为监管机构、金融市场、广大投资者高度信赖的权威信源,成为具有全国影响力的...
10:49
9月14日,阿里巴巴达摩院首席科学家、具身智能实验室负责人赵德丽被曝离职,下一步去向尚未公布。距离赵德丽最后一次以达摩院身份公开露面,仅过去不到两个月——7月18日的WAIC首席科学家圆桌上,他还在谈“多模态是下一代智能范式”。5月,他代表达摩院与国家人工智能应用中试基地(具身智能)签约。今年2月,赵德丽带队开源了具身智能大脑基础模型Ryn...
10:49
《科创板日报》9月17日报道,由字节跳动分拆出的AI制药公司新生探途宣布完成首轮天使轮融资,融资金额达2.9亿美元,投后估值升至15亿美元。融资完成后,字节跳动持股56%,继续保持控股地位。 新生探途的前身是字节跳动内部的药物发现团队,由资深AI算法人才与制药领域专家共同组建,核心团队约50人,由刘凯牵头。该团队于2021年成立,并于2026年6月从字节跳动...
10:49
据鼓狮财经9月17日报道,华泰证券研报指出,美联储在9月会议上如期将基准利率上调25个基点,区间升至3.75%至4.00%。在随后的投票中,12位票委一致支持此次加息。从点阵图及SEP来看,美联储内部整体立场更为鹰派,沃什更是直言此举意味着从货币政策中撤走了一剂“宽松”。 展望未来,随着9月加息落地,12月将成为下一次加息博弈的关键时期。虽然目前市场预计美联...
10:49
据鼓狮财经9月17日电,中信证券研报分析认为,美联储在9月如期加息25个基点,并上调了本年度经济增长及通胀预期。点阵图与沃什的发言均释放出鹰派信号,市场强烈的预期压力使得此次加息成为美联储顺水推舟之举。 后续加息的节奏与幅度将很大程度上取决于油价走势,尽管这一变量难以精准预测,但鉴于总体通胀率同比有望在明年初显著回落,届时继续加息的理由势必减弱。中信证券预计...
10:49
鼓狮财经9月17日讯,9月本应是碳酸锂市场的传统旺季,但近期市场却遭遇单边下行行情,锂矿板块上市公司股价亦随之走弱。据数据显示,9月16日国内碳酸锂期货主力合约盘中一度下探至124020元/吨,本月累计跌幅已逾两成。回溯至今年5月份,该合约价格曾高达21万元/吨左右,短短四个月时间价格暴跌超四成,几乎回吐了全年的涨幅。 关于此次价格大幅回调的原因,记者多方了...
10:49
美联储加息与AI行情似乎正在分道扬镳。昨晚,美联储25个基点的加息如市场预期般落地,并未引发剧烈震荡。由于前期已有充分计价,美股科技板块表现平稳,纳指仅微跌0.01%收平,而道指则受金融板块拖累下跌1.21%。相比之下,港股受冲击更为明显,开盘即跌超1%。不过,美股夜盘迅速修复,纳指上涨约0.66%,科技巨头普涨,加息带来的负面影响已被市场消化。 从历史数据...