智东西7月22日消息,今日凌晨,谷歌推出了Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber三款新模型。此次更新的核心重点在于提升Agent工作流所需的Token效率、响应速度和运行可靠性。

面向编程、知识工作和多模态任务的Gemini 3.6 Flash,在第三方评测机构Artificial Analysis的Intelligence Index中表现出色。其任务Token消耗量比3.5 Flash减少了17%,在DeepSWE测试中的输出Token消耗更是减少了约65%。

主打低延迟和高吞吐量的Gemini 3.5 Flash-Lite,生成速度达到每秒350个输出Token,在Agent工作流中较前代有较大提升。而专门用于发现和修复网络安全漏洞的Gemini 3.5 Flash Cyber,则与CodeMender代码安全Agent配合使用,性能已达到前沿模型的竞争水平,与Mythos 5和GPT-5.6 Sol相当,不过目前暂不面向普通开发者开放。

在Artificial Analysis榜单上,Gemini 3.6 Flash的速度测评成绩优秀,但智力和成本的优势相对不明显。该模型的Intelligence得分只有50,落后于Claude Fable 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM-5.2,甚至被Meta的Muse Spark 1.1超越。其单任务成本达到0.50美元,比DeepSeek、MiniMax、GLM、Muse Spark、Grok等模型更贵。作为昔日大模型“御三家”之一,谷歌此次最突出的优势仍然是速度。目前,Gemini 3.5 Flash-Lite和Gemini 3.6 Flash在输出速度上位列榜单前两位。

对于等待了两个月的用户来说,这次发布多少有些“等错了人”。今年5月,谷歌CEO桑达尔·皮查伊在I/O大会上预告Gemini 3.5 Pro将在6月推出,如今7月已过半,用户仍未等来该模型。谷歌称该模型正在与合作伙伴测试,将在准备就绪后尽快发布。与此同时,谷歌还提前预告了Gemini 4,称已启动公司迄今规模最大的预训练任务。这一连串的延迟发布和未来承诺,被戏称为“不负众望”地又画了两张新“饼”。

01. 3.6 Flash:输出Token最多减少65%,编程与知识工作提升明显

Gemini 3.6 Flash基于开发者和企业客户对3.5 Flash的反馈进行改进。在处理多步骤工作流时,新模型需要的推理步骤和工具调用次数更少,同时减少了输出冗余。

3.6 Flash的输入价格为每100万个Token 1.5美元,输出价格为每100万个Token 7.5美元,输出价格低于3.5 Flash,输入价格不变。该模型大幅降低了每项Agent任务的运行成本。在DeepSWE v1.1测试中,3.5 Flash平均每项任务消耗约27.6万个输出Token,3.6 Flash降至约9.7万个,降幅接近65%;在Artificial Analysis Intelligence Index中,两款模型的平均输出Token消耗分别约为2.8万个和2.3万个,3.6 Flash的Token消耗量降低约17%。

在软件工程Agent评测DeepSWE v1.1中,3.6 Flash得分为49%,高于3.5 Flash的37%和3.1 Pro的12%;在机器学习工程测试MLE-Bench中,3.6 Flash得分为63.9%,领先3.5 Flash的49.7%和3.1 Pro的42.6%。在知识工作测试GDPval-AA v2中,3.6 Flash、3.5 Flash和3.1 Pro的得分分别为1421、1349和965;在测试Computer Use的OSWorld-Verified中,三者得分分别为83.0%、78.4%和76.2%。

谷歌还展示了模型的应用案例,Gemini 3.6 Flash能够更高效、准确地分析金融数据和电话会议记录,通过多Agent协作执行代码迁移,为3D工作流开发照片纹理提取工具,以及结合tldraw离线编辑器创建交互式主题设计工具。

在代码迁移任务的对比测试中,Gemini 3.6 Flash的规划耗时为20秒,低于3.5 Flash的24秒;执行迁移的时间则由2分08秒缩短至1分20秒,整体耗时减少约34%。根据案例展示的信息,3.6 Flash生成了更详细、结构更清晰的代码审计与验证文档。

多家早期客户给出了反馈。设计软件公司Figma认为,3.6 Flash在质量、速度和成本之间取得了较好平衡;法律AI公司Harvey称,该模型在文档起草和审查任务中平均快12%;开发工具公司JetBrains称,其低推理等级下的编程性能较上一代Flash提高了10%至20%。

安全方面,3.6 Flash加强了针对化学、生物、放射性与核风险以及网络攻击滥用的前沿安全防护。谷歌称,这些措施提高了模型抵抗越狱攻击的能力,同时尽量减少对正常用途的错误拒绝。

02. 3.5 Flash-Lite:每秒输出350个Token,部分测试超过3 Flash

Gemini 3.5 Flash-Lite是Gemini 3.5系列中速度最快、价格最低的模型,主要面向Agent搜索、文档处理等强调低延迟和高吞吐量的任务。

根据Artificial Analysis的数据,该模型每秒可以生成350个输出Token。其输入和输出价格分别为每100万个Token 0.3美元和2.5美元。开发者可以根据工作负载调整模型的思考等级,在大规模、低成本任务中选择minimal或low等级,在需要处理多步骤子Agent任务时启用更高等级。3.5 Flash-Lite同样内置了Computer Use工具。

与3.1 Flash-Lite相比,3.5 Flash-Lite在Agent终端编程测试Terminal-Bench 2.1中的得分从31%升至54%;在长上下文测试GDM-MRCR v2中,得分从60.1%升至72.2%;在知识工作测试GDPval-AA v2中,得分从642升至1140。

值得注意的是,3.5 Flash-Lite在部分测试中还超过了定位更高的3 Flash。在SWE-Bench Pro中,Gemini 3.5 Flash-Lite和Gemini 3 Flash两款模型得分分别为54.2%和49.6%;在OSWorld-Verified中,两者得分分别为74.0%和65.1%。

美国金融科技公司Ramp认为,Gemini 3.5 Flash-Lite在票据提取任务中较好地平衡了准确率、延迟和成本。

03. 网络安全模型:搭配Agent使用,暂不面向普通开发者开放

第三款模型Gemini 3.5 Flash Cyber基于3.5 Flash微调,专门用于发现、验证和修复网络安全漏洞。相比体量更大的模型,其Token价格更低,适合规模化检查代码安全问题。

该模型将与谷歌代码安全Agent CodeMender配合使用。CodeMender会同时运行多个3.5 Flash Cyber Agent,最后将不同Agent的分析结果合并成一份报告。

在CyberGym测试中,CodeMender最多调用5次模型时,3.5 Flash Cyber得分为83.2%。该模型在测试中的表现接近OpenAI和Anthropic的前沿模型,Anthropic Agent内的Mythos Preview得分为83.1%,OpenAI Agent内的GPT-5.6 Sol得分为83.6%,Anthropic Agent内的Mythos 5得分为83.8%,OpenAI Agent内的GPT-5.5-Cyber得分为85.6%。

考虑到漏洞发现和修复技术具有明显的双重用途,谷歌暂不向普通开发者开放3.5 Flash Cyber。该模型近期将通过CodeMender启动小范围试点,仅供政府机构和可信合作伙伴使用。

04. 两款模型均已上线,3.5 Pro仍在测试

目前,Gemini 3.6 Flash和3.5 Flash-Lite已经通过Google AI Studio、Android Studio及Gemini API向开发者开放,其中3.6 Flash还进入了Google Antigravity。

企业客户可以通过Gemini Enterprise Agent Platform使用这两款模型,3.6 Flash同时接入了Gemini Enterprise应用。普通用户可以在Gemini应用中使用两款模型,3.5 Flash-Lite还将逐步接入谷歌搜索。

Gemini 3.5 Pro目前仍处于合作伙伴测试阶段,谷歌计划在准备完成后扩大开放范围。

05. 结语:Gemini从追求单次性能,转向降低Agent总成本

谷歌此次更新Flash系列,重点转向降低Agent的实际运行成本。Gemini 3.6 Flash显著减少了完成任务所需的输出Token、推理步骤和工具调用次数,Gemini 3.5 Flash-Lite则进一步提升了生成速度。对于需要大规模部署Agent的企业和开发者来说,更低的成本和更快的响应速度仍具有实际吸引力。

不过,从Artificial Analysis等第三方榜单来看,Gemini的Flash系列模型能力目前难以保持领先。上周,月之暗面发布Kimi K3,其Intelligence得分仅落后于Claude Fable 5和GPT-5.6 Sol,在前端编程测试中甚至排到了榜首。国产模型已经从跟随者变成全球前沿模型竞争中的重要力量,谷歌面对的对手也远不止OpenAI和Anthropic。至于谷歌能否重回昔日“御三家”的牌桌中,恐怕还要看已经延期的Gemini 3.5 Pro,以及刚刚开始预训练的Gemini 4。

来源:谷歌、X、Artificial Analysis

最新快讯

2026年07月22日

17:30
鼓狮财经7月22日电,动力新科(600841.SH)公告称,公司收到控股股东上汽集团出具的承诺函,基于对公司未来发展前景的信心及内在投资价值的认可,上汽集团承诺自2026年7月22日起6个月内,不以任何方式减持其持有的公司股份(包括因资本公积转增股本、派送股票红利等取得的新增股份)。截至目前,上汽集团持有公司股份5.39亿股,占总股本的38.86%。
17:30
鼓狮财经7月22日电,云南能投(002053.SZ)公告称,公司获得龙陵县段家坝风电场项目开发权。该项目已列入云南省2025年第二批新能源项目开发建设清单,预计总装机容量80MW,建设总工期12个月。项目实施尚需获得政府核准及相关审批,存在不确定性。
17:29
鼓狮财经7月22日电,华菱钢铁(000932.SZ)公告称,7月21日,控股股东湖南钢铁集团取得中国建设银行股份有限公司湖南省分行营业部出具的《湖南钢铁集团有限公司股票增持专项贷款承诺函》,该行承诺同意向湖南钢铁集团提供最高额不超过2亿元的股票增持专项贷款,贷款期限不超过3年。
17:29
鼓狮财经7月22日电,在菲律宾马尼拉出席东盟外长会的俄罗斯外长拉夫罗夫表示,他将于23日与美国国务卿鲁比奥会面,并希望了解美方目前在乌克兰问题上的立场。
17:29
鼓狮财经7月22日电,德国国防部长鲍里斯·皮斯托里乌斯21日说,在德国汽车产业面临压力背景下,他支持德国车企生产军工产品。对于这类“转向”能否产生效果,也有人提出质疑。皮斯托里乌斯当天参观德法合资军工企业KNDS防御系统公司在德国的一家工厂时表示,德国汽车产业正面临困难,而军工产业对劳动力和生产设施“需求巨大”,前者调整生产方向将使两个产业“都受益”。KND...
17:18
鼓狮财经7月22日讯因三星电子、SK海力士计划将龙仁晶圆厂竣工时间提前,韩国政府相应调整龙仁半导体集群的电力、供水等配套基建规划,其中国家产业园区的电力供应目标达成时间将提前超10年。 政府护航 韩国气候能源环境部部长金星焕于今日视察了位于京畿道龙仁市处仁区的半导体集群,实地考察电力与供水基础设施的建设进度及供应保障措施。 金星焕部长表示: “抢抓半导体投...
17:15
鼓狮财经7月22日讯谷歌母公司Alphabet将在美股周三盘后公布第二季度财报,其被视为判断人工智能交易发展的一个重要参考。投资者仍在消化各大巨头为人工智能平台建设数据中心和芯片投入的巨额资金,并开始对投资人工智能公司保持谨慎。 分析师预计,Alphabet第二季度营收将进一步增长到1168亿美元,同比增长21.1%,与第一季度的增速21.8%基本持平。谷歌...
16:57
鼓狮财经7月22日电,交运股份(600676.SH)公告称,公司证券简称自2026年7月28日起由“交运股份”变更为“久事动娱”,证券代码“600676”保持不变。公司已完成资产置换,置入文体娱乐业与旅游业核心业务,转型为全国综合性文体旅交产业集团。
16:57
鼓狮财经7月22日电,华强科技(688151.SH)公告称,预计2026年半年度归属于母公司所有者的净利润为850万元到1067万元,同比增长105.65%到158.15%。业绩变动主要系公司优化医药包装产品结构,加大市场开拓,产品销量及收入增加,同时提质增效行动取得实效。小财注:公司Q2净利润预计0.02亿-0.04亿,Q1净利润0.06亿,据此计算,Q2...
16:57
鼓狮财经7月22日电,中国西电(601179.SH)公告称,公司下属14家子公司为国家电网2026年特高压项目第三次设备及输变电项目第三次变电设备招标采购中标人,中标金额合计约41.29亿元。其中,特高压项目中标金额26.32亿元,输变电项目中标金额14.97亿元。相关项目签约后将对公司未来经营产生积极影响,但尚未签署正式合同,存在不确定性。
16:57
鼓狮财经7月22日电,国电电力(600795.SH)公告称,经初步统计,2026年上半年,公司合并报表口径完成发电量2189.11亿千瓦时,上网电量2078.75亿千瓦时,较上年同期分别增长6.25%和6.17%;参与市场化交易电量占上网电量的94.2%;平均上网电价393.31元/千千瓦时。2026年二季度,公司合并报表口径完成发电量1129.27亿千瓦时...