智东西7月22日消息,今日凌晨,谷歌推出了Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber三款新模型。此次更新的核心重点在于提升Agent工作流所需的Token效率、响应速度和运行可靠性。

面向编程、知识工作和多模态任务的Gemini 3.6 Flash,在第三方评测机构Artificial Analysis的Intelligence Index中表现出色。其任务Token消耗量比3.5 Flash减少了17%,在DeepSWE测试中的输出Token消耗更是减少了约65%。

主打低延迟和高吞吐量的Gemini 3.5 Flash-Lite,生成速度达到每秒350个输出Token,在Agent工作流中较前代有较大提升。而专门用于发现和修复网络安全漏洞的Gemini 3.5 Flash Cyber,则与CodeMender代码安全Agent配合使用,性能已达到前沿模型的竞争水平,与Mythos 5和GPT-5.6 Sol相当,不过目前暂不面向普通开发者开放。

在Artificial Analysis榜单上,Gemini 3.6 Flash的速度测评成绩优秀,但智力和成本的优势相对不明显。该模型的Intelligence得分只有50,落后于Claude Fable 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM-5.2,甚至被Meta的Muse Spark 1.1超越。其单任务成本达到0.50美元,比DeepSeek、MiniMax、GLM、Muse Spark、Grok等模型更贵。作为昔日大模型“御三家”之一,谷歌此次最突出的优势仍然是速度。目前,Gemini 3.5 Flash-Lite和Gemini 3.6 Flash在输出速度上位列榜单前两位。

对于等待了两个月的用户来说,这次发布多少有些“等错了人”。今年5月,谷歌CEO桑达尔·皮查伊在I/O大会上预告Gemini 3.5 Pro将在6月推出,如今7月已过半,用户仍未等来该模型。谷歌称该模型正在与合作伙伴测试,将在准备就绪后尽快发布。与此同时,谷歌还提前预告了Gemini 4,称已启动公司迄今规模最大的预训练任务。这一连串的延迟发布和未来承诺,被戏称为“不负众望”地又画了两张新“饼”。

01. 3.6 Flash:输出Token最多减少65%,编程与知识工作提升明显

Gemini 3.6 Flash基于开发者和企业客户对3.5 Flash的反馈进行改进。在处理多步骤工作流时,新模型需要的推理步骤和工具调用次数更少,同时减少了输出冗余。

3.6 Flash的输入价格为每100万个Token 1.5美元,输出价格为每100万个Token 7.5美元,输出价格低于3.5 Flash,输入价格不变。该模型大幅降低了每项Agent任务的运行成本。在DeepSWE v1.1测试中,3.5 Flash平均每项任务消耗约27.6万个输出Token,3.6 Flash降至约9.7万个,降幅接近65%;在Artificial Analysis Intelligence Index中,两款模型的平均输出Token消耗分别约为2.8万个和2.3万个,3.6 Flash的Token消耗量降低约17%。

在软件工程Agent评测DeepSWE v1.1中,3.6 Flash得分为49%,高于3.5 Flash的37%和3.1 Pro的12%;在机器学习工程测试MLE-Bench中,3.6 Flash得分为63.9%,领先3.5 Flash的49.7%和3.1 Pro的42.6%。在知识工作测试GDPval-AA v2中,3.6 Flash、3.5 Flash和3.1 Pro的得分分别为1421、1349和965;在测试Computer Use的OSWorld-Verified中,三者得分分别为83.0%、78.4%和76.2%。

谷歌还展示了模型的应用案例,Gemini 3.6 Flash能够更高效、准确地分析金融数据和电话会议记录,通过多Agent协作执行代码迁移,为3D工作流开发照片纹理提取工具,以及结合tldraw离线编辑器创建交互式主题设计工具。

在代码迁移任务的对比测试中,Gemini 3.6 Flash的规划耗时为20秒,低于3.5 Flash的24秒;执行迁移的时间则由2分08秒缩短至1分20秒,整体耗时减少约34%。根据案例展示的信息,3.6 Flash生成了更详细、结构更清晰的代码审计与验证文档。

多家早期客户给出了反馈。设计软件公司Figma认为,3.6 Flash在质量、速度和成本之间取得了较好平衡;法律AI公司Harvey称,该模型在文档起草和审查任务中平均快12%;开发工具公司JetBrains称,其低推理等级下的编程性能较上一代Flash提高了10%至20%。

安全方面,3.6 Flash加强了针对化学、生物、放射性与核风险以及网络攻击滥用的前沿安全防护。谷歌称,这些措施提高了模型抵抗越狱攻击的能力,同时尽量减少对正常用途的错误拒绝。

02. 3.5 Flash-Lite:每秒输出350个Token,部分测试超过3 Flash

Gemini 3.5 Flash-Lite是Gemini 3.5系列中速度最快、价格最低的模型,主要面向Agent搜索、文档处理等强调低延迟和高吞吐量的任务。

根据Artificial Analysis的数据,该模型每秒可以生成350个输出Token。其输入和输出价格分别为每100万个Token 0.3美元和2.5美元。开发者可以根据工作负载调整模型的思考等级,在大规模、低成本任务中选择minimal或low等级,在需要处理多步骤子Agent任务时启用更高等级。3.5 Flash-Lite同样内置了Computer Use工具。

与3.1 Flash-Lite相比,3.5 Flash-Lite在Agent终端编程测试Terminal-Bench 2.1中的得分从31%升至54%;在长上下文测试GDM-MRCR v2中,得分从60.1%升至72.2%;在知识工作测试GDPval-AA v2中,得分从642升至1140。

值得注意的是,3.5 Flash-Lite在部分测试中还超过了定位更高的3 Flash。在SWE-Bench Pro中,Gemini 3.5 Flash-Lite和Gemini 3 Flash两款模型得分分别为54.2%和49.6%;在OSWorld-Verified中,两者得分分别为74.0%和65.1%。

美国金融科技公司Ramp认为,Gemini 3.5 Flash-Lite在票据提取任务中较好地平衡了准确率、延迟和成本。

03. 网络安全模型:搭配Agent使用,暂不面向普通开发者开放

第三款模型Gemini 3.5 Flash Cyber基于3.5 Flash微调,专门用于发现、验证和修复网络安全漏洞。相比体量更大的模型,其Token价格更低,适合规模化检查代码安全问题。

该模型将与谷歌代码安全Agent CodeMender配合使用。CodeMender会同时运行多个3.5 Flash Cyber Agent,最后将不同Agent的分析结果合并成一份报告。

在CyberGym测试中,CodeMender最多调用5次模型时,3.5 Flash Cyber得分为83.2%。该模型在测试中的表现接近OpenAI和Anthropic的前沿模型,Anthropic Agent内的Mythos Preview得分为83.1%,OpenAI Agent内的GPT-5.6 Sol得分为83.6%,Anthropic Agent内的Mythos 5得分为83.8%,OpenAI Agent内的GPT-5.5-Cyber得分为85.6%。

考虑到漏洞发现和修复技术具有明显的双重用途,谷歌暂不向普通开发者开放3.5 Flash Cyber。该模型近期将通过CodeMender启动小范围试点,仅供政府机构和可信合作伙伴使用。

04. 两款模型均已上线,3.5 Pro仍在测试

目前,Gemini 3.6 Flash和3.5 Flash-Lite已经通过Google AI Studio、Android Studio及Gemini API向开发者开放,其中3.6 Flash还进入了Google Antigravity。

企业客户可以通过Gemini Enterprise Agent Platform使用这两款模型,3.6 Flash同时接入了Gemini Enterprise应用。普通用户可以在Gemini应用中使用两款模型,3.5 Flash-Lite还将逐步接入谷歌搜索。

Gemini 3.5 Pro目前仍处于合作伙伴测试阶段,谷歌计划在准备完成后扩大开放范围。

05. 结语:Gemini从追求单次性能,转向降低Agent总成本

谷歌此次更新Flash系列,重点转向降低Agent的实际运行成本。Gemini 3.6 Flash显著减少了完成任务所需的输出Token、推理步骤和工具调用次数,Gemini 3.5 Flash-Lite则进一步提升了生成速度。对于需要大规模部署Agent的企业和开发者来说,更低的成本和更快的响应速度仍具有实际吸引力。

不过,从Artificial Analysis等第三方榜单来看,Gemini的Flash系列模型能力目前难以保持领先。上周,月之暗面发布Kimi K3,其Intelligence得分仅落后于Claude Fable 5和GPT-5.6 Sol,在前端编程测试中甚至排到了榜首。国产模型已经从跟随者变成全球前沿模型竞争中的重要力量,谷歌面对的对手也远不止OpenAI和Anthropic。至于谷歌能否重回昔日“御三家”的牌桌中,恐怕还要看已经延期的Gemini 3.5 Pro,以及刚刚开始预训练的Gemini 4。

来源:谷歌、X、Artificial Analysis

最新快讯

2026年07月22日

16:26
鼓狮财经7月22日电,赛托生物(300583.SZ)公告称,公司控股子公司山东斯瑞药业近日收到国家药监局签发的糠酸氟替卡松《化学原料药上市申请批准通知书》。该原料药用于鼻喷剂治疗过敏性鼻炎,以及吸入粉雾剂治疗哮喘和慢性阻塞性肺疾病。本次获批将进一步丰富公司产品线,提升市场竞争力,但该品种生产销售时间存在不确定性。
16:26
鼓狮财经7月22日电,双元科技(688623.SH)公告称,公司收到实际控制人、董事长、总经理郑建提议,拟使用首次公开发行超募资金,以集中竞价交易方式回购公司股份,回购资金总额不低于5000万元(含),不超过8000万元(含),回购价格不高于董事会审议通过回购方案前30个交易日公司股票交易均价的150%,回购股份将用于员工持股计划或股权激励。
16:26
鼓狮财经7月22日电,中望软件(688083.SH)公告称,公司于近日收到政府补助款项共计553.80万元,为与收益相关的政府补助,占公司最近一个会计年度经审计净利润的26.70%。
16:23
一家公司,准备花 100 万美元买下一家真正运营中的企业,不是为了赚钱,而是为了做一个 AI 实验,你会不会觉得这有些疯狂? 过去两年,AI 行业几乎所有玩家都在努力打造“AI 员工”:OpenAI 想把 ChatGPT 变成数字同事,Anthropic 希望 Claude 成为企业里的“超级员工”,Google 则不断将 Gemini 塞...
16:23
OpenAI 的工程师们花了数周时间,试图解释 Rockset 中那些神秘的崩溃问题。Rockset 是一款 C++ 数据基础设施服务,为 ChatGPT 的搜索和数据插件提供支持。函数似乎会返回错误的内存地址,栈指针在执行过程中似乎会偏移 8 个字节。团队提出的每一种假设都面临着有力的反证。这个 Bug 似乎根本不可能存在。 他们原本以为...
16:23
昨夜,在 Alphabet 发布财报前一天,谷歌一口气推出了三款全新的 Gemini 模型,全部属于主打“快速、低成本”的 Flash 系列,重点聚焦于提升复杂智能体(agentic)工作流中的运行效率,并降低 token 消耗。其核心特性很明确:效率优先于绝对性能。 短短一周内,xAI 的 Grok 4.5、OpenAI 的多版本 GPT...
16:23
这是今天 AI 圈最大的瓜。  OpenAI 的神秘模型,主动对开源平台 Hugging Face 发起了攻击。  Hugging Face 随后追踪展开还击,用的是智谱的开源模型 GLM 5.2。  闭源模型一举攻破开源社区,社区用开源模型自救 ,这离谱的剧情听起来都能拍一部电影了。  ...
16:23
现在,你可以通过录屏 + 语音讲解的方式,彻底把自己蒸馏成 Skill 了。 7 月 21 日,Anthropic 在 Claude 桌面端 Cowork 的 + 菜单里加了一项「Record a Skill」:录屏,一边操作一边用语音讲解,录完后 Claude 自动把演示转化成一个可复用的 Skill。 https://x.co...
16:20
7月22日,地平线与大众汽车集团正式宣布,通过CARIAD与地平线的合资公司酷睿程 (CARIZON) ,大众汽车集团将进一步深化与地平线在AI基座大模型领域的技术合作。根据协议,酷睿程将基于白盒授权模式,依托地平线先进的AI基座大模型能力,自主开发并加速构建大众汽车集团中国统一的AI驾驶解决方案。地平线的AI基座大模型将与酷睿程在研的系统...
15:55
鼓狮财经7月22日电,据伊朗塔斯尼姆通讯社7月21日报道,伊朗伊斯兰革命卫队陆军总司令穆罕默德·卡拉米视察了驻扎在波斯湾海岸线、霍尔木兹海峡周边的伊朗部队。卡拉米当天仔细评估了部队的作战状态和备战水平,他表示,伊斯兰革命卫队在地区的权威存在,是波斯湾水域可持续安全的主要支柱。 (央视新闻)