7月21日,谷歌突然在AI Studio和Gemini模型选择器中上线了两个新模型:Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。毫无征兆,也毫无犹豫,它们就这样悄然而至。这两个模型一个主打更强的代码和Agent能力,另一个则专注于低成本的大规模调用。反观被寄予厚望的旗舰模型Gemini 3.5 Pro,千呼万唤始出来,却依然不见踪影。按照原定计划,3.5 Pro本应在6月上线,如今7月已过大半,这款被寄予厚望的模型仍未正式亮相。代表旗舰实力的答卷迟迟未交,谷歌先抛出这两张“草稿纸”,究竟意欲何为?

**01 3.6 Flash:成本降低,性能稳步提升**

谷歌表示,相较于上一代Flash模型,Gemini 3.6 Flash在编码、推理和工具调用方面均有提升,同时通过减少输出token来降低运行成本。3.6 Flash的定位是面向真实生产环境的高效模型,或者更直白地说,是为Agent服务的。在Agent时代,一次任务可能需要数十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。Google此前已在Gemini 3.5 Flash上强化了这一路线。根据官方文档,3.5 Flash支持百万级上下文,能一次处理大量信息,并支持代码执行、外部工具调用及文件搜索,能完成更复杂、更长时间的任务。3.6 Flash延续了这一路线,它追求的不是单次回答的极致质量,而是“能够承担得起每日真实工作”的位置。

定价方面:输入1.50美元/百万token,输出7.50美元/百万token。相比3.5 Flash(输入1.5美元,输出9美元),输入成本不变,但输出成本下降。对于需要大量调用AI的企业而言,这种成本变化可能比基准测试中的几个百分点提升更为重要。谷歌内部测试显示,在完成同一任务时,3.6 Flash相比3.5 Flash减少了55.8%的token消耗,任务评分从85分提升至100分。这只是谷歌希望展示的方向:新模型更省,且能用更少的计算完成同样甚至更好的任务。

在公开基准测试中,谷歌主要强调代码和Agent能力。在DeepSWE代码评测中,3.6 Flash得49%,高于上一代的37%。谷歌称新模型能减少无效代码修改和重复执行。在OSWorld-Verified(AI操作电脑)评测中,3.6 Flash得83%,超过3.5 Flash的78.4%。在MLE Bench(机器学习任务)中,3.6 Flash得63.9%,高于上一代的49.7%。这些数据表明3.6 Flash相比上一代有所进步。

但若放在当前大模型竞争中横向比较,Google的对手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5。从结果看,3.6 Flash并未全面领先,GPT和Claude在复杂软件工程和知识工作上的优势依然明显。但这正是Flash系列的意义:在明显低于旗舰模型成本的情况下,提供够用的能力。

官方测评之外,Artificial Analysis的测试显示,3.6 Flash在综合智力指数上与3.5 Flash持平(50分)。这意味着,如果只看模型综合“智力”,3.6 Flash并没有升级。但速度很好地弥补了这一点。Artificial Analysis统计显示,3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash的约2.7分钟,速度提升了一倍。3.5 Flash-Lite的任务完成时间也从约1.6分钟下降到约0.6分钟。

总的来说,3.6 Flash的升级方向是效率:更少的token消耗、更低的运行成本,以及更适合长期运行的Agent能力。对于习惯使用3.5 Flash的用户来说,这确实是一次不错的升级。

**02 3.5 Flash-Lite:速度飞升,单价未降**

再来关注另一个模型Gemini 3.5 Flash-Lite。顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash牺牲了一部分能力上限,换取了更低的成本和更快的速度。如前所述,3.5 Flash-Lite的任务完成时间从上一代的约1.6分钟下降到了约0.6分钟。它是3.5系列中速度最快的型号,根据Artificial Analysis数据,其生成速度达到约350 token/秒,属于当前主流大模型的高速水平。

定价方面:输入0.30美元/百万token,输出2.50美元/百万token。相比3.6 Flash,输入价格约为1/5,输出约为1/3。不过,与上一代3.1 Flash-Lite相比,新模型并未进一步降价。虽然3.5 Flash-Lite因能力提升可能减少输出量从而降低部分成本,但综合来看,很难抵消单价上的成本增加。

根据文档,相比上一代,新模型在不同思考等级下都有明显提升,开发者可根据需求调整思考深度。此外,3.5 Flash-Lite还内置了Computer Use能力,帮助Agent更可靠地操作电脑环境。

具体测试中,新模型相比上一代有明显提升:Terminal-Bench 2.1编程Agent测试中,成绩从31%提升到54%;GDM-MRCR v2(长上下文理解)从60.1%提升到72.2%;GDPval-AA v2(任务执行)从642提升到1140。

值得注意的是,在一些Agent和代码测试中,3.5 Flash-Lite甚至超过了上一代更高定位的3 Flash模型。例如,SWE-Bench Pro中得54.2%,高于3 Flash的49.6%;OSWorld-Verified中得74.0%,超过3 Flash的65.1%。这意味着,随着模型能力提升,过去需要更大模型才能完成的Agent任务,正在下沉到更便宜、更快速的模型。

顺便一提,除前两个通用模型外,谷歌还推出了Gemini 3.5 Flash Cyber,主要针对网络安全场景。在CodeMender系统中,多个Flash Cyber Agent可协同完成不同分析任务并汇总报告。在CyberGym基准测试中,表现接近前沿模型。该模型目前不公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。

**03 3.5 Pro:迟迟未揭晓的旗舰答卷**

如果说3.6 Flash和3.5 Flash-Lite可以看作谷歌对AI规模化应用的判断,那么3.5 Pro则代表着谷歌模型的上限。但问题在于:这份答卷,到现在还没有交出来。

5月I/O大会时,谷歌表示3.5 Pro将在“接下来一个月左右”推出,即预计6月上线。现在7月已过大半。据彭博社7月16日报道,3.5 Pro发布时间已落后原计划数月,谷歌仍在继续优化模型能力,尤其是编码表现,希望达到内部目标。路透社最新报道显示,截至目前谷歌仍未公布具体上线时间,仅表示正在与合作伙伴测试,并将“很快”推出;另有新闻稿透露,Gemini 4的训练工作已开始。而我们都知道,“很快”意味着不确定。

Gemini 1.0曾因演示争议受质疑;1.5 Pro凭借百万上下文短暂扳回局面,但随后Claude和GPT系列快速追赶;直到3系列发布,谷歌才重新获得“回到前沿竞争”的评价。如今3.5 Pro再次延期,市场关注的已不只是一个模型何时上线,还有谷歌能否保持旗舰模型的竞争节奏。

何况谷歌透露的编码表现不及预期,并非容易解决的小问题。随着Agent进入企业工作流,代码能力的重要性迅速提升。一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已成为衡量其实际生产价值的重要指标。路透社指出,华尔街正在等待3.5 Pro,因为它将成为判断Google DeepMind能否跟上OpenAI和Anthropic的重要指标。

当然,谷歌并非没有动作,这次推出的模型恰说明谷歌正在强化另一条路线:让AI变得更便宜、更容易规模化。谷歌CEO Sundar Pichai近期多次强调成本优势,并表示企业若将大部分AI工作负载迁移至Gemini,可每年节省超10亿美元。但问题在于,市场期待的是一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——这很难不让人觉得,谷歌在用Flash系列填补Pro延迟留下的空档。

有趣的是,在3.5 Pro延期的同时,AI竞争格局正在变化。过去,人们讨论AI领先者主要关注海外“御三家”:OpenAI、Anthropic和Google DeepMind。但最近,GLM-5.2、Kimi K3等国产模型也开始进入前沿竞争。前沿模型的追赶速度加快,也让谷歌的问题变得更加紧迫。谷歌当然可以继续大力推出Flash模型,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。

如果谷歌最终推出一个真正领先的旗舰模型,那么Flash路线将成为完整体系的一部分:Pro负责突破能力上限;Flash负责规模化应用。但如果3.5 Pro持续落后,市场很可能会继续追问:谷歌拥有最强AI研究资源,为何却无法稳定跑赢竞争对手?在Alphabet本周举行的第二季度财报电话会议时,人们很可能会进一步询问有关3.5 Pro的更多细节。

最新快讯

2026年07月22日

09:39
2097万。这是腾讯旗下AI Agent办公工具WorkBuddy在2026年6月的月度访问量。四个月前刚发布时,这一数字还只有800多万。7月20日,易观发布《2026年Q2中国办公智能体平台市场洞察报告》。在17款主流桌面端AI原生办公智能体中,WorkBuddy访问量排名第一,超过第二名和第三名之和。这份榜单不仅坐实了各家的排位,更释放出一个关键信号:...
09:39
谷歌 DeepMind 宣布推出三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。然而,备受期待的 3.5 Pro 正式版依然缺席,取而代之的是这一系列被称为“阉割版”的模型。就在昨夜,这些模型在 Vertex AI 上线后,口碑遭遇了滑铁卢,被用户戏称为“史上最差”。 尽管谷歌声称 3.6 Fl...
09:39
最近一周,华尔街陷入了一场对芯片产业的信任危机。费城半导体指数周内下跌12.5%,跌入技术性熊市;17家华尔街投行连夜下调AI芯片企业目标价;高盛更是将此次下跌定义为“去杠杆事件”,认为“算力扩张时代”或已接近尾声,AI估值逻辑面临重塑。这场震荡的导火索,源于一家中国企业大模型产品的更新。7月16日,月之暗面发布新一代大模型Kimi K3,不仅成为全球首个开...
09:39
7月21日,谷歌毫无征兆地推出了两款新模型:Gemini 3.6 Flash和Gemini 3.5 Flash-Lite,正式登陆Google AI Studio和模型选择器。与此同时,备受瞩目的旗舰模型Gemini 3.5 Pro却依然不见踪影。原计划6月上线的3.5 Pro至今仍未发布,这让市场不禁疑惑:谷歌为何先交出两张“草稿纸”? **Gemini ...
09:20
据鼓狮财经7月22日报道,三星电子会长李在镕、SK集团会长崔泰源以及Naver会长李海珍计划于本周前往美国,与英伟达CEO黄仁勋举行会晤。知情人士透露,这四家公司的高层将于24日在硅谷附近举行一场圆桌会议,共同探讨相关合作议题。
09:20
**存储器决定AI的未来:专访HBM之父金正浩** “我认为,十年以后,NAND Flash和HBF的市场需求,可能会比HBM还要大。”“冷却技术会成为三星和SK海力士之间的性能差异来源。”“HBM、HBF,甚至其他高带宽存储器,未来都会变成一栋栋‘百层大楼’。最上面再放上GPU,进行冷却。这样的3D半导体结构,几乎必然会成为未来AI计算机的架构。这是我现在...
09:20
特朗普政府作为过渡性措施的122关税将于7月24日到期。但关税政策仍是特朗普核心经济议程的重要支柱。从特朗普政府已经采取的政策行动看,美国正在通过301调查、338调查和232调查,分别重建国别关税并扩大行业关税。一、122条款到期后,特朗普新关税如何接续?301调查主要针对特定国家的贸易政策和做法。最新落地的国别案例是巴西。USTR已完成调查,决定自7月2...
09:07
7月以来,芯片板块走势震荡,但华尔街分析师普遍建议投资者继续坚守AI硬件股。经过几日思考,分析师们一致认为,中国最新发布的AI模型Kimi K3将进一步推升存储芯片需求,这也是隔夜美股存储股大幅反弹的重要推手。 周二,美股存储概念股全线飘红,反弹力度惊人。Roundhill存储ETF(DRAM)收涨10.91%,闪迪涨14.27%,SK海力士涨13.75%,...
08:50
2097万。 这是腾讯旗下AI Agent办公工具WorkBuddy在2026年6月的月度访问量。4个月前刚发布时,这个数字还只有800多万。 7月20日,易观发布《2026年Q2中国办公智能体平台市场洞察报告》,17款主流桌面端AI原生办公智能体中,WorkBuddy访问量排名第一,超过第二、第三名之和。 榜单坐实了各家的排位,更...
08:50
谷歌这次不再遮遮掩掩,一口气连发三款Gemini新模型。今天,谷歌DeepMind接连放出三张王牌:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber。一款是更强的主力军,一款是更快的轻量级选手,还有一款是专攻漏洞的安全特种兵。这三款产品的核心目标非常明确:让生产环境中的AI智能体跑得...
08:50
就在昨夜,谷歌DeepMind宣布推出三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber。然而,随着这些模型在Vertex AI上的上线,Gemini 3.6 Flash的口碑遭遇了滑铁卢,被许多用户戏称为“史上最差”。 尽管谷歌宣称3.6 Flash在代码任务上超越了3....