7月21日,谷歌突然在AI Studio和Gemini模型选择器中上线了两个新模型:Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。毫无征兆,也毫无犹豫,它们就这样悄然而至。这两个模型一个主打更强的代码和Agent能力,另一个则专注于低成本的大规模调用。反观被寄予厚望的旗舰模型Gemini 3.5 Pro,千呼万唤始出来,却依然不见踪影。按照原定计划,3.5 Pro本应在6月上线,如今7月已过大半,这款被寄予厚望的模型仍未正式亮相。代表旗舰实力的答卷迟迟未交,谷歌先抛出这两张“草稿纸”,究竟意欲何为?
**01 3.6 Flash:成本降低,性能稳步提升**
谷歌表示,相较于上一代Flash模型,Gemini 3.6 Flash在编码、推理和工具调用方面均有提升,同时通过减少输出token来降低运行成本。3.6 Flash的定位是面向真实生产环境的高效模型,或者更直白地说,是为Agent服务的。在Agent时代,一次任务可能需要数十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。Google此前已在Gemini 3.5 Flash上强化了这一路线。根据官方文档,3.5 Flash支持百万级上下文,能一次处理大量信息,并支持代码执行、外部工具调用及文件搜索,能完成更复杂、更长时间的任务。3.6 Flash延续了这一路线,它追求的不是单次回答的极致质量,而是“能够承担得起每日真实工作”的位置。
定价方面:输入1.50美元/百万token,输出7.50美元/百万token。相比3.5 Flash(输入1.5美元,输出9美元),输入成本不变,但输出成本下降。对于需要大量调用AI的企业而言,这种成本变化可能比基准测试中的几个百分点提升更为重要。谷歌内部测试显示,在完成同一任务时,3.6 Flash相比3.5 Flash减少了55.8%的token消耗,任务评分从85分提升至100分。这只是谷歌希望展示的方向:新模型更省,且能用更少的计算完成同样甚至更好的任务。
在公开基准测试中,谷歌主要强调代码和Agent能力。在DeepSWE代码评测中,3.6 Flash得49%,高于上一代的37%。谷歌称新模型能减少无效代码修改和重复执行。在OSWorld-Verified(AI操作电脑)评测中,3.6 Flash得83%,超过3.5 Flash的78.4%。在MLE Bench(机器学习任务)中,3.6 Flash得63.9%,高于上一代的49.7%。这些数据表明3.6 Flash相比上一代有所进步。
但若放在当前大模型竞争中横向比较,Google的对手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5。从结果看,3.6 Flash并未全面领先,GPT和Claude在复杂软件工程和知识工作上的优势依然明显。但这正是Flash系列的意义:在明显低于旗舰模型成本的情况下,提供够用的能力。
官方测评之外,Artificial Analysis的测试显示,3.6 Flash在综合智力指数上与3.5 Flash持平(50分)。这意味着,如果只看模型综合“智力”,3.6 Flash并没有升级。但速度很好地弥补了这一点。Artificial Analysis统计显示,3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash的约2.7分钟,速度提升了一倍。3.5 Flash-Lite的任务完成时间也从约1.6分钟下降到约0.6分钟。
总的来说,3.6 Flash的升级方向是效率:更少的token消耗、更低的运行成本,以及更适合长期运行的Agent能力。对于习惯使用3.5 Flash的用户来说,这确实是一次不错的升级。
**02 3.5 Flash-Lite:速度飞升,单价未降**
再来关注另一个模型Gemini 3.5 Flash-Lite。顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash牺牲了一部分能力上限,换取了更低的成本和更快的速度。如前所述,3.5 Flash-Lite的任务完成时间从上一代的约1.6分钟下降到了约0.6分钟。它是3.5系列中速度最快的型号,根据Artificial Analysis数据,其生成速度达到约350 token/秒,属于当前主流大模型的高速水平。
定价方面:输入0.30美元/百万token,输出2.50美元/百万token。相比3.6 Flash,输入价格约为1/5,输出约为1/3。不过,与上一代3.1 Flash-Lite相比,新模型并未进一步降价。虽然3.5 Flash-Lite因能力提升可能减少输出量从而降低部分成本,但综合来看,很难抵消单价上的成本增加。
根据文档,相比上一代,新模型在不同思考等级下都有明显提升,开发者可根据需求调整思考深度。此外,3.5 Flash-Lite还内置了Computer Use能力,帮助Agent更可靠地操作电脑环境。
具体测试中,新模型相比上一代有明显提升:Terminal-Bench 2.1编程Agent测试中,成绩从31%提升到54%;GDM-MRCR v2(长上下文理解)从60.1%提升到72.2%;GDPval-AA v2(任务执行)从642提升到1140。
值得注意的是,在一些Agent和代码测试中,3.5 Flash-Lite甚至超过了上一代更高定位的3 Flash模型。例如,SWE-Bench Pro中得54.2%,高于3 Flash的49.6%;OSWorld-Verified中得74.0%,超过3 Flash的65.1%。这意味着,随着模型能力提升,过去需要更大模型才能完成的Agent任务,正在下沉到更便宜、更快速的模型。
顺便一提,除前两个通用模型外,谷歌还推出了Gemini 3.5 Flash Cyber,主要针对网络安全场景。在CodeMender系统中,多个Flash Cyber Agent可协同完成不同分析任务并汇总报告。在CyberGym基准测试中,表现接近前沿模型。该模型目前不公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。
**03 3.5 Pro:迟迟未揭晓的旗舰答卷**
如果说3.6 Flash和3.5 Flash-Lite可以看作谷歌对AI规模化应用的判断,那么3.5 Pro则代表着谷歌模型的上限。但问题在于:这份答卷,到现在还没有交出来。
5月I/O大会时,谷歌表示3.5 Pro将在“接下来一个月左右”推出,即预计6月上线。现在7月已过大半。据彭博社7月16日报道,3.5 Pro发布时间已落后原计划数月,谷歌仍在继续优化模型能力,尤其是编码表现,希望达到内部目标。路透社最新报道显示,截至目前谷歌仍未公布具体上线时间,仅表示正在与合作伙伴测试,并将“很快”推出;另有新闻稿透露,Gemini 4的训练工作已开始。而我们都知道,“很快”意味着不确定。
Gemini 1.0曾因演示争议受质疑;1.5 Pro凭借百万上下文短暂扳回局面,但随后Claude和GPT系列快速追赶;直到3系列发布,谷歌才重新获得“回到前沿竞争”的评价。如今3.5 Pro再次延期,市场关注的已不只是一个模型何时上线,还有谷歌能否保持旗舰模型的竞争节奏。
何况谷歌透露的编码表现不及预期,并非容易解决的小问题。随着Agent进入企业工作流,代码能力的重要性迅速提升。一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已成为衡量其实际生产价值的重要指标。路透社指出,华尔街正在等待3.5 Pro,因为它将成为判断Google DeepMind能否跟上OpenAI和Anthropic的重要指标。
当然,谷歌并非没有动作,这次推出的模型恰说明谷歌正在强化另一条路线:让AI变得更便宜、更容易规模化。谷歌CEO Sundar Pichai近期多次强调成本优势,并表示企业若将大部分AI工作负载迁移至Gemini,可每年节省超10亿美元。但问题在于,市场期待的是一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——这很难不让人觉得,谷歌在用Flash系列填补Pro延迟留下的空档。
有趣的是,在3.5 Pro延期的同时,AI竞争格局正在变化。过去,人们讨论AI领先者主要关注海外“御三家”:OpenAI、Anthropic和Google DeepMind。但最近,GLM-5.2、Kimi K3等国产模型也开始进入前沿竞争。前沿模型的追赶速度加快,也让谷歌的问题变得更加紧迫。谷歌当然可以继续大力推出Flash模型,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。
如果谷歌最终推出一个真正领先的旗舰模型,那么Flash路线将成为完整体系的一部分:Pro负责突破能力上限;Flash负责规模化应用。但如果3.5 Pro持续落后,市场很可能会继续追问:谷歌拥有最强AI研究资源,为何却无法稳定跑赢竞争对手?在Alphabet本周举行的第二季度财报电话会议时,人们很可能会进一步询问有关3.5 Pro的更多细节。
