7月21日,谷歌毫无征兆地推出了两款新模型:Gemini 3.6 Flash和Gemini 3.5 Flash-Lite,正式登陆Google AI Studio和模型选择器。与此同时,备受瞩目的旗舰模型Gemini 3.5 Pro却依然不见踪影。原计划6月上线的3.5 Pro至今仍未发布,这让市场不禁疑惑:谷歌为何先交出两张“草稿纸”?
**Gemini 3.6 Flash:成本更低,效率更高**
谷歌表示,相比上一代,3.6 Flash在编码、推理和工具调用方面有所提升,同时通过减少输出token降低了运行成本。这款模型的定位是面向真实生产环境的高效模型,特别是为Agent服务。在Agent时代,任务往往需要数十轮模型调用,因此模型必须足够快且便宜。
根据官方API文档,3.6 Flash延续了3.5 Flash的长上下文优势(支持100万token),并支持代码执行、外部工具调用等能力。定价方面,输入1.50美元/百万token,输出7.50美元/百万token。相比3.5 Flash(输出9美元),输出成本有所下降。谷歌内部测试显示,3.6 Flash相比3.5 Flash减少了55.8%的token消耗,同时评分从85分提升至100分。
在公开基准测试中,3.6 Flash在DeepSWE(代码评测)中得分49%,高于上一代的37%;在OSWorld-Verified(电脑操作)中得83%,超过3.5 Flash的78.4%;在MLE Bench(机器学习)中得63.9%,高于49.7%。虽然这些数据表明有进步,但在与GPT-5.6 Luna、Claude Sonnet 5等前沿模型的横向对比中,3.6 Flash在复杂软件工程和知识工作上仍不占优势。
Artificial Analysis的评测显示,3.6 Flash的综合智力指数仍为50分,与3.5 Flash持平。但其速度优势明显,每项任务平均耗时约1.3分钟,相比上一代的2.7分钟缩短了一半。这意味着3.6 Flash的升级核心在于效率:用更少的计算完成更多任务。
**Gemini 3.5 Flash-Lite:速度最快,但单价微涨**
作为Flash系列的轻量版,3.5 Flash-Lite牺牲了部分上限,换取了更低的成本和更快的速度。测试数据显示,其任务完成时间从上一代的1.6分钟缩短至0.6分钟,生成速度达到约350 token/秒,处于当前主流高速水平。
定价上,输入0.30美元/百万token,输出2.50美元/百万token。相比3.6 Flash,价格约为1/5和1/3。但相比上一代3.1 Flash-Lite,新模型并未降价,甚至因能力提升导致综合成本可能上升。
尽管如此,3.5 Flash-Lite在各项测试中表现亮眼。它支持不同的思考深度,并内置了Computer Use能力。在Terminal-Bench 2.1、GDM-MRCR v2等测试中均有显著提升。值得注意的是,在一些Agent和代码测试中,3.5 Flash-Lite甚至超过了上一代更高定位的Gemini 3 Flash。这表明,随着技术进步,更便宜、更快的模型正在承接过去需要大模型才能完成的部分任务。
此外,谷歌还推出了专门针对网络安全场景的Gemini 3.5 Flash Cyber。该模型未公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。在CodeMender系统中,多个Flash Cyber Agent可协同工作完成分析任务,并在CyberGym基准测试中达到了接近前沿模型的表现。
**Gemini 3.5 Pro:迟迟未交的旗舰答卷**
相比Flash系列展现出的务实路线,Gemini 3.5 Pro代表了谷歌的模型上限。然而,这份“答卷”至今仍未交出。原定于6月上线的3.5 Pro,目前已延期数月。
据彭博社和路透社报道,谷歌仍在优化模型能力,尤其是编码表现,以期达到内部目标。华尔街正密切关注3.5 Pro的发布,将其视为判断Google DeepMind能否跟上OpenAI和Anthropic的重要指标。随着Agent进入企业工作流,代码能力的重要性日益凸显,一个模型能否理解复杂项目、修改真实代码,直接决定了其实际生产价值。
谷歌CEO皮查伊近期多次强调成本优势,表示迁移至Gemini模型可为企业节省超过10亿美元。然而,市场期待的硬实力证明尚未出现。在国产模型如GLM-5.2、Kimi K3迅速追赶的背景下,如果Gemini 3.5 Pro持续滞后,Flash系列充其量只能作为填补空档的“草稿纸”。反之,若3.5 Pro能强势回归,Flash路线将成为完整体系的一部分:Pro负责突破上限,Flash负责规模化应用。在即将到来的财报电话会议中,市场势必会继续追问这款旗舰模型的最终表现。
