谷歌动作极快!继 3.6 Flash 发布仅三周后,Gemini 3.7 Flash 便迅速登场。这也是在哈萨比斯卸任、Koray Kavukcuoglu 接任后,谷歌公开亮相的首款 Gemini 模型。虽然模型早已在内部测试,但何时发布、如何定位,如今全由 Koray 掌舵。这一发布时机耐人寻味,恰如“新官上任三把火”,首刀便砍向了价格。
官方宣布,3.7 Flash 将在年底前实施半价策略,每百万 token 输入仅需 0.75 美元,输出 3.75 美元,费用直接减半。相比同样亲民的 Grok 4.6,Gemini 3.7 Flash 的价格优势更加明显。性能方面,3.7 Flash 实现了显著跃迁,在 DeepSWE 基准测试中提升了 18.8%,编码、网页开发及复杂知识处理能力全面增强,性价比与速度双双超越 3.6 Flash。
谷歌将 3.7 Flash 定位为“迄今为止最智能的编码和 Agent 主力模型”。这意味着该模型将深入 Agent 工作流核心,具备更强的工具调用、调试和多步骤执行能力。例如,在由三个智能体组成的机器人训练任务中,3.7 Flash 的建模质量优于 Grok 4.6,推理时间仅为其十分之一,成本也大幅降低。
在具体基准测试中,Gemini 3.7 Flash 的表现亮眼。代码生成上,FrontierCode 得分从 34.4% 提升至 43.6%,DeepSWE 从 48.6% 升至 65.3%。在网页开发方面,Elo 分数从 1538 涨至 1588,能以更少的提示词生成更完善的布局和应用程序。对于金融、法律等知识密集型领域,在 GDP.pdf 和 AutomationBench 等测试中均有显著进步。这表明新模型在遇到障碍时更会切换路径,也更愿意在意图不清时先确认,再完成多步规划。
值得注意的是,Flash 系列的定价策略十分激进。3.7 Flash 的 API 限时价格比初始价格少一半,不仅如此,3.6 Flash 现在也降价了 50%。此次半价活动仅限年底,明年一月价格将有所回升。
然而,备受瞩目的 Gemini 3.5 Pro 却音讯全无。面对接连发布的 Flash 系列和竞品,谷歌似乎在“弃车保帅”。Flash 系列正在快速迭代,甚至开始蚕食 Pro 模型的定位,未来 Pro 是否还有生存空间令人担忧。这种策略转向也反映了谷歌内部的分歧:哈萨比斯更侧重长期研究与能力上限,而新任主管 Koray 则倾向于快速发布、降低成本以服务大规模产品。两个领导,两种画风,谷歌内部这场拉锯才刚刚开始。
