7月21日,谷歌突然在AI Studio和Gemini模型选择器中上线了两个新模型:Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。毫无征兆,也毫无犹豫,它们就这样悄然而至。这两个模型一个主打更强的代码和Agent能力,另一个则专注于低成本的大规模调用。反观被寄予厚望的旗舰模型Gemini 3.5 Pro,千呼万唤始出来,却依然不见踪影。按照原定计划,3.5 Pro本应在6月上线,如今7月已过大半,这款被寄予厚望的模型仍未正式亮相。代表旗舰实力的答卷迟迟未交,谷歌先抛出这两张“草稿纸”,究竟意欲何为?

**01 3.6 Flash:成本降低,性能稳步提升**

谷歌表示,相较于上一代Flash模型,Gemini 3.6 Flash在编码、推理和工具调用方面均有提升,同时通过减少输出token来降低运行成本。3.6 Flash的定位是面向真实生产环境的高效模型,或者更直白地说,是为Agent服务的。在Agent时代,一次任务可能需要数十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。Google此前已在Gemini 3.5 Flash上强化了这一路线。根据官方文档,3.5 Flash支持百万级上下文,能一次处理大量信息,并支持代码执行、外部工具调用及文件搜索,能完成更复杂、更长时间的任务。3.6 Flash延续了这一路线,它追求的不是单次回答的极致质量,而是“能够承担得起每日真实工作”的位置。

定价方面:输入1.50美元/百万token,输出7.50美元/百万token。相比3.5 Flash(输入1.5美元,输出9美元),输入成本不变,但输出成本下降。对于需要大量调用AI的企业而言,这种成本变化可能比基准测试中的几个百分点提升更为重要。谷歌内部测试显示,在完成同一任务时,3.6 Flash相比3.5 Flash减少了55.8%的token消耗,任务评分从85分提升至100分。这只是谷歌希望展示的方向:新模型更省,且能用更少的计算完成同样甚至更好的任务。

在公开基准测试中,谷歌主要强调代码和Agent能力。在DeepSWE代码评测中,3.6 Flash得49%,高于上一代的37%。谷歌称新模型能减少无效代码修改和重复执行。在OSWorld-Verified(AI操作电脑)评测中,3.6 Flash得83%,超过3.5 Flash的78.4%。在MLE Bench(机器学习任务)中,3.6 Flash得63.9%,高于上一代的49.7%。这些数据表明3.6 Flash相比上一代有所进步。

但若放在当前大模型竞争中横向比较,Google的对手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5。从结果看,3.6 Flash并未全面领先,GPT和Claude在复杂软件工程和知识工作上的优势依然明显。但这正是Flash系列的意义:在明显低于旗舰模型成本的情况下,提供够用的能力。

官方测评之外,Artificial Analysis的测试显示,3.6 Flash在综合智力指数上与3.5 Flash持平(50分)。这意味着,如果只看模型综合“智力”,3.6 Flash并没有升级。但速度很好地弥补了这一点。Artificial Analysis统计显示,3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash的约2.7分钟,速度提升了一倍。3.5 Flash-Lite的任务完成时间也从约1.6分钟下降到约0.6分钟。

总的来说,3.6 Flash的升级方向是效率:更少的token消耗、更低的运行成本,以及更适合长期运行的Agent能力。对于习惯使用3.5 Flash的用户来说,这确实是一次不错的升级。

**02 3.5 Flash-Lite:速度飞升,单价未降**

再来关注另一个模型Gemini 3.5 Flash-Lite。顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash牺牲了一部分能力上限,换取了更低的成本和更快的速度。如前所述,3.5 Flash-Lite的任务完成时间从上一代的约1.6分钟下降到了约0.6分钟。它是3.5系列中速度最快的型号,根据Artificial Analysis数据,其生成速度达到约350 token/秒,属于当前主流大模型的高速水平。

定价方面:输入0.30美元/百万token,输出2.50美元/百万token。相比3.6 Flash,输入价格约为1/5,输出约为1/3。不过,与上一代3.1 Flash-Lite相比,新模型并未进一步降价。虽然3.5 Flash-Lite因能力提升可能减少输出量从而降低部分成本,但综合来看,很难抵消单价上的成本增加。

根据文档,相比上一代,新模型在不同思考等级下都有明显提升,开发者可根据需求调整思考深度。此外,3.5 Flash-Lite还内置了Computer Use能力,帮助Agent更可靠地操作电脑环境。

具体测试中,新模型相比上一代有明显提升:Terminal-Bench 2.1编程Agent测试中,成绩从31%提升到54%;GDM-MRCR v2(长上下文理解)从60.1%提升到72.2%;GDPval-AA v2(任务执行)从642提升到1140。

值得注意的是,在一些Agent和代码测试中,3.5 Flash-Lite甚至超过了上一代更高定位的3 Flash模型。例如,SWE-Bench Pro中得54.2%,高于3 Flash的49.6%;OSWorld-Verified中得74.0%,超过3 Flash的65.1%。这意味着,随着模型能力提升,过去需要更大模型才能完成的Agent任务,正在下沉到更便宜、更快速的模型。

顺便一提,除前两个通用模型外,谷歌还推出了Gemini 3.5 Flash Cyber,主要针对网络安全场景。在CodeMender系统中,多个Flash Cyber Agent可协同完成不同分析任务并汇总报告。在CyberGym基准测试中,表现接近前沿模型。该模型目前不公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。

**03 3.5 Pro:迟迟未揭晓的旗舰答卷**

如果说3.6 Flash和3.5 Flash-Lite可以看作谷歌对AI规模化应用的判断,那么3.5 Pro则代表着谷歌模型的上限。但问题在于:这份答卷,到现在还没有交出来。

5月I/O大会时,谷歌表示3.5 Pro将在“接下来一个月左右”推出,即预计6月上线。现在7月已过大半。据彭博社7月16日报道,3.5 Pro发布时间已落后原计划数月,谷歌仍在继续优化模型能力,尤其是编码表现,希望达到内部目标。路透社最新报道显示,截至目前谷歌仍未公布具体上线时间,仅表示正在与合作伙伴测试,并将“很快”推出;另有新闻稿透露,Gemini 4的训练工作已开始。而我们都知道,“很快”意味着不确定。

Gemini 1.0曾因演示争议受质疑;1.5 Pro凭借百万上下文短暂扳回局面,但随后Claude和GPT系列快速追赶;直到3系列发布,谷歌才重新获得“回到前沿竞争”的评价。如今3.5 Pro再次延期,市场关注的已不只是一个模型何时上线,还有谷歌能否保持旗舰模型的竞争节奏。

何况谷歌透露的编码表现不及预期,并非容易解决的小问题。随着Agent进入企业工作流,代码能力的重要性迅速提升。一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已成为衡量其实际生产价值的重要指标。路透社指出,华尔街正在等待3.5 Pro,因为它将成为判断Google DeepMind能否跟上OpenAI和Anthropic的重要指标。

当然,谷歌并非没有动作,这次推出的模型恰说明谷歌正在强化另一条路线:让AI变得更便宜、更容易规模化。谷歌CEO Sundar Pichai近期多次强调成本优势,并表示企业若将大部分AI工作负载迁移至Gemini,可每年节省超10亿美元。但问题在于,市场期待的是一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——这很难不让人觉得,谷歌在用Flash系列填补Pro延迟留下的空档。

有趣的是,在3.5 Pro延期的同时,AI竞争格局正在变化。过去,人们讨论AI领先者主要关注海外“御三家”:OpenAI、Anthropic和Google DeepMind。但最近,GLM-5.2、Kimi K3等国产模型也开始进入前沿竞争。前沿模型的追赶速度加快,也让谷歌的问题变得更加紧迫。谷歌当然可以继续大力推出Flash模型,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。

如果谷歌最终推出一个真正领先的旗舰模型,那么Flash路线将成为完整体系的一部分:Pro负责突破能力上限;Flash负责规模化应用。但如果3.5 Pro持续落后,市场很可能会继续追问:谷歌拥有最强AI研究资源,为何却无法稳定跑赢竞争对手?在Alphabet本周举行的第二季度财报电话会议时,人们很可能会进一步询问有关3.5 Pro的更多细节。

最新快讯

2026年07月22日

10:41
月之暗面发布的 Kimi K3 再次引发了市场对于算力需求的担忧,导致美股半导体板块应声下跌。然而,多家华尔街机构认为,这并非算力需求见顶的信号,反而是需求加速的催化剂。这款拥有 2.8 万亿参数、百万上下文长窗口的开源模型,将显著推高 KV 缓存、HBM、存储及云基建需求。Kimi K3 更像是 AI 使用量扩散的催化剂,而非硬件需求见顶的信号。 市场将 ...
10:41
7月22日,据《科创板日报》报道,英伟达正式发布了新一代Spectrum-6以太网交换芯片,旨在支持基于Vera Rubin平台的超大规模AI基础设施。 作为下一代Spectrum-X以太网交换机平台的核心组件,Spectrum-6凭借高带宽、智能流量管理及故障恢复能力,致力于提升AI工厂的整体计算效率。目前,CoreWeave、微软、Nebius、Spac...
10:36
鼓狮财经7月22日电,美国总统特朗普于7月21日在社交媒体上宣布,已指示美国政府解除针对黎巴嫩长达40多年的直飞航班禁令。这一表态是在当天于白宫与到访的黎巴嫩总统奥恩举行会晤后作出的。此次会晤具有特殊的历史意义,这是奥恩自2025年1月就任黎总统以来,首次与美国总统进行正式会晤,也是自2009年以来首位访问白宫的黎巴嫩国家元首。不过,据美国媒体报道,目前尚不...
10:36
据鼓狮财经7月22日报道,韩国产业通商部21日指出,尽管中东局势再度升级引发全球能源市场动荡,但韩国的原油供应依然保持稳定,预计直至9月底均无虞。根据该部当天发布的新闻稿,韩国7月和8月已确定的原油现货接收量已达到去年同期水平的110%,9月确定的到货量则为去年的90%。
10:36
7月17日,世界人工智能大会的展馆里,模型在生成代码,机器人在人群中穿行。然而,受外围市场科技股调整的影响,A股市场呈现出截然不同的景象。当日,上证指数下跌3.05%,科创50指数跌幅超过7%。全市场超过5000只个股下跌,其中半导体、算力硬件产业链大幅下挫,存储器、光刻机及AI应用等题材领跌。这两个画面发生在同一座城市、同一时间段。就在大会开幕前夕,月之暗...
10:10
许多年以后,当市场回望2026年7月,它很可能成为全球大模型产业竞争的一道重要分水岭。因为更多人或许从这个月开始意识到,没有哪次模型的性能座次是绝对安全的。这个月的短短几周内,中国的5家头部独立大模型公司分别在忙着不同的事。智谱用4.2%的新增股份换取314亿港元,提出了2年不追求变现的摸高计划;MiniMax同一周拿出160亿港元的配股加可转债组合,创始人...
10:10
本届世界杯中,西班牙以1比0战胜阿根廷。虽然赛场上的角逐已经落幕,但网上的“谣言大战”却愈演愈烈。从挪威球星哈兰德的伪造视频,到指控阿根廷“操纵比赛”的假图,真真假假混杂在一起广泛传播。大量由人工智能生成的视频、合成图片以及断章取义的片段随着世界杯的热度四处扩散。这些虚假内容往往在官方辟谣之前,就已经获得了数百万的播放量。其形式五花八门,有的为了搞笑,有的为...
10:10
谷歌 DeepMind 今日毫无保留,一口气祭出三张王牌:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及 Gemini 3.5 Flash Cyber。这三款产品分别代表了更强的主力、更快的轻量级版本以及专攻漏洞的安全特种兵。它们的共同指向非常明确:让运行在生产环境中的 AI Agent 变得更快、更聪明且更廉价。与此同时...
10:09
鼓狮财经7月22日消息,被誉为“华尔街一哥”的美国最大商业银行摩根大通首席执行官杰米·戴蒙,对于当前人工智能(AI)领域的投资热潮持谨慎态度。不过,他对SpaceX公司计划在太空建立数据中心的宏伟构想却给予了高度评价。 在接受最新一期播客采访时,戴蒙直言,人工智能领域的资金投入规模空前巨大。虽然他认为AI最终可能像互联网一样产生回报,但绝不会按照投资者预期的...
10:09
鼓狮财经7月22日讯,受存储芯片巨头股价飙升的带动,韩国综合股价指数(KOSPI)周三延续前一日强势,大幅收涨并再次触发熔断机制。开盘后不久,KOSPI指数便飙升4.5%,截至发稿时涨幅已扩大至5.53%,报收7,121.17点,盘中最高涨幅一度超过6%。 北京时间上午8时07分左右,韩国交易所启动了“侧车机制”,即暂停KOSPI的程序化买盘。该机制通常在K...
09:56
WAIC2026刚刚结束,厂商们的大模型战略似乎变了味儿。往年大家比拼的是参数规模和榜单分数,今年关注的焦点变成了“模型能干什么”以及“能不能赚钱”。细究之下,一个显著的趋势浮出水面:厂商们都在搞轻量化部署,推出各种迷你版本。这究竟是为何? 回想一下,你有多久没在信号不佳的电梯里,对着那个怎么叫都不应的语音助手干瞪眼了?或者就在昨天,开车进隧道时导航突然失声...
09:55
回望2026年7月,这很可能会成为全球大模型产业竞争的一道重要分水岭。人们开始意识到,没有哪次模型的性能排名是绝对安全的。在这个月的短短几周内,中国的5家头部独立大模型公司分别在忙着不同的事。智谱用4.2%的新增股份换取314亿港元,提出了2年不追求变现的摸高计划;MiniMax同一周拿出160亿港元的配股加可转债组合,创始人宣布零薪酬直到实现AGI;月之暗...