最近,大模型厂商纷纷将目光投向了“Flash”。这一趋势始于7月21日,Google DeepMind一口气推出了三款Flash模型,尽管当时旗舰Gemini 3.5 Pro缺席。尽管当时有评论认为Gemini 3.6 Flash的表现不如中国顶尖的开源模型,但国内厂商敏锐地捕捉到了Flash背后的产业信号,纷纷跟进这一效率架构路线。
十天后的7月31日,国内大模型市场迎来了DeepSeek V4 Flash正式版的开源,该模型拥有284B总参数,但每次推理仅激活13B。DeepSeek还调整了商业模式,在涨价的同时引入了峰谷分时计费。8月26日至28日,Flash成为绝对的主战场,三天内至少有五款重量级模型发布,其中Flash版本占据多数。智谱将匿名刷屏的“牛来”(Ox-Alpha)认领为GLM-5.3-Flash,总参数320B,每次推理激活18B;阿里在同一天连夜推出了Qwen3.8-Flash,总参数125B,每个token仅唤醒6B参与计算。9月1日,腾讯发布了其最新旗舰模型预览版本Hy4的轻量版。
上半年,大模型行业的叙事主线还停留在比拼更多数据、更多参数、更多算力,各家追求的是更大规模的模型。但开源与低价的浪潮正在改写行业逻辑。过去Flash只是Google产品线中一个追求快、便宜、够用的档位,如今它已进化为效率优先的架构版本,行业的比拼重心也正从“谁的参数更大”转向“谁成本更低、更具备落地价值”。
Agent的兴起是推动Flash成为主流的关键。如果只有三分之一的价格就能完成大部分日常任务,谁还会默认把所有工作交给最强模型?以阿里Qwen3.8 Flash为例,其发布的同时,千问办公Agent产品同步上线,模型与智能体业务的绑定趋势十分直观。Agent业务特性带来了两重现实约束:一是大量工作集中在意图路由、信息抽取、工具调用等任务,不需要旗舰模型那样的深度推理能力,但对推理延迟、并发承载力和调用成本高度敏感;二是完成一套Agent业务闭环往往需要数十次模型循环调用,若全部交由旗舰模型处理,成本会随调用轮次成倍膨胀,商业化规模化便无从谈起。
DeepSeek V4 Flash、GLM 5.3 Flash、Qwen 3.8 Flash这类国产MoE模型正是瞄准了这些痛点。它们依靠稀疏路由机制,保留庞大的总参规模与完整知识底座,每轮推理仅激活一小部分参数。海外独立评测社区Artificial Analysis曾绘制性能与价格对比图,DeepSeek V4 Flash在其中形成了一道醒目的“斩杀线”——即在它的价格之下,性能比它差且价格更贵的模型都不用看了。DeepSeek过去半年的用户增长很大程度上是踩着这条线走过来的。
GLM-5.3 Flash与Qwen 3.8 Flash几乎在同一时间将价格压至同一水位,新一轮“斩杀线”之争由此展开。具体来看,GLM-5.3 Flash与Qwen 3.8 Flash定价几乎持平:输入0.8元、输出约2.7至2.8元/百万tokens,双双站上行业高端档。智谱更是叠加限时5折优惠,折后输入0.4元、输出1.4元,进一步降低门槛。DeepSeek则坚持峰谷定价:高峰时段输入3.0元、输出9.0元,空闲时段半价。平均来看约为另外两家的2至3倍,但其视觉能力不额外加价,仍保留了差异化底牌。
标价之下还有第二层。三家都支持上下文缓存,缓存命中的输入价格会大幅下探,Qwen低至0.1元/百万tokens;对系统提示长、上下文重复度高的场景,实际账单还能进一步降低。DeepSeek的缓存命中价在闲时仅为0.05元,仍是三者中的最低水平。便宜没有换来能力的缩水。根据Artificial Analysis智能指数,GLM-5.3 Flash拿到57分,DeepSeek V4 Flash为50分,这意味着智谱用比DeepSeek更低的价格,拿到了高出7分的第三方评分,这一次被斩杀的反而是当初立线的那一方。
如今,“斩杀线”的位置每隔几周就会下移,淘汰一批模型。大模型下半场,卷性能的时代已经落幕,拼的是算力与数据。上半年大家比拼数据、参数和算力;到了下半年,DeepSeek、智谱、阿里、腾讯集体转身,将赌注压在“效率”上。当各家Flash的权重全部开源,MoE“大总参、小激活”成为行业共识的基础架构,模型厂之间的区别正在肉眼可见地变小。
架构不再是秘密,真正难复制的只剩两样:算力规模和数据管线。算力这一侧,效率模型表面上是把成本打下来了,背后却有一场更烧钱的军备竞赛。智谱动用10万张国产芯片集群支撑GLM-5.3 Flash的线上推理;MiniMax声称是国内最早建成规模化、长期稳定基础设施体系的两家独立大模型公司之一;腾讯则罕见地承认“整体算力严重不足”,拖慢了混元迭代。同一场竞争里,Flash恰恰是算力紧张时代的最佳解:320B的GLM-5.3 Flash每次推理只唤醒18B,770B的Hy4只激活49B,同样的卡能服务更多用户、摊薄更多成本。与其说厂商选择了效率路线,不如说是算力瓶颈让各家不得不走这条路。
但算力用钱能买到,数据却不能。数据这一侧,预训练语料、后训练数据管线、对齐工程,才是各家真正拉开身位的地方。DeepSeek靠强化学习与蒸馏把推理能力压进13B激活的模型;Qwen在多模态语料配比上押注;智谱在数据与对齐工程上积累。更被寄予期待的是,数据如何形成飞轮?各家都在押注Agent,每一次Agent调用都是一次真实使用数据的回流,回流进训练,模型更强,便有更多Agent接入。
谁先跑通Agent的规模化闭环,谁就同时拿到了算力之外最深的护城河。这也是千问的Flash发布就在千问办公Agent同步上线、模型与业务绑定如此紧密的原因。在过去卷性能的时代,大家比的是榜单;但卷效率的时代,比的是工程化的能力还有价格。如今价格战把模型压到成本线附近,模型层利润变薄,落到Agent、端侧与云服务身上的压力变得更重。接下来,模型厂商要么靠规模稳坐头部,要么靠场景做出差异化。一时的便宜不是终局,谁能在成本、效率与数据之间跑通飞轮,谁才能划出下一道斩杀线。
