8 月 26 日晚,阿里和智谱几乎同时发布了两个名字里带着“Flash”的模型。

Qwen3.8-Flash-Next 拥有 125B 主模型和额外的 51B N-gram Embedding,每个 Token 只激活 6B 参数。GLM-5.3-Flash 总参数 320B,激活参数 18B。前者开放权重,后者采用 MIT 许可证开源。

过去的大模型发布会,喜欢往参数规模和 Benchmark 榜首上冲。这一次,两家公司却不约而同地把“少算一点”摆到了台前。

Qwen 开放了新架构和权重,迅速接入 vLLM、SGLang 等推理框架,生产版将以 Qwen3.8-Flash 进入 QwenCloud,千问办公已经用它支撑 Standard 模式。Qwen 官方公布的 API 价格为每百万 Token 输入 0.16 美元、输出 0.47 美元。

GLM 的打法就比较传统,先推出个匿名模型 Ox Alpha,在 OpenCode 和 OpenRouter 免费开放。开发者不知道它来自哪家公司,照样拿它写代码、调用工具、跑长任务。调用量起来之后,智谱才揭晓身份,开放 MIT 权重,并宣布测试期的全部请求由国产芯片集群承载。

但无论他们的打法有多不同,目的都是进入 Agent ,成为那个默认、常驻、一天到晚跑个不停的模型。

01、DeepSeek 涨价十天后,替代者同时到场

这个时间点很微妙。

8 月 1 日,DeepSeek-V4-Flash 上线。短短两周,它在 OpenCode 上的日 Token 量便从约 3 万亿冲到 18 万亿。低价第 一次把 Agent 需求彻底释放出来:过去舍不得交给模型反复尝试的任务,现在可以放心跑上几十轮。

但 8 月 16 日涨价后,日 Token 量迅速跌到峰值的一半以下。OpenCode CEO 估算,平台上由此空出了接近 10 万亿 Token 的日需求。

四天后,Ox Alpha 匿名(GLM)上线。

没有品牌背书,也没有发布会造势。开发者甚至不知道它来自哪家公司,只知道它免费、能力够用,可以接替 DeepSeek 继续干活。据公开数据,Ox Alpha 六天内在 OpenCode 累计处理 44 万亿 Token;在 OpenRouter 过去七天的调用量达到 23.2 万亿 Token,位列第 一。

这几乎是一场天然的品牌盲测。摘掉公司名字之后,开发者仍然用调用量投了票:在 Agent 市场,模型是谁并没有账单、速度和完成率重要。

8 月 26 日晚,智谱揭晓 Ox Alpha 的身份,阿里也在同一天发布 Qwen3.8-Flash-Next。

DeepSeek 刚刚用一次涨价榨出了市场对低价模型的渴求,Qwen 和 GLM 便顺着这道裂缝挤了进来。

02、Agent 最重要的生态位,是日常主力模型

大模型竞争最容易被看见的,是谁又拿了 Benchmark 第 一。但进入 Agent 之后,真正值钱的位置变了。

最强模型负责解决少数难题,日常模型负责处理绝大多数工作:读取代码、搜索文件、调用工具、检查结果,失败了再重来一轮。一个看似简单的任务,背后可能循环几十次。上下文不断变长,思考 Token 和工具调用逐层累积,几毛钱的价差很快就会被放大。

这正是 DeepSeek-V4-Flash 此前受欢迎的原因。它未必每项能力都最强,却便宜到让开发者不必盯着账单,可以把任务交给它一直跑。

在聊天产品里,用户可能习惯某个模型的语气、界面和记忆。但在 Agent 世界,大模型几乎没有品牌忠诚度。换模型通常不需要迁移社交关系或重新学习一套产品,有时只是改掉配置文件里的模型名。

模型价格一旦变动,流量马上会寻找下一个出口。开发者关心的是任务能否完成、工具调用是否可靠,以及跑一晚上究竟要花多少钱。模型来自哪家公司并不重要。

也因此,日常主力模型的位置比旗舰模型更难守,也更有价值。一旦成为默认选项,拿到的就不只是 API 调用量。IDE、Agent 框架和办公工具会围绕它做适配,企业部署、订阅计划和云服务也会随之跟进。

最强模型决定 Agent 能做到什么,日常模型决定 Agent 每天在做什么。

榜单第 一赢得发布会,默认模型拿走工作流。

03、这是一轮有技术的价格战

Qwen 和 GLM 毫无疑问带来了新一轮价格战。区别在于,过去的低价往往来自云平台补贴,这一次,两家公司先从模型结构里压低了成本。

总参数决定模型能够容纳多少知识和能力,激活参数则更接近每生成一个 Token 时,真正需要参与计算的部分。

Qwen3.8-Flash-Next 的主模型拥有 125B 参数,另有 51B N-gram Embedding,但每个 Token 只激活 6B 参数。模型规模没有大幅缩水,每次推理真正参与计算的部分却被压得很小。

Agent 最烧钱的地方,往往不是回答一个问题,而是反复处理越来越长的上下文。每执行一轮,模型都要重新读取系统提示、历史对话、代码文件和工具返回结果。传统全注意力机制近似于每写一个字,都要把前面的整本材料重新翻一遍。上下文越长,计算量和 KV Cache 占用就越高,GPU 不仅忙着计算,还要不断搬运数据。

Qwen 的处理方式,是让四分之三的网络层使用 GDN,把历史信息持续压缩到固定大小的状态中;剩余层再通过 QSA 稀疏注意力,从长上下文里寻找真正相关的部分。它不再要求每一层都完整扫描全部历史,而是先做摘要,需要细节时再精准检索。

额外的 51B N-gram Embedding,则更像一套规模庞大的常用词组和局部模式库。查找位置可以提前确定,因此能够放在成本更低的主机内存中,需要时再异步读取,不必长期占用昂贵的 GPU 显存,也几乎不增加每个 Token 的矩阵运算量。

GLM-5.3-Flash 走的是相似方向。

它拥有 320B 总参数,每个 Token 只激活 18B,并采用线性注意力与稀疏注意力结合的混合架构。线性注意力负责低成本地压缩和延续历史状态,稀疏注意力负责从百万 Token 上下文中找回关键细节。智谱称,相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量降至约三分之一,KV Cache 缩小至约四分之一。

这也是 Agent 时代的价格战与聊天时代不同的地方。聊天产品的成本主要来自一次生成,Agent 的成本会在几十轮循环中持续累积。模型结构每节省一次上下文读取、一次显存搬运,都会在整个任务里被重复放大。

当然,激活参数少不等于最终账单一定低。真正的竞争指标已经从“每百万 Token 多少钱”,转向“完成一个任务需要多少钱”。

免费补贴可以开启价格战,但只有架构效率才能决定价格战能打多久。

看起来Qwen和GLM就是在用DeepSeek制造斩杀线的方式制造新的斩杀线,并且第 一个要斩杀的就都瞄准了DeepSeek。

不过,竞争不会就此结束。

涨价之后,DeepSeek 仍有一个价格几乎无人能打:缓存命中。

按照调整后的峰谷价格,V4-Flash 每百万缓存命中 Token,闲时为 0.007 美元,折合约 0.05 元;高峰为 0.014 美元,约 0.10 元。GLM-5.3-Flash 五折后的缓存输入价格是 0.015 美元,约 0.11 元。

差距看起来只有几分钱,放进 Agent 循环里却可能被放大很多次。

任务的缓存率高、上下文重复多,DeepSeek 依然可能最 便宜。新输入和输出占比高,Qwen 与 GLM 的低价就更有优势。

谁才是真正的低价模型,得等整个任务跑完再看账单。斩杀线的所有权,接下来看起来还会不停的继续迁移下去。

最新快讯

2026年08月27日

17:44
鼓狮财经8月27日电,口子窖(603589.SH)公告称,公司发布2026年半年度报告,实现营业收入19.52亿元,同比下降22.89%;归属于上市公司股东的净利润3.65亿元,同比下降48.97%。业绩下降主要系报告期内营业收入减少,同时管理费用、销售费用下降幅度均小于营业收入下降幅度所致。小财注:公司Q2净利润0.36亿,Q1净利润3.29亿,据此计算,...
17:44
鼓狮财经8月27日电,思泉新材(301489.SZ)公告称,公司发布2026年半年度报告,实现营业收入5.21亿元,同比增长34.95%;归属于上市公司股东的净利润3361.24万元,同比增长10.17%。公司拟向全体股东每10股派发现金红利0.5元(含税)。
17:44
鼓狮财经8月27日电,中天科技(600522.SH)公告称,公司发布2026年半年度报告,实现营业收入309.39亿元,同比增长31.1%;归属于上市公司股东的净利润23.87亿元,同比增长52.29%。小财注:公司Q2净利润14.69亿,之前预告区间为14.33亿-15.89亿,Q1净利润9.19亿,据此计算,Q2净利润环比增长59%。
17:44
鼓狮财经8月27日电,精测电子(300567.SZ)公告称,公司发布2026年半年度报告,实现营业收入18.12亿元,同比增长31.19%;归属于上市公司股东的净利润7503.49万元,同比增长171.21%。业绩增长主要系公司半导体领域产品规模化量产,交付能力增强,以及显示检测业务延续增长态势。公司计划不派发现金红利,不送红股,不以公积金转增股本。小财注:...
17:44
鼓狮财经8月27日电,德方纳米(300769.SZ)公告称,公司发布2026年半年度报告,实现营业收入104亿元,同比增长167.92%;归属于上市公司股东的净利润4.55亿元,同比扭亏为盈。业绩扭亏主要系下游需求增长,产品销量及售价上涨,盈利能力改善。公司计划不派发现金红利,不送红股,不以公积金转增股本。小财注:公司Q2净利润1.91亿,Q1净利润2.65...
17:44
鼓狮财经8月27日电,理奇智能(301599.SZ)公告称,公司拟与无锡宛山湖产业发展有限公司签订投资合作协议,计划投资建设理奇锂电设备智能制造生产基地及研发中心项目,项目总投资20亿元,其中一期投资10亿元,建设物料自动化处理设备智能制造生产基地及研发中心项目;二期投资10亿元,视产能需求分批实施。项目选址位于锡山经济技术开发区,用地约260亩,建设内容为...
17:44
鼓狮财经8月27日电,南大光电(300346.SZ)公告称,公司发布2026年半年度报告,实现营业收入13.68亿元,同比增长11.35%;归属于上市公司股东的净利润2.56亿元,同比增长23.1%。公司拟向全体股东每10股派发现金红利0.80元(含税)。小财注:公司Q2净利润1.32亿,Q1净利润1.24亿,据此计算,Q2净利润环比增长5%。
17:44
鼓狮财经8月27日电,据美国方面26日消息,美国司法部准备重启捕获法庭的运作,以简化扣押伊朗油轮及相关货物的程序,加强对伊朗的海上封锁。据3名消息人士称,美国司法部正与国防部协调推进有关计划。按照该计划,美国联邦检察官可更快将敌方或中立船只上的石油等货物认定为“美国资产”。相关货物可被出售,所得款项将转交美国财政部。据悉,捕获法庭常见于18世纪和19世纪。自...
17:43
鼓狮财经8月27日讯在AI算力建设持续烧钱的大背景下,Meta、微软、亚马逊等全球超大规模科技企业开启了一轮史无前例的发债浪潮。海量债务供给正在考验全球债券市场的承接能力,投资者已开始索要更高的溢价。 据媒体当地时间周四报道,摩根大通欧洲投资级融资业务主管Matthias Reschke近日接受采访时表示,当前市场并不担心AI巨头的债券卖不出去,真正的核心矛...
17:43
鼓狮财经8月27日讯在英伟达公布全面超预期的财报后,华尔街投行密集上调了对这家AI芯片巨头的目标价。 周三美股盘后,英伟达公布了2027财年第二季度财报。受AI板块强劲需求驱动,英伟达第二财季营收为962亿美元,同比增长106%,超越市场共识预期的919亿美元;调整后每股盈利为2.22美元,同比增长120%,亦高于华尔街预期的2.08美元。 英伟达核心的数据...
17:43
鼓狮财经8月27日讯美国社会对数据中心的不满日益累积。有机构指出,由于反对情绪升温以及实体基础设施建设本身的复杂性,美国多达一半的拟建数据中心面临延期或取消的风险。 地面数据中心进展不顺,这就让人将脑筋动到太空之中。美国国家航空航天局(NASA)局长Jared Isaacman最新建议在太空设立数据中心,并利用太阳能来赢得人工智能竞赛。 他表示,此举将带来巨...