近一个月来,硅谷AI界捷报频传,GPT-5.6、Fable 5、Grok 4.5等前沿模型相继问世。国内开发者与程序员群体因此沸腾,关于这些模型的讨论与测评层出不穷。尽管本月也有Kimi-K3等国产新锐模型问世,但从整体来看,国产大模型在一线开发者群体中仍处于“叫好不叫座”的状态。根据最新数据,OpenRouter 6月22日至28日的统计显示,中国模型周调用量达到20.39万亿Token,美国模型仅为4.25万亿,前者已连续九周领先。然而,与之形成鲜明反差的是,国内“AI六小龙”的营收表现却不尽如人意:智谱2025年营收7.24亿元,亏损却高达30亿元以上;MiniMax营收7900万美元(约5.7亿元);月之暗面等其他四家尚未披露完整年营收。即便是头部企业,收入也多停留在数亿元量级。相比之下,Anthropic作为AI头部企业,ARR已达到约600亿至700亿美元,主要驱动力为B2B API及AI Coding场景。这不禁引出一个尖锐的问题:为何号称“便宜”、“调用量大”的国产模型,至今仍然叫好不叫座,在AI Coding等高价值场景上难以与国外顶尖模型正面抗衡?

近期,通过与多位一线开发者的深入探讨,笔者发现了一个反直觉的事实:国产大模型,在某种程度上其实非常“贵”。也正是因为这种“贵”,让某些性能上有所突破的国产模型难以真正展现其价值。

一、“低价”的误区

提起国产大模型,很多人首先想到的是DeepSeek、Kimi、智谱等代表,与之关联最紧密的标签便是“低价、便宜”。若仅从Token单价上看,国产模型与GPT-5.6、Fable 5等顶尖模型相比,确实存在优势。以GLM-5.2与DeepSeek V4为例:GLM-5.2每百万Token输入/输出为1.4/4.4美元,DeepSeek-V4-Pro为0.435/0.87美元;而GPT-5.6 Sol为5/30美元,Claude Fable 5则为10/50美元。

但实际上,这种“低价”印象是圈外人长久的误区。尤其是在高强度编程场景下,国产大模型的单价不仅没有优势,反而比有套餐的GPT、Claude贵出几倍。

李光是AI领域的一位科研工作者,因工作需要,每天在AI Coding场景下消耗几十亿Token。在这样的消耗量下,若使用国产模型,例如GLM-5.2,整体成本会变得非常恐怖。李光晒出的Token账单显示,交谈当天消耗的Token已接近40亿。换算如下:若使用GLM-5.2,成本约为(8639万普通输入×1.4美元+33.80亿缓存输入×0.26美元+1906万输出及推理×4.4美元),总计约1084美元,按1美元兑7.2元估算,约合人民币7800元。而李光之所以能如此放开手脚烧Token,是因为他开通了GPT的CodeX套餐。简单来说,CodeX是针对编程场景推出的套餐:Plus为20美元/月,Pro从100美元/月起,额度约为Plus的5倍或20倍;触顶后可购买Credits继续使用。同样地,Anthropic的Claude Code也有类似套餐:Claude Pro为20美元/月,Max 5x和Max 20x分别为100、200美元/月;Claude网页端与Claude Code共享每5小时及每周额度,触顶后可按API价格续用。

在这些套餐的兜底下,巨大的Token成本被抹平。对于国内开发者而言,在高强度AI Coding场景下,每天消耗几十亿甚至上百亿Token是常态。小刘是一位AI Coding重度开发者,他在CodeX上实际一周花费约300元人民币,即便是在没有公司报销的情况下。但即使是这样的成本,对比国产模型,依然显得“便宜”很多,因为同样300元,根本买不来GLM 5.2同等数量的Token。小刘的Token账单表明,在国内开发者眼中,GPT的CodeX套餐是目前能买到的最便宜的token,比智谱、Kimi便宜好几倍。这可能反直觉,但事实就是国产模型在高强度的Coding场景下,性价比完全无法与之对比。

需要说明的是,CodeX并非真正意义的不限量套餐,如果按最高档200美元算,一周大概有20亿额度。但由于部分开发者通过“中转站”等手段使用模型,某些模型的实际成本会比官方渠道低很多,这才有了300块能买120亿Token的现象。实际上,国产模型并非没有推出过类似套餐,但如果细究起来,其限额方面相比CodeX存在很大限制。

二、国产定价之痛

国产大模型在定价方面的现状,可以用一句话来形容:“你以为你进的是自助餐的场子,但最后发现,商家还是按斤计费。”

以套餐为例,国内的Kimi、GLM-5.2:Kimi Code分为49、99、199、699元四档,额度按周刷新;GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt,每周约400、2000、8000次,且GLM-5.2高峰期按3倍扣额。以阿里的Qoder为例,根据笔者一位从事B端客户运维的朋友阿迷介绍:“Qoder曾经是国内最好用的AI IDE,可惜它自己的新定价把优势搞没了。”在套餐方面,Qoder CN个人Pro、Pro+分别为59、169元/月,含2000、6000 Credits;Teams与VPC版分别为99、199元/席位·月,均含3000 Credits,后者50席起售。“今年他们合并灵码调了定价后,就我知道的,至少都有二三十家放弃续费了。”阿迷后来介绍道。根据阿迷的测试,Qoder企业版199的套餐,按他的用法,3天就没了,如果按重度开发者的用法,估计一天就没了。

同样地,在套餐方面,令国内用户感到五味杂陈的还有GLM-5.2。按照开发者小薇的说法:“GLM-5.2的套餐约等于没有,就算有套餐高峰期仍然限流,并且还存在‘背刺’用户的现象。”此前,GLM-5.2的套餐比演唱会门票还难抢,每天早上十点钟准时刷新,能不能买到全凭手速。2026年1月,智谱发公告说因为算力紧张,把每日可销售量直接砍到原来的20%,每天早上10点放一点额度,几分钟就售罄。

说到底,国产模型在套餐、价格上的“吝啬”,本质上是算力不足造成的窘迫。根据2025年中国信通院、工信部的数据,中国现存的数据中心是449个,而美国则是5427个;在总算力方面,中国为1053 EFLOPS,美国则是2400。但关键在于,美国那2400 EFLOPS里高端GPU占比极高;中国的算力里,大量是华为昇腾、寒武纪等国产芯片,单卡性能与H100仍有代差。为应对高涨的算力需求,2026年3月开始,智谱、阿里云、腾讯云、百度在Token价格上集体涨价,涨幅从5%到460%不等。

说白了,国产模型的“低价”、“价格战”早已成为过去式。不是国产模型不想搞“自助餐”,是因为算过账:以现在的算力成本和亏损状态,搞包月等于拿固定月费去赌用户不会刷爆,而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法,这样的商业模式很快会被击穿成本线。而OpenAI和Anthropic的编程套餐,卖的是高净值企业客户——Cursor、GitHub Copilot这种大客户一年能给Anthropic贡献14亿美元收入。在高算力的加持下,这套商业模式本质是用“固定月费”换“长期锁客”,客户质量高,ARPU也相对较高,摊得平成本。相比之下,国内虽然有阿里这样的云巨头,但问题是:阿里云FY2026调整后EBITA Margin只有7.5%,云智能集团虽然收入增长快,但利润并不丰厚。并且,传统云厂商敢卖“不限量云服务器”,是因为用户不是24小时满负载。一台ECS,实际CPU利用率可能只有10%,云厂商可以把一台物理机超卖给十个人。但大模型推理不一样:来一个token,就要实打实烧一次GPU算力。用户如果24小时不间断刷,云厂商的HBM显存、GPU核心、电费全是刚性支出,没有任何超卖空间。

三、模型的“黄金三角”

除了价格因素外,对国内开发者来说,选择CodeX、Claude Code的原因无疑是其强大的编程性能。然而,在性能方面,国产模型也并非像某些刻板印象中想的那样。在与多个开发者交谈后,笔者发现一个较为普遍的观点是:国产大模型,尤其是GLM-5.2等最新模型,已经可以承接一些辅助性、次要的任务,例如做测试和修改Bug。但在较为复杂的、长时间的异步任务上,国产模型目前与GPT、Claude等顶尖模型仍有较大差距。

开发者小张今年3月份用过一次国产模型编程,用GLM、Qwen和GPT对比同样的任务,只有GPT跑完了,且符合页面要求,那是一个多级、多列内容比对和结果生成的项目。而另一个开发者小薇则表示,根据她的体验,Kimi 2.7和豆包2.1 Pro性能也尚可,但总体而言要弱一档(属于第二梯队),但总体而言也超过了Claude Sonnet 4.6。目前,开发者群体中的普遍共识是:GLM-5.2是第一个达到了Opus级别的国产模型。它在执行真实的、复杂的、长时间的异步任务中是可用的,占据了一席之地。尽管在很多维度,例如世界知识上,其与真正的Opus模型仍有较大差距,但这不妨碍其成为国产模型的新高度。但现实是,这刚刚崭露头角的少数“尖子生”,却被与性能无关的其他因素拖累了。具体来说,这些因素包括缓存效率不高、高峰期仍然会限流等等,让开发者的实际体验很糟糕。

这就引出了当下模型对比中的另一个维度:稳定性。在一线开发者、程序员的体验中,模型的选择早已不是简单的性能对比,而是——性能、价格、稳定性的“黄金三角”。在这三个维度中,国产模型只勉强拿下了第一维度的部分指标。

近期,国内的Kimi发布了其最新的旗舰模型K3:这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型,主攻长程编程、知识工作与深度推理。在众多测评中,其在Artificial Analysis上的智力指数是57分、位列全球第三;Arena前端编程榜以1679分登顶,甚至有传言称其性能已经能比肩Claude Fable 5。然而,在耀眼的分数与排名背后,开发者关切最多的,仍然是一个词:性价比。在K3发布后,很多开发者表示,现在Kimi仍然很贵,与CodeX相比没有性价比,且额度不够用。单看API价格,K3也谈不上“白菜价”:每百万Token缓存/输入/输出分别为2/20/100元;GPT-5.6 Sol为0.5/5/30美元,K3虽低于Sol,却明显高于GPT-5.6 Luna的0.1/1/6美元。且在使用K3的过程中,开发者表示还出现了API断连,甚至断了一上午的情况。

就目前的情况来看,国内开发者不是不愿意为国产模型付费,而是国产模型目前因算力紧、成本高,开不起CodeX这样具有性价比的套餐,只能开看似自助餐、实则限量的“大众点评套餐”(类似智谱的Coding Plan)。而套餐的体验不稳定、性价比模糊,导致用户使用过难以留存。这本质上,是在目前算力底座成本高的情况下,用户的理性选择。

以上这些,并非我们要长他人志气,灭自己威风,只是想提示一种风险。目前,国产模型在追赶GPT、Claude的路途中,非常喜欢强调性能,但国产大模型从研发到应用,需要攀登的,远不止性能这一座高山。我们需要的是等待,等到国产算力基座大规模量产了,在技术、价格、稳定性方面,形成合力了,我们的产品就能撑起用户的期待。

最新快讯

2026年07月29日

20:52
7月20日,2026世界人工智能大会(WAIC)在上海圆满闭幕。 作为AI应用方向的一线从业者,我深切感受到了行业明显的变化之一,“Agent”正在加速走入软件和应用层。 在参展的席位上,从手机、办公软件、开发工具,到营销、客服、医疗和企业管理系统,几乎所有应用都在展示尝试接入Agent,让AI从生成一段内容,走向调用工具、跨越系统并完...
20:52
很多人对智能客服的第一印象不太好。 快递明明没收到,打电话过去,智能客服翻来覆去只有一句“已签收”;问题还没讲完,系统就自顾自地跳转、答非所问;好不容易磨到人工,又得把来龙去脉从头再说一遍。这样的场景几乎人人都经历过,智能客服在一次次“鸡同鸭讲”中,不断消耗用户的耐心和信任。 可企业偏偏不能放弃它。 客服是企业和C端用户之间最直接的...
20:52
就在前不久,港交所新版上市规则正式落地之日,智元创新高调确认启动赴港上市流程。这一消息虽不突兀,但选择在新规生效当天官宣,足见智元对时机的精准拿捏——节奏紧凑,步步为营。 成立仅三年,智元创新实现了惊人的跨越:营收从初创时的30万元飙升至10亿元级别,量产下线数量突破1.5万台,在全球通用人形机器人市场中占据了近40%的份额。这种爆发式增长在硬科技赛道实属罕...
20:50
据鼓狮财经7月29日消息,美军中央司令部告诫驻中东部队,严禁在互联网上传播基地遇袭的视频,以免这些影像落入伊朗手中,助其精准研判打击成效。据悉,美军中央司令部司令布拉德·库珀在7月28日致信指出,伊朗正通过士兵上传的影像,近乎实时地评估袭击是否奏效。此外,两名匿名知情人士透露,驻约旦美军士兵已接到通知,手机可能很快会被统一收缴。对此,美军中央司令部官员予以否...
20:50
鼓狮财经7月29日讯,摩根大通市场情报团队分析认为,美联储维持利率不变并释放鸽派信号,将是美股市场的“最佳选择”。 根据该团队的情景分析,主要结果如下: * **最佳情况**:若美联储按兵不动,且对通胀前景释放宽松信号(概率28%),标普500指数有望上涨0.5%至1%。 * **最差情况**:若美联储加息50个基点(概率仅1%),标普500指数可能...
20:50
据鼓狮财经7月29日消息,巴基斯坦军方发布声明称,在过去24小时内,安全部队在西北部的开伯尔-普什图省和西南部的俾路支省展开反恐行动,成功击毙32名恐怖分子。 行动细节显示,28日晚至29日,安全部队在开伯尔-普什图省开伯尔地区突袭了多个恐怖分子据点,造成24名武装分子死亡。同时,在俾路支省努什基地区的行动中,又有8名恐怖分子被击毙。此外,部队还缴获了包括武...
20:16
煤矿时代的金丝雀曾用于预警瓦斯,如今韩国股市似乎正成为AI狂热退潮中的“预警者”。作为本轮AI交易最拥挤的市场之一,韩国半导体板块率先遭遇剧烈抛售。 继6月28日重挫近11%后,6月29日KOSPI盘中一度跌13%,最终收盘跌近6%,近一个月跌幅已超过三分之一。追踪韩国股市的3倍做多ETF KORU,更是从6月高点的约64美元跌至14美元附近,累计跌幅达78...
20:16
最近,关于 OpenAI 硬件版图的曝光度激增。无论是彭博社关于音箱细节的报道,还是供应链分析师郭明錤关于手机规格和代工名单的详尽调查,都让我们逐渐拼凑出了 OpenAI 硬件布局的真实轮廓:一台音箱、一部手机,以及后续可能出现的眼镜、台灯和耳机。其中,音箱作为最早首发的硬件,预计将于 2027 年初上市,手机量产时间也提前到了 2027 年上半年。音箱预计...
20:16
若要用一句话概括当下漫剧界炙手可热的“罪妻”模板,那便是:女主角开局流放边关,被迫选夫后,在艰苦环境中开启种田基建大业。她凭借智慧与坚韧让荒芜之地焕发生机,不仅收获了真挚的爱情与深厚的亲情,还衍生出了星际、兽世、废土等多个版本。这个IP的源头,竟是一对95后夫妻“打造”出的《发配边关,罪妻开荒养出战神》,如今已更新至第九季,全系列有6部作品闯入“上半年AI剧...
20:16
AI办公正成为大厂竞逐的新高地。近期,各大互联网巨头纷纷调整组织架构,整合产品线,试图在办公领域抢占先机。阿里推出千问办公,整合了QoderWork、悟空和MuleRun,由钉钉新任CEO陈宇森掌舵;腾讯持续加码WorkBuddy,不仅加速推广,还传出将QClaw团队并入的消息;字节跳动则推进飞书、TRAE、豆包等多条战线,并讨论整合方案。 与此同时,市场格...
20:16
开源大神贾扬清再次有了新动作。就在今天,他宣布启动名为 Intent Lab 的创业项目,并组建了一支名为“Fleet”的自主 AI 团队,致力于将模糊的意图转化为生产级软件。与此同时,他还展示了三个早期成果:最快的 GLM 5.2 推理引擎、一句话生成的数据库引擎,以及一套带有形式化验证的文件系统。贾扬清的 X 账号简介也已更新为“Intent Lab 创...
20:16
美伊短暂的停火未能维持,地区紧张局势再度升温。周三晚间,国际油价出现大幅上涨。截至发稿,WTI原油期货价格涨幅超过4%,报82.96美元/桶;布伦特原油期货价格涨幅亦超过3%,报81.46美元/桶。 消息面上,7月29日下午,美国空袭了伊朗西阿塞拜疆省皮兰沙赫尔市的边境地带。据一位军事知情人士透露,霍尔木兹海峡目前处于完全封闭状态,所有船只均不得通过这一战略...