最近一个月,硅谷AI界动作频频,GPT-5.6、Fable 5、Grok-4.5接连发布,国内开发者圈也随之沸腾,关于这些前沿模型的测评与讨论此起彼伏。尽管这个月也有Kimi-K3等新锐国产模型问世,但整体来看,国产大模型在一线开发者群体中仍面临“叫好不叫座”的尴尬。根据最新数据,OpenRouter 6月22日至28日的统计显示,中国模型周调用量高达20.39万亿Token,美国模型仅为4.25万亿,前者已连续九周领先。但与之形成强烈反差的是,国内AI六小龙在营收方面的表现却不尽如人意:公开财报显示,智谱2025年营收7.24亿元,亏损却达到了30亿元以上;MiniMax为7900万美元(约5.7亿元);月之暗面等其余四家尚未披露完整年营收。即使头部企业,收入也仅停留在数亿元量级。相较之下,作为AI头部企业的Anthropic,其ARR已达到约600亿至700亿美元,主要驱动力为B2B API及AI Coding场景。这不由得引出了一个尖锐的问题:为何号称“便宜”、“调用量大”的国产模型,至今仍然叫好不叫座,在AI Coding等高价值场景上,至今仍难以与国外顶尖模型正面抗衡?

最近,在与多个一线开发者深入探讨此问题后,发现了一个很反直觉的事实:国产大模型,某种程度上其实非常“贵”。也正是这样的“贵”,让某些性能上有所突破的国产模型,难以真正展现自己的闪光之处。

01 “低价”的幻觉

提起国产大模型,很多人想到的都是DeepSeek、Kimi、智谱这样的代表,而与之关联最紧密的标签之一,就是低价、便宜。如果仅从Token单价上来看,国产模型与GPT-5.6、Fable 5等顶尖模型相比,确实有着不小的优势。拿GLM-5.2与DeepSeek V4举例:GLM-5.2每百万Token输入/输出为1.4/4.4美元,DeepSeek-V4-Pro为0.435/0.87美元;GPT-5.6 Sol为5/30美元,Claude Fable 5则为10/50美元。

但实际上,这种“低价”的印象,是一种长期存在的误区。尤其在高强度的编程场景下,国产大模型的单价不但没有优势,甚至反而还比有套餐的GPT、Claude贵出好几倍。

李光(化名)是AI领域的一位科研工作者,由于工作需要,每天都要在AI Coding的场景下消耗几十亿Token,在这样的消耗量下,如果用国产大模型,例如GLM-5.2,整体的成本就会变得非常恐怖。李光晒出的Token账单显示,交谈当天他消耗的Token已接近40亿。倘若他用的是GLM-5.2,成本大致是:(8639万普通输入×1.4美元+33.80亿缓存输入×0.26美元+1906万输出及推理×4.4美元)约为1084美元,按1美元兑7.2元估算,约合人民币7800元。

而让李光如此放开手脚烧Token的原因,就是因为他开了GPT的CodeX套餐。简单来说,它是针对编程场景推出的一款套餐:严格说来,它并非真正不限量,而是把Codex纳入ChatGPT订阅。Plus为20美元/月,Pro从100美元/月起,额度约为Plus的5倍或20倍;触顶后可购买Credits继续使用。同样地,Anthropic的Claude Code也有一套类似的套餐,具体形式是:Claude Pro为20美元/月,Max 5x和Max 20x分别为100、200美元/月;Claude网页端与Claude Code共享每5小时及每周额度,触顶后可按API价格续用。

在这样的套餐兜底下,巨大的Token成本反而被抹平了。对于国内的开发者来说,在高强度AI Coding场景下,每天消耗几十亿、上百亿Token,是一个很普遍的常态。小刘也是一个AI Coding的重度开发者,他在Codex上实际一周的花费是300元人民币,而这还是在没有公司报销的情况下。但即使是这样的成本,对比国产模型,依然显得“便宜”了很多,因为同样300元,根本买不来GLM 5.2同等数量的Token。

小刘的Token账单在国内开发者看来,GPT的codex套餐,是目前能买到的最便宜的token,比智谱、kimi便宜好几倍。这可能反直觉,但是事实就是国产模型在高强度的Coding场景下,性价比完全无法与之对比。

这里需要说明的是,codex并非真正意义的不限量套餐,如果按最高档200美元算,一周大概有20亿额度。但是,由于部分开发者会通过“中转站”等手段使用模型,某些模型的实际成本,会比官方渠道低很多,这就导致有时能以更低的价格,买到更多Token,于是才有了300块能买120亿Token的现象。

实际上,国产模型在定价方面,不是没有推出过类似的套餐,但如果细究起来,这样的套餐,在限额方面,比起codex而言,存在着很大的限制。

02 国产定价之痛

国产大模型在定价方面的现状,可以用一句话来形容:“你以为你进的是自助餐的场子,但最后发现,商家还是按斤计费。”

举例来说,在套餐方面,国内的Kimi、GLM-5.2:Kimi Code分为49、99、199、699元四档,额度按周刷新;GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt,每周约400、2000、8000次,且GLM-5.2高峰期按3倍扣额。

以阿里的qoder为例,根据笔者一位从事B端客户运维的朋友阿迷(化名)介绍:“qoder曾经是国内最好用的AI IDE,可惜它自己的新定价,把优势搞没了。”在套餐方面:Qoder CN个人Pro、Pro+分别为59、169元/月,含2000、6000 Credits;Teams与VPC版分别为99、199元/席位·月,均含3000 Credits,后者50席起售。“今年他们合并灵码调了定价后,就我知道的,至少都有二三十家放弃续费了。”

根据阿迷的测试,qoder企业版199的套餐,按他的用法,3天就没了,如果按重度开发者的用法,估计一天就没了。

同样地,在套餐方面,令国内用户感到五味陈杂的,还有GLM-5.2。按照开发者小薇的说法:“GLM-5.2的套餐约等于没有,就算有套餐高峰期仍然限流,并且还存在‘背刺’用户的现象。”按照36氪的报道:GLM-5.2的套餐,之前比演唱会门票还难抢,每天早上十点钟准时刷新,能不能买到全凭手速。2026年1月,智谱发公告说因为算力紧张,把每日可销售量直接砍到原来的20%,每天早上10点放一点额度,几分钟就售罄。

说到底,国产模型在套餐、价格上的“吝啬”,本质上是算力不足造成的窘迫。根据2025年中国信通院、工信部的数据,中国现存的数据中心是449个,而美国则是5427个,在总算力方面,中国为1053 EFLOPS,而美国则是2400。但这里的关键在于:美国那2,400 EFLOPS里,高端GPU占比极高;中国的算力里,大量是华为昇腾、寒武纪等国产芯片,单卡性能与H100仍有代差。

为应对愈发高涨的算力需求,2026年3月开始,智谱、阿里云、腾讯云、百度在Token价格上集体涨价,涨幅从5%到460%不等。说白了,国产模型的“低价”、“价格战”早已成为了过去式。不是国产模型不想搞buffet,是因为算过账:以现在的算力成本和亏损状态,搞包月等于拿固定月费去赌用户不会刷爆,而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法,这样的商业模式,很快会被击穿成本线。

而OpenAI和Anthropic的编程套餐,卖的是高净值企业客户——Cursor、GitHub Copilot这种大客户一年能给Anthropic贡献14亿美元收入。在高算力的加持下,这套商业模式,本质是用“固定月费”换“长期锁客”,客户质量高,ARPU也相对较高,摊得平成本。而相较之下,国内虽然有阿里这样的云巨头,但问题是:阿里云FY2026调整后EBITA Margin只有7.5%,云智能集团虽然收入增长快,但利润并不丰厚。并且,传统云厂商敢卖“不限量云服务器”,是因为用户不是24小时满负载。一台ECS,实际CPU利用率可能只有10%,云厂商可以把一台物理机超卖给十个人。但大模型推理不一样:来一个token,就要实打实烧一次GPU算力。用户如果24小时不间断刷,云厂商的HBM显存、GPU核心、电费全是刚性支出,没有任何超卖空间。

03 模型的“黄金三角”

除了价格方面的因素外,对国内开发者来说,选择Codex、Calude Code的原因,无疑是其强大的编程性能。然而,在性能方面,国产模型也并非像某些刻板印象中想的那样。

在与多个开发者交谈后,笔者发现一个较为普遍的观点是:国产大模型,尤其是GLM-5.2等最新的模型,已经可以承接一些辅助性的、次要的任务,例如做测试和修改bug。但在较为复杂的、长时间的异步任务上,国产模型目前与GPT、Calude等顶尖模型,仍有较大差距。

开发者小张,今年3月份用过一次国产模型编程,用GLM、qwen和GPT对比同样的任务,只有gpt跑完了,且符合页面要求,那是一个多级、多列内容比对和结果生成的项目。而另一个开发者小薇则表示,根据她的体验,Kimi 2.7和豆包2.1 Pro性能也尚可,但是它总的来说还是要弱一档(属于第二梯队),但总体而言也超过Claude Sonnet 4.6了。目前,开发者群体中的普遍共识是:GLM-5.2是第一个达到了Opus级别的国产模型。它在执行真实的、复杂的、长时间的异步任务中,它是可用的、占据了一席之地的。尽管在很多维度,例如世界知识上,其与真正的Opus模型仍有较大差距,但这不妨碍其成为国产模型的新高度。

但现实是:这刚刚崭露头角少数“尖子生”,却被与性能无关的其他因素拖累了。具体来说,这样的因素包括了缓存效率不高、高峰期仍然会限流等等,让开发者的实际体验很糟糕。这就引出了当下模型对比中的另一个维度:稳定性。

在一线开发者、程序员的体验中,模型的选择,早已不是简单的性能对比,而是——性能—价格—稳定性的“黄金三角”。在这三个维度中,国产模型只勉强拿下了第一维度的部分指标。

近期,国内的Kimi发布了其最新的旗舰模型K3:这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型,主攻长程编程、知识工作与深度推理。在众多测评中,其在Artificial Analysis上的智力指数是57分、位列全球第三;Arena前端编程榜以1679分登顶,甚至有传言称,其性能已经能比肩Claude Fable 5。然而,在耀眼的分数与排名背后,开发者关切最多的,仍然是一个词:性价比。

在K3发布后,很多开发者表示,现在Kimi仍然很贵,与Codex相比没有性价比,且额度不够用,单看API价格,K3也谈不上“白菜价”:每百万Token缓存/输入/输出分别为2/20/100元;GPT-5.6 Sol为0.5/5/30美元,K3虽低于Sol,却明显高于GPT-5.6 Luna的0.1/1/6美元。且在使用K3的过程中,开发者表示还出现了API断连,甚至断了一上午的情况。

就目前的情况来看,国内开发者不是不愿意为国产模型付费,而是国产模型目前因算力紧、成本高,目前开不起Codex这样具有性价比的套餐,只能开看似自助餐,实则限量的“大众点评套餐”(类似智谱的Coding Plan)。而套餐的体验不稳定、性价比模糊,导致用户使用过难以留存。这本质上,是在目前算力底座成本高的情况下,用户的理性选择。

以上这些,并非我们要长他人志气,灭自己威风,只是想提示一种风险。目前,国产模型在追赶GPT、Claude的路途中,非常喜欢强调性能,但国产大模型从研发到应用,需要攀登的,远不止性能这一座高山。我们需要的是等待,等到国产算力基座大规模量产了,在技术、价格、稳定性方面,形成合力了,我们的产品就能撑起用户的期待。

最新快讯

2026年07月30日

11:27
鼓狮财经7月30日电,俄罗斯联邦安全局29日发布声明,寻求逮捕社交媒体“电报”创始人、首席执行官帕维尔·杜罗夫,他因涉嫌协助恐怖活动受到刑事指控,被列入全球通缉名单。俄联邦安全局在声明中说,乌克兰情报部门利用“电报”平台的频道、聊天工具密谋在俄罗斯境内搞破坏、支持恐怖主义活动、谋杀及网络诈骗,导致重大人员伤亡及数十亿美元财产损失,而“电报”管理方没有删除上述...
11:27
当代版 “ 焚书坑儒 ” 的判决出来了,但 “ 焚书坑儒 ” 成了里面最合法的一环。。。从 2024 年 8 月,到这个月 20 号,拉扯了快两年的 Anthropic 盗版书训练集体诉讼案,终于结束了。  法院最终批准,Anthropic 向原告支付 15 亿美元的天价和解金。这个数有多夸张呢,这么说吧,不看那些离谱的...
11:27
7 月 5 日下午的上海国际赛车场,是那种赛车迷会记很多年的下午。雨下下停停,赛道半干半湿。Formula E 电动方程式上海站的第二回合正赛在安全车带领下起步,发车顺序几乎在开赛前就被打乱——原本领跑车手积分榜的捷豹车手米奇·埃文斯,因为赛车疑似出现 DC/DC 电控故障,连发车都没能完成。而真正的主角,是从全场最后一位、第 20 位发车...
11:27
2024年,哈萨比斯(Demis Hassabis)凭借AlphaFold拿下了诺贝尔化学奖。两年不到,创造这一AI科学奇迹的核心团队,被解散了。据《金融时报》7月29日报道,Google DeepMind近期解散了负责AlphaFold研发的核心AI for Science(简称AI4S)团队。过去一年里,AlphaFold论文的大部分原...
11:23
智东西7月30日报道,今日,马斯克旗下SpaceXAI宣布推出新一代语音模型Grok Voice Think Fast 2.0,这是该公司迄今能力最强的语音到语音(speech-to-speech)模型。 马斯克连发两条推文,第一条宣布“Grok Voice现在在智能体性能方面排名第一”,第二条则直接喊话网友“试试新的Grok Voi...
11:23
智东西7月30日消息,今日凌晨,OpenAI四个大消息被放出: 1、OpenAI放出GPT-5.6开始优化“自己”的新进展:用GPT-5.6 Sol优化生产环境GPU内核,推理服务部署成本大降20%;优化推测解码技术,让token生成效率涨超15%。 2、AI自进化研究上,OpenAI或再招揽回一员大将:刚离职的美国AI独角兽Th...
11:23
2024年,哈萨比斯(Demis Hassabis)凭借AlphaFold拿下了诺贝尔化学奖。 两年不到,创造这一AI科学奇迹的核心团队,被解散了。 据《金融时报》7月29日报道,Google DeepMind近期解散了负责AlphaFold研发的核心AI for Science(简称AI4S)团队。过去一年里,AlphaFold...
11:23
那份流传又消失的梁文锋与投资人闭门交流实录中提到,DeepSeek现阶段最重要的重心在于Coding Agent。就在一个月前的火山引擎大会上,外界沉浸在豆包大模型Seedance达到全球SOTA水平的赞誉声中时,字节跳动表现得却有些心不在焉。火山引擎总裁谭待当时表示,内部始终将Coding视为核心方向。更耐人寻味的是,几天前IDC突然公布了一项关于AI编程...
11:22
微软凭借一份全面超出预期的财报,暂时平息了市场对于AI投资回报率的质疑。第四财季营收达900亿美元,Azure及其他云服务收入激增43%,两大核心指标均超预期。更重要的是,在Meta和谷歌持续加码的背景下,微软率先释放出资本开支收紧的信号,缓解了市场担忧。财报发布后,其股价盘后涨幅超过7%。 第四财季业绩全面超预期。数据显示,营收同比增长18%至900.07...
11:22
A股市场白酒板块今日全线飘红,表现抢眼。舍得酒业强势涨停,涨幅达10%;口子窖上涨6%;迎驾贡酒、酒鬼酒、洋河股份、山西汾酒等个股涨幅均超5%,古井贡酒、金种子酒等也跟随上扬。 此轮上涨主要受市场避险情绪升温驱动。近期美股及全球科技巨头因AI业务资本支出过高且回报不及预期,遭遇重挫,A股半导体、芯片及算力等前期高位科技股也面临获利回吐压力。相比之下,白酒板块...
11:22
7月29日晚,兆易创新连发五条公告,核心内容为董事长朱一明提议以10亿至20亿元回购A股股份并注销,同时承诺12个月内不减持,并计划增持不低于10亿元。消息公布后,7月30日A股高开逾3%但迅速回落,报366.96元,涨幅收窄至0.80%;港股表现更为积极,盘中涨超4%。 这种看似利好的反应实则暗藏疑虑。回溯不到两个月前,朱一明刚刚高位套现44亿元。兆易创新...
10:45
北京时间7月29日,据《华尔街日报》报道,硅谷正酝酿一股抵制Anthropic的风潮。这股浪潮的根源在于,Anthropic的产品不仅与现有软件提供商形成直接竞争,更大力倡导封闭式的AI生态系统。 与合作伙伴竞争 多位创业公司创始人、软件高管及AI研究人员表示,在Anthropic向市场推出对标现有服务的工具后,他们开始转向价格更低廉的AI模型。最典型的例子...