AI大模型正变得愈发智能,但支撑其运行的物理世界却已逼近极限。花旗于7月24日发布的最新研报显示,月之暗面的Kimi K3以57分的成绩跻身全球第三,仅落后于闭源榜首Claude Fable 5三分。与此同时,以Kimi K3为代表的中国前沿模型定价一周内暴涨45%,Blackwell架构GPU的租金年初至今上涨27%,甚至有实验室斥资10亿美元直接购入发电机组。
花旗分析指出,AI行业的投资回报正加速向基础设施层转移;而下一阶段的模型竞争护城河,也将从单纯的“算力获取”彻底转向“高效产出与专有数据”。
01 差距仅剩三分
花旗在研报中提及,Kimi K3是目前公开发布的参数量最大的开源模型。几周前,开源模型的最高分还停留在51分(Z.ai GLM-5.2),Kimi K3一举跃升至57分,仅次于Claude Fable 5(60分)和OpenAI GPT-5.6 Sol(59分)。
整个行业都在加速狂奔。前20大模型提供商的中位智能得分从六周前的34分升至43分。在开源阵营中,DeepSeek V4 Pro(44分)的定价仅为0.03,小米等厂商的定价更低——其智能水平已接近前沿,价格却低了两个数量级。
闭源阵营同样没有放慢脚步。Google于7月21日发布了Gemini 3.6 Flash,同时透露Gemini 3.5 Pro仍在测试中,而Gemini 4的预训练工作已经启动——三代模型三线并进。不过,花旗认为,“Flash先发、Pro延后”的发布节奏释放出一个信号:前沿模型的推进正变得更加困难——这与各公司在基础设施建设上遭遇的延误相一致,也折射出行业希望压缩交付周期却难以如愿的现状。模型越大、越强,运行时所需的资源也在急剧膨胀。
02 瓶颈转移
万亿参数模型正在改写“算力”的定义。
花旗指出,这些超大模型在实际运行时,越来越多的时间花在跨HBM内存和GPU互联网络搬运权重及KV-cache数据上,而非矩阵运算本身。瓶颈已经从“算得快不快”(FLOPs)转向了“搬得动搬不动”——即内存带宽、GPU互联和电力供应。
尽管GPU需求依然旺盛,Blackwell架构租金年初至今上涨27%,但单纯堆砌GPU已经不够了。部分实验室开始直接切入上游发电环节:SpaceX斥资10亿美元购买1GW移动涡轮机组(7月15日),Georgia Power同周签署了相关服务协议(7月22日)。AI实验室购买发电设备——这一在一年前几乎不可想象的事情,如今正在发生。
模型定价直接反映了产能的紧张程度。中国前沿模型的混合定价从每百万token跳涨至0.87,周环比和月环比均上涨45%,是两个月来首次大幅波动。全球前沿模型均价周环比上涨6.8%,月环比上涨11.3%。美欧市场相对稳定(周环比-0.5%),但月环比也上升了4.1%。
花旗判断,随着增量基础设施陆续上线,定价压力终将缓解。届时,有价值的数据和任务特定性能,将比算力获取构成更持久的护城河。
03 Agent突破沙箱
模型在变强,但跑在模型上的Agent也在变得更危险。花旗报告用了一个耐人寻味的表述:自主AI Agent突破沙箱的现实风险,已从4月的“打断午餐”升级到7月的“渗透Hugging Face基础设施”。
开源模型越强、越普及,安全风险的扩散面就越大。AI监管辩论仍在进行——英伟达(7月24日)和美国财长贝森特(7月22日)近日均有表态——但短期内难有定论。即便监管框架尚未落地,维护自有模型运行架构的企业已面临更高的合规门槛。
更棘手的是,训练这些模型的提供商自己,仍然无法完全检视模型为何如此行动。可解释性问题,至今没有解决。
然而,安全隐忧并没有减慢Agent的商业化进程。METR(7月21日)的数据显示,AI Agent与人工之间的经济性差距正在收窄。当Agent更自主、更接近经济可行性时,token消耗会持续加速——这又反过来推高基础设施需求。
能力越强,约束越紧。约束越紧,基础设施需求越大。这个循环,没有减速的迹象。
