花旗半导体分析师Peter Lee认为,Kimi K3的发布触发了“杰文斯悖论”。简单来说,技术效率的提升降低了单位使用成本,但这反而可能导致资源总消耗不降反升。美银证券也持类似观点,认为更强的开源模型未必会削减巨头的算力投入,反而可能因为竞争加剧而推高成本。Kimi K3拥有2.8万亿参数,支持100万token上下文窗口,其低价高性能的特性引发了市场对芯片和内存需求变化的讨论。
**01 低价高性能,触发“杰文斯悖论”**
花旗将Kimi K3视为这一悖论的典型案例。其公开定价显示,缓存命中输入价格仅为每百万token 0.3美元,输出价格为15美元。花旗认为,低成本不会自动减少硬件需求,反而可能提高开发者和企业的调用意愿。特别是智能体任务,它不是一次性的问答,而是连续的生成与处理过程。这意味着调用次数、任务长度和token生成量的增加,会将单位成本的下降转化为总资源消耗的上升。
**02 长上下文推理,推高内存压力**
Kimi K3采用了Kimi Delta Attention、Attention Residuals和Stable LatentMoE等关键技术,大幅提升了扩展效率。虽然高稀疏度和长上下文能力降低了部分计算压力,但花旗指出,这并不意味着推理端资源压力消失。长上下文和智能体任务会显著增加KV Cache占用,进而加重内存负担。DDR5和eSSD因此成为关键受益者,因为高频存取和更大的缓存需求直接依赖于这些硬件。
**03 模型逼近,反而抬高算力门槛**
美银证券分析师Vivek Arya指出,更强的开源模型未必会让美国AI巨头削减投入,相反,模型差距的缩小会提高维持领先地位的门槛。如果开源模型持续逼近,OpenAI、Anthropic和Google等机构需要通过更大规模的训练、更重的推理和更快的迭代来保持差异化。这种竞争压力最终会传导至底层基础设施,包括GPU、HBM、高速网络和推理系统。
**04 MoE架构改变瓶颈,关注互连与显存**
MoE(混合专家)架构虽然将总参数量与实际激活参数分离,减轻了部分计算压力,但也将基础设施的瓶颈从单纯的算力转移到了显存访问、专家路由、响应延迟和互连能力上。美银证券强调,现代MoE推理需要更高效的调度和数据搬运能力。英伟达GB300 NVL72等基础设施在优化后,每瓦性能可大幅提升。CoreWeave的测试也表明,开源MoE模型若要保持领先,仍需依赖优化的高性能硬件集群。
**05 Token使用仍在扩张,需求端未见顶**
数据显示,AI模型的调用量仍在快速增加。OpenRouter作为第三方API平台,其上的token使用量持续增长,其中中国AI实验室模型的占比已超过非中国实验室。企业付费订阅率也在上升,数据显示约55%的美国企业已付费订阅AI工具。虽然AI支出仍集中在头部企业,但整体处于扩散阶段。低价模型降低的门槛,有望带来更多开发者、企业和智能体应用的增量需求。
**06 从“更省算力”转向“更多工作负载”**
花旗和美银证券的共同结论是:Kimi K3的意义不在于单一模型降低了单位推理成本,而在于低成本是否释放了更大规模的工作负载。对花旗而言,服务器DDR5和eSSD是直接受益者;对美银而言,GPU、HBM、高速网络和推理系统更为关键。随着模型调用量扩大,这些环节将成为竞争的焦点。此外,美银还提到,关于“45纳米开源EDA”的讨论不应简单理解为商业EDA被替代,这反而说明芯片设计依然离不开EDA工具的支持。
