Kimi 创始人杨植麟。图片经由 AI 生成。Kimi K3 最近大火,美国科技圈的一些人开始反思:为什么杨植麟卡内基梅隆博士毕业后,不留在美国创业?
作为年度最强开源模型,Kimi K3 的参数量达到了 3T 级别,并在各大基准测试中“屠榜”,一部分榜单表现甚至超越 Fable 5 这种美国实验室的最前沿模型。在算力不足的情况下,通过算法、工程的优化,叠加参数的扩展,不仅追上前沿闭源模型的性能,打破 Scaling Law“撞墙”一说,甚至还引发了一部分硅谷巨头的焦虑与恐慌。OpenAI 战略负责人迪恩·W·鲍尔说:“开源模型会阻碍人工智能领域的进一步资本支出。”
这不难理解,大家都在探索 AGI,你来做的话需要 10 块钱,而别人只需要 1 块。那么,你就需要论证多出来的 9 块钱的必要性、合理性。对于年度资本开支 7000 亿美元的硅谷巨头来说,如果答案是否定的,人工智能产业将迎来一轮史无前例的“泡沫破裂”。
不过,“搅局”的同时,Kimi 很快遇到了自己的第一个难题:算力焦虑。
**01、一封充满算力焦虑的信**
7 月 19 日晚间,Kimi 发通知信暂停新用户接入,暂时性关上了新用户体验 Kimi K3 的通道。通知信大意是:热度高、需求超预期、存量算力不够且逼近极限。不得不暂停 C 端新用户订阅,将已有算力分配给存量用户,直至新算力到位再陆续开放更多订阅名额。
“暂停”增量用户接入与“Token Plan”限售,虽然都源于算力紧缺,但二者略有不同。过去,国内模型推理算力不够,通过“Token Plan”限售的方式开一个口子提供服务,起码意味着有供给空间,也能够在后续通过 API 接入转化重度用户。直接“暂停”接入,把增量用户拒之门外,意味着算力供给上没有任何腾挪的空间,可见现阶段 Kimi 的算力紧缺程度。
“它自己的算力都没法批量获取,现在这么多用户想用都没法开通付费账户,这严重影响商业变现和用户口碑。”一位资深科技投资人说。
长期关注中国科技产业发展的上海财经大学教授胡延平认为,Kimi 暂停新用户接入的原因是算力准备不足,而非 ROI 没有转正。“因为算力约束,接不住泼天的用户,目前比 ROI 转正更重要的是接住用户。”
关于 ROI 的问题,胡延平认为只从“算力/token”来看问题,有可能出现用户 token 消耗越多亏损越大的情况,只有从“算力成本效率/token”来分析,才能看清算力约束的真实涵义。
“类似 Kimi 接不住用户这种情况,除了需要有更合理的资费、更多的算力卡,更重要的是要有能效比、量效比更高的算力卡和算力集群。”一位接近 Kimi 的知情人士透露,暂停新会员订阅后,找算力成为他们的头号任务。
“我们已经在非常努力地通过模型性能的优化和算力供给来解决问题。”Kimi 企业业务负责人黄震昕日前在沟通会上说。
Kimi 在寻找算力的同时,智谱 1GW 纯国产算力的消息却被释放出来。这也引发多位国产算力从业者的讨论,核心在于智谱从哪里能够获得如此天量规模的算力。以刚刚在 2026 世界人工智能大会上亮相的华为昇腾 Atlas 950 超节点为例,仅按 64 卡机柜 100KW 功耗上限来换算,不考虑交换等设备,1GW 相当于 10000 个 Atlas 950 机柜,即 640000 张 NPU。再假设单卡价格是 20 万元,整个 1GW 的订单,仅算力部分就将超过 1200 亿元。即便考虑国产卡价格差异,按照平均单价 10 万元算,1GW 纯国产算力,也将是一笔超 600 亿元的算力大单。若消息准确,对国产算力来说将是一个巨大利好。
**02、先找路,再找钱**
“从目前披露的信息看,K3 暂未呈现出范式级的全新架构。”期智研究院研究员李彪告诉腾讯科技。KDA 和 AttnRes 此前已有论文,本次更值得关注的是将这些模块与极稀疏 MoE、低精度训练和大规模并行系统整合,并扩展到 2.8 万亿参数。
“由于 K3 完整技术报告尚未发布,目前仍难以评估其全部技术增量。”李彪补充说。
《Kimi K3 不是中国的 Fable 5》一文中提到,KDA 让序列计算更便宜,AttnRes 让深度信息流更智能,Stable LatentMoE 让参数容量更庞大——三者共同构成了 Kimi K3 的架构骨架。算得更省、流得更顺、装得更多,共同成就了 2.8 万亿参数的 Kimi K3,以及它在开源生态和整个大模型领域的影响力。
“Kimi K3 再次说明‘size still matters’。”李彪强调说。
他认为,模型规模仍是提升前沿能力的重要变量,但规模能否有效转化为能力,取决于架构、数据配比、优化方法和基础设施的共同配合。“对于 2.8 万亿参数的极稀疏 MoE 模型,当前更显性的工程约束来自功耗、通信开销、专家负载均衡和集群可靠性。从其能够支撑 2.8 万亿参数 MoE 训练来看,Kimi 应该在底层基础设施上做了不错的优化。”
另一位学术研究员也认同训练过程中基础设施、工程能力的重要性,“大家思路都大差不差,归根结底变成软件工程了。”
前述科技投资人告诉腾讯科技,中国公司再一次在较短时间内把开源模型推到接近全球闭源旗舰模型的水平,“我觉得还是非常厉害。它给我的冲击是 Scaling Law 还在继续;当前最前沿的模型训练配方,中国公司也可以快速掌握。”
如果把上述研究员、有投资人的观点综合到一起,可以归结为:Kimi 通过基础设施、工程的手段,找到了一条持续 Scaling Law 的路,这不仅是 Kimi 自己的路,也是中国开源模型生态的路。
所以,Kimi K3 亮相后不久,2.4 万亿参数的 Qwen 3.8 预览版也宣布上线了。当可靠的 Scaling Law 路径有了,剩下就是找钱的问题。
在一级市场,过去半年 Kimi 一直是“当红炸子鸡”,融资相关的传闻不断。根据外媒披露的数据,Kimi 计划 8 月启动上市前最后一轮融资谈判,目标估值为 500 亿美元。这相当于 DeepSeek 的上一轮融资完成后的估值。同期,Kimi 也拆 VIE 架构,加速赴港上市流程,冲击继智谱、MiniMax 之后在港股上市的“大模型第三股”。
如果时间倒退至 2025 年 12 月 31 日,彼时杨植麟发内部信确认完成了 5 亿美元的 C 轮融资。“当前现金持有量超过 100 亿元。相比于二级市场,我们判断还可以从一级市场募集更大量资金,事实上,我们 B/C 轮融资金额就超过绝大部分 IPO 募资及上市公司的定向增发。所以我们短期不着急上市。”杨植麟在内部信中说。
资料显示,Kimi 的 C 轮完成后,投后估值 43 亿美元,对比外媒报道最新的 Pre-IPO 轮 500 亿美元估值,半年涨幅近 12 倍。半年之前,杨植麟判断可以从一级市场拿到更多的钱,这个点后续被时间验证了,但 100 亿元的现金在 7 个月之后,在 Kimi K3 被迫暂停新用户接入之后来看,显然不够用。
**03、中国芯片的第二场战争**
“Kimi K3 目前证明的是技术能力进入前沿,还没有完全证明推理经济性、产品体验和商业模式同样成立。”前述科技投资人说。
根据 Artifacial Analysis 的“智能指数”评测,Kimi K3 在全部 9 项测试中总共产生了约 1.3 亿个输出 Token,高吞吐量导致跑完整套评测的总账单高达 2709.75 美元。相比之下,同类参评模型的中位数仅为 6300 万个。
拆分成单一任务,Kimi K3 的平均花费仅为 0.94 美元,GPT-5.6 Sol 为 1.04 美元,Claude Opus 4.8 为 1.8 美元。单看定价,Kimi K3 的 token 已经不便宜了。而 Kimi 自身关于这个问题的解释是:中国开源模型不应该被贴上性价比标签,SOTA 模型应该有自己的定价权。
不过,对于用户而言,追逐性价比就是追逐更高经济性。放在 Kimi K3 身上,如果 Token 输出量压缩一半,那么成本也就对应会压缩一半。这与胡延平教授提出的量效比高度一致。
他说,如果不考虑量效比,长期竞争会是问题,“某些时间点会出现 token 不经济”。
胡延平以英伟达为例,强调在 H200 上,token 的 ROI 下可能是亏的,但升级为 B300 可能分分秒秒都是“印钞机”。这其实给国产算力提出了一个新的要求,既要给国产模型保证算力供给,也要在硬件层面释放 token 的经济性。
SemiAnalysis 5 月份报告显示,在 MiniMax-M2.5 的 8K/1K 负载下,B200 NVFP4 凭借硬件与内核优化,在高吞吐交互下(单用户速度提升至 110 tok/s/user),每百万 token 为 0.09 美元。作为对比,H100 FP8 在统一的条件下,每百万 token 0.74 美元,实现了超过 8 倍的每美元性能提升(性价比)。
高交互负载下,B200 NVFP4 较 H100 FP8 运行 Minimax 2.5 成本对比。
关于国产算力的进化,今年的世界人工智能大会(WAIC)出现了一些比较好的趋势。最典型的就是 2025 年的华为 CloudMatrix 384 和 2026 年的 Atlas 950 两代超节点的进化——单柜从 32 卡到 64 卡,计算密度翻倍;计算柜也从 12 个增至 16 个。机柜内部采用高密度铜缆电互联,机柜间采用全光互联,从支持千亿参数模型的训练,扩展至万亿参数模型的低精度训练和混合推理。
这种变化,不去现场看,不做对比,很难直观地感受到差异。《2026,中国芯片为国产模型“托底”》里提到了国产算力进化背后的一些花絮,其中最具代表性的是国产算力从业者都表现出了不同程度的喜悦、开心,这里面有几个原因:公司上市,很大一部分员工获得了股权激励;同时,市场开始为中国芯片重新定价,逐步放大这种财富效应。
如果说上市是中国芯片的第一场战争,那么接住国产大模型的需求,为其 token 成本托底,将成为关键的第二战。
