自从 Kimi K3 开源以来,部署大模型便成了网络热议的话题。这款模型在全球性能中排名第三,且完全免费下载,这无疑让人心动。然而,根据网传的部署方案,想要独自搞定 Kimi K3,大约需要投入 3000 万元人民币的硬件设备。
毕竟 Kimi K3 的总参数高达 2.8 万亿,仅权重文件就达到了 1.4TB 至 1.5TB,实际运行所需的显存更是超过 2TB。因此,Kimi 官方给出的建议是,至少需要拥有一个包含 64 张加速卡的超算节点才能进行部署。以目前市场主流的 B200 型号为例,单卡价格约为 40 万元人民币,64 张显卡的总价约为 2560 万元。此外,普通居民楼的地板无法承受如此沉重的设备,必须专门建设机房,还需考虑设备运行及配套液冷设备的电费。可以说,如果铁了心要自己部署 Kimi K3,前期投入至少相当于两辆劳斯莱斯幻影。
然而,即便你手眼通天,真的搞定了所有设备,想要亲自部署 Kimi K3 也绝非易事。后续等待你的还有电费、散热、模型调优、运维等一系列开销,每一项都是一笔巨款。
除了 Kimi K3,国产开源大模型还有许多,如 DeepSeek V4-Pro、GLM-5.2、Qwen 3.8,它们个个都是千亿甚至万亿参数级别的选手。那么它们的部署成本又是多少呢?
实际上,“普通人想自己跑大模型”这件事并非近期才出现,只因 Kimi K3 出圈才再次引发热议。早在 DeepSeek V3 发布时,就已经有许多人讨论普通人如何部署大模型了。
2024 年底,DeepSeek V3 以 6710 亿总参数、370 亿激活参数的 MoE 架构开源,训练成本仅 557 万美元,性能却比肩 Claude 3.5 Sonnet。一时间,知乎、B站、公众号里铺天盖地全是“手把手教你本地部署 DeepSeek V3”的教程。有人拿 RTX 4090 硬扛,有人把家里电表跑跳闸,甚至有不谙技术的亲戚都在问“DeepSeek 是什么,怎么用”。那阵势,像极了当年比特币行情启动时,人人都在聊怎么用笔记本挖矿。
但热闹归热闹,真要把 V3 完整跑起来,推荐配置是 8 张 H100 或 A100。H100 单卡官方定价 3.65 万美元,折合人民币约 26 万,A100 单卡约 10.8 万人民币,8 卡整机也要 80 万以上。要知道,高配版的宝马 X5、奔驰 GLE、奥迪 Q7,落地价也才 70 多万。还有,网上那些所谓的“RTX 4090 本地部署”教程,跑的是量化到面目全非的 4 位精度阉割版。输出的答案不仅质量低,而且有严格的字数限制,一旦超过几百个字,模型就会瞬间崩溃。普通人想要跨越千亿参数的距离,远比教程里写的“5 分钟搞定”要遥远得多。
到了 2026 年,局面就更夸张了。2026 年 4 月 24 日发布的 DeepSeek V4-Pro,总参数 1.6 万亿,MIT 协议开源,权重放在 Hugging Face 上免费下载。即使使用 FP8 精度量化,权重文件也得 1.6TB 起步。要把它完整装进显存,至少需要 16 张 H200。H200 单卡 141GB 显存,16 张合计 2.2TB,扣掉 KV 缓存和系统开销,刚好够用。H200 英伟达官方定价为单颗 2.7 万美元,折合人民币约 19 万,但国内报价 23.5 万,8 卡整机报价 188 万,16 张就是 376 万。
再看 2026 年 6 月 17 日智谱开源的 GLM-5.2,总参数约 7530 亿,激活参数更小。同样也只需要 8 张 H200 就能跑得起来。最后是 Qwen 3.8。2026 年 7 月 19 日阿里发布预览版,总参数 2.4 万亿,承诺即将开放权重。要完整装下 2.4 万亿参数,H200 的 141GB 显存已经不够看了,得上 B200,单卡 192GB 显存,64 张 B200 合计 12.3TB,才能撑住这个体量。换句话说,想要部署 Qwen 3.8,也得跟前面提到的 Kimi K3 一样,准备 3000 万。
然而事情到此还没完,甚至它还只是刚刚开始,显卡只是第一笔账。接下来是电费。以 Qwen 3.8 的 64 张 B200 为例。B200 单卡 TDP 是 1000W,液冷版能拉到 1200W。64 张卡满载就是 64 千瓦到 77 千瓦,再加上 CPU、网络交换机、散热泵等周边功耗,整机柜轻松突破 80 千瓦。一台 1.5 匹家用空调制热功率大概 1200W,一张 B200 就快赶上一台空调了。64 张 B200 满载运行,相当于同时开 50 多台空调,顶得上半栋居民楼的用电量。按工业用电每度 0.8 元算,80 千瓦满载运行,每天电费就是 1536 元,一年 56 万。这还是不停机的情况,大模型推理服务器一旦上线,基本就是 7×24 小时运转,没有“关机省电”这个选项。
电的问题说完了,热的问题紧跟而来。B200 单卡 1000W 的功耗,意味着传统的风冷散热根本压不住。英伟达官方表示,B200 的 SXM 版本从设计之初就是奔着液冷去的,风冷版本性能上限只有 18PFLOPS,液冷版本能跑到 20PFLOPS。而液冷设备又可以分为两种,第一种是英伟达认证,市场价格大约每一机柜 15 至 20 万人民币,第二种是非英伟达认证,大约每机柜 8 至 15 万。
空间也是个问题。一台标准的 8 卡 HGX 服务器,高度为 6U 到 8U,1U 为 44.45 毫米,因此高度可以理解为 0.267 米至 0.356 米。然后裸机普遍 75 至 120 公斤,满配、带导轨、线缆、PDU,整机通常超过 90 公斤。但一个机柜底座面积很小,通常为 0.36 平方米。普通住宅的均匀活荷载为 200 公斤每平方米,这就意味着,一个机柜的局部压强,远高于民用常规设计,因此没办法放进普通住宅之中。此外,这种设备对环境温度、湿度、灰尘也有严格要求,若无法严格管控,会有包括冷却液外露等风险。
最后还有运维。大模型部署不是“装个软件”这么简单。模型权重加载、推理框架调优、KV 缓存策略配置、监控告警、日志排查、故障恢复,每一个环节都需要专业工程师。至少需要一个 3 到 5 人的小团队。按目前行情,一个合格的 AI 基础设施工程师年薪 30 万起步,一个小团队一年的人力成本就要超过百万。
钱不能解决所有问题。价格只是一方面,接下来这些,才是真正让人感到无力的部分。英伟达的高端卡对中国有出口管制,这不是什么新闻了。美国工业与安全局明确规定,基于 Blackwell 架构的 B200、B300 以及下一代 Rubin 系列芯片,在国内发布后至少 18 到 24 个月内仍严格禁止向中国出口。好在的是,由于咱们只是拿模型跑,而不是训练大模型,所以只需要考虑 GPU 的推理能力就行。而推理这件事,国产 AI 芯片同样也能干。但话又说回来了,能跑是一回事,好不好用是另一回事。英伟达的 CUDA 生态经过十几年积累,全球开发者几百万,Stack Overflow 上你能搜到的答案浩如烟海。但是在国产 AI 芯片这边,虽然 DeepSeek V4 做到了全栈国产化训练,8 大国产芯片厂商也都做了 Day 0 适配,Kimi 也宣布在未来能跑在国产卡上,但这是 DeepSeek 和 Kimi 官方团队的工程能力。你一个民间玩家拿到国产卡,CUDA 上一天能跑通的东西,国产卡上你得等一段时间才能拿到适配。出了报错,你没办法到 Stack Overflow 上找答案。软件生态的差距,比硬件性能的差距更让人绝望。硬件慢,你可以等;软件跑不通,你连等的资格都没有。
退一万步说,就算你路子野,搞到了卡,搞定了液冷,扛住了电费,养起了团队,把模型跑起来了——然后呢?你拿这套东西和官方 API 比一比就会发现,99% 的公司自建永远不回本。我们拿 DeepSeek V4-Pro 的最低配方案来算一笔账。DeepSeek V4-Pro 的 API 定价,输入每百万 token 3 元(缓存命中仅 0.025 元),输出每百万 token 6 元,还首创了“峰谷分时计费”,谷时算力费直降 60%。不考虑峰谷的差价,假设你团队每天调用 5000 万 token,其中输入 3500 万、输出 1500 万,这已经是一个相当高频的使用量了。输入费用为 35×3=105 元/天;输出费用为 15×6=90 元/天。每天合计不到 200 块钱,一年约 7 万。前面说了,16 张 H200 光显卡就是 376 万,加上液冷改造 30 万、电力增容和场地改造 30 万,硬件首年投入约 436 万。再算运维,一个小团队一年人力百万,电费按 16 张 H200 满载约 11.2 千瓦、24 小时运转,整台服务器还要算 CPU、内存、硬盘、风扇,加上数据中心 PUE,实际取电功耗大概在 15 至 20 千瓦左右。按工业用电 1 元/度算,一年电费应该在 13 万到 18 万之间。也就是说,不算硬件折旧,光是“养”这套系统,每年就要烧掉 120 多万。硬件按 5 年折旧,合计自建每年成本超过 200 万。大模型推理成本的核心逻辑是模型规模越大,推理越贵,然而 API 厂商靠规模效应摊薄成本的能力,远超任何单一企业。DeepSeek、Kimi、阿里这些厂商,一张 GPU 上跑着几百个用户的请求,批处理、KV 缓存复用、投机解码、动态路由,每一项技术都在榨干每一滴算力。Kimi K3 靠着缓存命中率超过 90%,命中后输入成本直接降到标准价的四分之一。你自己部署,一张卡就伺候你一个用户,GPU 利用率可能连 10% 都到不了。老老实实用 API,不丢人。
你下载的模型和官方的模型是两回事。就算你路子野,搞到了所有需要的设备,而且你花了好几个通宵终于成功地在你自己的设备上部署了想要的大模型。那么恭喜你,你跑出来的那个东西,和官方 API 里的那个东西,压根不是同一个物种。为什么?因为你能下载到的,只是权重文件。权重文件是模型的“记忆”。模型在训练过程中学到的一切,比如语言规律、知识、逻辑、甚至某种程度上的“常识”,全都以数字的形式存在这些权重里。然而模型权重不是一个数据库,它是大模型理解问题的方式,你可以把模型权重理解成为一个“分量”。怎么判断一张照片里是不是猫?可能会看脸、有没有胡子、身上有没有毛、有没有尾巴……脸是最重要的,猫科动物的脸长得都差不多,但是有没有尾巴和有没有毛就不那么重要,很多动物都有尾巴和毛。不同特征的重要程度(权重)就是它在大模型中的分量。但一个模型从“权重文件”变成“好用的 AI 服务”,中间隔着一整套你拿不到的工程。
首先是推理优化框架。DeepSeek 官方跑 DSpark 投机解码,靠半自回归生成和置信度调度验证,在不损失质量的前提下把推理速度提升 51% 到 85%;Kimi 有自研的 Mooncake 架构分离式推理。这些框架对模型的结构做了深度定制优化,知道哪个专家该走哪条路径,哪个层可以做算子融合,哪些计算可以跳过。你拿到的权重文件只是一个“裸”的模型,性能和官方的差出一个数量级都不稀奇。
然后是 KV 缓存策略。大模型每生成一个字,都要把前面所有的内容重新“理解”一遍,这个中间结果叫 KV 缓存。官方服务会管理这些缓存,比如多个用户问了相似的问题,那么这些缓存就可以复用;高频请求的内容,缓存提前预热;内存紧张时,哪些缓存该淘汰、哪些该保留,全有精细的路由算法。Kimi K3 靠着缓存命中,命中率超过 90%,命中后输入成本直接降到标准价的四分之一。你自己跑,没有这套缓存策略,每个请求都从零开始算,慢且贵。
还有动态批处理。官方服务会把不同用户的请求动态打包成一个 batch,一次性丢给 GPU 处理,GPU 的并行计算能力被压榨到极致。你自己一个人用,一次就一个请求,GPU 99% 的算力在空转。这就好比买了一辆大巴车,却只有你一个人坐,油钱一分不少,座位空了 95%。
推理优化、KV 缓存策略、动态批处理、路由算法,这些真正决定体验的东西全是闭源的。就像餐厅把菜谱给你了。菜谱上写着用多少盐、放多少酱油、几成热油下锅。你照着做,能做出一盘能吃的菜。不说别的,可口可乐的配料就写在瓶子上,有谁能拍着胸脯说它能在可口可乐的价格之内完美复刻可口可乐的味道呢?模型也一样。自己下载的权重,和官方 API 里跑的那个模型,虽然参数一模一样,但背后的推理框架、缓存策略、批处理优化、路由调度,差了十万八千里。你问它同一个问题,官方的回答又快又好,你的又慢又有幻觉。
所以,得稍微掂量掂量自己的实力再考虑部署。如果是企业,有数据合规需求、有数据安全要求、有定制化微调的需要,那确实有自建的理由,但那是企业级的事,有专门的团队、专门的预算、专门的机房。如果是普通老百姓,看着开源模型免费下载就心动了,想在家里搞一套“自己的 AI”,那我觉得还是省省吧。一个月 99 块钱,买个 Moderato 级别的 Kimi 订阅,就能用上全球第三的模型。开源是好事,但开源不等于“免费部署”。从入门到放弃,这才是老百姓部署开源大模型的真实距离。
