《科创板日报》7月28日报道,月之暗面发布了其迄今为止最强大的模型——Kimi K3。7月27日晚11点,月之暗面正式公开了Kimi K3的模型权重、技术报告以及支撑其训练的关键基础设施代码,包括MoonEP、FlashKDA和AgentEnv。这意味着,无论是用于内部研发还是嵌入面向终端用户的产品,任何人都可以下载并部署Kimi K3。
Kimi K3于7月17日凌晨发布,拥有2.8万亿参数,属于混合专家架构。它具备原生视觉理解能力,支持100万token的超长上下文窗口。作为全球首个开源的3万亿级别模型,Kimi K3专为长程编程、知识工作及推理等前沿智能场景打造。
Kimi K3开源后迅速引发广泛关注。Hugging Face CEO Clem Delangue发文称,Kimi K3在30分钟内收获了超过4000个点赞,登顶趋势榜,创造了“迄今为止最快的发布增长速度”。同日,多家AI生态公司宣布接入Kimi K3。
在国内,华为昇腾CANN宣布支持Kimi K3部署,其Atlas A3产品可充分发挥昇腾超节点架构优势,趋境科技也完成了基于SGLang的Day0推理适配。阿里云方面,其真武M890超节点实例已实现Day0适配,双方将进一步展开国产算力合作,千问AI平台和阿里云百炼也将提供Kimi K3的模型API。
在国外,Nebius、Baseten、Fireworks等基础设施厂商也宣布了Day0适配。Cursor已引入Kimi K3;Cognition(Devin的开发者)表示Kimi K3已接入其桌面客户端和命令行工具,并在Frontier Code1.1评测基准上,成为首款性能逼近前沿水准的开源模型。
随着Kimi K3模型权重的公开,其47页技术报告及训练方法也一并发布。技术细节包括:KDA+AttnRes以3:1比例混合KDA与GatedMLA,实现高效长上下文建模,并通过块级注意力残差增强跨层信息流动;Stable LatentMoE每个token从896个路由专家中激活16个,通过SiTU-GLU与Quantile Balancing保持极高稀疏度下的训练稳定;MoonViT-V2视觉编码器从零开始使用next-token prediction训练,无需对比预训练,在达到SigLIP初始化基线效果的同时获得更稳定的优化过程;后训练与评估则在通用推理、通用Agent和编程Agent三大领域进行大规模任务合成,建立百万token上下文的强化学习基建,并完成了近20个内部评测集的评估。
模型能力背后,离不开训练系统的支撑。月之暗面详细介绍了支撑Kimi K3训练的三项Infra基础设施技术:MoonEP、FlashKDA和AgentEnv,覆盖了从高性能通信、高性能算子到分布式RL环境的关键链路。MoonEP是专为超大规模细粒度MoE设计的高性能通信库,让专家并行的通信在不均衡情况下仍实现极致效率;FlashKDA是KimiDelta Attention高性能算子,在英伟达H20上相比flash-linear-attention基线,prefill速度提升1.72至2.22倍,可直接作为替换后端;AgentEnv是与KVCache.ai合作开发的沙箱系统,用于大规模运行Agent环境,为Kimi K3的后训练提供高保真、强隔离的沙箱环境,支持快速快照、恢复和分叉。
开源模型正式迈入3万亿参数时代,将持续拉动云服务和算力基础设施的需求。黄仁勋于7月24日在X平台转发由a16z发起、英伟达等多家公司签署的公开信,主张“前沿开源模型与前沿闭源模型应并存发展”,认为开源模型具备安全、创新及AI自主主权价值,将同步推动云与算力基础设施需求的增长。
国金证券分析认为,Kimi K3作为全球首个开放3T级模型,拉开了开源大模型3T时代的序幕。3T级别模型推动行业部署架构转向超节点集群,国产AI芯片迎来发展机遇。Kimi K3官方要求至少64卡集群才能实现高效推理,2026年WAIC展会期间,华为昇腾、沐曦等国产芯片厂商将集中推出大规格超节点产品。3T模型将竞争从单卡性能延伸至芯片、高速互联、整机集群及推理软件栈的一体化系统能力,具备完整生态适配能力的厂商将充分受益。
国盛证券看好开源模型能力大幅跃迁将抬高全行业“底线水位”。他们认为,当下游应用开发者能以更低成本获取近前沿能力时,应用渗透与Token消耗将加速。配置建议上,看好具备真实场景和数据壁垒的应用/Agent链;优选具备自有生态与商业化闭环的平台型厂商(如阿里、腾讯、智谱、Minimax);以及开源放量拉动下同步受益的训练与推理需求及国产算力链。
