Kimi K3 近期终于公布了其技术报告,不仅详细介绍了模型架构,还深入探讨了关键的基础设施层面。如果把硬件比作手机,AI 比作应用,那么 AI 基础设施就是连接两者的操作系统,没有它,硬件便无法发挥作用。行业普遍认为,国产开源大模型未来的商业化将取决于厂商自部署能力,这其中的核心支撑点正是基础设施层面的技术积累与经验差距。OpenAI 核心工程师翁家翌也曾坦言,大模型训练的核心差距在于基础设施,工程师的主要工作就是给基础设施“修 Bug”。这意味着,当模型架构趋于同质化、数据复现门槛降低后,基础设施的工程能力将成为拉开训练成本、部署效率和运行稳定性的关键。Kimi K3 的报告虽然公开了许多细节,但出于商业考量,一定有所保留。这预示着不同公司部署 Kimi K3 时,可能会遇到一百种不同的运行效率问题。不过,既然公开了细节,我们就应当学习借鉴。对于非从业者而言,AI 基础设施往往是一个陌生的领域。因此,本文将结合 Kimi K3 技术报告中的有趣技巧,为大家科普 AI 基础设施的核心原则。

01 为什么基础设施重要?

首先,为什么基础设施如此重要?如前所述,翁家翌指出工程师的工作主要是修复基础设施 Bug。这里的 Bug 不仅包括导致计算错误或中断的传统 Bug,还包括那些虽然不影响数学正确性,却会导致 GPU 空闲、内存浪费、通信阻塞和吞吐量下降的系统性问题。具体来说,就是在保证计算逻辑正确的前提下,检查 GPU 是否被充分利用,是否存在不必要的重复计算,负载是否均衡,通信是否流畅。这些 Bug 最终直接影响集群的吞吐量,反映在训练效率上。模型浮点运算利用率(MFU)是评估训练效率的标准指标,它是“观测吞吐量”与“理论最大吞吐量”的比值。目前,大模型训练效率仍有很大提升空间。在公开可验证的万卡、千亿参数预训练案例中,字节跳动的 MegaScale 以 55.2% 的 MFU 保持着代表性的最高纪录之一。然而,今年 4 月出现的反面案例令人咋舌:据《The Information》报道,马斯克旗下 xAI 虽然坐拥约 55 万张英伟达 GPU,但其内部备忘录显示 MFU 仅为 11%,远低于业界 35% 至 45% 的正常水平,也不及 Meta(43%)和谷歌(46%)等竞争对手。拥有更高的训练效率意味着更短的训练周期、更低的成本、更多的实验机会以及更大的模型规模。

02 总体设计

其次,了解 Kimi K3 的总体分布式系统设计。其训练采用的并行方法包括流水线并行、专家并行和 ZeRO 分片等。简单来说,大模型训练包含大量串行过程,但矩阵计算是可以并行的,且单张卡的内存难以装下超大参数的所有数值。我们可以用盖房子来比喻:盖房子必须一步步往上盖(串行),但搬水泥和钢筋可以同时进行(矩阵并行)。为此,大模型通常从模型参数、训练数据和中间激活值等维度进行切分,分配到多张 GPU 上。例如,把模型的不同层放到不同 GPU 上依次计算,这叫流水线并行;把一层中的权重矩阵拆分到多张 GPU 上共同完成,这叫张量并行。张量并行需要频繁交换数据,对带宽要求很高。专家并行则针对 MoE 架构,技术报告显示其“MoE 层使用在各 EP rank 之间复制的共享专家”,意味着每个 GPU 都保存一份参数完全相同的共享专家以及不同的路由专家,让共享专家尽可能吸收数据中的共有特征。接下来,我们将深入探讨 Kimi K3 的核心架构机制:KDA、AttnRes 和 MoonEP,看看它们背后的基础设施优化原则。

03 KDA

再次,是混合 KDA 注意力机制。KDA 全称 Kimi Delta Attention,是一种线性注意力机制。标准注意力机制需要计算 Q、K、V,好比搜索引擎中先配对查询词和索引,再匹配内容,计算量随输入长度呈平方增长,限制了 Scaling Law。KDA 则先让 K 和 V 相乘,好比先总结网页内容,再由查询词匹配,计算量固定,与输入长度无关。KDA 继承了 Gated DeltaNet,增加了对记忆库的管控结构,使其能合理地忘记旧内容并记住新内容。但这引入了串行依赖,后一个 token 的状态必须等待前一个计算完成,容易导致 GPU 算力闲置。为了解决这个问题,月之暗面提出了 FlashKDA,将 token 分块计算,块内并行,块间串行。此外,Kimi K3 还采用了 KDA 上下文并行(KCP),在多 GPU 间独立计算状态转移,再合成历史信息,从而提升并行度。

04 AttnRes

接着是注意力残差 AttnRes 机制。标准残差连接是“输出 = 原输入 + 本层计算结果”,通过增量修改保持信息流动。但随着深度增加,前层贡献会稀释。AttnRes 使继承更加基于语义筛选。然而,这会增加内存负担,于是月之暗面提出了 Block AttnRes。它将神经网络层分为多个块,块内使用标准残差,块间使用注意力机制,研究表明约 8 个块能获得大部分性能优势。Block AttnRes 的优化策略包括:块表示只需计算一次并长期保留;前向传播时不保存注意力中间结果,反向传播时再计算(用计算换显存);利用流水线并行特性,将块表示按层顺序传递并缓存,避免重复传输。最终,显存中只保留当前时刻真正有用的数据,达到了“内存占用理论下限”。

05 MoonEP

最后,是 MoonEP 机制。在 MoE 架构中,每个 token 可能激活不同专家,导致各 GPU 收到的 token 数量不均,造成负载不均衡和内存碎片化,拖慢整体训练速度。MoonEP 的做法是直接给每个 GPU 分配相同的任务量,接收 S×K 个 token。每个 GPU 内部配置冗余专家,为高负载专家分摊计算任务。月之暗面证明,每个 GPU 只需固定数量的冗余专家(如专家总数 100,GPU 数 20,每个 GPU 最多 5 个),就能确保负载均衡。虽然精确应用此算法成本过高,但实际落地时采用了近似优化手段。

06 结语

综上所述,这三个技巧分别关注串行并行化、计算重复性和负载均衡,体现了一套贯穿系统的工程思维:凡是串行链条就寻找可并行拆解的部分,凡是重复计算就判断能否重算或缓存,凡是动态负载就转化为可预测的静态形状。AI 基础设施竞争并非简单堆砌 GPU,而是消除那些被默认接受的等待、复制和闲置。虽然 Kimi K3 公开的方法只是冰山一角,并非标准答案,但能帮助后来者少走弯路。最终,模型架构决定了能力的上限,而基础设施决定了这种能力能否以可承受的成本、稳定地变为现实。

最新快讯

2026年07月31日

12:23
鼓狮财经7月31日电,安徽省人民政府办公厅印发 《安徽省加快数智供应链发展行动方案 (2026—2028年)》,其中指出,推动批发业数智化集成。支持大宗商品、农产品、消费品等领域批发企业建设数智化平台,引导大型农产品批发市场及其他专业市场积极发展电子统一结算,整合商流、物流、资金流、信息流,构建集成开放的供应链服务体系,为上下游客户和产业集群提供原料采购、仓...
12:23
鼓狮财经7月31日电,安徽省人民政府办公厅印发 《安徽省加快数智供应链发展行动方案 (2026—2028年)》,围绕构建“1188”现代化产业体系,聚焦先进制造业产业集群培育,发展现代服务业,推动数智技术与供应链全链条深度融合。到2028年,培育50家左右省级数智供应链领军企业、2—3家国家级数智供应链领军企业,打造15个以上省级数智供应链平台、2—3家在国...
12:11
首个模型Inkling亮相之后,全新AI又刷屏了! 今天,Thinking Machines正式发布第二款重磅模型——Inkling-Small。 276B总参数、12B激活参数,原生多模态,100万token上下文 半个月前,首个开源975B Inkling登场,曾在AI圈掀起了巨浪。 Inkling-Small仅用四分...
12:11
亚马逊昨日发布了第二季度财报。尽管数据繁杂,但净利润达到626亿美元,远超华尔街预期。然而,透过表象看本质,财报中隐藏着明显的“猫腻”。其中534亿美元净利润源于投资收益,而非实际经营现金流。真正反映亚马逊造血能力的,是275亿美元的营业利润。这种“左手当房东,右手握期权”的模式,让经营利润增速与净利润增速出现了巨大的背离。 为何亚马逊股价在盘后逆势大涨超9...
12:11
过去一周,最受瞩目的话题之一,莫过于两位中国籍数学家邓煜和王虹荣获菲尔茨奖。巧合的是,这两位科学家的“次元壁”也被意外打破:王虹的社交头像使用了动画《跃动青春》中的岩仓美津未,邓煜则挂着《天才麻将少女》的角色。网友们翻遍了两人的过往,发现他们也是不折不扣的二次元爱好者。而今天的主角,正是二次元圈里的一位技术大佬——米哈游创始人蔡浩宇。 从少年时期凭借计算机动...
12:11
前不久,Claude Code 的高频用户 Garry Tan 在探讨如何利用 AI 编程智能体时,提出了一个极具传播力的观点:一个 Skill 文件犹如一名员工,而公司真正需要构建的,是一套由知识库、记忆机制和图书管理员组成的大脑。尽管模型本身足够聪明,但若想让它长期理解特定公司的业务流程与偏好,仍需不断补充 Skills,为其打造一个可反复调用的“头脑”...
12:11
日本央行宣布维持1%的目标利率不变,这一决定符合市场预期。此前该行已将基准利率上调至1995年以来的最高水平。值得注意的是,审议委员高田创对此持异议,主张加息25个基点。他认为当前经济形势已进入新阶段,央行需采取更灵活的策略,以应对物价上行风险及海外金融环境的变化。 日本央行同时表示,将继续根据经济、物价走势及金融状况逐步提高利率。目前基础通胀已接近2%,金...
12:11
7月30日,苹果公司正式发布2026财年第三季度(截至6月27日)财报。这份被外界视为库克告别演出的成绩单,虽整体亮眼,却暗藏隐忧。财报显示,苹果当季总营收达到1094.17亿美元,同比增长16%,创下公司历史上6月季度最高纪录;净利润为297.89亿美元,同比大增27%。然而,服务业务营收307.4亿美元,略低于预期的312.2亿美元;大中华区营收188亿...
11:52
在今日的发布会上,中国贸促会代表中国工商界,就欧盟加快出台《网络安全法》修订草案及《工业加速器法案》一事作出正式回应。针对前者拟在信息通信、能源、交通等18个关键行业全面排除“高风险供应商”,以及后者对外国企业投资和参与公共采购设置诸多限制的条款,中国工商界表达了深切关切。 业界认为,相关做法明显超出了维护安全的必要限度,与世贸组织基本规则、国际服务贸易承诺...
11:52
7月31日,国家发展改革委新闻发言人、政策研究室主任蒋毅在发布会上指出,将深入实施能源安全新战略,加速推进新型能源体系“十五五”规划及相关配套政策的落地见效,致力实现从“能源大国”向“能源强国”的历史性跨越。 蒋毅强调,始终要把能源安全置于首要位置,筑牢极端情形下的战略安全底线。在具体举措上,要强化煤炭的兜底保障功能,加大油气增储上产力度,提升能源进口的多元...