Kimi K3 近期终于公布了其技术报告,不仅详细介绍了模型架构,还深入探讨了关键的基础设施层面。如果把硬件比作手机,AI 比作应用,那么 AI 基础设施就是连接两者的操作系统,没有它,硬件便无法发挥作用。行业普遍认为,国产开源大模型未来的商业化将取决于厂商自部署能力,这其中的核心支撑点正是基础设施层面的技术积累与经验差距。OpenAI 核心工程师翁家翌也曾坦言,大模型训练的核心差距在于基础设施,工程师的主要工作就是给基础设施“修 Bug”。这意味着,当模型架构趋于同质化、数据复现门槛降低后,基础设施的工程能力将成为拉开训练成本、部署效率和运行稳定性的关键。Kimi K3 的报告虽然公开了许多细节,但出于商业考量,一定有所保留。这预示着不同公司部署 Kimi K3 时,可能会遇到一百种不同的运行效率问题。不过,既然公开了细节,我们就应当学习借鉴。对于非从业者而言,AI 基础设施往往是一个陌生的领域。因此,本文将结合 Kimi K3 技术报告中的有趣技巧,为大家科普 AI 基础设施的核心原则。

01 为什么基础设施重要?

首先,为什么基础设施如此重要?如前所述,翁家翌指出工程师的工作主要是修复基础设施 Bug。这里的 Bug 不仅包括导致计算错误或中断的传统 Bug,还包括那些虽然不影响数学正确性,却会导致 GPU 空闲、内存浪费、通信阻塞和吞吐量下降的系统性问题。具体来说,就是在保证计算逻辑正确的前提下,检查 GPU 是否被充分利用,是否存在不必要的重复计算,负载是否均衡,通信是否流畅。这些 Bug 最终直接影响集群的吞吐量,反映在训练效率上。模型浮点运算利用率(MFU)是评估训练效率的标准指标,它是“观测吞吐量”与“理论最大吞吐量”的比值。目前,大模型训练效率仍有很大提升空间。在公开可验证的万卡、千亿参数预训练案例中,字节跳动的 MegaScale 以 55.2% 的 MFU 保持着代表性的最高纪录之一。然而,今年 4 月出现的反面案例令人咋舌:据《The Information》报道,马斯克旗下 xAI 虽然坐拥约 55 万张英伟达 GPU,但其内部备忘录显示 MFU 仅为 11%,远低于业界 35% 至 45% 的正常水平,也不及 Meta(43%)和谷歌(46%)等竞争对手。拥有更高的训练效率意味着更短的训练周期、更低的成本、更多的实验机会以及更大的模型规模。

02 总体设计

其次,了解 Kimi K3 的总体分布式系统设计。其训练采用的并行方法包括流水线并行、专家并行和 ZeRO 分片等。简单来说,大模型训练包含大量串行过程,但矩阵计算是可以并行的,且单张卡的内存难以装下超大参数的所有数值。我们可以用盖房子来比喻:盖房子必须一步步往上盖(串行),但搬水泥和钢筋可以同时进行(矩阵并行)。为此,大模型通常从模型参数、训练数据和中间激活值等维度进行切分,分配到多张 GPU 上。例如,把模型的不同层放到不同 GPU 上依次计算,这叫流水线并行;把一层中的权重矩阵拆分到多张 GPU 上共同完成,这叫张量并行。张量并行需要频繁交换数据,对带宽要求很高。专家并行则针对 MoE 架构,技术报告显示其“MoE 层使用在各 EP rank 之间复制的共享专家”,意味着每个 GPU 都保存一份参数完全相同的共享专家以及不同的路由专家,让共享专家尽可能吸收数据中的共有特征。接下来,我们将深入探讨 Kimi K3 的核心架构机制:KDA、AttnRes 和 MoonEP,看看它们背后的基础设施优化原则。

03 KDA

再次,是混合 KDA 注意力机制。KDA 全称 Kimi Delta Attention,是一种线性注意力机制。标准注意力机制需要计算 Q、K、V,好比搜索引擎中先配对查询词和索引,再匹配内容,计算量随输入长度呈平方增长,限制了 Scaling Law。KDA 则先让 K 和 V 相乘,好比先总结网页内容,再由查询词匹配,计算量固定,与输入长度无关。KDA 继承了 Gated DeltaNet,增加了对记忆库的管控结构,使其能合理地忘记旧内容并记住新内容。但这引入了串行依赖,后一个 token 的状态必须等待前一个计算完成,容易导致 GPU 算力闲置。为了解决这个问题,月之暗面提出了 FlashKDA,将 token 分块计算,块内并行,块间串行。此外,Kimi K3 还采用了 KDA 上下文并行(KCP),在多 GPU 间独立计算状态转移,再合成历史信息,从而提升并行度。

04 AttnRes

接着是注意力残差 AttnRes 机制。标准残差连接是“输出 = 原输入 + 本层计算结果”,通过增量修改保持信息流动。但随着深度增加,前层贡献会稀释。AttnRes 使继承更加基于语义筛选。然而,这会增加内存负担,于是月之暗面提出了 Block AttnRes。它将神经网络层分为多个块,块内使用标准残差,块间使用注意力机制,研究表明约 8 个块能获得大部分性能优势。Block AttnRes 的优化策略包括:块表示只需计算一次并长期保留;前向传播时不保存注意力中间结果,反向传播时再计算(用计算换显存);利用流水线并行特性,将块表示按层顺序传递并缓存,避免重复传输。最终,显存中只保留当前时刻真正有用的数据,达到了“内存占用理论下限”。

05 MoonEP

最后,是 MoonEP 机制。在 MoE 架构中,每个 token 可能激活不同专家,导致各 GPU 收到的 token 数量不均,造成负载不均衡和内存碎片化,拖慢整体训练速度。MoonEP 的做法是直接给每个 GPU 分配相同的任务量,接收 S×K 个 token。每个 GPU 内部配置冗余专家,为高负载专家分摊计算任务。月之暗面证明,每个 GPU 只需固定数量的冗余专家(如专家总数 100,GPU 数 20,每个 GPU 最多 5 个),就能确保负载均衡。虽然精确应用此算法成本过高,但实际落地时采用了近似优化手段。

06 结语

综上所述,这三个技巧分别关注串行并行化、计算重复性和负载均衡,体现了一套贯穿系统的工程思维:凡是串行链条就寻找可并行拆解的部分,凡是重复计算就判断能否重算或缓存,凡是动态负载就转化为可预测的静态形状。AI 基础设施竞争并非简单堆砌 GPU,而是消除那些被默认接受的等待、复制和闲置。虽然 Kimi K3 公开的方法只是冰山一角,并非标准答案,但能帮助后来者少走弯路。最终,模型架构决定了能力的上限,而基础设施决定了这种能力能否以可承受的成本、稳定地变为现实。

最新快讯

2026年07月31日

13:30
**市场表现:板块强势拉升,资金大幅净流入** 截至当天上午9时46分,中证半导体行业精选指数(932066)表现强劲,涨幅达8.20%。其跟踪标的半导体ETF南方(159325)交投活跃,盘中换手率高达9.86%,成交金额达到1.18亿元。资金面方面,截至7月30日,该ETF单日净流入0.24亿元,近五个交易日合计净流入1.49亿元,显示市场资金积极看好半...
13:30
截至2026年7月30日收盘,银行ETF南方(512700)表现活跃,换手率达8.76%,成交额为0.95亿元。其跟踪的中证银行指数(399986.SZ)当日上涨2.47%。 展望二季度,银行板块的盈利韧性预计将保持稳健态势。规模方面,尽管贷款及总资产增速有所放缓,但存款重定价的红利持续释放,有效改善了负债成本,对冲了相关压力。息差方面,预计2026年上半年...
13:30
截至2026年7月30日收盘,汽车ETF南方(516840)换手率为18.78%,成交额0.19亿元,其跟踪的中证全指汽车指数(931008.CSI)上涨2.93%。 在政策层面,汽车行业顶层规划正加速落地。工信部正加快编制智能网联新能源汽车产业发展“十五五”规划,致力于构建贯通全产业链的生态体系并明确行业中长期发展方向。与此同时,相关部门正加快制定汽车企业...
13:30
截至2026年7月30日收盘,新能源ETF南方(516160)录得4.89%的换手率,成交额达1.86亿元。尽管其跟踪的中证新能源指数(399808.SZ)当日微跌0.89%,但行业基本面依然强劲。 当前,新能源产业正迎来政策顶层设计与产业基本面双重共振的关键窗口。《可再生能源发展“十五五”规划》正式落地,为行业中长期发展锚定了方向。政策层面,储能被重新定位...
13:30
7月30日,A股市场震荡走低,上证指数收跌0.62%,深证成指跌幅达2.73%,创业板指更是下跌3.97%,全天成交额为2.36万亿元。在主要宽基指数普跌的背景下,自由现金流ETF南方(159232)逆势上涨0.67%,表现相对稳健。截至收盘,该ETF换手率为9.64%,成交额2.41亿元,其跟踪的标的指数中证全指自由现金流指数(932365.CSI)亦录得...
13:29
据鼓狮财经7月31日报道,美国商务部本周低调宣布了一项重大举措:将向半导体制造领域注入超过8.7亿美元的联邦资金,以换取七家相关企业的少数股权。 美国国家标准与技术研究院(NIST)在周三发布的博客中透露,商务部下属的“芯片研发办公室”已与七家公司签署意向书,依据具有里程碑意义的《芯片与科学法案》,向其提供总额8.74亿美元的联邦资金。这笔资金将主要用于关键...
13:16
今天,全网都被这位25岁「AI先知」的故事刷屏了。就在刚刚,华尔街上演了一场教科书级别的平仓。这场血雨腥风的主角,是被硅谷奉为「AI预言家」的Leopold Aschenbrenner,以及他那只439%逆天回报率的对冲基金——Situational Awareness(情境感知)。因为精准押中AI浪潮,他曾被捧上神坛,掌管超200亿美元的庞大帝国。但一场突...
13:16
OpenAI的RSI技术(递归自进化)正式亮相。在黄仁勋高调呼吁开放权重之后,OpenAI也展现了开放姿态。最新技术报告披露了GPT-5.6的部分RSI能力:它开始自主改造自身的运行系统。GPT-5.6已部署在生产环境中,分析流量、优化路由,并直接重写底层内核及改进推测解码。这一举措使端到端服务成本降低了20%,Token生成效率提升了15%以上。值得一提的...
13:16
AI交易风暴卷土重来,而这一切的导火索竟是那位年仅24岁的“AI股神”轰然倒下。在经历整整一个月的暴跌后,全球市场在7月的最后一个交易日爆发了令人咋舌的暴力狂飙。韩国KOSPI指数盘中暴涨逾16%,创下1980年以来的最大盘中涨幅,芯片巨头SK海力士盘中飙升28%,韩国交易所紧急触发SIDECAR机制暂停程序化交易。隔夜美股同样狂热,费城半导体指数大涨超8%...
12:57
截至2026年7月30日收盘,红利低波50ETF南方(515450)换手率为1.71%,成交额达3.43亿元。其跟踪的标普中国A股大盘红利低波50指数(SPCLLHCP.SPI)上涨1.27%,推动红利低波50全收益指数创下历史新高。 近期市场处于重要窗口期,走势分化且波动加剧。海外方面,尽管7月FOMC会议维持利率不变,但内部表态偏鹰,加之北美云厂商业绩及...
12:57
7月30日,港股创新药板块出现大幅回调。国证港股通创新药指数收报1750.08点,跌幅为2.30%。紧密跟踪该指数的港股通创新药ETF南方(159297)当日成交额约为194万元,换手率为7.12%。 从市场分析来看,昨日板块调整主要源于多重因素的共振:前期反弹积累的获利盘集中兑现,加之公募基金中报窗口期临近锁定浮盈,导致资金流向低估值顺周期品种。市场定价逻...
12:57
截至本月30日收盘,恒生科技指数报4803.77点,下跌1.25%。相较于昨日恒指微涨0.2%,科指的回调主要受半导体芯片板块拖累,受海外半导体指数连续下挫及全球AI硬件交易阶段性降温等外围因素影响。不过,头部互联网平台表现分化,部分个股逆势收涨。 分析人士指出,当前市场不宜盲目抄底单一半导体赛道。但恒生科技指数涵盖了互联网、AI应用与半导体等更均衡的产业链...