算力的重要性再度凸显。近期,随着GLM 5.2、Kimi K3.0等大模型的上新,叠加DeepSeek投资人会议纪要的泄露,算力紧张的现实再次被推至台前。这意味着,国产大模型若想实现进一步突破,必须跨越这道算力门槛。围绕算力的争论一度平息,如今为何又起波澜?国产算力究竟发展到何种地步?超节点能否成为破局的关键抓手?
算力门槛难以绕过。曾几何时,全球业界流行“力大飞砖”的堆算力模式,但受限于种种因素,这条路在国内走得颇为艰难,算力短缺长期困扰行业。直到DeepSeek面世,通过算法优化等手段降低了对算力的依赖,才打破了以往的粗放思维。此后,借助技术手段为算力做减法,成为行业共识:灵活调整MoE架构参数以减少单次计算量,优化注意力机制以缓解长上下文显存压力,借助开源模型打造垂直应用以降低训练量……毕竟,花小钱办大事是国人喜闻乐见的操作。
在此背景下,关于算力永远短缺的叙事逐渐沉寂,而消除算力溢价的呼声高涨,相关担忧自然平息。未曾想,国产大模型后来居上,纷纷跻身国际第一梯队,随之而来的却是算力相对不足,不得不采取限购、涨价等措施以抑制日益旺盛的需求。于是,另辟蹊径绕过算力门槛的逻辑宣告破产。
复盘来看,单次推理效率的优化并不等同于满足总需求。一旦需求高企,令模型满负荷工作,算力缺口便会显现。以Kimi K3为例,其参数高达2.8T,虽然为提高效率,单个Token仅激活104B参数,通常情况下足以应对,但Kimi K3出圈之后,Token消耗激增,后台可能跑了几十次推理(读代码、调用工具、自我纠错),导致总吞吐量水涨船高,最终抬高了算力需求。这一现象高度契合经济学中的“杰文斯悖论”。即当技术进步提高了资源利用效率后,反而可能导致资源的总消耗量增加。通俗来说,大模型推理成本下降了,但模型能力变强,能应对更多复杂场景,从而吸引更多用户,需求激增,算力扩容便成为必由之路。
其实,针对算力的基础建设从未放松。公开资料显示,2025年国内智能算力规模为1590 ExaFLOPS,到了2026年上半年,这一规模将达2185 EFLOPS,同比增长177%,呈现爆发式增长。
超节点堪称大模型的最佳搭档。智能算力规模爆发式增长背后,国产AI芯片走到了舞台中央。例如,昆仑芯发布了第四代AI芯片M100,主要针对大规模推理场景进行优化设计,以全国产方案对标NVIDIA H20,主打高性价比推理应用。摩根大通数据显示,百度昆仑芯片收入预计将从2025年的约13亿元飙升至2026年的83亿元,同比增长超6倍。又如平头哥发布了新一代AI芯片真武M890,性能较上一代提升3倍,可满足更大规模的大模型训练及推理需求。官方数据显示,真武AI芯片累计出货56万片,服务20多个行业的400多家客户,其中在智驾行业已部署超13万卡,客户涵盖小鹏、理想、蔚来等头部造车新势力。国产AI芯片的崛起为国产算力提供了“定心丸”。
尤为值得一提的是,超节点走出了实验室,成为国产AI芯片下一个新战场,也为国产算力带来了更大的想象力。所谓超节点,即将数张、数十张乃至数百张AI芯片融为一体,组成具备一台计算机特征的超级计算系统,从而大幅提升性能,缩小与国外高端芯片的差距,并大幅降低Token成本。沐曦股份研发副总裁黄向军表示:“随着模型规模越来越大,尤其是万亿参数的大模型,客观上需要更大规模的GPU,通过高带宽连接在一起。此外,MOE模型的专家间通信,无论是训练还是推理都要求延迟越低越好,超节点这个架构比普通的服务器更适合。”
需要注意的是,超节点并非简单的堆芯片。其核心竞争力在于借助超大带宽、超低时延、软硬协同等技术优势,最大程度实现“高效率、低成本”的目标,将字面算力转化为可用算力。CHIP实验室主任罗国昭表示:“一个2万亿参数的MoE模型往往需要同时调用多个专家网络,每完成一步推理,都需要不同GPU之间频繁交换数据。如果互联带宽不足,大量GPU不得不停下来等待数据同步,即使理论算力充足,也难以真正发挥出来。这也是业内常说的‘GPU不是在计算,而是在等待’。”不难看出,超节点是解决当下算力紧张的最优解。
尽管如此,作为新物种的超节点也面临诸多技术分歧,其中排在首位的就是规模到底多大合适。一种声音认为节点越大越好。随着大模型进入万亿参数时代、上下文长度突破千万以及并发推理持续增长,超节点走向百卡、千卡甚至万卡是必然趋势。唯有大节点才能满足大模型的全场景需求。这条技术路径的典型代表是昇腾,其推出的384卡超节点已销售了750多套,目前已迭代至1024卡超节点,实现了业界最大的256TB跨物理节点的内存统一编址空间,且将推出8192卡超节点,进一步探索超节点的满配技术上限。
另一种声音则认为节点越经济越好。大模型既要高带宽、高性能,也要低时延、强稳定,因而需要进行平衡。更为重要的是,配置的AI芯片数量相对较少,成本也会随之降低,适合中小企业的实际需求,避免出现算力浪费。如此一来,小节点也大行其道。这条技术路径的典型代表是浪潮信息,先是推出64卡超节点,契合小节点的主流路线,最新产品已降为32卡。浪潮信息副总裁赵帅表示:“我们自己内部用万亿大模型做AI Coding,效率绝对比用千亿大模型好,这就是万亿参数大模型带来的价值,所以再次推出32卡产品,让更多企业真正用得起。”
总而言之,超节点最初并不受重视,随着交付能力的提升以及算力紧张的肉眼可见,一跃成为大模型的最佳搭子。百度、阿里巴巴、浪潮信息、沐曦科技、摩尔线程等大小厂商纷纷入局,为AI基础设施生态注入了新动力。国产算力破局,正当时。
