中国大型互联网企业正计划在下半年大量部署超节点方案。尽管超节点整机价格通常高于同等卡数的普通服务器,但其算力密度更高、空间占地更小,在有限空间内承载更多算力的优势明显,被视为“大杀器”。近期,此前未采用超节点的DeepSeek也明确表示将投入使用,这具有风向标意义。在2026世界人工智能大会上,这一热潮尤为突出,华为、中科曙光、百度、阿里云、浪潮信息等均展出了各自的重磅产品。
什么是超节点?简单而言,它是通过高速互联技术,将大量GPU或加速卡从“多台服务器”深度整合,形成逻辑上的一台“超级计算机”。这种架构解决了传统集群跨机器通信的带宽和延迟瓶颈,大幅提升了芯片利用率,降低了单位Token成本。
“超节点已成为目前AI Infra建设的一个主流趋势。”华为资深人士表示。一年前,它还只是少数厂商展示系统能力的旗舰产品,如今已成为主流算力企业必须参与的军备赛。“国产超节点从去年推出,目前已发展到可批量落地阶段。”百度昆仑芯人士指出,“到今年底,每家算力企业基本上都具备交付能力。”
01、谁在造超节点
超节点赛道已涌入多个玩家,主要形成了三条不同路线:不断扩大单个超节点规模、强调部署效率和经济性、以及用新芯片和互联架构重新定义超节点。
目前,华为、中科曙光和百度在走向“大节点”。华为已向业界展示了由20个机柜组成的1024卡昇腾950超节点真机,并将在今年第四季度批量交付8192卡超节点。中科曙光采用浸没式液冷技术,单机柜部署640张加速卡,其构建的十万卡算力集群“曙光8000”已落地国家超算互联网郑州核心节点。百度智能云天池超节点则从256卡向512卡演进,强调全栈自研,已交付多个万卡集群。
另一批厂商并不认同“越大越好”。阿里云推出的灵骏真武M890以64卡为一个Scale-up单元,通过Scale-out网络扩展,并面向公共云按需调用。浪潮信息、沐曦也选择了类似方向。浪潮信息副总裁赵帅介绍,32卡超节点可以支撑万亿大模型推理,能显著提升效率,让更多企业用得起。沐曦则以单柜64卡为基础,强调CUDA生态兼容和向万卡集群的横向扩展。
还有一些厂商试图跳出英伟达GPU或华为加速卡路线。清微智能采用可重构数据流架构,每颗芯片同时承担计算和数据转发,已推出4096卡超节点。东方算芯、摩尔线程也计划推出类似产品。
02、为什么是今年
超节点为什么会在今年爆发?业内认为主要有三大原因。
首先,模型训练和推理需求巨大。随着模型参数暴涨,训练万亿参数模型需要数万张卡,推理端的高并发和长上下文需求也日益增长。阿里云资深人士指出,目前线上推理和训练比已接近5:1到10:1。
其次,经济账算得过来。虽然超节点单价更高,但通过集约化部署,大幅降低了电力、空间和冷却成本。浪潮信息副总裁赵帅举例,通过超节点做PD分离推理,性能提升30%到50%,而耗电可能只提升2倍。
最后,批量交付能力成熟。超节点涉及芯片、存储、通信、散热、供电、软件等多个环节,是工程化产物。目前,各厂商已具备批量交付能力。
关于超节点更适合训练还是推理,各厂商看法不一。华为认为两者均有价值,沐曦认为在推理的Decode阶段价值更突出。
03、分歧与共识
超节点技术路线存在诸多分歧,目前尚无标准答案。
第一个分歧是规模之争。一派主张64卡或128卡,认为这已是TP和EP并行的极限,过大节点会增加延迟风险。另一派主张512卡或1024卡,认为Agent时代需要更大的内存池来支撑万亿参数模型和海量并发。
第二个分歧是CUDA兼容之争。阿里平头哥、沐曦等走CUDA兼容路线,代码迁移成本低。华为昇腾、昆仑芯等走自研生态路线,虽然迁移成本高,但长期演进空间更大。一位大厂人士认为,随着Agent编程的普及,CUDA的重要性可能会降低。
此外,在连接介质(铜缆vs光纤)、散热方式(风冷vs液冷)上也存在不同选择。
共识是软硬架构协同。模型架构的演变将直接影响超节点的硬件适配方向。浪潮信息董事长彭震指出,软硬件联合创新已成为基础设施演进的新方向。
业内人士认为,这条赛道未来二三十年都将持续发展。随着AI渗透各行各业,算力越便宜,行业扩张越快。目前,供应链挑战仍是主要瓶颈,能否批量交付、稳定运行并降低每Token成本,将是未来竞争的关键。
