**超节点成为算力基建主流:大厂布局、技术路线分化与未来展望**
**一、 部署预测与行业风向**
据一位资深算力人士透露,下半年国内大型互联网企业将迎来超节点方案的集中部署。尽管超节点单机价格高于同等卡数的普通服务器,但其算力密度更高、空间占用更小。在有限空间内承载更多算力已成为企业的刚需,超节点无疑是这一场景下的“大杀器”。新华三相关人士补充道,即便是此前未采用超节点的DeepSeek,近期也明确表达了使用意向,正在积极议价。这一动向具有风向标意义。
这一热潮在2026世界人工智能大会上得到了充分印证。华为展出了由20个机柜组成的1024卡超节点真机;中科曙光则展示了单机柜640卡、采用浸没式液冷技术的超节点。此外,百度天池、阿里云灵骏真武M890、浪潮信息元脑以及沐曦曦景S600等,均在各自展台占据了核心位置。
**二、 超节点:概念解析与现状**
究竟什么是超节点?简单而言,它利用高速互联技术,将大量GPU或加速卡从多台服务器深度整合,形成逻辑上的一台“超级计算机”。这种架构有效解决了传统集群跨机器通信的带宽与延迟瓶颈,大幅提升了GPU利用率,从而降低单位Token成本。华为资深人士表示,超节点已成为AI基础设施建设的当前主流趋势。
一年前,超节点还是少数厂商展示系统能力的旗舰产品;而如今,它已演变为算力企业必须参与的主流军备竞赛。国产超节点从去年推出至今,已发展到可批量落地阶段。百度昆仑芯人士指出,预计今年底,各家算力企业基本都具备交付能力。
**三、 厂商竞逐:路线分化**
目前,国内厂商在超节点赛道上已形成三条主要路线:一是不断扩大单节点规模;二是强调部署效率与经济性;三是尝试用新芯片和互联架构重新定义超节点。数智前线观察发现,华为、中科曙光和百度正致力于打造“大节点”。
华为已向业界展示了由20个机柜组成的1024卡昇腾950超节点真机,并计划于第四季度批量交付8192卡超节点,这被视为该技术上限的满配形态。华为判断,随着大模型参数、上下文长度及推理并发量的持续增长,单个计算域需容纳更多芯片与更大内存。其去年推出的384卡超节点已在互联网、金融、能源等多个行业落地逾750套,验证了商业规模部署能力。中科曙光则依托浸没式液冷技术实现高密度部署,单机柜搭载640张加速卡,由一台冷却设备驱动两个机柜。基于此构建的十万卡算力集群“曙光8000(登峰)”已落地国家超算互联网郑州核心节点,目前利用率已达90%,主要支撑模型训练及AI for Science应用。
百度智能云天池超节点正从256卡向512卡演进,预计年底推出。该方案强调从互联协议、交换芯片到液冷系统的全栈自研。百度智能云混合云部总经理杜海介绍,其超节点已交付多个万卡集群,成功完成了文心5.1重要版本的全国产集群训练,并支撑了能源电力行业80多个场景的推理及自研电力大模型训练。
另一派厂商则持不同观点,认为“越大越好”并非唯一解。阿里云推出的灵骏真武M890,以64卡为一个Scale-up单元,通过Scale-out网络扩展至更大集群。与多数超节点主要面向私有化部署不同,阿里将其放入公共云,客户无需采购设备即可按需调用。浪潮信息与沐曦也选择了类似路径。浪潮信息去年推出64卡超节点,今年再推32卡产品,以支撑万亿参数大模型的推理。浪潮信息副总裁赵帅表示,内部测试显示,32卡超节点在AI Coding场景下的效率远超千亿参数模型,能为企业提供更具性价比的算力。沐曦则基于单柜64卡,强调CUDA生态兼容性及向万卡集群的横向扩展能力。
此外,部分厂商试图跳出英伟达GPU或华为加速卡的传统路线,探索第三条路径。清微智能采用可重构数据流架构,每颗芯片同时承担计算与数据转发,芯片间直连无需交换机,已推出峰值算力500PFLOPS的4096卡超节点,并在北京、内蒙、新疆等多地落地。同样采用该路线的东方算芯也于7月上市。摩尔线程计划年底伴随新一代GPU推出相关产品,寒武纪虽暂未推出超节点,但业界判断其下一代芯片也将跟进。
**四、 爆发原因:需求、成本与工程化**
为何超节点会在今年爆发?业内认为主要源于三大原因。
首先是巨大的训练与推理需求。训练端,模型参数量呈指数级增长,Kimi发布的K3模型参数已达2.8万亿。业内预测,下一个春节参数将达3万亿,再往后是6万亿乃至10万亿。目前中等规模海外模型参数量已达5万亿,单机集群已难以满足需求。推理端,AI Coding场景中,一次任务操作调用可达数万次,复杂长程任务更是百万级,这需要超节点提供大内存池以支持海量并发。
其次是算账划算。超节点总价虽高,但客户看重的是总体效能。新华三人士指出,大企业部署超节点必然经过详细测算。浪潮信息副总裁赵帅举例,若超节点能让推理性能提升10倍,而耗电仅增加2倍,则具有显著收益。昆仑芯人士表示,传统模式下多台机器算力相加往往小于卡数总和,而超节点通过高速互联将损耗降至最低,在PD分离推理场景下,性能提升可达30%至50%。
第三是工程化成熟度达到批量交付阶段。超节点涉及芯片、存储、通信、散热、供电及软件等多个环节,非单一厂商能独立完成。昆仑芯人士称,目前超节点已具备批量落地能力,整机交付不再是难题。
**五、 训练与推理的边界**
关于超节点更适合训练还是推理,各家说法不一。华为认为两者均有价值,万亿参数训练需大内存池,Agent推理需海量上下文并发。摩尔线程认为其应面向万亿至5万亿参数模型训练及高速推理的Tokens工厂场景。沐曦人士认为,超节点在推理的Decode阶段(逐Token生成)价值更为突出。清微智能陈逸伦分析,目前超节点在训练侧多用于微调,而在推理侧性能表现更佳。
**六、 技术分歧与未来展望**
在超节点爆火的同时,技术路线也存在诸多分歧,尚未形成统一标准。首先是规模之争。一派主张64卡或128卡的小节点派认为,TP和EP并行对延迟极度敏感,超过64卡后通信延迟会抵消性能优势,且64-128卡是最经济形态。另一派是大节点派,如华为的1024卡、中科曙光的640卡、百度和新华三的512卡,认为在Agent时代,万亿参数和百万Token上下文下,小节点内存池不足,必须依靠大节点进行完整训练和大规模并发。
其次是CUDA兼容性的分歧。阿里平头哥、沐曦、海光等选择CUDA兼容路线,降低代码迁移成本;华为昇腾、昆仑芯等坚持自研生态路线。一位大厂人士分析,自研生态虽迁移成本高,但可控性更好,且随着Agent编程的发展,CUDA的重要性可能下降。华为人士则表示,华为增强了向量处理能力,与英伟达的矩阵处理能力形成互补,两者均走向“矩阵和向量综合型”。
此外,连接技术(铜缆与光纤)、散热方式(风冷与液冷,特别是浸没式液冷)等方面也存在不同选择。这些新旧技术的转换中,技术瓶颈、故障率与运维成本是各厂商需要权衡的挑战。
尽管存在分歧,但业界达成了一个共识:软硬架构必须协同演进。浪潮信息董事长彭震指出,过去基础设施沿摩尔定律演进,现在则是软硬件联合创新,一端提出新算法,一端用新介质、硬件和网络适配。沐曦杨建博士认为,这条赛道未来二三十年都不会停歇。随着AI渗透到各行各业,算力需求将持续增长。目前,超节点正成为产业链向下延伸的重要算力底座。随着更多厂商具备整机交付能力,激烈的竞争已正式开启,核心比拼在于能否批量交付、稳定运行并真正降低每Token成本,而供应链的锁定则是未来发展确定性的关键。
