8月12日,阿里云正式上线灵骏真武M890超节点实例,首批产品已在乌兰察布开售。就在前一天,据《科创板日报》报道,阿里云正计划将模块化数据中心的全球产能提升两倍以上。采访中获悉,阿里自研芯片平头哥的产能正在持续爬坡,预计未来在算力体系中的占比将越来越高。
平头哥AI芯片产能逐步提升
灵骏真武M890是国内首个成功运行超2万亿参数大模型的超节点形态算力平台。目前,Kimi K3和Qwen3.8 Max均已通过该实例对外提供服务。该实例支持FP8/FP4低精度计算,通过ICN Switch 1.0芯片,其Scale-up互联规模从16卡提升至64卡,卡间互联带宽达到800GB/s。在智能驾驶、具身智能等训练场景中,相比上一代真武810E,其训练性能提升了三倍。
支撑该超节点集群的是阿里云灵骏智算平台。依托HPN 8.0训练推一体网络,单集群最高可支持13万卡异构算力混布,并可扩展至百万卡级。
截至今年4月,平头哥真武AI芯片累计出货已达56万片。阿里云全球数据中心总经理王朝阳表示,平头哥产能正在逐步提升。“未来非常确定的是,国产自有芯片的产能将持续增长,占比越来越高。这一过程预计不需要三年。”
王朝阳指出,随着AI时代到来,数据中心正迈入第四代——智算中心。数据中心的规模是过去的十倍,密度提升数十倍,芯片种类也更加多样,需要兼容多种架构。阿里云正积极推进“一云多芯”战略,兼容多种芯片的异构计算。
阿里云推进模块化数据中心建设
基于全模块化设计架构CUBE 5.0,阿里云已将大型AIDC数据中心的交付工期缩短至100天。相比之下,国内传统交付周期通常为6至12个月,美国则需12至18个月。在大幅缩短工期的同时,数据中心整体建设成本反而降低了10%以上。
CUBE 5.0架构已在阿里云乌兰察布、中卫等数据中心试点跑通,并获得基于EN标准的欧洲CE认证和基于IEC标准的东南亚产品准入。今年,阿里云正计划将模块化数据中心的全球产能提升两倍以上。
王朝阳透露,AI算力需求爆发,对交付速度要求极高。传统施工是串行依赖,而阿里云通过全模块化设计,工厂制造后预调至集装箱,现场像搭积木一样吊装,实现了各环节并行生产。
AI推理算力呈现从西往东下沉的趋势
本次超节点实例首发地域为乌兰察布,这是阿里云五大超级数据中心之一,其绿电占比约45%。选择乌兰察布的核心原因在于电价优势,当地电价约为3毛2至3毛5,而华东、华南普遍在6毛至9毛。据测算,一个吉瓦级的数据中心若放在乌兰察布与放在东部,每年电费相差可达50亿元。
王朝阳分析了AI算力分布规律。以训练为中心的算力呈现从东往西纵深的趋势,西部凭借低电价、土地广阔和气候凉爽的优势,天然适合高能耗、对延迟不敏感的训练任务。因此,万卡、十万卡集群基本都搬到了“胡焕庸线”以西。
与之相反,以推理为中心的算力呈现从西往东下沉的趋势。这是由于东部是AI推理需求的主力爆发点,用户数据和业务集中,AI推理必须靠近用户。
王朝阳预计,未来长三角、大湾区、京津冀三大经济圈将出现大量推理型算力集群,并逐步形成产业群的覆盖。
未来单机柜平均功率或将突破1000千瓦
随着数据中心进入智算中心时代,规模是过去的十倍,密度是十倍甚至几十倍,芯片多样性要求对电力供应提出了巨大挑战。
王朝阳表示,选址需选择能源富集地。目前单机柜功率密度已达100千瓦,未来两年内甚至可能出现1000千瓦的机柜。
与此同时,供给端瓶颈已从芯片蔓延至存储、电力、光纤及光模块。王朝阳评估,在目前全中国约8吉瓦的产能下,可以较好覆盖当下芯片的产能需求,虽然可能出现局部或短期问题,但整体无大碍。
高压直流技术至关重要。下一代数据中心若采用240伏交流电,已无法承载当前密度,电缆在物理空间上超出极限。因此,电压必须升至400伏,甚至800伏、1500伏。
风冷和液冷兼容已是AIDC的标配,如何实现更高配比、更好效果是持续优化的方向。
在算电协同方面,GPU时代功耗呈现垂直增长。中美都在尝试新框架,但仍处初级阶段。随着算力中心发展,会对电网稳定性、发电企业造成冲击,从而催生新的业态。
