9月17日,华为全联接大会2024在上海启幕。华为推出了业界首个采用NPO技术的昇腾960超节点,同时升级了鲲鹏超节点并推出了OceanStor M900 AI记忆存储系统;基于灵衢UnifiedBus统一互联技术,华为构建了Agentic超节点集群,支持百万卡超大规模集群。
据大会披露,截至目前,华为在生态建设上成果斐然。鲲鹏全球开发者已突破416万,全球生态合作伙伴超过7200家,支持了560多个全球开源项目。openEuler操作系统的装机量已超2000万套,稳居中国服务器操作系统市场份额第一。CANN社区月活开发者突破5200名,基于昇腾与CANN的原生训练模型超过40个,是国内唯一支持预训练的技术路线。
华为副董事长、轮值董事长汪涛在会上强调,AI变革的速度远超历史上任何一次技术革命。他指出,当前大模型参数规模正快速迈向10万亿,预计到2030年将突破100万亿;智能体已能实现小时级连续工作,未来将按月执行任务;中国每日推理Token量已达约500万亿,2030年有望达到百万万亿级。此外,端侧智能也在飞速发展,手机模型参数从2024年的30亿(3B)跃升至目前的300亿(30B),未来将迈向1000亿(100B)级别。面对这些变化,AI基础设施在规模、性能和可靠性上面临更高挑战。汪涛表示,华为AI战略的核心是算力,坚持硬件变现,围绕“超节点+集群”的系统架构创新构建竞争力,打造中国坚实的算力底座。华为致力于构建开源开放的生态,支持主流大模型基于昇腾原生训练,并积极拥抱“百模千态”。在客户服务上,提供线上线下灵活算力方案,加速千行百业智能化;在端侧,通过提供大中小微多样性算力,推进AI入端、上车,实现物联轻智能升级;在网络侧,围绕“用算”构筑新一代通信网络,将智能传递给每个人、家庭和企业。
华为正式发布了业界首个采用NPO技术的昇腾960超节点。截至目前,昇腾910C超节点已部署超过1000套,昇腾950超节点也已实现规模商用。超节点通过高效的互联协议将多个计算节点紧密连接,具备跨物理节点统一内存编址能力,在逻辑上表现为“一台计算机”。汪涛指出,超节点已成为建设超大规模AI基础设施的必然选择。随着10万卡集群成为训练十万亿级SOTA模型的标配,传统服务器架构导致集群内通信时间占比过高,严重制约了模型浮点算力利用率(MFU)。仿真数据显示,由4K超节点组成的10万卡集群,其MFU比由8卡服务器组成的集群提升了2.75倍。会上,汪涛宣布昇腾960芯片研发进度超预期,性能实现翻番。其中,昇腾960DT将于2027年Q1推出,提前三个季度;昇腾960PR将于2027年Q3推出,提前一个季度。后续将坚持一年一代的演进节奏,昇腾970计划于2028年推出,昇腾980计划于2029年推出。依托τ定律,算力规格将再次翻倍,访存带宽、容量及互联带宽均将大幅提升。超节点的设计核心在于多NPU的协同互联。华为研发了新一代NPO形态的光互联产品Hi-ONE,通过光、机、电、磁、热等要素的均衡设计,实现了单引擎7.2T的传输容量。这是业界首个量产的NPO产品,也是目前传输能力最大且内置光源的NPO产品。基于昇腾960芯片和Hi-ONE,华为打造了业界首个采用NPO技术的昇腾960超节点。该超节点单节点规模达4096卡,最大可提供8E FP8算力及1PB的HBM容量。系统中使用5500个Hi-ONE,替代了原本所需的4.8万颗800G光模块,降低了超过550千瓦的功耗,并将系统无故障运行时间提升一倍,可用度达到99.8%。
针对日益增长的算力需求,华为对鲲鹏超节点进行了升级。基于灵衢全光组网技术,鲲鹏超节点最大支持4096节点,并形成了256TB的统一内存池。同时,华为推出了OceanStor M900 AI记忆存储系统。为满足Agent推理系统对长序列和多层次KV Cache的需求,华为提出了多层KV缓存架构。基于灵衢UnifiedBus,M900集群支持“一跳直连”,成为华为L3.5层PB级KV缓存解决方案。该系统采用混合介质结合优化Retention算法,可将SSD读写寿命提升16倍,从底层保障KV命中率和长期可靠性。
华为还带来了全新的Agentic超节点集群,旨在加速10万亿级大模型的训练与推理。基于灵衢UnifiedBus统一互联技术,华为将多种互联协议统一为灵衢协议,大幅减少协议转换开销。这使得昇腾超节点、鲲鹏超节点、KV缓存集群等子系统能够平等互联,提供多层次、高带宽、大容量的存储系统。各类KV缓存均可实现一跳直达。通过二层CLOS四平面组网,该集群最大规模可达51.2万卡;结合多轨道拓扑技术,最大支持100万卡昇腾超节点集群。
