随着人工智能大模型的不断迭代,算力需求与内存消耗呈指数级增长,直接导致内存芯片采购成本飙升。为应对这一挑战,行业巨头们正纷纷转向软件与系统层面的优化,试图通过降低AI数据处理过程中的内存占用来削减开支。
谷歌研究院推出的TurboQuant算法是其中的代表。该技术通过将AI推理过程中的键值(KV)缓存压缩至3至4比特,有效减轻了DRAM的计算负担。简单来说,它利用特殊的量化算法,在无需改动原有模型架构的情况下,用更小的空间存储推理过程中的临时数据。据业内分析,这项技术能在不重新训练模型的前提下,将内存使用量最高降至原来的六分之一。
英伟达在3月发布了上下文记忆存储平台(CMX)方案,旨在通过增设独立存储层来缓解内存压力。该方案依托数据处理单元(DPU)构建共享CMX平台,将原本集中在高带宽内存(HBM)中的计算数据进行分流。这种设计不仅避免了HBM的过载,还有效提升了整体能效。
微软近期披露了IndexMem技术,该技术能够在推理阶段自动筛选优先级较低的数据并进行压缩。学术界也提出了EVICPRESS系统作为备选方案,该系统主张将键值缓存分散存储至高带宽内存、普通DRAM以及固态硬盘等多种介质中,并根据上下文的重要性对数据进行压缩或删除。这实际上是将AI临时缓存分流到不同速度的存储设备上,优先保障关键数据,从而减轻HBM的压力。
这些技术大多在今年上半年陆续公布,目前尚无确切消息表明已实现大规模的商业化落地。
内存价格的持续上涨,迫使大型科技企业不得不通过削减内存消耗来控制成本。摩根士丹利最新预测显示,2026年第三季度DDR4等成熟DRAM价格预计将环比大幅上涨50%,第四季度可能再涨10%。该机构指出,成熟DRAM芯片的供应紧张局势将进一步恶化。
韩国券商iM证券的测算数据显示,今年全球前十五大科技巨头的资本开支中,用于存储芯片采购的占比已达37%,这一比例较去年的15%大幅上升了2.5倍。有媒体分析称,内存成本的攀升正在拖累大型科技企业的自由现金流。
受AI基础设施投入激增的影响,谷歌母公司Alphabet今年第二季度出现了历史上首次负自由现金流。为此,Alphabet在本月初发行了约250亿美元的公司债以筹集资金。英伟达同样在6月发行了至少200亿美元的公司债,这是其五年来首次发债,主要用于覆盖基础设施建设开支。
一位业内人士表示:“大型科技企业目前的经营现金流已难以完全覆盖AI基础设施的投入。未来,能够提升有限芯片资源利用效率的内存优化技术,将成为决定企业盈利水平的关键变量。”
