智谱近期的市场表现引发了外界诸多猜测,而最直接的导火索似乎来自竞争对手的强势出击。7月16日,月之暗面发布了Kimi K3,该模型拥有2.8万亿参数,原生支持百万级上下文,并宣称是全球首个开源的3万亿级模型。面对这一冲击,智谱首席科学家唐杰在7月19日(开盘前一天)的微博评论区仅回复了一句:“史诗级Plus”。言简意赅,却耐人寻味。
这句看似随意的回复,其实隐藏着一条技术线索。唐杰的这条微博原po,实际上是介绍智谱与清华大学团队联合发表的一篇论文《IndexCache》。这篇论文于3月挂上arXiv,并在7月被COLM会议接收。唐杰在文中提到,IndexCache只需改动少量代码,就能消除DSA留下的隐性开销。
那么,IndexCache究竟解决了什么问题?它并非一种全新的注意力机制,而是针对长上下文推理中DSA(稀疏注意力)的瓶颈而设计。传统的DSA思路是在每一层注意力机制前放置一个轻量级索引器,由它从完整上下文中筛选出最重要的Token,从而减少主注意力的计算负担。然而,随着上下文长度增加,索引器本身也必须扫描一遍上下文,且每一层都要重复扫描。这使得索引器从省算力的帮手变成了新的计算瓶颈——在30B模型的测试中,当上下文达到200K时,索引器竟然占据了81%的预填充时间。
IndexCache的创新在于抓住了相邻层选择Token的高度相似性。实验数据显示,相邻模型层选出的重要Token重合率高达70%至100%。既然结果差不多,何必每层都重新计算?IndexCache的核心思路是:少数层负责计算索引并缓存结果,其余层直接复用。这种方案无需额外GPU显存,推理代码也仅需增加一次条件判断。在30B模型上,IndexCache最多能削减75%的索引器计算量。在200K上下文下,生成首个Token前的速度最高提升1.82倍,后续出字速度提升1.48倍。
看到这里,读者可能会问:这篇论文和“史诗级Plus”有何关联?事实上,IndexCache的核心思想早在一个月前发布的GLM-5.2中就已经应用,彼时被命名为“IndexShare”。GLM-5.2采用了每四个Transformer层共享一个索引器的策略,第一层计算索引,后三层直接复用。这与IndexCache的原理不谋而合。
凭借IndexShare等工程优化,GLM-5.2成功将上下文窗口扩展至100万Token,并将每Token的计算量降低了2.9倍。这表明智谱并未打算放弃DSA路线,而是通过跨层复用等技术,进一步挖掘长上下文推理的效率极限。这不禁让人猜测,所谓的“史诗级Plus”,或许正是智谱在极致性价比与长上下文能力上的一次突破。
除了软件侧的优化,智谱在硬件基础设施上也落下了关键的一块拼图。7月21日,智谱宣布建成1GW级国产AI算力数据中心,全部采用国产AI芯片。与此同时,智谱还完成了对国产AI异构算力软件公司中科加禾的收购。中科加禾源自中科院计算所,在异构算力软件栈和编译优化领域处于国内顶尖水平。这一系列动作,一方面解决了算力“从哪里来”的问题,另一方面通过编译器、Runtime和推理引擎,解决了算力“如何用得更彻底”的问题,旨在降低模型训练与推理成本。
从IndexCache、IndexShare,到如今的1GW算力中心与AI Infra收购,智谱补齐的似乎不仅仅是一款模型,而是一条从芯片、软件栈到模型的全栈产业链。虽然“史诗级Plus”的具体形态尚不明确,但结合这些技术动作来看,智谱正在构建的,是一条具备极高性价比的国产大模型全栈能力。
