CUDA再次遭遇挑战,这一次,对手竟是英伟达亲手培育的AI力量。一家成立仅一年的初创公司,利用AI编程Agent,在短短10小时内便搭建出了一套“类CUDA”软件。这不禁让人发问:这套耗费了英伟达近20年心血构建的软件帝国,难道真的被“复刻”了?
提起英伟达,人们往往首先想到的是H100、Blackwell等高性能GPU芯片。然而,英伟达真正的护城河并非硬件,而是其软件生态。芯片可以买,参数可以追,制程也会迭代,但真正让客户一旦使用了英伟达就很难再换走的,是围绕GPU建立起来的整套软件平台。
CUDA(Compute Unified Device Architecture)由英伟达高管Ian Buck带领团队历时近20年打造。它不仅仅是一个编程语言,更是一套完整的软件平台。如果将其拆解,最底层是负责指挥芯片运作的Kernel、编译器和运行时;中间层是经过高度优化的计算库(如cuBLAS、cuDNN)及调试工具;最上层则是PyTorch、TensorFlow等开发框架,以及庞大的开发者社区。可以说,购买英伟达GPU,等于买到了一座开箱即用的“软件工厂”。
就在近期,Infinity公司的创始人Jeremy Nixon带着其开发的AI Agent“Ignition”登场了。Nixon曾是Google Brain的研究员,他的团队利用Ignition为AI芯片初创公司d-Matrix搭建了一套类CUDA软件,整个过程仅耗时10小时。这套Agent能够自动生成GPU Kernel、运行测试、修正错误并测量性能,将繁琐的底层代码编写工作交给了AI。
客观来看,AI Agent确实擅长处理这种具有明确反馈的编程任务。它能够形成“写代码→编译→运行→测试→修改”的闭环。不过,Infinity主要攻克的是CUDA的第一层——即针对不同芯片生成和优化推理Kernel,并搭建底层软件能力。这并不意味着它瞬间复制了CUDA近20年积累的完整生态。
尽管如此,这并不妨碍资本的热情。Infinity凭借此技术获得了1500万美元融资,估值已达1亿美元。
如果说AI Agent是攻城的武器,那么推理市场就是英伟达护城河上的缺口。大模型的计算主要分为“训练”和“推理”两段。在训练侧,CUDA依然占据主导地位,因为大规模训练对性能、稳定性和集群协同要求极高,容错率低。但在推理侧,规则发生了变化。
Rebellions首席商务官Marshall Choy指出,推理侧不再是CUDA的决胜点,而是一场开源软件的竞争。训练追求极致性能,而推理更看重每个回答的成本。推理任务可以拆分到小集群甚至单卡运行,客户更愿意尝试新的、更便宜的方案。如果推理框架能跨芯片运行,CUDA的锁定效应就会失效,这为专用推理芯片留下了巨大的市场空间。
那么,英伟达的护城河真的被颠覆了吗?答案可能还差得远。10小时重写的只是“一块芯片的适配代码”,而CUDA生态拥有20年的库积累、调试工具、社区支持和数百万开发者。这并非轻而易举就能被取代的。
代码生成容易,验证难。INT21创始人Bing Xu指出,Agent能快速生成大量代码,但要在各种边界情况下证明其正确性和稳定性极慢。CUDA最深的资产恰恰在于其强大的验证工具链。Modular联合创始人Chris Lattner也泼了冷水,认为AI在编码上的改进是渐进的,生产级优化才是决定性能的关键,且芯片软件领域的公开数据远少于应用开发,迁移存量代码的组织决策成本也不容忽视。
此外,英伟达自身也在利用AI Agent来加速CUDA的开发和验证,以己之矛攻彼之盾,进攻方的优势也会被抵消。Bing Xu总结认为,胜负的关键在于竞争对手追赶英伟达的速度,能否快过英伟达自我迭代的速度。显然,这家全球最大的芯片制造商并未停滞不前。
总的来说,短期内英伟达的护城河依然稳固,但变化会先在推理侧悄然发生。长期的悬念在于,护城河正从“代码存量”向“验证与优化的生态”迁移。谁先占住新位置,谁才是下一个赢家。
