仅用一个周末,Claude便成功将自家最前沿的模型运行在一台全新的AMD MI355X机架上,且全程无需人类工程师编写一行代码。这一幕,似乎正在宣告英伟达苦心经营二十年的CUDA护城河,正面临被跨越的风险。
这起事件的起因,源于AMD向Anthropic赠送的一台搭载MI355X的机架。起初,团队预期这会是一场艰苦的适配战,毕竟新硬件往往需要繁琐的软件栈调整。然而,Anthropic决定让Claude试一试。一名工程师只是简单指令:“去,把这台机器跑起来。”等到周末结束,屏幕上不仅出现了持续攀升的性能曲线,更证明了机器已完全接管任务。
Anthropic联合创始人兼首席计算官Tom Brown回忆道,当AMD CEO苏姿丰得知只有一名工程师在处理MI355X时,第一反应竟是让AMD团队赶紧去协助。结果对方带回的消息却是:“不用,已经全部搞定了。”这一周末实验迅速转化为实际部署计划,Anthropic宣布将在AMD Helios系统中部署最高2GW的Instinct GPU,首批1GW将于2027年上半年启动。双方更计划直接利用Claude优化AMD工作负载,加速ROCm软件生态的构建。
Claude之所以能对CUDA生态形成降维打击,关键在于AMD提供了一套让AI能直接上手调用的工具。在AMD Advancing AI 2026大会上,ROCm.AI工具箱正式发布,为Claude、Codex和Cursor等智能体配备了经过验证的ROCm知识库。通过名为“AMD Skills”的入口,Agent能够自主安装环境、部署模型、排查故障,并利用ROCm CLI调用真实硬件。开发者只需下达目标,剩下的路便由Agent自行探索。
值得注意的是,AMD甚至改变了芯片说明书的编写方式。公司AI软件与解决方案副总裁Anush Elangovan透露,新一代GPU将公开指令集并使其具备AI可读性。Agent在读懂手册后,便可直接进行性能调优。AMD推出的Hyperloom工具便是这一理念的实践:它拉起推理服务,先跑出基线,定位CPU和GPU瓶颈,测试不同配置并生成定制内核。现场演示显示,Hyperloom将MiniMax M3的输出速度提升了38%,甚至能一次性测试1.4万个模型,将测试结果沉淀为可复用的经验。
CUDA生态的建立,二十年来依靠的是无数工程师一行行代码堆砌出的编译器、库、调试器及文档,更难复制的是那一代代专家积累的“手感”——如何调优算子、如何分配显存、如何解决分布式部署问题。后来者即便硬件性能接近,也需重走这段软件长路。而Agent正是填补这一空白的利器。它通读文档、调用工具、定位瓶颈、迭代方案。培养一名顶级GPU工程师需要数年,而启动一个Agent仅需一个任务。一名工程师指挥一群Agent,便能并行排查错误、优化性能。这种将“按年计算的追赶”压缩为“按任务计算的优化”的能力,正是Agent对CUDA生态最致命的降维打击。
如今,中国工程师正站在这场AI改造GPU软件栈的最前沿。他们沉淀的底层经验,正转化为Agent可调用的能力。一个全新的追赶起点已然出现:将硬件接口和软件工具完全交给AI,让Agent昼夜不息地工作。二十年的生态差距,如今终于可以由这群不知疲倦的智能体来填补。
