这一消息震撼业界。就在刚刚,英伟达正式公布了 Vera Rubin NVL72 的首批实测数据,并携手 DeepSeek-V4-Pro 模型进行了真实「智能体编码」任务的测试。结果令人咋舌:对比当前的主力机皇 GB300 NVL72,Vera Rubin 的每兆瓦吞吐量最高提升了 30 倍,Token 成本最高降低了 35 倍。有人感叹:「我连骗投资人的 PPT 都不敢这么写!」更有网友调侃:「以前嫌 H200 三万美元一张贵,现在回头看,H200 居然连丐版都算不上了。」
让我们深入分析一下。从 H200 到 GB300,在真实 Agent 工作负载下,吞吐量提升了 15 倍,成本翻倍;而从 GB300 到 Vera Rubin,吞吐量再次飙升 30 倍,整机架价格大致再翻倍。按照摩尔定律,这两年英伟达最大的技术突破并非 GPU 本身,而是通过让价格贵 4 倍,换来了整整 900 倍的速度飞跃。英伟达向世界宣告了一个反常识的真相:大语言模型时代已结束,智能体时代降临,旧有的 AI 基准测试全部作废。
为什么需要 Vera Rubin?OpenRouter 的数据显示,真实世界中的 Agent 任务消耗的 Token 数量是普通聊天对话的 15 倍。Agent 需要进行推理、调用工具、处理长上下文,这些复杂的交互使得算力和算法的矛盾日益凸显。传统的基准测试已无法衡量 Agent 的真实能力。为此,英伟达引入了 SemiAnalysis 的 AgentX 基准测试,它模拟了真实的代码编写会话,包含上下文增长、工具调用和子智能体生成等环节。这揭示了 H200 在 Agent 战场上的力不从心,也预示了 Vera Rubin 的统治地位。
Vera Rubin NVL72 × DeepSeek-V4-Pro:算力怪兽降临。英伟达使用 DeepSeek-V4-Pro 进行了实测。在 AgentX 工作负载下,Vera Rubin NVL72 的每兆瓦吞吐量比 GB300 NVL72 最高提升了 30 倍。这意味着在相同的电力预算下,它相当于凭空变出了 30 倍的算力资产。此外,NVIDIA DSX MaxLPS 技术可在 GPU、机架和工作负载层面进行电源管理,让 AI 工厂在相同兆瓦预算内多配置高达 40% 的 GPU。随之而来的是商业模式的核爆:生产每百万 Token 的成本比 GB300 降低了 35 倍。
极致协同设计是关键。Vera Rubin 的性能提升得益于 NVFP4 量化、第六代 NVLink 以及 MegaMoE 等技术。NVFP4 将模型权重压缩至 4 位精度,大幅缩减内存占用;NVLink 提供了比以太网快 10 倍的互联网络,让 MoE 架构的大模型能够在 72 个 GPU 间流畅调度专家子网络。这不再是简单的显卡销售,而是一整套「AI 发电厂」的构建。
同日,英伟达 Groq 3 LPX 也全面量产。作为 Vera Rubin 平台的专属扩展,Groq 3 LPX 旨在解决 AI 智能体的解码延迟问题。它通过将上下文处理与 Token 生成分离,实现了极致的低延迟。在 Artificial Analysis 基准测试中,Groq 3 LPX 在 10 万 Token 超长上下文窗口下运行 Gemma 4 31B,输出速度达到惊人的 3400 Token/秒,比竞品快 4 倍。在编码任务中,其最大输出速度可达 6981 token/s,使得过去几小时的任务几分钟内即可完成。
专为智能体打造的 Vera CPU 也在同日发布。它配备了 88 个自研 Olympus 核心和 1.2TB/s 的高带宽内存,专门负责处理 Agent 背后繁重的调度工作,如执行 Python 代码、翻阅上下文等。SpaceXAI 已连夜宣布规模化部署 Vera CPU,用于其 Grok 模型。更令人震撼的是,SpaceXAI 正在基于 Vera Rubin 平台建设吉瓦级算力工厂,并计划将优化版 Vera Rubin NVL72 部署在 2028 年的 Starmind 卫星上。英伟达通过 CPU、GPU 和加速器的协同,正在为「Agent 时代」重新铺路。
