昊梵体育网

#how i ai# 英伟达放出 Vera Rubin NVL72 的实测数据 在真实 Agent 编程负载下,Vera Rubin NVL72 比 GB300 NVL72 每兆瓦吞吐高出最多 30 倍,每百万 token 成本最多低 35 倍。 数据来自英伟达用 SemiAnalysis AgentX 工作负载测出的早期结果。 Agent 的推理形态和聊天完全不一样,聊天或摘要的输 ​

how i ai

英伟达放出 Vera Rubin NVL72 的实测数据

在真实 Agent 编程负载下,Vera Rubin NVL72 比 GB300 NVL72 每兆瓦吞吐高出最多 30 倍,每百万 token 成本最多低 35 倍。

数据来自英伟达用 SemiAnalysis AgentX 工作负载测出的早期结果。

Agent 的推理形态和聊天完全不一样,聊天或摘要的输入输出通常 1K 到 8K token,但 Agent 会连续调用工具、不断把中间结果塞进下一轮上下文,输入长度动辄几十万 token。OpenRouter 的数据也显示,Agentic AI 工作负载比简单聊天请求多消耗 15 倍 token。所以评价基础设施不能再只看单次推理,而得看完整的多轮工作流。

传统推理和 Agent 推理存在不同:传统推理输入长度固定、没有工具调用、单次请求;Agent 推理则是动态序列、工具调用、多轮交互、端到端任务。

Vera Rubin 的测试就是基于这种真实世界 Agent 编程轨迹,保留了上下文增长、工具调用和子 Agent 生成的完整过程。

Vera Rubin NVL72 支持的优化包括:把上下文处理(prefill)和生成(decode)拆开独立扩展;用 rate matching 让 prefill 和 decode GPU 的速度对齐;大规模专家并行;分布式 KV cache,把不活跃的上下文 offloading 到主机和存储;KV-aware routing 把请求导向已经缓存了相关上下文的 GPU;还有 MegaMoE 这类融合 CUDA kernel,把多个计算和通信操作并成一次执行。

硬件层面,Rubin GPU 有第五代 Tensor Core、第三代 Transformer Engine,NVFP4 量化把权重压到 4bit。NVL72 的 scale-up 域依赖第六代 NVLink Switch,报称比通用以太网方案包速率高 10 倍、延迟低 3 倍。整个平台是七芯片架构,除了 Rubin GPU,还包括 Vera CPU、Groq 3 LPU、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX 和 ConnectX-9 SuperNIC。

另外英伟达提到,通过 NVIDIA DSX MaxLPS 技术,可以在同一兆瓦预算里多部署最多 40% 的 GPU,相当于在 AI factory 尺度上再挤出吞吐。

Vera Rubin 已经全面投产,正在生态规模化。