暂无菜单项

NVIDIA Vera Rubin首测:AgentX吞吐每兆瓦最高提升30倍,AI Agent算力进入系统级竞争

发布于
5

从固定序列跑分到真实智能体会话,性能评估正在转向长上下文、工具调用、KV缓存与每兆瓦有效吞吐

NVIDIA 公布了 Vera Rubin NVL72 在 AgentX 智能体编码工作负载上的首批片上预览数据。与单轮聊天基准不同,AgentX 会回放真实编码智能体会话,覆盖上下文增长、工具调用、子智能体协作、KV 缓存复用和动态并发,更接近生产环境中的 Agent 推理。

根据 NVIDIA 官方技术博客,在每位用户 160 Token/秒的交互目标下,Vera Rubin NVL72 的每兆瓦 AI 工厂吞吐量相较 GB300 NVL72 最高提升 30 倍。不过,这组数据由 NVIDIA 测量,仍待 SemiAnalysis 复核;它代表特定模型、软件栈与交互点下的预览结果,不能简单外推为所有任务都快 30 倍。

想了解相关硬件与开发平台,可查看站内的 NVIDIA 英伟达官网导航;文中测试涉及的模型入口可参考 DeepSeek 站内导航

NVIDIA Vera Rubin AgentX与AI工厂配图 1
Vera Rubin NVL72 面向大规模训练与智能体推理的机架级平台。
NVIDIA Vera Rubin AgentX与AI工厂配图 2
NVIDIA 公布 Vera Rubin 与 Blackwell 在 AgentX 工作负载下的对比。
NVIDIA Vera Rubin AgentX与AI工厂配图 3
智能体任务会不断累积上下文并穿插工具调用。
NVIDIA Vera Rubin AgentX与AI工厂配图 4
AgentX 用真实编码智能体会话替代固定长度请求。

一、Agent 时代为什么需要一套新基准?

普通聊天通常是一问一答,而智能体会连续规划、调用工具、执行代码、读取结果,再把新信息追加到上下文。NVIDIA 引用 OpenRouter 的使用数据称,单个智能体请求消耗的 Token 数量可达到普通聊天请求的 15 倍。负载形态因此从“固定输入、固定输出”转向长时间、状态化、波动明显的会话。

传统 8K 输入、1K 输出等固定序列测试仍可比较基础推理能力,却难以体现工具调用间隙、长上下文预填充、缓存命中率、尾延迟和多 Agent 并发。AgentX 的价值,是把同一批预录制编码会话逐轮回放给不同系统,让差异更多来自服务栈和硬件,而不是人为挑选最有利的请求长度。

NVIDIA Vera Rubin AgentX与AI工厂配图 5
传统聊天请求与智能体请求的负载形态明显不同。
NVIDIA Vera Rubin AgentX与AI工厂配图 6
固定 8K/1K 序列测试难以覆盖动态智能体工作流。
NVIDIA Vera Rubin AgentX与AI工厂配图 7
会话上下文随主智能体与子智能体协作持续增长。
NVIDIA Vera Rubin AgentX与AI工厂配图 8
AgentX 同时观察吞吐、交互速度、延迟与首 Token 时间。

二、30 倍吞吐提升应该如何正确理解?

NVIDIA 公布的核心指标是“每兆瓦吞吐量”,而不是单颗 GPU 的峰值算力。AgentX 同时约束每位用户的交互速度,再比较固定电力预算下系统能承载多少有效 Token。官方图表显示,在 110、130 和 160 Token/秒等不同交互点上,Vera Rubin 相对 GB300 的优势并不相同,最高 30 倍出现在 160 Token/秒这一测试点。

这也解释了为什么标题中的“最高提升 30 倍”必须带限定条件:模型是 DeepSeek V4-Pro,负载是 AgentX,指标是每兆瓦吞吐,数据是 NVIDIA 预览测试且尚待第三方复核。对采购方而言,更重要的是查看自己业务对应的延迟、并发、模型精度、机架功率和软件配置。

NVIDIA Vera Rubin AgentX与AI工厂配图 9
Vera Rubin NVL72 的预览数据扩展了每兆瓦吞吐边界。
NVIDIA Vera Rubin AgentX与AI工厂配图 10
在高交互目标下,Vera Rubin 与 GB300 的差距进一步扩大。
NVIDIA Vera Rubin AgentX与AI工厂配图 11
GB300 在 DeepSeek V4-Pro 负载上相对 H200 显示出明显优势。
NVIDIA Vera Rubin AgentX与AI工厂配图 12
单位 Token 成本必须结合负载、交互目标与系统配置理解。

三、GB300、H200 与 Vera Rubin:真正比的是整套系统

同一份官方数据中,GB300 NVL72 在 AgentX 的 DeepSeek V4-Pro 1.6T 负载上,相比 H200 NVL8 的每兆瓦吞吐最高提升 15 倍,每百万 Token 成本最高降低 10 倍。对于更大的 MoE 模型,优势还会受到专家并行、通信带宽和运行时调度影响。

需要注意,原始报道把不同代际、不同指标的提升连续相乘,并进一步推导出“900 倍速度”或“35 倍成本下降”,容易产生误导。硬件代际不能脱离模型、精度、批量、交互速度和系统价格直接相乘。本文保留官方可核验的 30 倍、15 倍与 10 倍数据,并明确各自比较条件。

NVIDIA Vera Rubin AgentX与AI工厂配图 13
大型 MoE 模型对互联、内存与专家并行提出更高要求。
NVIDIA Vera Rubin AgentX与AI工厂配图 14
系统级优化包含运行时、内核、路由与机架互联。
NVIDIA Vera Rubin AgentX与AI工厂配图 15
NVIDIA Dynamo 用分离式服务与会话感知路由协调推理资源。
NVIDIA Vera Rubin AgentX与AI工厂配图 16
NVLink 将 72 颗 GPU 连接为机架级计算域。

四、性能来自哪里:GPU 之外还有运行时、缓存和互联

Vera Rubin 的提升并非只依赖单颗芯片。对大型 MoE 与长上下文 Agent,系统需要同时解决专家并行、KV 缓存复用、预填充与解码分离、跨节点通信和请求路由。NVIDIA Dynamo 会把预填充与解码放到可独立扩展的工作池,并通过会话感知与 KV 缓存感知路由减少重复计算。

NVLink 6 和机架级互联把 72 颗 GPU 连接成统一的扩展域;混合精度、MoE 内核与通信计算重叠则降低等待时间。对用户而言,这意味着“买更快 GPU”正在变成“设计一套更高效的 AI 工厂”。

NVIDIA Vera Rubin AgentX与AI工厂配图 17
Rubin GPU、Vera CPU 与 Groq 3 LPX 承担不同推理阶段。
NVIDIA Vera Rubin AgentX与AI工厂配图 18
Groq 3 LPX 是面向低延迟生成的机架级推理扩展。
NVIDIA Vera Rubin AgentX与AI工厂配图 19
LPX 与 Vera Rubin 组合形成异构推理架构。
NVIDIA Vera Rubin AgentX与AI工厂配图 20
LPX 系统由 256 个互联的 Groq 3 LPU 加速器组成。

五、Groq 3 LPX:把低延迟 Token 生成交给专用加速器

NVIDIA Groq 3 LPX 是 Vera Rubin 平台的机架级推理扩展,重点处理低延迟、可预测的 Token 生成。官方规格显示,一个 LPX 系统由 256 个 Groq 3 LPU 组成,提供 128GB 片上 SRAM、40PB/s 片上 SRAM 带宽、640TB/s 机架级扩展带宽和 315PFLOPS FP8 推理算力。

其设计思路是异构推理:Rubin GPU 负责大规模上下文预填充与解码注意力,LPX 处理对延迟敏感的 FFN 或 MoE 专家执行。官方宣称,Vera Rubin 与 LPX 的组合面向万亿参数模型可实现最高 35 倍每兆瓦推理吞吐提升;同样,这属于厂商在特定配置下给出的“最高”指标,实际效果取决于模型和服务策略。

NVIDIA Vera Rubin AgentX与AI工厂配图 21
每个计算托盘集成 LPU、主机处理器与网络扩展逻辑。
NVIDIA Vera Rubin AgentX与AI工厂配图 22
Groq 3 LPU 强调确定性执行和显式数据移动。
NVIDIA Vera Rubin AgentX与AI工厂配图 23
高带宽片上 SRAM 用于降低 Token 生成阶段的抖动。
NVIDIA Vera Rubin AgentX与AI工厂配图 24
芯片间互联帮助多个 LPU 以可预测方式协同。

六、确定性执行为什么对交互式 Agent 重要?

Groq LPU 强调编译器统一编排计算、内存访问和芯片间通信。与依赖动态硬件调度不同,显式数据移动和片上 SRAM 能减少运行时抖动,让首 Token 时间和每 Token 延迟在高并发下更稳定。

这种架构并不是要替代所有 GPU 任务。批量文档处理、Embedding 和离线生成更关注总吞吐与利用率;编码助手、语音助手和多 Agent 协作更关注每位用户速度、首 Token 时间与尾延迟。异构系统的目标,是让不同处理器承担最适合自己的阶段。

NVIDIA Vera Rubin AgentX与AI工厂配图 25
编译器统一调度计算、通信和同步。
NVIDIA Vera Rubin AgentX与AI工厂配图 26
高吞吐批处理与低延迟交互需要不同优化路径。
NVIDIA Vera Rubin AgentX与AI工厂配图 27
异构推理把长上下文预填充和低延迟解码分开。
NVIDIA Vera Rubin AgentX与AI工厂配图 28
Dynamo 可根据请求阶段把任务路由至 GPU 或 LPU。

七、DSX MaxLPS:当数据中心先碰到电力上限

机架越来越密集后,数据中心的约束不再只是芯片数量,而是土地、电力、冷却和配电。NVIDIA DSX MaxLPS 通过动态功率分配、工作负载功率配置、软件调度和 45℃ 温水液冷,提高固定站点功率下的 GPU 容量。

NVIDIA 预计,MaxLPS 配合数据中心功率规划,可在相同电力预算内配置最高 40% 更多 Rubin GPU。官方代表性测试还显示,通过降低机架预留功率,可在保持工作负载吞吐的同时容纳更多机架。这里的 40% 是规划上限与特定场景预测,不是所有现有机房都能直接获得的固定收益。

NVIDIA Vera Rubin AgentX与AI工厂配图 29
DSX MaxLPS 从站点、机架与工作负载层统一管理功耗。
NVIDIA Vera Rubin AgentX与AI工厂配图 30
动态功率分配回收静态配置中被闲置的电力余量。
NVIDIA Vera Rubin AgentX与AI工厂配图 31
温水液冷与工作负载功率配置提升固定电力下的计算密度。
NVIDIA Vera Rubin AgentX与AI工厂配图 32
AI 工厂的竞争焦点正在转向每兆瓦能产出多少有效 Token。

八、对开发者和企业意味着什么?

第一,基准要跟着工作负载变化。如果业务是智能体编码、深度研究或多 Agent 协作,应重点观察长上下文、工具调用、缓存命中、首 Token 时间和并发下的尾延迟,而不是只看固定序列的峰值 TPS。

第二,成本核算要从 GPU 单价升级为系统经济性。电力、冷却、网络、软件、利用率和服务质量都会影响每百万 Token 成本。厂商公布的“最高倍数”适合观察技术方向,不应直接替代真实业务压测。

第三,AI 基础设施正在异构化。GPU、CPU、LPU、DPU、NVLink 与调度软件共同决定最终体验。Vera Rubin 的意义不只是下一代 GPU,而是 NVIDIA 希望把训练、长上下文处理、低延迟解码和 AI 工厂运营纳入同一套平台。

结语:Agent 算力竞争进入“系统级共设计”阶段

Vera Rubin 的首批 AgentX 数据释放出清晰信号:AI 推理的核心指标正在从单卡峰值,转向特定交互目标下每兆瓦能持续产出多少有效 Token。30 倍提升是值得关注的预览结果,但必须连同测试模型、负载、交互点和待复核状态一起理解。

接下来真正决定 Agent 商业化速度的,不只是哪家公司造出更强芯片,还包括谁能把计算、互联、缓存、调度、功率和冷却设计成稳定、可扩展且可负担的完整系统。

常见问题(FAQ)

NVIDIA Vera Rubin NVL72 在 AgentX 中提升了多少?
NVIDIA 的预览测试显示,在 DeepSeek V4-Pro AgentX 负载、每位用户 160 Token/秒的交互点上,每兆瓦吞吐量相较 GB300 NVL72 最高提升 30 倍;数据仍待 SemiAnalysis 复核。
AgentX 与传统大模型跑分有什么区别?
AgentX 回放真实编码智能体会话,覆盖上下文增长、工具调用、子智能体、KV 缓存复用和动态并发,而不是只测试固定输入输出长度。
Vera Rubin 的 30 倍提升是否适用于所有 AI 任务?
不适用。该数字对应特定模型、工作负载、软件栈和交互速度,应通过实际业务压测评估部署收益。
NVIDIA Groq 3 LPX 是什么?
Groq 3 LPX 是与 Vera Rubin 配套的机架级低延迟推理加速系统,主要面向可预测、快速的 Token 生成。
DSX MaxLPS 有什么作用?
DSX MaxLPS 通过动态功率分配、工作负载功率配置和液冷设计,提高固定站点电力预算下可部署的计算密度。
0 点赞
0 收藏
分享
0 讨论
反馈
近期热门