从固定序列跑分到真实智能体会话,性能评估正在转向长上下文、工具调用、KV缓存与每兆瓦有效吞吐
NVIDIA 公布了 Vera Rubin NVL72 在 AgentX 智能体编码工作负载上的首批片上预览数据。与单轮聊天基准不同,AgentX 会回放真实编码智能体会话,覆盖上下文增长、工具调用、子智能体协作、KV 缓存复用和动态并发,更接近生产环境中的 Agent 推理。
根据 NVIDIA 官方技术博客,在每位用户 160 Token/秒的交互目标下,Vera Rubin NVL72 的每兆瓦 AI 工厂吞吐量相较 GB300 NVL72 最高提升 30 倍。不过,这组数据由 NVIDIA 测量,仍待 SemiAnalysis 复核;它代表特定模型、软件栈与交互点下的预览结果,不能简单外推为所有任务都快 30 倍。
想了解相关硬件与开发平台,可查看站内的 NVIDIA 英伟达官网导航;文中测试涉及的模型入口可参考 DeepSeek 站内导航。




一、Agent 时代为什么需要一套新基准?
普通聊天通常是一问一答,而智能体会连续规划、调用工具、执行代码、读取结果,再把新信息追加到上下文。NVIDIA 引用 OpenRouter 的使用数据称,单个智能体请求消耗的 Token 数量可达到普通聊天请求的 15 倍。负载形态因此从“固定输入、固定输出”转向长时间、状态化、波动明显的会话。
传统 8K 输入、1K 输出等固定序列测试仍可比较基础推理能力,却难以体现工具调用间隙、长上下文预填充、缓存命中率、尾延迟和多 Agent 并发。AgentX 的价值,是把同一批预录制编码会话逐轮回放给不同系统,让差异更多来自服务栈和硬件,而不是人为挑选最有利的请求长度。




二、30 倍吞吐提升应该如何正确理解?
NVIDIA 公布的核心指标是“每兆瓦吞吐量”,而不是单颗 GPU 的峰值算力。AgentX 同时约束每位用户的交互速度,再比较固定电力预算下系统能承载多少有效 Token。官方图表显示,在 110、130 和 160 Token/秒等不同交互点上,Vera Rubin 相对 GB300 的优势并不相同,最高 30 倍出现在 160 Token/秒这一测试点。
这也解释了为什么标题中的“最高提升 30 倍”必须带限定条件:模型是 DeepSeek V4-Pro,负载是 AgentX,指标是每兆瓦吞吐,数据是 NVIDIA 预览测试且尚待第三方复核。对采购方而言,更重要的是查看自己业务对应的延迟、并发、模型精度、机架功率和软件配置。




三、GB300、H200 与 Vera Rubin:真正比的是整套系统
同一份官方数据中,GB300 NVL72 在 AgentX 的 DeepSeek V4-Pro 1.6T 负载上,相比 H200 NVL8 的每兆瓦吞吐最高提升 15 倍,每百万 Token 成本最高降低 10 倍。对于更大的 MoE 模型,优势还会受到专家并行、通信带宽和运行时调度影响。
需要注意,原始报道把不同代际、不同指标的提升连续相乘,并进一步推导出“900 倍速度”或“35 倍成本下降”,容易产生误导。硬件代际不能脱离模型、精度、批量、交互速度和系统价格直接相乘。本文保留官方可核验的 30 倍、15 倍与 10 倍数据,并明确各自比较条件。




四、性能来自哪里:GPU 之外还有运行时、缓存和互联
Vera Rubin 的提升并非只依赖单颗芯片。对大型 MoE 与长上下文 Agent,系统需要同时解决专家并行、KV 缓存复用、预填充与解码分离、跨节点通信和请求路由。NVIDIA Dynamo 会把预填充与解码放到可独立扩展的工作池,并通过会话感知与 KV 缓存感知路由减少重复计算。
NVLink 6 和机架级互联把 72 颗 GPU 连接成统一的扩展域;混合精度、MoE 内核与通信计算重叠则降低等待时间。对用户而言,这意味着“买更快 GPU”正在变成“设计一套更高效的 AI 工厂”。




五、Groq 3 LPX:把低延迟 Token 生成交给专用加速器
NVIDIA Groq 3 LPX 是 Vera Rubin 平台的机架级推理扩展,重点处理低延迟、可预测的 Token 生成。官方规格显示,一个 LPX 系统由 256 个 Groq 3 LPU 组成,提供 128GB 片上 SRAM、40PB/s 片上 SRAM 带宽、640TB/s 机架级扩展带宽和 315PFLOPS FP8 推理算力。
其设计思路是异构推理:Rubin GPU 负责大规模上下文预填充与解码注意力,LPX 处理对延迟敏感的 FFN 或 MoE 专家执行。官方宣称,Vera Rubin 与 LPX 的组合面向万亿参数模型可实现最高 35 倍每兆瓦推理吞吐提升;同样,这属于厂商在特定配置下给出的“最高”指标,实际效果取决于模型和服务策略。




六、确定性执行为什么对交互式 Agent 重要?
Groq LPU 强调编译器统一编排计算、内存访问和芯片间通信。与依赖动态硬件调度不同,显式数据移动和片上 SRAM 能减少运行时抖动,让首 Token 时间和每 Token 延迟在高并发下更稳定。
这种架构并不是要替代所有 GPU 任务。批量文档处理、Embedding 和离线生成更关注总吞吐与利用率;编码助手、语音助手和多 Agent 协作更关注每位用户速度、首 Token 时间与尾延迟。异构系统的目标,是让不同处理器承担最适合自己的阶段。




七、DSX MaxLPS:当数据中心先碰到电力上限
机架越来越密集后,数据中心的约束不再只是芯片数量,而是土地、电力、冷却和配电。NVIDIA DSX MaxLPS 通过动态功率分配、工作负载功率配置、软件调度和 45℃ 温水液冷,提高固定站点功率下的 GPU 容量。
NVIDIA 预计,MaxLPS 配合数据中心功率规划,可在相同电力预算内配置最高 40% 更多 Rubin GPU。官方代表性测试还显示,通过降低机架预留功率,可在保持工作负载吞吐的同时容纳更多机架。这里的 40% 是规划上限与特定场景预测,不是所有现有机房都能直接获得的固定收益。




八、对开发者和企业意味着什么?
第一,基准要跟着工作负载变化。如果业务是智能体编码、深度研究或多 Agent 协作,应重点观察长上下文、工具调用、缓存命中、首 Token 时间和并发下的尾延迟,而不是只看固定序列的峰值 TPS。
第二,成本核算要从 GPU 单价升级为系统经济性。电力、冷却、网络、软件、利用率和服务质量都会影响每百万 Token 成本。厂商公布的“最高倍数”适合观察技术方向,不应直接替代真实业务压测。
第三,AI 基础设施正在异构化。GPU、CPU、LPU、DPU、NVLink 与调度软件共同决定最终体验。Vera Rubin 的意义不只是下一代 GPU,而是 NVIDIA 希望把训练、长上下文处理、低延迟解码和 AI 工厂运营纳入同一套平台。
结语:Agent 算力竞争进入“系统级共设计”阶段
Vera Rubin 的首批 AgentX 数据释放出清晰信号:AI 推理的核心指标正在从单卡峰值,转向特定交互目标下每兆瓦能持续产出多少有效 Token。30 倍提升是值得关注的预览结果,但必须连同测试模型、负载、交互点和待复核状态一起理解。
接下来真正决定 Agent 商业化速度的,不只是哪家公司造出更强芯片,还包括谁能把计算、互联、缓存、调度、功率和冷却设计成稳定、可扩展且可负担的完整系统。






