### [NVIDIA Vera Rubin首测:AgentX吞吐每兆瓦最高提升30倍,AI Agent算力进入系统级竞争](https://www.zuoshipin.com/article/25433) **Published:** 2026-08-26T03:55:09 **Author:** 天才交易员 **Excerpt:** NVIDIA 首次公布 Vera Rubin NVL72 的 AgentX 预览数据:在特定 DeepSeek… 从固定序列跑分到真实智能体会话,性能评估正在转向长上下文、工具调用、KV缓存与每兆瓦有效吞吐 NVIDIA 公布了 Vera Rubin NVL72 在 AgentX 智能体编码工作负载上的首批片上预览数据。与单轮聊天基准不同,AgentX 会回放真实编码智能体会话,覆盖上下文增长、工具调用、子智能体协作、KV 缓存复用和动态并发,更接近生产环境中的 Agent 推理。 根据 NVIDIA 官方技术博客,在每位用户 160 Token/秒的交互目标下,Vera Rubin NVL72 的每兆瓦 AI 工厂吞吐量相较 GB300 NVL72 最高提升 30 倍。不过,这组数据由 NVIDIA 测量,仍待 SemiAnalysis 复核;它代表特定模型、软件栈与交互点下的预览结果,不能简单外推为所有任务都快 30 倍。 想了解相关硬件与开发平台,可查看站内的 [**NVIDIA 英伟达官网导航**](https://www.zuoshipin.com/link/25398.html);文中测试涉及的模型入口可参考 [**DeepSeek 站内导航**](https://www.zuoshipin.com/link/873.html)。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 1](https://admin.zuoshipin.com/wp-content/uploads/2026/08/183c0f2f-a03e-11f1-8d73-fa163e47d677.webp) Vera Rubin NVL72 面向大规模训练与智能体推理的机架级平台。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 2](https://admin.zuoshipin.com/wp-content/uploads/2026/08/18bc347b-a03e-11f1-b66a-fa163e47d677.webp) NVIDIA 公布 Vera Rubin 与 Blackwell 在 AgentX 工作负载下的对比。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 3](https://admin.zuoshipin.com/wp-content/uploads/2026/08/193ec8dc-a03e-11f1-91d5-fa163e47d677.gif) 智能体任务会不断累积上下文并穿插工具调用。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 4](https://admin.zuoshipin.com/wp-content/uploads/2026/08/199ea877-a03e-11f1-bec7-fa163e47d677.webp) AgentX 用真实编码智能体会话替代固定长度请求。 ## 一、Agent 时代为什么需要一套新基准? 普通聊天通常是一问一答,而智能体会连续规划、调用工具、执行代码、读取结果,再把新信息追加到上下文。NVIDIA 引用 OpenRouter 的使用数据称,单个智能体请求消耗的 Token 数量可达到普通聊天请求的 15 倍。负载形态因此从“固定输入、固定输出”转向长时间、状态化、波动明显的会话。 传统 8K 输入、1K 输出等固定序列测试仍可比较基础推理能力,却难以体现工具调用间隙、长上下文预填充、缓存命中率、尾延迟和多 Agent 并发。AgentX 的价值,是把同一批预录制编码会话逐轮回放给不同系统,让差异更多来自服务栈和硬件,而不是人为挑选最有利的请求长度。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 5](https://admin.zuoshipin.com/wp-content/uploads/2026/08/1a0ef6cd-a03e-11f1-9303-fa163e47d677.webp) 传统聊天请求与智能体请求的负载形态明显不同。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 6](https://admin.zuoshipin.com/wp-content/uploads/2026/08/1a8780e8-a03e-11f1-85bd-fa163e47d677.webp) 固定 8K/1K 序列测试难以覆盖动态智能体工作流。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 7](https://admin.zuoshipin.com/wp-content/uploads/2026/08/1b717344-a03e-11f1-9e74-fa163e47d677.gif) 会话上下文随主智能体与子智能体协作持续增长。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 8](https://admin.zuoshipin.com/wp-content/uploads/2026/08/1bd3fa9c-a03e-11f1-98a1-fa163e47d677.webp) AgentX 同时观察吞吐、交互速度、延迟与首 Token 时间。 ## 二、30 倍吞吐提升应该如何正确理解? NVIDIA 公布的核心指标是“每兆瓦吞吐量”,而不是单颗 GPU 的峰值算力。AgentX 同时约束每位用户的交互速度,再比较固定电力预算下系统能承载多少有效 Token。官方图表显示,在 110、130 和 160 Token/秒等不同交互点上,Vera Rubin 相对 GB300 的优势并不相同,最高 30 倍出现在 160 Token/秒这一测试点。 这也解释了为什么标题中的“最高提升 30 倍”必须带限定条件:模型是 DeepSeek V4-Pro,负载是 AgentX,指标是每兆瓦吞吐,数据是 NVIDIA 预览测试且尚待第三方复核。对采购方而言,更重要的是查看自己业务对应的延迟、并发、模型精度、机架功率和软件配置。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 9](https://admin.zuoshipin.com/wp-content/uploads/2026/08/1c9dacff-a03e-11f1-897c-fa163e47d677.webp) Vera Rubin NVL72 的预览数据扩展了每兆瓦吞吐边界。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 10](https://admin.zuoshipin.com/wp-content/uploads/2026/08/1d677982-a03e-11f1-8a3c-fa163e47d677.webp) 在高交互目标下,Vera Rubin 与 GB300 的差距进一步扩大。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 11](https://admin.zuoshipin.com/wp-content/uploads/2026/08/1dd830c4-a03e-11f1-a818-fa163e47d677.webp) GB300 在 DeepSeek V4-Pro 负载上相对 H200 显示出明显优势。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 12](https://admin.zuoshipin.com/wp-content/uploads/2026/08/1ea0ad83-a03e-11f1-9dc5-fa163e47d677.webp) 单位 Token 成本必须结合负载、交互目标与系统配置理解。 ## 三、GB300、H200 与 Vera Rubin:真正比的是整套系统 同一份官方数据中,GB300 NVL72 在 AgentX 的 DeepSeek V4-Pro 1.6T 负载上,相比 H200 NVL8 的每兆瓦吞吐最高提升 15 倍,每百万 Token 成本最高降低 10 倍。对于更大的 MoE 模型,优势还会受到专家并行、通信带宽和运行时调度影响。 需要注意,原始报道把不同代际、不同指标的提升连续相乘,并进一步推导出“900 倍速度”或“35 倍成本下降”,容易产生误导。硬件代际不能脱离模型、精度、批量、交互速度和系统价格直接相乘。本文保留官方可核验的 30 倍、15 倍与 10 倍数据,并明确各自比较条件。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 13](https://admin.zuoshipin.com/wp-content/uploads/2026/08/1f1042d4-a03e-11f1-889e-fa163e47d677.webp) 大型 MoE 模型对互联、内存与专家并行提出更高要求。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 14](https://admin.zuoshipin.com/wp-content/uploads/2026/08/1fd9912f-a03e-11f1-8220-fa163e47d677.webp) 系统级优化包含运行时、内核、路由与机架互联。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 15](https://admin.zuoshipin.com/wp-content/uploads/2026/08/2049cf92-a03e-11f1-852a-fa163e47d677.webp) NVIDIA Dynamo 用分离式服务与会话感知路由协调推理资源。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 16](https://admin.zuoshipin.com/wp-content/uploads/2026/08/20b7bfc5-a03e-11f1-a88a-fa163e47d677.webp) NVLink 将 72 颗 GPU 连接为机架级计算域。 ## 四、性能来自哪里:GPU 之外还有运行时、缓存和互联 Vera Rubin 的提升并非只依赖单颗芯片。对大型 MoE 与长上下文 Agent,系统需要同时解决专家并行、KV 缓存复用、预填充与解码分离、跨节点通信和请求路由。NVIDIA Dynamo 会把预填充与解码放到可独立扩展的工作池,并通过会话感知与 KV 缓存感知路由减少重复计算。 NVLink 6 和机架级互联把 72 颗 GPU 连接成统一的扩展域;混合精度、MoE 内核与通信计算重叠则降低等待时间。对用户而言,这意味着“买更快 GPU”正在变成“设计一套更高效的 AI 工厂”。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 17](https://admin.zuoshipin.com/wp-content/uploads/2026/08/21831ae1-a03e-11f1-a479-fa163e47d677.webp) Rubin GPU、Vera CPU 与 Groq 3 LPX 承担不同推理阶段。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 18](https://admin.zuoshipin.com/wp-content/uploads/2026/08/21effd0a-a03e-11f1-a8ff-fa163e47d677.webp) Groq 3 LPX 是面向低延迟生成的机架级推理扩展。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 19](https://admin.zuoshipin.com/wp-content/uploads/2026/08/226612d5-a03e-11f1-9d7e-fa163e47d677.webp) LPX 与 Vera Rubin 组合形成异构推理架构。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 20](https://admin.zuoshipin.com/wp-content/uploads/2026/08/2312ec1b-a03e-11f1-9a38-fa163e47d677.webp) LPX 系统由 256 个互联的 Groq 3 LPU 加速器组成。 ## 五、Groq 3 LPX:把低延迟 Token 生成交给专用加速器 NVIDIA Groq 3 LPX 是 Vera Rubin 平台的机架级推理扩展,重点处理低延迟、可预测的 Token 生成。官方规格显示,一个 LPX 系统由 256 个 Groq 3 LPU 组成,提供 128GB 片上 SRAM、40PB/s 片上 SRAM 带宽、640TB/s 机架级扩展带宽和 315PFLOPS FP8 推理算力。 其设计思路是异构推理:Rubin GPU 负责大规模上下文预填充与解码注意力,LPX 处理对延迟敏感的 FFN 或 MoE 专家执行。官方宣称,Vera Rubin 与 LPX 的组合面向万亿参数模型可实现最高 35 倍每兆瓦推理吞吐提升;同样,这属于厂商在特定配置下给出的“最高”指标,实际效果取决于模型和服务策略。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 21](https://admin.zuoshipin.com/wp-content/uploads/2026/08/238839db-a03e-11f1-9114-fa163e47d677.webp) 每个计算托盘集成 LPU、主机处理器与网络扩展逻辑。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 22](https://admin.zuoshipin.com/wp-content/uploads/2026/08/23f18228-a03e-11f1-b4d0-fa163e47d677.webp) Groq 3 LPU 强调确定性执行和显式数据移动。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 23](https://admin.zuoshipin.com/wp-content/uploads/2026/08/245db013-a03e-11f1-a342-fa163e47d677.webp) 高带宽片上 SRAM 用于降低 Token 生成阶段的抖动。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 24](https://admin.zuoshipin.com/wp-content/uploads/2026/08/24c5fea8-a03e-11f1-bb35-fa163e47d677.webp) 芯片间互联帮助多个 LPU 以可预测方式协同。 ## 六、确定性执行为什么对交互式 Agent 重要? Groq LPU 强调编译器统一编排计算、内存访问和芯片间通信。与依赖动态硬件调度不同,显式数据移动和片上 SRAM 能减少运行时抖动,让首 Token 时间和每 Token 延迟在高并发下更稳定。 这种架构并不是要替代所有 GPU 任务。批量文档处理、Embedding 和离线生成更关注总吞吐与利用率;编码助手、语音助手和多 Agent 协作更关注每位用户速度、首 Token 时间与尾延迟。异构系统的目标,是让不同处理器承担最适合自己的阶段。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 25](https://admin.zuoshipin.com/wp-content/uploads/2026/08/253b75b3-a03e-11f1-a339-fa163e47d677.webp) 编译器统一调度计算、通信和同步。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 26](https://admin.zuoshipin.com/wp-content/uploads/2026/08/25ae73f7-a03e-11f1-8732-fa163e47d677.webp) 高吞吐批处理与低延迟交互需要不同优化路径。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 27](https://admin.zuoshipin.com/wp-content/uploads/2026/08/261d5bcc-a03e-11f1-bc47-fa163e47d677.webp) 异构推理把长上下文预填充和低延迟解码分开。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 28](https://admin.zuoshipin.com/wp-content/uploads/2026/08/26efaa35-a03e-11f1-954f-fa163e47d677.webp) Dynamo 可根据请求阶段把任务路由至 GPU 或 LPU。 ## 七、DSX MaxLPS:当数据中心先碰到电力上限 机架越来越密集后,数据中心的约束不再只是芯片数量,而是土地、电力、冷却和配电。NVIDIA DSX MaxLPS 通过动态功率分配、工作负载功率配置、软件调度和 45℃ 温水液冷,提高固定站点功率下的 GPU 容量。 NVIDIA 预计,MaxLPS 配合数据中心功率规划,可在相同电力预算内配置最高 40% 更多 Rubin GPU。官方代表性测试还显示,通过降低机架预留功率,可在保持工作负载吞吐的同时容纳更多机架。这里的 40% 是规划上限与特定场景预测,不是所有现有机房都能直接获得的固定收益。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 29](https://admin.zuoshipin.com/wp-content/uploads/2026/08/2769b075-a03e-11f1-bc22-fa163e47d677.webp) DSX MaxLPS 从站点、机架与工作负载层统一管理功耗。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 30](https://admin.zuoshipin.com/wp-content/uploads/2026/08/27dffbe0-a03e-11f1-b278-fa163e47d677.webp) 动态功率分配回收静态配置中被闲置的电力余量。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 31](https://admin.zuoshipin.com/wp-content/uploads/2026/08/28557d9a-a03e-11f1-8cc2-fa163e47d677.webp) 温水液冷与工作负载功率配置提升固定电力下的计算密度。 ![NVIDIA Vera Rubin AgentX与AI工厂配图 32](https://admin.zuoshipin.com/wp-content/uploads/2026/08/293333ef-a03e-11f1-9177-fa163e47d677.webp) AI 工厂的竞争焦点正在转向每兆瓦能产出多少有效 Token。 ## 八、对开发者和企业意味着什么? **第一,基准要跟着工作负载变化。**如果业务是智能体编码、深度研究或多 Agent 协作,应重点观察长上下文、工具调用、缓存命中、首 Token 时间和并发下的尾延迟,而不是只看固定序列的峰值 TPS。 **第二,成本核算要从 GPU 单价升级为系统经济性。**电力、冷却、网络、软件、利用率和服务质量都会影响每百万 Token 成本。厂商公布的“最高倍数”适合观察技术方向,不应直接替代真实业务压测。 **第三,AI 基础设施正在异构化。**GPU、CPU、LPU、DPU、NVLink 与调度软件共同决定最终体验。Vera Rubin 的意义不只是下一代 GPU,而是 NVIDIA 希望把训练、长上下文处理、低延迟解码和 AI 工厂运营纳入同一套平台。 ## 结语:Agent 算力竞争进入“系统级共设计”阶段 Vera Rubin 的首批 AgentX 数据释放出清晰信号:AI 推理的核心指标正在从单卡峰值,转向特定交互目标下每兆瓦能持续产出多少有效 Token。30 倍提升是值得关注的预览结果,但必须连同测试模型、负载、交互点和待复核状态一起理解。 接下来真正决定 Agent 商业化速度的,不只是哪家公司造出更强芯片,还包括谁能把计算、互联、缓存、调度、功率和冷却设计成稳定、可扩展且可负担的完整系统。 **Categories:** AI资讯 ---