AI产业链地图·知识库 AI深度报告解析 · Rubin·实测
🚧 网站建设中 → 产业链图谱

SemiAnalysis 实测 Vera Rubin 推理:67 倍性价比只在曲线末端,常用区间是 GB300 的 1.4–3 倍

来源 SemiAnalysis2026 年 9 月 14 日
本篇要点
  1. SemiAnalysis 用 AgentX 智能体基准实测预发布软件上的 Vera Rubin NVL72:在 170 TPS 这个点上,每美元 TCO 的吞吐是 GB300 的约 67 倍——但那是 GB300 曲线的末端。
  2. 在多数推理厂商实际运行的 60–100 TPS 区间,Rubin 只比最强的 GB300 配置高 1.4 到 3 倍;换成开源 SGLang 引擎,GB300 的交互速度还能追平 Rubin。
  3. 每吉瓦口径更有参考价值:75 TPS、60% 利用率下 Rubin 年收入 1,595 亿美元、模型利润 1,499 亿,比最强 GB300 配置高 39% 和 42%。
这是一份什么报告

SemiAnalysis 2026 年 9 月 14 日发布的文章,作者 Bryan Shan、Alec Ibarra、Cam Quilici、Wenyao Gao、Dylan Patel。这是 Vera Rubin 平台第一份经过验证的智能体推理实测结果
被测对象:英伟达 Vera Rubin NVL72 机柜,生产版 SKU,2300W TDP,每个计算托盘 1.5TB CPU LPDDR5X。SemiAnalysis 称 Rubin 是第一个跨六款产品协同设计的平台——Rubin GPU、Vera CPU、NVLink 6 交换芯片、ConnectX-9、BlueField-4、Spectrum-6。
测试方法:用自研的智能体推理基准 AgentX,在上千颗芯片的机群上回放真实世界的智能体流量。模型用 DeepSeek V4 Pro 1.6T(MIT 许可,无授权费),作为 1—3 万亿参数量级模型的代理。
重要限定:测试跑在早期预发布的 TensorRT-LLM 软件上,作者明确说性能后续还会提升。
口径说明:原文为英文,本篇为中文重制与注释,非全文翻译。凡本站换算或补充之处均标注「本站」。

01

先搞清楚它在测什么:智能体负载和两种成本口径

这两件事决定了所有倍数怎么读

AgentX 测的不是聊天机器人,是智能体工作负载。作者给了四个特征:

  • 多轮:一次会话包含几十到上百轮用户与助手的交互,而聊天场景只有寥寥几轮。
  • 长上下文:系统提示词、工具定义、加上大量轮次,上下文积累得很快。
  • 高前缀复用:对话是线性推进的,第 n−1 轮的输出被拼到第 n 轮,所以大部分上下文可以从 KV 缓存里取而不必重算。轮数 n 越大,缓存命中的比例越接近 1——前提是有足够的存储空间放这些 KV 张量
  • 子智能体突发:一次会话会派生出多个短生命周期的子智能体,各自带全新上下文,造成突发式的缓存压力。

成本这一侧,InferenceX 给每个 SKU 提供两套 TCO 口径,本篇后面所有倍数都要看清用的是哪一套:

  • 自有(超大规模厂商量级):自购自运营的每 GPU 小时成本,含服务器与网络资本开支按使用年限摊销、托管、电力和资金成本,按超大规模厂商的采购与融资条件计算(有批量折扣和定制服务器)。
  • 租赁(3 年承诺):向云厂商租用的市场价,按 SemiAnalysis 的租赁价格调研。2026 年 7 月的读数是 Rubin 每芯片每小时超过 8.5 美元,Blackwell Ultra NVL72 为 5 美元

本站提示:这两套口径会给出完全不同的倍数。文章的头条数字 67 倍用的是自有口径;租赁口径下同一个对比只有 62%。

02

头条的 67 倍:它成立在哪个点上

170 TPS 是 GB300 曲线快到头的地方

原文的说法是:在 170 TPS 的P90 交互速度目标下,同口径(都用 TensorRT-LLM、NVFP4 稠密),Vera Rubin NVL72 每美元自有 TCO 的总吞吐是 GB300 Dynamo TRT-LLM 的约 67 倍

理解这个数字的关键在下面这句:GB300 的最高 P90 交互速度是 171.53 TPS,Rubin 是 276.24 TPS(后者高 61%)。也就是说,170 TPS 这个对比点,正好卡在 GB300 曲线的最末端——在那里 GB300 已经拼尽全力,吞吐塌到接近于零,而 Rubin 还在舒适区。两个接近于零的分母做除法,倍数自然会很大。

作者自己在文中另一处把这件事讲明白了:同样是 170 TPS,如果 GB300 换成开源的 SGLang 引擎而不是 TRT-LLM,倍数从 62.9 倍(每兆瓦口径)掉到 5.56 倍。原文的原话是「引擎标签在引用高交互速度增益时是必不可少的」。

276.24
Rubin 最高 P90 交互速度(TPS)
171.53
GB300 Dynamo TRT-LLM 最高 P90 交互速度(TPS)
+61%
Rubin 相对 GB300 的最高交互速度优势

还有一句常被略过的限定:用开源 SGLang 栈时,GB300 能达到与 Vera Rubin 相近的交互速度。换句话说,「Rubin 交互速度高 61%」这个结论也是对特定引擎组合成立的。

03

常用区间:1.4 到 3 倍

这才是采购决策该用的数

原文在给出 67 倍之后紧接着写了一句限定,这句话本站认为是全文最该被读到的:在这条曲线上多数服务商实际会部署这个模型的位置(60—100 TPS),Vera Rubin 每 TCO 吞吐是最新最强 GB300 TRT-LLM 配置的 1.4 到 3 倍。

把两个数并排放,差距一目了然。

170 TPS(GB300 末端)
约 67×
60–100 TPS 上沿
60–100 TPS 下沿
1.4×

其余几个对比的量级如下,都在自有 TCO 口径下:

  • 单节点 B300,在 80 TPS 的 P90 服务等级目标下,推理服务商每美元能多产出 10 倍的 token。
  • H200,80 TPS 下是 18 倍,120 TPS 下扩大到 39 倍。原文的形容是「在智能体负载上,Vera Rubin 让 H200 看起来跟一台 TI-84 计算器差不多有竞争力」。
  • 不过作者也补了一句:Rubin 的优势在离线批量推理上更小,在训练上更大——大实验室正在把 Hopper 慢慢挪去做训练,原因就在这里。

端到端延迟这一侧也有优势。在每美元自有 TCO 产出 6,000 万 token 的水平上,Rubin 的 P90 端到端延迟约 20 秒,跑最新 vLLM 栈的 B200/B300 是 60 秒;到 1.6 亿 token 时差距扩大到约六倍——Rubin 仍是 20 秒,对方 120 秒

04

租赁口径:同样的钱多 62% 的 token

因为 Rubin 的租金本身就贵 70%

2026 年 7 月的三年期租赁价,Rubin 每芯片每小时超过 8.5 美元,Blackwell Ultra NVL72 5 美元——本站算了一下,租金本身贵了 70%

在这个更贵的价格上,原文的结论是升级仍然划算:在 80 TPS 的 P90 交互速度下,同样的租赁 TCO,Vera Rubin 能多产出 62% 的 token;在交互速度更高的那一段,最多能到 16 倍

本站的读法:62% 这个数比 67 倍诚实得多。它已经把 Rubin 的溢价租金扣进去了,也落在真实运行的速度区间上。一个推理服务商如果今天要做租还是不租的决定,该看的是这个数,而不是头条。

原文给出的建议很直接:有钱买或租 VR NVL72 就该上,它产出的 token 会显著更便宜,也因此更赚钱。作者还引了黄仁勋那句「买得越多,省得越多」。

05

每兆瓦吞吐:作者说黄仁勋在 GTC 上少报了

官方口径 3 倍,实测最高 7 倍

在 GTC 2026 上,黄仁勋展示的一张图是:在约 200 TPS、1—3 万亿参数量级模型上,VR NVL72 相比 Blackwell 的每兆瓦性能是 3 倍。SemiAnalysis 的实测结论是,即便在预发布软件上,每兆瓦 token 吞吐已经能到 7 倍

作者用了很重的话:「黄仁勋该停止在 GTC 上压低自己的性能宣称了。」并且举了上一次的例子——GTC 2024 他说 GB200 NVL72 会比 Hopper 快 30 倍,SemiAnalysis 实测是 98 倍

配置(100 TPS 目标)每兆瓦吞吐(百万 tok/s/MW)相对 Rubin精度
Vera Rubin NVL7259.41.0×FP4
GB300 Dynamo SGLang28.52.09×FP4
GB300 Dynamo TRT-LLM21.12.81×FP4
B200 SGLang6.958.5×FP4
B300 vLLM5.5610.7×FP4
H200 Dynamo SGLang2.2626.3×FP8
MI355X SGLang2.0129.5×FP4

这张表有三处值得注意。

第一,同一块 GB300,换引擎差 35%(SGLang 28.5 对 TRT-LLM 21.1)。软件栈在这份测试里不是背景变量,是主变量。

第二,倍数随速度目标剧烈变化。原文给的曲线:150 TPS 时 Rubin 仍有近 3,700 万 tok/s/MW,约为 GB300 SGLang 的 7.2 倍;到 200 TPS 收窄到 2.72 倍;而在 75 TPS 时领先的 GB300 引擎又换回 TRT-LLM。引擎的强弱本身就随速度目标翻转。

第三,MI355X 的 29.5 倍是特定负载与特定快照下的结果,原文自己加了这个限定。本站提醒不要把它当作 AMD 与英伟达的整体差距——SGLang 是所测 MI355X 引擎里最强的那个,但 AMD 下一代 MI455X UALoE72 已承诺与 SemiAnalysis 合作测试。

另外,Rubin 还带来一项叫 DSX MaxLPS 的动态功率调度能力。原理是:推理负载(尤其中高速度段)下 GPU 其实吃不满标称功耗,与其按满 TDP 再加 10—20% 超配来规划供电,不如对负载做功率画像,按实际功率把更多 GPU 塞进同一个数据中心电力预算里。在电力是硬约束的今天,这一条的实际价值可能不亚于芯片本身的性能提升。

06

每吉瓦的钱:收入多 39%,利润多 42%

这是把性能换算成生意的那一步

作者的论证落点在这里:在电力受限的条件下,Rubin 的优势不只是能处理更多 token,而是让运营方在不额外拿到电的前提下,有更多可变现的产能

测算条件:75 TPS 交互速度、60% 利用率、模型无授权费(DeepSeek V4 Pro 是 MIT 许可)。

每吉瓦全口径电力 · 年度Vera RubinGB300 Dynamo SGLang差额
年收入1,595 亿美元1,149 亿美元+39%
模型口径年利润1,499 亿美元1,053 亿美元+42%
利润绝对差额约 446 亿美元/吉瓦·年10MW 折约 4.46 亿

原文解释了为什么利润的增幅(42%)比收入(39%)还高:这两种配置每吉瓦的年度成本相近,所以增量收入大部分直接落到利润上

同一笔优势还可以换个用法——定价空间。在工作负载组合、吞吐和计费利用率不变的前提下,Rubin 可以把缓存输入、未缓存输入和输出三类 token 的价格整体下调约 28%,仍能匹配 GB300 Dynamo SGLang 在标示价格下的每吉瓦收入。运营方可以把效率优势留作利润,也可以拿去打价格战,取决于模型的需求弹性。

本站补一句读法:28% 这个数比 67 倍更接近市场会感受到的东西。它意味着 Rubin 一旦铺开,推理的市场价格有约四分之一的下行空间是被硬件效率支撑的,而不是靠亏损补贴。

07

该不该等 Rubin:累计收入十月底反超

但作者强调这不是回本日

最后一节做的是机群全生命周期的比较,把部署时间和可获得性也算进来。

基准案例:GB300 Dynamo TRT-LLM,75 TPS、60% 利用率,10MW 电力可容纳 4,716 颗 GPU(每颗 2.12kW);按半个月的爬坡期,日收入约 253 万美元,与年化 941.16 亿美元/吉瓦的结果一致(已做可获得性调整和整数颗数取整)。Rubin 机群爬坡完成后约 430 万美元/日,是前者的约 1.7 倍。

累计收入曲线体现的是「早部署」与「等更强的机器」之间的权衡:GB300 先开始产生收入,一开始领先;Rubin 靠更高的日收入率把差距追回来。如果 Rubin 在测试结果发布时就开始服务,它的累计收入大约会在 2026 年 10 月底反超 GB300。

作者对这个结论加了很明确的限定,本站原样保留:这个交叉点取决于假设的部署排期、爬坡、可获得性、需求和持续服务该负载的定价;它是一个收入交叉点,不是资本回收日,也不能证明等 Rubin 就能让投资回报最大化

08

这份测试的四个限定条件

引用它的数字之前先看一眼

  • 软件是预发布版。Rubin 跑的是早期 TensorRT-LLM,作者预期随着软件栈和内核库成熟、开发者社区积累经验,差距还会拉大。反过来说,今天买到的 Rubin 达不到这份测试里的最优状态,中间有一段软件成熟期。
  • 倍数强依赖三个标签:速度目标、引擎、TCO 口径。同一对硬件,170 TPS 下是 67 倍,60—100 TPS 下是 1.4—3 倍;GB300 换 SGLang 能让倍数从 62.9 掉到 5.56;自有口径的优势远大于租赁口径。只报倍数不报这三个标签,数字没有意义。
  • 只测了一个模型、一类负载。DeepSeek V4 Pro 1.6T 作为 1—3 万亿参数模型的代理,负载是智能体流量。原文明确说 Rubin 在离线批量推理上优势更小。而且写作时该模型已被 DeepSeek V4.1 Flash 取代。
  • 测试与英伟达有协作。文末致谢里包括黄仁勋、Ian Buck、Nick Comly 等英伟达人员以及中国大陆 TensorRT-LLM 团队,协助完成下一代 Rubin 软件启用与基准结果验证。这不必然影响结论,但读者应当知情。另一方面,作者同时公开指名批评黄仁勋在 GTC 上压低宣称,且 InferenceX 基准代码开源、已被谷歌云、微软 Azure、甲骨文、Meta 等主要算力买家以及 vLLM、SGLang、PyTorch 等社区复现或背书。
延伸阅读

本篇是 Rubin 的第一份实测。下面三篇分别接住它的三头:同一家机构在实测之前的预估版、同一套基准测另一颗芯片的结果、以及 Rubin 机柜硬件本身的拆解。

  1. 01 SemiAnalysis 重算 Vera Rubin 推理账:10 倍是对去年基线,同期只有 1.9–4.5 倍 本篇的预估版,两篇放一起能看出实测改了什么 那篇是硬件上市前基于规格做的测算,已经指出官方口径的倍数用的是去年的基线。本篇是同一批人拿到真机之后的实测,1.4—3 倍这个区间与那篇的 1.9—4.5 倍正好可以互相校验。
  2. 02 SemiAnalysis 实测谷歌 TPUv7:推理性价比比英伟达 B200 高 50%,赢在机时便宜不在芯片更快 同一套 InferenceX 基准测的另一颗芯片 那篇是 InferenceX 上第一份 TPU 实测,结论是性价比优势来自机时单价而不是芯片吞吐。本篇的 Rubin 恰好相反——芯片本身快得多,租金也贵 70%。两篇一起看,才知道「每美元 token」这个指标到底由什么决定。
  3. 03 SemiAnalysis 拆英伟达 Vera Rubin 机柜:算力翻 3.5 倍,每 GPU 成本比 GB300 高 45% 被测那台机器的硬件拆解 本篇只报性能和 TCO,不讲机器本身。那篇拆的是同一台 VR NVL72 的物料与成本结构,给出每 GPU 成本比 GB300 高 45%——这正是本篇租金贵 70% 的来源。

三篇加本篇回答的是同一个问题:一台更贵的机器,什么时候才真的更便宜。

全文要点回顾
  1. 这是 Vera Rubin NVL72 第一份经过验证的智能体推理实测,跑在早期预发布的 TensorRT-LLM 上。
  2. 头条的 67 倍成立在 170 TPS,而 GB300 的最高交互速度只有 171.53 TPS,那是它曲线的末端。
  3. 多数服务商实际部署的 60—100 TPS 区间,Rubin 是最强 GB300 配置的 1.4 到 3 倍。
  4. 同一块 GB300 换成开源 SGLang,交互速度能追平 Rubin,每兆瓦倍数从 62.9 掉到 5.56。
  5. 三年期租赁价 Rubin 每芯片每小时超 8.5 美元,Blackwell Ultra 5 美元,贵 70%。
  6. 租赁口径下,80 TPS 时同样的钱 Rubin 多产出 62% 的 token。
  7. 每兆瓦吞吐在 100 TPS 下 Rubin 59.4 百万 tok/s,GB300 最强引擎 28.5,B300 vLLM 5.56。
  8. GTC 上官方说每兆瓦性能 3 倍,实测最高 7 倍;上一次 GB200 说 30 倍,实测 98 倍。
  9. DSX MaxLPS 按实际功率画像调度,能在同样的数据中心电力预算里塞进更多 GPU。
  10. 每吉瓦年收入 1,595 亿对 1,149 亿美元(+39%),模型利润 1,499 亿对 1,053 亿(+42%)。
  11. 同样的优势也可用作降价空间:三类 token 整体降价约 28% 仍能匹配 GB300 的每吉瓦收入。
  12. 累计收入约在 2026 年 10 月底反超 GB300,但作者强调这是收入交叉点不是资本回收日。

本文基于 SemiAnalysis《67x better Performance per Dollar》(2026 年 9 月 14 日,作者 Bryan Shan、Alec Ibarra、Cam Quilici、Wenyao Gao、Dylan Patel)公开正文部分重制并加注释,非全文翻译,含本站换算与解读(已逐处标注)。测试数据来自 SemiAnalysis InferenceX/AgentX 基准与 AI Cloud TCO 模型。据 SemiAnalysis · 仅供学习研究,不构成任何投资建议。