每瓦算力就是钱:万亿美元 AI 需求的底层逻辑
这是黄仁勋在 NVIDIA 年度技术大会 GTC 2026 上的主题演讲,被业界称为"AI 行业的年度朝圣"。黄仁勋在演讲中阐述了 NVIDIA 从"芯片公司"到"AI 基础设施与制造公司"的转型,回应了市场对业绩可持续性和增长潜力的核心关切,提出了"Token 工厂经济学"这一全新商业框架。
演讲的核心论断是:到 2027 年,AI 基础设施需求至少达到 1 万亿美元(较去年预测的 5000 亿翻倍),而且"实际计算需求可能远高于此"。支撑这一判断的逻辑链条是:数据中心受功率约束 → 每瓦吞吐量决定生产成本 → Token 将按速度和智能程度分层定价 → NVIDIA 的极致协同设计在每个价格层都领先。
硬件发布方面,Vera Rubin 系统实现了两年内 Token 生成速率从 2200 万/秒到 7 亿/秒的 350 倍跃升;Groq 整合解决了超高速推理的带宽瓶颈;CPO 光交换机 Spectrum X量产落地。软件和生态方面,OpenClaw 被定义为 Agent 时代的操作系统,"每家 SaaS 公司都将变成 AaaS 公司"。路线图末端是下一代 Feynman 架构和部署在太空的Vera Rubin Space-1。
华尔街见闻过去两年,全球对 AI 算力的需求呈指数级爆发。随着大模型从"感知"和"生成"演进到"推理"和"行动(任务执行)",算力消耗急剧飙升。对于市场高度关注的订单和收入天花板问题,黄仁勋给出了极为强劲的预期。
黄仁勋在演讲中坦言:
黄仁勋大约去年这个时候,我说我们看到了 5000 亿美元的高确信度需求,涵盖 Blackwell 和 Rubin,延伸到 2026 年。现在,就在此时此地,我看到的数字至少是 1 万亿美元的需求,延伸到 2027 年。
华尔街见闻黄仁勋的万亿美元预期一度推动 NVIDIA 股价上涨超过 4.3%。
此外,他还在这个数字上补充道:
黄仁勋这合理吗?这正是我接下来要谈的。事实上,我们甚至可能面临供给短缺。我确信实际的算力需求会远远高于这个数字。
从 5000 亿到 1 万亿
一年时间,高确信度需求翻倍:$500B → $1T。作为参照,全球半导体行业 2025 年总收入约 6000 亿美元。单单 NVIDIA 平台的需求就已超过整个半导体行业的体量。
股价立刻反应
万亿美元预期当日推动股价涨超 4.3%,对应市值增加约 1500 亿美元。市场对这一指引的信任度极高——因为去年 5000 亿的预测已被验证。
华尔街见闻黄仁勋指出,NVIDIA 的系统如今已经证明自己是全球"成本最低的基础设施"。由于 NVIDIA 能够在几乎所有领域运行 AI 模型,这种通用性使客户投入的 1 万亿美元能够被充分利用,并保持较长的使用寿命。
目前,NVIDIA 60% 的业务来自排名前五的超大规模云服务商,另外 40% 广泛分布在主权云、企业、工业、机器人和边缘计算等各个领域。
通用性 = 长寿命
这是回应市场的核心质疑:"AI 投资会不会变成沉没成本?"黄仁勋的反驳逻辑是:NVIDIA GPU 能跑所有类型的 AI 工作负载,所以即使某一类需求退潮,硬件也不会闲置。相比之下,专用 ASIC 只能做一件事。
60/40 客户结构
40% 来自超大规模之外的客户——这是一个重要的多元化信号。主权云(各国政府)、企业、工业机器人等客户的采购周期与互联网公司不同步,为 NVIDIA 提供了反周期的收入缓冲。
华尔街见闻为了解释万亿美元需求背后的逻辑,黄仁勋向全球企业 CEO 提出了一套全新的商业思维。他指出,未来的数据中心不再是存储文件的仓库,而是生产 Token(AI 生成的基本单元)的"工厂"。
黄仁勋强调:
黄仁勋每个数据中心、每座工厂,按照定义,都受到功率约束。一座 1GW(吉瓦)的工厂永远不会变成 2GW 的工厂——这是物理定律和原子的法则。在固定功率水平下,谁的每瓦吞吐量最高,谁的生产成本就最低。
华尔街见闻黄仁勋将未来的 AI 服务划分为以下商业层级:
黄仁勋免费层(高吞吐、低速度);中间层(约 $3/百万 Token);高级层(约 $6/百万 Token);高速层(约 $45/百万 Token);超高速层(约 $150/百万 Token)。
他指出,随着模型变大、上下文变长,AI 会变得更智能,但 Token 生成速率会下降。黄仁勋表示:
黄仁勋在这座 Token 工厂里,你的吞吐量和 Token 生成速度将直接转化为你明年的精确收入。
华尔街见闻黄仁勋强调,NVIDIA 的架构使客户在免费层也能实现极高的吞吐量,同时在最高价值的推理层实现惊人的 35 倍性能提升。
数据中心是"工厂"
传统观念中数据中心是存储和计算的"仓库"。黄仁勋的重新定义——数据中心是生产 Token 的工厂——彻底改变了估值框架:不再按资产负债表估值,而按产量 x 单价 = 营收的制造业逻辑估值。
Token 分层定价
从免费到 $150/百万 Token,价差高达数十倍。这意味着同一座数据中心,如果能从免费层升级到高速层服务,单位算力的收入可以提升数十倍。每瓦性能的提升直接等于毛利率的提升。
Token = 新商品
黄仁勋实质上在说:Token 就是这个时代的石油。它有分级(类比原油、汽油、航空燃油)、有价格体系、有产能约束。拥有最高"炼化效率"(每瓦吞吐)的基础设施供应商将获得最大的经济租金。
华尔街见闻在这些物理极限的约束下,NVIDIA 发布了有史以来最复杂的 AI 计算系统——Vera Rubin。黄仁勋表示:
黄仁勋过去,当我提到 Hopper 的时候,我会举起一块芯片,那还挺可爱的。但当我提到 Vera Rubin 时,人们想到的是整个系统。在这个 100% 液冷、彻底消除传统线缆的系统中,过去需要两天安装的一个机柜,现在只需两小时就能搭建完成。
黄仁勋指出,通过端到端极致的软硬件协同设计,Vera Rubin 在同一座 1GW 数据中心里创造了惊人的数据飞跃:
黄仁勋仅仅两年时间,我们将 Token 生成速率从 2200 万提高到了 7 亿,提升了 350 倍。摩尔定律在同一时期只能实现大约 1.5 倍的提升。
为了解决超高速推理(如每秒 1000 个 Token)条件下的带宽瓶颈,NVIDIA 通过整合其收购的公司 Groq,给出了终极方案:非对称解耦推理。黄仁勋解释道:
黄仁勋这两种处理器有着非常不同的特性。Groq 芯片有 500MB 的 SRAM,而一颗 Rubin 芯片有 288GB 的内存。
黄仁勋指出,NVIDIA 通过其 Dynamo 软件系统,将需要大量计算和内存的"预填充"阶段委托给 Vera Rubin,而将对延迟敏感的"解码"阶段交给 Groq。黄仁勋还就企业算力配置给出了建议:
黄仁勋如果你的工作主要是高吞吐量场景,就 100% 使用 Vera Rubin;如果你有大量生成高价值、程序级 Token 的需求,就把数据中心 25% 的空间分配给 Groq。
华尔街见闻据悉,由三星制造的 Groq LP30 芯片已经量产,预计将在第三季度出货,而首批 Vera Rubin 机柜已经在 Microsoft Azure 云上运行。
此外,在光互联技术方面,黄仁勋展示了全球首款量产的共封装光学(CPO)交换机 Spectrum X,从而平息了市场关于"铜退光进"路线的争论。
黄仁勋我们需要更多的铜缆产能、更多的光芯片产能、更多的 CPO 产能。
350 倍 vs. 1.5 倍
摩尔定律两年翻 1.5 倍,NVIDIA 做到了 350 倍。这不是芯片性能的提升,而是系统级极致协同设计的结果——从芯片架构、互联、封装到软件调度,每个环节都在贡献倍率。这彻底重新定义了"性能进步"的可能速度。
Groq 非对称解耦
Groq(2024 年被 NVIDIA 收购)的芯片拥有 500MB 片上 SRAM,可实现极低延迟的 Token 生成,但内存太小无法独立跑大模型。NVIDIA 的方案是让 Vera Rubin 做"重活"(预填充),Groq 做"快活"(解码),通过 Dynamo 调度软件将两者耦合。
华尔街见闻除了硬件壁垒,黄仁勋用大量篇幅阐述了 AI 软件和生态的变革,尤其是 Agent 的爆发。
他将开源项目 OpenClaw 描述为"人类历史上最受欢迎的开源项目",称其在短短几周内就超越了 Linux 三十年的成就。黄仁勋直言,OpenClaw 本质上是Agent 计算机的"操作系统"。
黄仁勋断言:
黄仁勋每一家 SaaS(软件即服务)公司都将变成 AaaS(Agent 即服务)公司。毫无疑问,为了确保这些能够访问敏感数据和执行代码的 Agent 的安全部署,NVIDIA 推出了企业级 NeMo Claw 参考设计,增加了策略引擎和隐私路由。
对于普通职场人,这场变革也近在眼前。黄仁勋描绘了未来的新型工作形态:
黄仁勋未来,我们公司的每一位工程师都需要一个年度 Token 预算。他们的基本年薪可能是几十万美元,而我会额外分配大约一半年薪等值的 Token 配额,让他们实现 10 倍的效率提升。这已经是硅谷的新招聘话术了:你的 offer 里包含多少 Token?
华尔街见闻在演讲的最后,黄仁勋还预告了下一代计算架构 Feynman(费曼),这将是第一个同时实现铜线和 CPO 横向扩展的架构。更引人遐想的是,NVIDIA 正在开发"Vera Rubin Space-1"——部署在太空中的数据中心计算机,彻底打开了将 AI 算力延伸至地球之外的可能性。
SaaS → AaaS
过去 20 年的 SaaS 范式——"卖工具订阅"——被黄仁勋判了死刑。未来企业不买工具,买的是能干活的 Agent。这对 Salesforce、ServiceNow、Workday 等 SaaS 巨头意味着根本性的商业模式重构。
年薪的一半给 Token
这不是修辞。如果一个工程师年薪 30 万美元,再配 15 万美元的 Token 预算,那 NVIDIA 自己就要为数万名工程师购买数十亿美元的推理算力。黄仁勋在为自家产品创造需求叙事的同时,也在告诉所有企业:不配 Token 的员工将被淘汰。
Feynman 与 Space-1
Feynman(费曼)是 NVIDIA 路线图上 Vera Rubin 的下一代架构,以物理学家理查德·费曼命名。Vera Rubin Space-1 是太空数据中心概念,面临的核心挑战是散热——太空中没有空气对流,只能靠辐射散热。
主持人有请 NVIDIA 创始人兼 CEO 黄仁勋登台。
黄仁勋欢迎来到 GTC。我要提醒大家,这是一场技术大会。我非常高兴看到这么多人一大早就排队进场,也很高兴今天看到在座的每一位。
GTC 将围绕三大主题展开:技术、平台和生态系统。NVIDIA 目前拥有三大平台:CUDA-X 平台、系统平台,以及我们全新推出的 AI 工厂平台。
在正式开始之前,我要感谢我们的预热主持人——Conviction 的 Sarah Guo、红杉资本的 Alfred Lin(NVIDIA 的第一位风险投资人),以及 Gavin Baker——NVIDIA 的第一位大型机构投资者。这三位对技术有深刻的洞察力,在整个技术生态中拥有重大影响力。当然,我也要感谢我亲自邀请到场的所有贵宾。感谢这支全明星团队。
我还要感谢今天到场的所有公司。NVIDIA 是一家平台公司;我们拥有技术、平台和丰富的生态系统。今天在场的公司几乎代表了 100 万亿美元产业中的所有参与者,我们深深感谢赞助本次活动的 450 家公司。
本次大会将举办 1000 场技术论坛,有 2000 位演讲者,覆盖人工智能"五层蛋糕"架构的每一层——从土地、电力和数据中心等基础设施,到芯片、平台、模型,以及最终推动整个行业前进的各种应用。
五层蛋糕架构
黄仁勋的"五层蛋糕"是 NVIDIA 对 AI 产业链的标准分层:①能源(电力/散热/电网)→ ②芯片系统(GPU/互联/存储)→ ③基础设施(云/数据中心)→ ④模型(训练/推理/工具链)→ ⑤应用。这个框架贯穿所有 GTC 演讲。
100 万亿美元产业
黄仁勋将 NVIDIA 生态的参与者归入"100 万亿美元产业"——这大致对应全球 GDP 的总量。他的意思是:AI 不是一个垂直行业,而是将渗透所有行业。
点名 Gavin Baker
Gavin Baker(Atreides Management)被称为"NVIDIA 的第一位大型机构投资者"。在 GTC 开场特别致谢,是黄仁勋对长期信仰者的公开认可——也是在暗示:早期看对 NVIDIA 的人获得了巨大回报。
黄仁勋一切从这里开始。今年是 CUDA 二十周年。
二十年来,我们一直致力于开发这个架构。CUDA 是一项革命性的发明——SIMT(单指令多线程)技术让开发者可以用标量代码编程,然后扩展为多线程应用,编程难度远低于之前的 SIMD 架构。我们最近还加入了 Tiles,帮助开发者更容易地对 Tensor Core 以及当今人工智能所依赖的各种数学结构进行编程。目前,CUDA 拥有数千种工具、编译器、框架和库,开源社区中有数十万个公开项目,并且已经深度融入了每一个技术生态系统。
这张图揭示了 NVIDIA 100% 的战略逻辑,我从一开始就在展示这张幻灯片。最难、最核心的要素是图表底部的"装机量"。过去二十年,我们在全球累积了数亿颗运行 CUDA 的 GPU 和计算系统。
我们的 GPU 覆盖所有云平台,服务几乎所有计算机制造商和行业。CUDA 庞大的装机量是这个飞轮持续加速的根本原因。装机量吸引开发者,开发者创造新算法并实现突破,突破创造新市场,新市场形成新生态并吸引更多公司加入,进一步扩大装机量——这个飞轮在持续加速。
NVIDIA 库的下载量正以惊人的速度、巨大的规模和不断加快的步伐增长。这个飞轮使我们的计算平台能够支持海量的应用和源源不断的新突破。
SIMT vs. SIMD
SIMT(Single Instruction, Multiple Threads)是 NVIDIA 发明的编程模型,让 GPU 编程像写普通 CPU 程序一样——用标量代码思考,硬件自动并行化。此前的 SIMD(Single Instruction, Multiple Data)要求程序员手动管理向量操作,门槛极高。这一创新是 CUDA 成功的技术基石。
飞轮效应
黄仁勋每次 GTC 都要讲这个飞轮图——装机量→开发者→算法突破→新市场→更多装机量。这不是空话:CUDA 的 20 年先发优势已经构成了几乎不可逾越的生态壁垒。AMD ROCm 和 Intel oneAPI 至今无法追上,根因就在于装机量差距。
黄仁勋更重要的是,它还赋予了这些基础设施极长的使用寿命。原因很明显:能够在 NVIDIA CUDA 上运行的应用极其多样化,覆盖 AI 生命周期的每一个阶段、各种数据处理平台和广泛的科学求解器。因此,一旦安装了 NVIDIA GPU,其实际价值极高。这也是为什么我们六年前发布的 Ampere 架构 GPU 的云端租用价格反而上涨了。
所有这一切的根本原因在于我们庞大的装机量、强大的飞轮架构和广泛的开发者生态。当这些因素协同运作,加上我们持续的软件更新,计算成本就在稳步下降。加速计算显著提升了应用性能,而随着我们对软件的长期维护和迭代,用户不仅能体验到初始的性能飞跃,还能享受到持续的计算成本降低。我们致力于为全球每一颗 GPU 提供长期支持,因为它们在架构上是兼容的。
我们愿意这样做,是因为装机量足够大——每次发布新的优化版本,都能惠及数百万用户。这种动态组合使 NVIDIA 架构能够持续扩大覆盖面并加速自身增长,同时不断降低计算成本,最终激发新的增长。CUDA 是这一切的核心。
六年前的 GPU 涨价
通常电子产品随时间贬值,但 Ampere(2020 年发布)的云端租用价格反而上涨。这是因为 CUDA 软件栈的持续优化使老硬件也能跑新模型——换言之,NVIDIA 通过软件更新"创造"了硬件的二次增值。
软件驱动的长尾收入
这揭示了 NVIDIA 一个被低估的护城河:持续的软件优化让老一代 GPU 保值甚至增值,客户的 TCO(总拥有成本)持续下降。这反过来增强了客户对下一代 GPU 的购买意愿——因为他们知道投资不会贬值。
黄仁勋我们与 CUDA 的旅程实际上始于 25 年前。
GeForce——你们中的很多人是和 GeForce 一起长大的。GeForce 是 NVIDIA 最成功的营销计划。我们从你们还买不起我们产品的时候就开始培养未来客户——你们的父母成了 NVIDIA 最早的用户,年复一年地购买我们的产品,直到有一天你们成长为优秀的计算机科学家,成为真正的客户和开发者。
这是 GeForce 25 年前打下的基础。二十五年前,我们发明了可编程着色器——一项看似简单却意义深远的发明,让加速器变得可编程,这就是世界上第一个可编程加速器——像素着色器。五年后,我们创造了 CUDA——我们有史以来最重要的投资之一。在资源有限的情况下,我们把绝大部分利润押在了将 CUDA 从 GeForce 扩展到每一台计算机上。我们如此坚定,因为我们相信它的潜力。尽管最初困难重重,公司坚持了 13 代产品,整整二十年,而今天 CUDA 已经无处不在。
正是像素着色器推动了 GeForce 革命。大约八年前,我们推出了 RTX——一次面向现代计算机图形的完整架构重塑。GeForce 把 CUDA 带向了世界,也正因为如此,许多学者——包括 Alex Krizhevsky、Ilya Sutskever、Geoffrey Hinton 和 Andrew Ng——发现 GPU 可以成为加速深度学习的强大工具,从而在十年前引爆了 AI 革命。
十年前,我们决定将可编程着色与两个全新概念结合:硬件光线追踪——这在技术上极具挑战;以及一个当时超前的想法——我们在大约十年前就预见到 AI 将革新计算机图形。正如 GeForce 把 AI 带向了世界,AI 如今也将反过来重塑计算机图形的实现方式。
今天,我要向你们展示未来。这是我们的下一代图形技术,我们称之为神经渲染(Neural Rendering)——3D 图形与人工智能的深度融合。这是 DLSS 5,请看。
"培养买不起的客户"
黄仁勋在描述一个 25 年的"钩子"战略:先通过游戏显卡让年轻人接触 GPU → 他们长大后成为 AI 研究者和工程师 → 自然成为 CUDA 生态的开发者和采购决策者。这可能是科技史上周期最长的"先种后收"策略。
DLSS 5 / 神经渲染
DLSS(Deep Learning Super Sampling)是 NVIDIA 用 AI 提升游戏画质的技术。DLSS 5 进化为"神经渲染"——将传统 3D 图形(确定性、可控)与生成式 AI(概率性、逼真)融合,既保持精确控制又能实时生成惊人画面。
黄仁勋是不是令人叹为观止?计算机图形活了过来。
我们做了什么?我们将可控的 3D 图形(虚拟世界的真正基础)及其结构化数据,与生成式 AI 和概率计算结合在了一起。一个是完全确定性的,另一个是概率性的但极其逼真——我们融合了这两个概念,通过结构化数据实现精确控制,同时实时生成内容。最终,内容既视觉震撼又完全可控。
将结构化信息与生成式 AI 融合的理念,将在各个行业持续涌现。结构化数据是可信 AI 的基石。
超越游戏的范式
"结构化数据 + 生成式 AI"的融合范式远不止于游戏。工业设计、建筑可视化、影视制作、自动驾驶仿真——所有需要"可控生成"的场景都将受益。这是 NVIDIA 图形业务的下一个增长引擎。
可信 AI 的基石
黄仁勋在这里埋了一个重要伏笔:纯粹的生成式 AI 会"幻觉",但结构化数据提供了"锚点"。这个原则不仅适用于图形——在企业 AI、金融分析、医疗诊断中,结构化数据都是防止 AI 胡说的关键。
黄仁勋现在我要展示一张技术架构图。
结构化数据——大家熟悉的 SQL、Spark、Pandas、Velox 等平台,以及 Snowflake、Databricks、Amazon EMR、Azure Fabric 和 Google BigQuery 等重要平台——都在处理数据框(data frame)。这些数据框就像巨型电子表格,承载着商业世界的所有信息,代表着企业计算的基准事实(ground truth)。
在 AI 时代,我们需要让 AI 使用结构化数据,并将其加速到极致。过去,加速结构化数据处理是为了让企业运营更高效。未来,AI 将以远超人类的速度使用这些数据结构,AI Agent 将大量使用结构化数据库。
关于非结构化数据:向量数据库、PDF、视频和音频构成了全球绝大多数的数据格式——每年生成的数据中大约 90% 是非结构化的。过去,这些数据几乎完全无法利用:我们阅读它、存储在文件系统里,仅此而已。我们无法查询它,也很难检索数据,因为非结构化数据缺乏简单的索引方法;我们必须理解它的含义和上下文。现在,AI 可以做到这一点——利用多模态感知和理解技术,AI 可以阅读 PDF 文档、理解其含义,并将其嵌入到一个更大的、可查询的结构中。
NVIDIA 为此创建了两个基础库:cuDF——用于数据框和结构化数据的加速处理;cuVS——用于向量存储、语义数据和非结构化 AI 数据处理。这两个平台将成为未来最重要的基础平台之一。
今天,我们宣布与多家公司的合作。IBM——SQL 语言的发明者——将使用 cuDF 加速其 WatsonX Data 平台。Dell 与我们合作构建了 Dell AI 数据平台,集成了 cuDF 和 cuVS,并在 NTT Data 的实际项目中取得了显著的性能提升。在 Google Cloud 方面,我们现在不仅加速 Vertex AI,还加速 BigQuery,并与 Snapchat 合作将其计算成本降低了近 80%。
加速计算的好处是三重的:速度、规模和成本。这与摩尔定律的逻辑一致——通过加速计算实现性能飞跃,同时持续优化算法,让每个人都能从不断降低的计算成本中受益。
NVIDIA 构建了一个加速计算平台,汇集了众多库,包括 RTX、cuDF 和 cuVS。这些库被集成到全球云服务和 OEM 系统中,触达全球用户。
90% 的数据是非结构化
每年生成的数据中 90% 是 PDF、视频、音频等非结构化数据——过去几乎完全是"死数据"。AI 让这些数据变得可查询、可理解,相当于打开了一座信息金矿。这是向量数据库赛道(如 Pinecone、Weaviate)爆发的根本驱动力。
cuDF 与 cuVS
cuDF 是 NVIDIA 开发的 GPU 加速数据框处理库(类比 Pandas 的 GPU 版本);cuVS 是 GPU 加速的向量搜索库。两者覆盖了结构化 + 非结构化数据的全部需求,是 NVIDIA 从"AI 训练/推理"向"数据处理全栈"扩张的关键。
Snapchat 降本 80%
计算成本降低 80% 意味着同等预算下处理量提升 5 倍。这类客户案例是 NVIDIA 说服企业采购 GPU 集群的最强武器——ROI 是立竿见影的。
黄仁勋与主要云服务商的合作:
Google Cloud:我们加速 Vertex AI 和 BigQuery,与 JAX/XLA 深度集成,同时在 PyTorch 上表现卓越——NVIDIA 是全球唯一一个在 PyTorch 和 JAX/XLA 上都表现优异的加速器。我们为 Google Cloud 生态带来了 Base10、CrowdStrike、Puma 和 Salesforce 等客户。
AWS:我们正在加速 EMR、SageMaker 和 Bedrock,与 AWS 深度集成。今年最令我兴奋的是,我们将把 OpenAI 带到 AWS,这将显著推动 AWS 云计算消费增长,并帮助 OpenAI 扩展其区域部署和计算规模。
Microsoft Azure:NVIDIA 100 PFLOPS 超级计算机是我们建造的第一台超级计算机,也是首台部署在 Azure 上的超级计算机,为我们与 OpenAI 的合作奠定了重要基础。我们正在加速 Azure 云服务和 AI Foundry,在 Azure 区域扩展上协作,并在 Bing 搜索上紧密合作。值得注意的是,我们的机密计算(Confidential Computing)能力——确保即使运营商也无法查看用户数据和模型——使 NVIDIA GPU 成为全球最早支持机密计算的产品之一,使 OpenAI 和 Anthropic 的模型能够在全球各地的云环境中安全部署。例如,我们正与 Synopsys 合作,加速其整个 EDA 和 CAD 工作流程,并将其部署在 Microsoft Azure 上。
Oracle:我们是 Oracle 的第一个 AI 客户,我很自豪地说我是第一个向 Oracle 解释 AI 云概念的人。从那以后,他们增长迅速,我们也为他们引入了许多合作伙伴,包括 Cohere、Fireworks 和 OpenAI。
CoreWeave:全球第一家 AI 原生云,专门为 GPU 托管和 AI 云服务设计,拥有出色的客户群和强劲的增长势头。
Palantir + Dell:三方联合打造了一个全新的 AI 平台,基于 Palantir 的本体平台(Ontology Platform)和 AI 平台,可以在任何国家、任何气隙隔离环境中以完全本地化的方式部署 AI——从数据处理(向量化或结构化)到完整的 AI 加速计算栈,一应俱全。
NVIDIA 与全球云服务商建立了这种特殊的合作关系——我们为云端带去客户,创造互利共赢的生态。
OpenAI 上 AWS
这是一个重大信号:OpenAI 过去几乎完全依赖 Azure,现在开始多云部署。对 AWS 而言是新增收入来源;对 Azure 而言是独家关系的松动。NVIDIA 在其中扮演"媒人"角色——它有动力让每朵云都跑 GPU 工作负载。
机密计算
Confidential Computing 确保数据在计算过程中始终加密,即使云服务商也无法窥视。这对 AI 部署至关重要——银行、医院、政府不会把敏感数据放在云商能看到的地方。NVIDIA 的 GPU 级机密计算是其在企业和主权 AI 市场的关键差异化能力。
黄仁勋NVIDIA 是全球第一家纵向整合、横向开放的公司。
这种模式的必要性很简单:加速计算不是一个芯片问题,也不是一个系统问题;它的完整描述应该是应用加速。CPU 可以让计算机整体运行更快,但这种方式已经达到了极限。未来,只有针对特定应用或特定领域的加速,才能继续带来性能飞跃和成本降低。
这正是为什么 NVIDIA 必须深入一个又一个库、一个又一个领域、一个又一个垂直行业。我们是一家纵向整合的计算公司;别无他法。我们必须理解应用,理解领域,深入理解算法,并且能够在任何场景中部署——数据中心、云端、本地、边缘,甚至机器人系统。
与此同时,NVIDIA 保持横向开放,愿意将技术集成到任何合作伙伴的平台中,让全世界都能享受加速计算的好处。
今年 GTC 的参会者构成完美地说明了这一点。金融服务业的参会比例最高——我们希望看到更多的开发者,而不是交易员。我们的生态系统横跨上下游供应链。无论一家公司有 50 年、70 年还是 150 年的历史,去年都是它有史以来最好的一年。我们正处于一件非常、非常重大的事情的起点。
纵向整合 + 横向开放
这描述了 NVIDIA 独特的商业模式:纵向——从芯片设计到系统集成到软件库到算法优化,全栈自研;横向——开放给所有云商、OEM、应用开发者。这既是苹果式的极致整合,又是安卓式的开放生态,同时享受两种模式的好处。
金融业参会最多
一场 GPU 技术大会上金融服务业参会比例最高——这在五年前不可想象。量化投资正从传统因子模型向 GPU 驱动的深度学习迁移,金融业正在经历自己的"Transformer 时刻"。
黄仁勋NVIDIA 在各垂直领域都有深度布局:
自动驾驶:影响范围广泛而深远。
金融服务:量化投资正在从手工特征工程转向超级计算机驱动的深度学习,迎来了它的"Transformer 时刻"。
医疗健康:正在进入自己的"ChatGPT 时刻"——涵盖 AI 辅助药物发现、AI 驱动的诊断和医疗客户服务等领域。
工业:全球最大规模的建设浪潮正在进行中——AI 工厂、芯片工厂和数据中心工厂如雨后春笋般涌现。
娱乐与游戏:实时 AI 平台支持翻译、直播、游戏交互和智能购物 Agent。
机器人:拥有超过十年的经验和完整的三套计算机架构(训练计算机、仿真计算机和机载计算机),本次展会展示了 110 台机器人。
电信:一个价值约 2 万亿美元的行业,基站将从单一通信功能进化为 AI 基础设施平台。其中一个平台 Aerial 与诺基亚和 T-Mobile 等公司有深度合作。
所有这些领域的核心是我们的 CUDA-X 库——这正是 NVIDIA 作为一家算法公司的根基。这些库是公司最核心的资产,使计算平台能够在各行各业创造实际价值。
其中最重要的库之一是 cuDNN(CUDA 深度神经网络库),它革新了人工智能,触发了现代 AI 的大爆发。
(播放 CUDA-X 演示视频)
你们刚才看到的一切都是仿真——包括基于物理的求解器、AI 操控的物理模型和物理 AI 机器人模型。全部是仿真;没有手绘动画或关节绑定。这正是 NVIDIA 的核心能力:通过对算法的深刻理解和计算平台的有机整合来释放这些机遇。
电信:2 万亿美元市场
全球电信行业收入约 2 万亿美元。如果基站从通信节点进化为 AI 边缘计算平台(如 NVIDIA Aerial),即使只有 5% 的渗透率也意味着 1000 亿美元的新市场。
cuDNN 的历史地位
cuDNN(CUDA Deep Neural Network Library)由 NVIDIA 于 2014 年发布,它将深度学习的关键操作(卷积、池化、归一化等)在 GPU 上极致优化。没有 cuDNN,就没有 AlexNet 的成功,也就没有后来的深度学习革命。它是整个现代 AI 的技术起点之一。
黄仁勋你们刚才看到了定义当今社会的行业巨头——沃尔玛、欧莱雅、摩根大通、罗氏和丰田——还有大量你们从未听说过的公司——我们称之为 AI 原生公司。这份名单极其庞大,包括 OpenAI、Anthropic,以及许多服务不同垂直行业的新兴公司。
过去两年,行业经历了惊人的增长。风险投资流入初创公司的资金达到了创纪录的 1500 亿美元。更重要的是,单笔投资的规模首次从数百万美元跃升至数亿甚至数十亿美元。原因只有一个:历史上第一次,每一家这样的公司都需要海量的计算资源和大量的 Token。这个行业正在为 Anthropic 和 OpenAI 等组织创造、生成或增加 Token 的价值。
正如 PC 革命、互联网革命和移动云革命各自催生了一批划时代的公司,这一代计算平台变革也将催生一批极具影响力的公司,它们将成为未来世界的重要力量。
VC 投资 1500 亿美元
创纪录的 1500 亿美元风投流入——这个数字相当于整个中国 2024 年风投总额的 3-4 倍。更关键的是单笔投资规模的跃升:OpenAI 400 亿美元、Anthropic 200 亿美元、xAI 120 亿美元——这些数字在历次科技革命中都前所未有。
每家 AI 公司都需要算力
黄仁勋在暗示:不管这些 AI 公司谁赢谁输,NVIDIA 都赢——因为每一家都必须大量购买 GPU。这是经典的"淘金热卖铲子"逻辑,但规模前所未有。
黄仁勋过去两年到底发生了什么?三件大事。
第一:ChatGPT,开创了生成式 AI 时代(2022 年底到 2023 年)。它不仅能感知和理解,还能生成独特的内容。我演示了生成式 AI 与计算机图形的融合。生成式 AI 从根本上改变了我们的计算方式——从基于检索变成基于生成——深刻影响了计算机架构、部署方式和整体意义。
第二:推理型 AI,以 O1 为代表。推理能力使 AI 能够自我反思、规划和分解问题——把无法直接理解的问题拆解为可管理的步骤。这使生成式 AI 变得可信,能够基于现实世界的信息进行推理。为了实现这一点,用于输入上下文的 Token 数量和用于推理的输出 Token 数量都大幅增加,导致计算复杂度急剧上升。
第三:Claude Code,第一个智能体模型。它可以读取文件、编写代码、编译、测试、评估和迭代。Claude Code 革新了软件工程——100% 的 NVIDIA 工程师都在使用 Claude Code、Codex 和 Cursor 中的一个或多个;没有一个软件工程师不借助 AI。
这是一个全新的转折点——你不再是在问 AI"什么、在哪里、怎么做",而是让它"创造、执行和构建",让它主动使用工具、读取文件、分解问题并采取行动。AI 已经从感知进化到生成,再到推理,现在它真的能把事情做成了。
过去两年,推理的计算需求增加了大约 10,000 倍,而用量增加了大约 100 倍。我一直认为,过去两年的计算需求增加了一百万倍——这是一种共同的感受,是 OpenAI 的感受,也是 Anthropic 的感受。如果能获取更多算力,就能生成更多 Token,收入就会增加,AI 就会变得更智能。推理的拐点已经到来。
Claude Code 被列为三大突破之一
黄仁勋将 AI 史上的三大里程碑定义为 ChatGPT、O1 和 Claude Code——把一个编程工具与 ChatGPT 和推理 AI 并列。这不是随口一说:Claude Code 代表的是 AI 从"回答问题"到"完成工作"的质变,是 Agent 时代的开端。
推理计算增长万倍
推理计算需求两年增加 1 万倍——这意味着即使 GPU 产能每年翻倍,也远远跟不上需求增速。"一百万倍"更是黄仁勋和 AI 实验室的共同感受,暗示当前的算力缺口可能比任何人预想的都大。
NVIDIA 全员 AI 辅助
100% 的 NVIDIA 工程师使用 AI 编程工具——黄仁勋用自家案例证明 Agent 时代不是口号。如果连硬件公司的工程师都依赖 AI,那纯软件公司的员工更加不可能抗拒。这为"Token 预算"叙事提供了最直接的证据。
黄仁勋去年这个时候,我站在这里说我们对 Blackwell 和 Rubin 的需求和订单簿拥有高确信度,大约 5000 亿美元,延伸到 2026 年。今天,GTC 一年后,我站在这里告诉你们:展望 2027 年,我看到的数字至少是 1 万亿美元。而且我确信,实际的算力需求将远大于此。
2025 年是 NVIDIA 的推理之年。我们的目标是确保在 AI 生命周期的每个阶段都做到卓越,不仅仅是训练和后训练,而是让我们投入的基础设施能够以更长的有效寿命和更低的单位成本持续高效运转。
与此同时,Anthropic 和 Meta 正式加入了 NVIDIA 平台,它们合计代表了全球三分之一的 AI 算力需求。开源模型正在逼近前沿水平,并且无处不在。
NVIDIA 目前是全球唯一能够在所有 AI 领域运行所有 AI 模型的平台——语言、生物学、计算机图形、计算机视觉、语音、蛋白质与化学、机器人等——无论是在边缘还是在云端,无论使用什么语言。NVIDIA 的架构在所有这些场景中都具有通用性,使我们成为成本最低、最可靠的平台。
目前,NVIDIA 60% 的业务来自全球排名前五的超大规模云服务商,其余 40% 分布在区域云、主权云、企业、工业、机器人和边缘计算等各个领域。AI 覆盖面的广度本身就是韧性的来源——这无疑是一场全新的计算平台革命。
黄仁勋就在 Hopper 架构还处于巅峰的时候,我们决定彻底重新设计系统,将 NVLink 从 8 路扩展到 NVLink 72 路,并对计算系统进行全面解构和重建。Grace Blackwell NVLink 72 是一场巨大的技术豪赌,对于我们的任何一个合作伙伴来说都不轻松。我们向所有参与者表示衷心的感谢。
与此同时,我们推出了 NVFP4——不只是普通的 FP4,而是一种全新的张量核心和计算单元。我们已经证明 NVFP4 可以实现无精度损失的推理,同时带来显著的性能和能效提升,而且同样适用于训练。此外,一系列新算法如 Dynamo 和 TensorRT-LLM 也相继问世,我们甚至投入数十亿美元专门建造了一台超级计算机来优化内核,名为 DGX Cloud。
结果证明了我们卓越的推理性能。来自 SemiAnalysis 的数据——迄今为止最全面的 AI 推理性能基准测试——显示 NVIDIA 在每瓦 Token 数和每 Token 成本方面都遥遥领先。摩尔定律可能预测 H200 的性能提升 1.5 倍,但我们实现了 35 倍。SemiAnalysis 的 Dylan Patel 甚至说:"黄仁勋在保守报告;实际上是 50 倍。"他说得对。
让我在此引用他的话:"Jensen sandbagged(黄仁勋在保守报告)。"
NVIDIA 的每 Token 成本是全球最低的,目前无人能及。原因在于它的极致协同设计(Extreme Co-design)。
以 Fireworks 为例,在 NVIDIA 更新全套软件和算法之前,其平均 Token 处理速度约为每秒 700 个 Token;更新之后,接近每秒 5000 个 Token,提升了约 7 倍。这就是极致协同设计的力量。
NVLink 72
NVLink 72 将 72 颗 GPU 通过专用高带宽互联连接为一个统一的计算节点。相比 Hopper 的 8 路 NVLink,规模扩大了 9 倍。这使得超大模型可以在单个逻辑机器内完成,避免了跨网络通信的延迟和带宽瓶颈。
"保守报告"35 倍
当 NVIDIA CEO 说"35 倍提升",第三方研究机构说"实际是 50 倍"——这在半导体行业是闻所未闻的。通常公司会夸大数字,而 NVIDIA 反过来"低报"业绩。这种反差本身就是信心的最强信号。
Fireworks 7 倍加速
纯软件更新(不换硬件)就带来 7 倍提速——从 700 到 5000 Token/秒。这说明 NVIDIA 的硬件潜力远未被充分释放,持续的软件优化是一个被低估的增长来源。
黄仁勋数据中心过去是存储文件的地方;现在它们是生产 Token 的工厂。未来,每一个云服务商和每一家 AI 公司都将以"Token 工厂效率"作为核心运营指标。
这是我的核心论点:
纵轴:吞吐量——在固定功率水平下每秒生成的 Token 数量。
横轴:Token 速度——每个推理步骤的响应速度。速度越快,可用的模型越大,上下文越长,AI 就越智能。
Token 是一种新商品,成熟之后将按层级定价:
免费层(高吞吐、低速度);中间层(约 $3/百万 Token);高级层(约 $6/百万 Token);高速层(约 $45/百万 Token);超高速层(约 $150/百万 Token)。
与 Hopper 相比,Grace Blackwell 在最高价值层实现了 35 倍的吞吐量提升,并开辟了全新的价格层级。用一个简化模型来说,将 25% 的功率分配到四个层级上,Grace Blackwell 能产生 Hopper 5 倍的收入。
5 倍收入 = ROI 论证
同等功率下收入提升 5 倍——这是黄仁勋给云厂商 CFO 的核心论证:换一代 GPU 的投资回报极其惊人。如果一座 1GW 数据中心用 Hopper 每年产出 X 亿美元收入,换成 Blackwell 就是 5X。这解释了为什么云厂商的 CapEx 不降反升。
从存储到生产
"数据中心 → Token 工厂"的概念重塑了整个行业的思考方式。过去数据中心按面积和电力出租(类似仓库),未来按Token 产量和品质计价(类似制造工厂)。这意味着数据中心的估值模型需要从"资产类"转向"制造类"。
(播放 Vera Rubin 系统介绍视频)
黄仁勋Vera Rubin 是一个完整的、端到端优化的系统,专为 Agent 工作负载设计:
大规模语言模型计算核心:NVLink 72 GPU 集群,处理预填充和键值缓存。
全新的 Vera CPU:专为极高单线程性能设计,使用 LPDDR5 内存,具备出色的能效。它是全球唯一使用 LPDDR5 的数据中心 CPU,适合 AI Agent 工具调用。
存储系统:BlueField 4 + CX 9,面向 AI 时代的全新存储平台,存储行业 100% 参与。
CPO Spectrum X 交换机:全球首款共封装光学以太网交换机,现已全面量产。
Kyber 机柜:全新机柜系统,支持 144 颗 GPU 组成单个 NVLink 域,前端计算、后端 NVLink 交换,构成一台超级计算机。
Rubin Ultra:下一代超级计算节点,纵向整合设计,兼容 Kyber 机柜,支持更大规模的 NVLink 互联。
Vera Rubin 现在 100% 液冷,安装时间从两天缩短到两小时。使用 45°C 热水冷却,大幅降低了数据中心的散热负担。我非常兴奋地告诉大家,Satya Nadella 已确认首批 Vera Rubin 机柜正在 Microsoft Azure 上运行。
Vera Rubin 命名
系统以美国天文学家 Vera Rubin(1928-2016)命名,她发现了星系旋转曲线异常,为暗物质的存在提供了关键证据。NVIDIA 的代际命名传统:Kepler → Maxwell → Pascal → Volta → Turing → Ampere → Hopper → Blackwell → Vera Rubin → Feynman。
数据中心 CPU 用 LPDDR5
LPDDR5 是手机内存——低功耗、高能效但带宽不如服务器用的 DDR5。把它放进数据中心 CPU 看似降级,实际上是为 Agent 工具调用场景优化:Agent 需要频繁执行轻量级操作(读文件、调 API),不需要大带宽但需要极低功耗。
首批上线 Azure
微软是 Vera Rubin 的首发客户——这延续了 NVIDIA 与微软/OpenAI 联盟的深度合作。但更值得注意的是:从芯片发布到首批上线的时间在不断缩短,说明 NVIDIA 的供应链执行力在提升。
黄仁勋我们收购了 Groq 团队并获得了技术授权。Groq 是一种确定性数据流处理器,采用静态编译和编译器调度,拥有大量 SRAM,针对单次推理工作负载优化,具有极低延迟和极高的 Token 生成速度。
然而,Groq 有限的内存容量(500MB 片上 SRAM)使其难以独立处理大模型的参数和 KV 缓存,从而限制了其大规模应用。
解决方案是 Dynamo——一个推理调度软件。我们使用 Dynamo 将推理管线解耦:
预填充和注意力机制解码在 Vera Rubin 上完成(需要大量算力和 KV 缓存存储)。
前馈网络解码,即 Token 生成部分,在 Groq 上完成(需要极高带宽和低延迟)。
两者通过以太网紧密耦合,一种特殊模式可将延迟降低约一半。在 Dynamo——"AI 工厂操作系统"——的统一调度下,整体性能提升 35 倍,并开辟了 NVLink 72 此前无法触及的全新推理性能层级。
Groq 和 Vera Rubin 组合建议:
如果工作负载主要是高吞吐量,使用 100% Vera Rubin。
如果大量工作负载涉及生成代码等高价值 Token,可以引入 Groq,建议比例约为 25% Groq + 75% Vera Rubin。
Groq LP30 由三星制造,目前已在量产中,预计第三季度开始出货。感谢三星的全力配合。
Dynamo 推理调度
Dynamo 是 NVIDIA 的推理管线调度软件,类似于操作系统中的进程调度器。它的核心创新是将一次推理拆分为两个阶段,分配给不同特性的硬件:重计算(Vera Rubin)+ 快生成(Groq)。这种"非对称解耦"是突破单一硬件极限的关键。
收购而非自研
NVIDIA 通常自研一切,但选择收购 Groq 而非自研低延迟推理芯片——说明 Groq 的确定性数据流架构确实独到,自研可能需要 3-5 年而市场等不了。这也表明 NVIDIA 对推理市场的紧迫感:必须在竞争对手(如 Cerebras、Groq 的竞品)成气候之前锁定技术路线。
黄仁勋量化前面的技术进步:两年之内,一座 1 吉瓦 AI 工厂的 Token 生成速率将从每秒 2200 万个 Token 提升到每秒 7 亿个 Token,提升 350 倍。这就是极致协同设计的力量。
技术路线图:
Blackwell:目前量产中,Oberon 标准机柜系统,铜缆延伸至 NVLink 72,可选光学扩展至 NVLink 576。
Vera Rubin(当前一代):Kyber 机柜,NVLink 144(铜缆);Oberon 机柜,NVLink 72 + 光学扩展至 NVLink 576;Spectrum 6,全球首款 CPO 交换机。
Vera Rubin Ultra(即将推出):下一代 Rubin Ultra GPU,LP35 芯片(首次集成 NVFP4),性能进一步提升数倍。
Feynman(下一代):全新 GPU,LP40 芯片(由 NVIDIA 和 Groq 团队联合开发,集成 NVFP4);全新 CPU——Rosa(Rosalyn);BlueField 5;CX 10;Kyber 机柜同时支持铜缆和 CPO 扩展。
路线图清晰:三条路线——铜缆扩展、光学扩展(Scale-Up)和光学扩展(Scale-Out)——正在并行推进。我们需要所有合作伙伴持续扩大铜缆、光纤和 CPO 的产能。
350 倍 vs. 摩尔 1.5 倍
两年 350 倍 vs. 摩尔定律两年 1.5 倍——差距达到 233 倍。这说明 NVIDIA 的"极致协同设计"——从芯片、互联、封装到软件全栈同步优化——已经完全超越了单纯靠晶体管微缩的进步速度。
Feynman 架构
Feynman 是 Vera Rubin 之后的下一代架构。关键特征:LP40 芯片由 NVIDIA 和 Groq 团队联合开发(收购整合的成果),新 CPU 名为 Rosa(Rosalyn),首次在 Kyber 机柜上同时支持铜缆和 CPO 扩展——意味着不再需要在铜和光之间二选一。
铜/光/CPO 三线并行
黄仁勋明确要求供应链三条路线同时扩产——铜缆、光纤、CPO 一个都不能少。对投资者而言,这意味着不需要押注"铜退光进"还是"光退铜进",三条赛道都有确定性需求。
黄仁勋AI 工厂正变得越来越复杂,但构成它们的各种技术供应商从未在设计阶段相互协作过,只有在数据中心里才"见面"——这显然不够。
为此,我们创建了 Omniverse,以及建立在其上的 NVIDIA DSX 平台——一个让所有合作伙伴在虚拟世界中共同设计和运营吉瓦级 AI 工厂的平台。DSX 提供:
机柜级的机械、热学、电气和网络仿真系统;与电网的连接,实现协同节能调度;基于 Max-Q 的数据中心动态功耗和散热优化。
保守估计,这个系统可以将能效提升约 2 倍——在我们讨论的规模上,这是非常可观的收益。Omniverse 从数字地球开始,将支持所有规模的数字孪生;我们正与全球合作伙伴一起,建造人类历史上最大的计算机。
此外,NVIDIA 正在进军太空。Thor 芯片已通过辐射认证,正在卫星上运行。我们正与合作伙伴开发 Vera Rubin Space-1,用于建设太空数据中心。太空中的散热是关键挑战——太空中散热完全依靠辐射,我们正在集结顶尖工程师来攻克这个难题。
Omniverse / DSX
Omniverse 是 NVIDIA 的实时 3D 仿真和协作平台;DSX(Data Center Simulation X)是基于 Omniverse 的 AI 工厂数字孪生平台。它让数据中心的所有供应商(供电、散热、网络、机柜)可以在虚拟环境中联合设计,而不是在物理建造完成后才发现问题。
太空数据中心
把数据中心放到太空听起来是科幻,但 NVIDIA 是认真的——Thor 芯片已经在卫星上运行。太空数据中心的核心逻辑:太空有无限的太阳能但散热极难(只能辐射散热,不能对流散热)。如果散热问题能解决,太空将成为不受地面电力和土地约束的 AI 计算新疆域。
黄仁勋Peter Steinberger 开发了一个叫 OpenClaw 的软件。这是人类历史上最受欢迎的开源项目,在短短几周内就超越了 Linux 三十年的成就。
OpenClaw 本质上是一个 Agent 系统,能够:管理资源、访问工具、文件系统和大语言模型;执行调度和定时任务;逐步分解问题并调用子 Agent;支持任何模态的输入和输出(语音、视频、文本、邮件等)。
用操作系统的术语来说,它确实就是一个操作系统——Agent 计算机的操作系统。Windows 使个人电脑成为可能;OpenClaw 使个人智能 Agent 成为可能。
每一家公司都需要制定自己的 OpenClaw 策略,就像我们都需要 Linux 策略、HTML 策略和 Kubernetes 策略一样。
超越 Linux 三十年成就
Linux 花了 30 年成为全球服务器操作系统的标准。OpenClaw 几周就超越了它的热度——无论这个"超越"如何衡量(GitHub stars、下载量或开发者采用速度),都说明 Agent 编排框架的需求是爆发性的。
类比 Windows/Linux
黄仁勋把 OpenClaw 类比为 Windows 和 Linux——这不是夸张。在他的框架中:PC 时代 → Windows;服务器时代 → Linux;容器时代 → Kubernetes;Agent 时代 → OpenClaw。每一次计算范式转换都催生了一个新的操作系统级标准。
黄仁勋OpenClaw 之前的企业 IT:数据和文件进入系统,流经工具和工作流程,最终成为人类使用的工具。软件公司创建工具,系统集成商(GSI)和咨询公司帮助企业使用它们。
OpenClaw 之后的企业 IT:每一家 SaaS 公司都将转型为 AaaS(Agent 即服务)公司——不再只是提供工具,而是提供专精于特定领域的 AI Agent。
但这里有一个关键挑战:企业内部的智能 Agent 可以访问敏感数据、执行代码并与外部实体通信。在企业环境中,这必须被严格控制。
为此,我们与 Peter 合作,将安全性集成到企业版中,推出了:
NeMo Claw(参考设计):基于 OpenClaw 的企业级参考框架,集成了 NVIDIA 完整的智能 Agent AI 工具套件。
Open Shield(安全层):集成到 OpenClaw 中,提供策略引擎、网络屏障和隐私路由,确保企业数据安全。
NeMo Cloud:可下载使用,与所有 SaaS 公司的策略引擎兼容。
这是企业 IT 的文艺复兴,一个原本价值 2 万亿美元的行业即将增长为数万亿美元的规模,从提供工具转向提供专业 AI Agent 服务。
我完全可以预见,未来公司里每位工程师都会有一个年度 Token 预算。他们的年薪可能是几十万美元,而我会额外给他们相当于一半年薪的 Token 配额,将他们的产出放大十倍。"入职包含多少 Token"已经成了硅谷新的招聘话题。
未来,每家企业既是 Token 的用户(为工程师使用),也是 Token 的生产者(为客户提供服务)。OpenClaw 的意义不可低估;它与 HTML 和 Linux 同等重要。
2 万亿 → 数万亿
企业 IT 从 2 万亿增长到"数万亿"——这意味着 SaaS → AaaS 转型将创造远大于原始 SaaS 市场的新增量。因为 Agent 不仅替代工具,还替代了部分人力——企业愿意为此支付更多。
NeMo Claw 安全架构
企业 Agent 面临的核心安全问题:Agent 能读数据库、写代码、发邮件——如果不加控制,等同于一个不受监管的"超级员工"。NeMo Claw 的安全层包括策略引擎(限定 Agent 权限)、网络屏障(隔离 Agent 通信)和隐私路由(防止数据泄露)。
黄仁勋关于定制 Claw,我们提供 NVIDIA 前沿的自研模型:
建模领域包括:Nemotron(大语言模型)、Cosmos(世界基础模型)、GROOT(通用人形机器人模型)、Alpamayo(自动驾驶)、BioNeMo(数字生物学)、Physics-AI(物理学)。
我们在每个领域都处于技术前沿,并致力于持续迭代——Nemotron 3 之后有 Nemotron 4,Cosmos 1 之后有 Cosmos 2,Groq 也将迭代到第二代。
Nemotron 3 在 OpenClaw 中跻身全球最佳模型前三名,处于该领域的最前沿。Nemotron 3 Ultra 将成为有史以来最强大的基础模型,帮助各国建设主权 AI。
今天,我们宣布成立 Nemotron 联盟(Nemotron Consortium),投入数十亿美元推动基础 AI 模型的发展。联盟成员包括:BlackForest Labs、Cursor、LangChain、Mistral、Perplexity、Reflection、Sarvam(印度)和 Thinking Machines(Mira Murati 的实验室)。企业软件公司也在加入,将 NeMo Claw 参考设计和 NVIDIA 的 AI Agent 工具包集成到自己的产品中。
Nemotron 联盟成员
联盟成员阵容令人瞩目:Mistral(欧洲最强 AI 公司)、Perplexity(AI 搜索独角兽)、Cursor(AI 编程工具现象级产品)、Thinking Machines(Mira Murati 离开 OpenAI 后创办的新实验室)。NVIDIA 在构建一个覆盖模型、工具、搜索的全栈 AI 联盟。
主权 AI 的模型需求
Nemotron 3 Ultra 服务主权 AI 建设——各国政府需要不依赖美国闭源模型的替代方案。NVIDIA 同时卖硬件(GPU)和开放模型(Nemotron),等于为主权 AI 提供了"全套解决方案",进一步锁定了 GPU 采购。
黄仁勋数字智能 Agent 在数字世界中行动——编写代码、分析数据;而物理 AI 是具身智能 Agent,也就是机器人。
今年 GTC 共展示了 110 台机器人,几乎涵盖了全球所有机器人研发公司。NVIDIA 提供了三台计算机(训练计算机、仿真计算机和机载计算机)以及完整的软件栈和 AI 模型。
在自动驾驶领域,自动驾驶的"ChatGPT 时刻"已经到来。今天,我们宣布四家新合作伙伴加入 NVIDIA RoboTaxi Ready 平台:比亚迪、现代、日产和吉利,合计年产能 1800 万辆。这进一步壮大了之前已加入的梅赛德斯-奔驰、丰田和通用汽车的阵容。我们还宣布与 Uber 达成重大合作,在多个城市部署和整合 RoboTaxi Ready 车辆。
在工业机器人领域,ABB、Universal Robots 和 KUKA 等众多机器人公司已与我们合作,将物理 AI 模型与仿真系统结合,推动机器人在全球制造产线上的部署。
在电信领域,Caterpillar 和 T-Mobile 也包含在内。未来,无线基站将不再只是通信节点,而是像 NVIDIA Aerial AI RAN 这样的智能边缘计算平台——能够实时感知流量、调整波束成形、实现节能增效。
1800 万辆年产能
比亚迪+现代+日产+吉利合计年产能 1800 万辆——加上此前的奔驰、丰田和通用,NVIDIA RoboTaxi Ready 平台覆盖的年产能已超过全球汽车总产量的 1/3。这是一个惊人的渗透速度。
三台计算机模式
NVIDIA 为每个机器人提供三台计算机(训练+仿真+机载)——意味着每个机器人客户要购买三倍的 GPU。机器人行业的规模化将为 NVIDIA 开辟一个与数据中心完全独立的增长曲线。
(播放迪士尼 Olaf 机器人演示视频)
黄仁勋雪人来了!Newton 运行完美!Omniverse 也运行完美!Olaf,你好吗?
Olaf见到你太高兴了。
黄仁勋是的,因为是我给了你计算机——Jetson!
Olaf那是什么?
黄仁勋它就在你肚子里面。
Olaf那太神奇了。
黄仁勋你是在 Omniverse 里学会走路的。
Olaf我喜欢走路。比骑驯鹿好多了,还能仰望美丽的天空。
黄仁勋这正是因为物理仿真——基于 Newton 求解器运行在 NVIDIA Warp 上,这是我们与迪士尼和 DeepMind 合作开发的,让你能够适应真实的物理世界。
Olaf这正是我要说的。
黄仁勋那就是你的智慧所在。我是一个雪人,不是一个雪球。
黄仁勋你能想象吗?未来的迪士尼乐园——所有这些机器人角色在整个乐园里自由行走。不过说实话,我以为你会更高一些。我从没见过这么矮的雪人。
Olaf(无回应)
黄仁勋你能帮我把今天的演讲讲完吗?
Olaf太棒了!
Olaf 的技术栈
这个行走的 Olaf 机器人集成了 NVIDIA 的多项技术:Jetson(边缘 AI 计算平台,就装在"肚子里")、Omniverse(仿真训练环境)、Newton(物理求解器)、Warp(GPU 加速的物理仿真框架)。它是 NVIDIA 物理 AI 全栈能力的一次生动展示。
主题乐园场景
"未来迪士尼乐园里机器人角色自由行走"——这不是幻想。迪士尼是 NVIDIA 的战略合作伙伴,主题乐园机器人是物理 AI 最早的大规模商业化场景之一。每个自主行走的角色都需要一套完整的 NVIDIA 计算系统。
黄仁勋今天,我们一起讨论了以下核心主题:
一、拐点的到来:推理已成为 AI 的核心工作负载,Token 是新商品,推理性能直接决定收入。
二、AI 工厂时代:数据中心从文件存储设施进化为 Token 生产工厂。未来,每家公司都将以"AI 工厂效率"来衡量自身竞争力。
三、OpenClaw 的 Agent 革命:OpenClaw 开创了 Agent 计算时代。企业 IT 正在从工具时代过渡到 Agent 时代,每家企业都需要制定 OpenClaw 策略。
四、物理 AI 与机器人:具身智能正在大规模部署。自动驾驶、工业机器人和人形机器人共同构成了物理 AI 的下一个巨大机遇。
感谢大家,祝大家在 GTC 过得愉快!
四大主题的内在逻辑
黄仁勋的四大主题形成了一个完整的论证链:推理拐点 → Token 成为商品 → AI 工厂是生产方式 → OpenClaw 是编排层 → 物理 AI 是终极落地。从经济逻辑到技术实现到最终应用,层层递进,这就是 NVIDIA 的"完整叙事"。
推理 > 训练
总结中"推理已成为核心工作负载"是最重要的信号。训练是一次性的(模型训练完就结束),但推理是永续的(只要 AI 在服务用户就在持续消耗算力)。推理超越训练意味着 NVIDIA 的收入从"项目型"转向"运营型"——更可预测、更具粘性。
五条核心要点
- 万亿美元需求翻倍仍嫌保守:高确信度需求从 5000 亿升至 1 万亿美元(到 2027 年),黄仁勋甚至暗示"可能还会供不应求"。背后逻辑是推理计算需求两年增长万倍,AI Agent 的拐点已经到来。
- Token 工厂经济学重定义数据中心:数据中心不再是"仓库"而是"工厂",Token 成为分层定价的新商品($0 到 $150/百万 Token)。在固定功率约束下,每瓦吞吐量直接等于营收能力——这是 NVIDIA 架构优势的核心变现路径。
- Vera Rubin 实现两年 350 倍跃升:同一座 1GW 数据中心的 Token 生成速率从 2200 万/秒到 7 亿/秒,是摩尔定律同期(1.5 倍)的 233 倍。Groq 的非对称解耦架构填补了超高速推理的最后缺口。
- OpenClaw = Agent 时代的 Windows:每家 SaaS 公司将变成 AaaS 公司,每位工程师将拥有年度 Token 预算。企业既是 Token 消费者也是 Token 生产者——一个全新的双向市场正在形成。
- 路线图从 Blackwell 延伸到太空:Blackwell → Vera Rubin → Vera Rubin Ultra → Feynman 的四代路线图清晰可见,铜/光/CPO 三线并行;Vera Rubin Space-1 将 AI 算力延伸至太空——这是 NVIDIA 对"算力无极限"的终极表达。