算力即营收——Agent 时代全面开启
2026 年 6 月 1 日,黄仁勋在台北 COMPUTEX 大会发表了近两小时的 GTC 台北主题演讲。核心论断被反复强调:有用的 AI 已经到来,每一个 token 都是利润单元,算力就是营收。
演讲围绕一个统一的"Agent 计算范式"展开:模型 + 编排框架 + 工具 + 运行时——这个模式将在云端、企业内网、个人 PC、自动驾驶汽车和机器人上反复出现。三大硬件发布贯穿始终:Vera Rubin 系统正式量产(不只是一颗芯片,而是 GPU + CPU + 存储 + 安全 + 网络的完整体系);Vera CPU(为 Agent 而非人类设计的全新处理器架构);RTX Spark(与微软合作,四十年来 PC 的首次重新发明)。软件侧发布了 Nemotron 3 Ultra 开放模型、Cosmos 3 物理 AI 基础模型、芯片设计超级 Agent(与 Cadence 合作)、Alpamayo 自动驾驶系统和 Isaac GR00T 人形机器人参考平台。
黄仁勋把 NVIDIA 定位为"AI 基础设施公司"——不仅卖 GPU,更帮客户建造并运营 AI 工厂,最终目标是让客户获得最大营收、最大利润。他反复致敬台湾供应链生态,称 Vera Rubin 的制造涉及 150 家台湾供应链合作伙伴、数百万平方英尺厂房面积。
开场视频旁白这就是智能的制造方式。一种全新的工厂。Token——AI 的基本构件。Token 开辟了一片新疆域,将数据转化为知识、推理和行动。它们揭示出复杂性中我们从未看到的规律。映射我们的城市,守护我们的安全。Token 帮助机器人向我们学习,弥合希望与治愈之间的鸿沟,让我们呼吸更顺畅,让最幼小的心脏跳动得更强劲。Token 正帮助我们开辟前所未有的新天地——"星云一号分离确认"——直抵无限,乃至更远。我们一起迈出伟大的一步,走向为全人类而建的光明未来。而一切,就从台北开始。
黄仁勋见到大家太高兴了。回到家的感觉真好。我把父母也带回来了。我爸妈在哪里?大家给我爸爸妈妈一个掌声!还有为我们暖场表演的超级明星们,女士们先生们——台湾之星。
今天在座的人太多了。我们现在正向全台湾 70 个分会场同步直播。70 场分会同时进行,所有人都在看这场演讲。我们有太多要告诉大家的,也有太多合作伙伴要感谢。我们在台湾的生态系统已经庞大得令人难以置信。
大多数时候,人们想到生态系统,会想到我们的软件栈,想到 NVIDIA 所构建的计算系统之上的开发者生态。但 NVIDIA 的生态系统从上游一直延伸到我们在台湾的整条供应链——一切从这里开始——再向下游一直延伸到数据中心,最终到达终端用户。今天,我们将谈论几乎所有这些生态。有太多人需要感谢。我爱我在这里的生态系统。这里有太多公司,还有我最喜欢的一些生态伙伴。
70 场分会同播
GTC Taipei 2026 在全台设 70 个分会场,同步收看主题演讲直播。这一数字体现了 NVIDIA 在台湾供应链生态中的号召力——从芯片封装到服务器组装,几乎所有产业链环节都有参与者。
带父母回台
黄仁勋出生于台南,9 岁移居美国。在台北演讲时带上父母出场,是对台湾"根"的情感呼应,也是对台湾供应链伙伴的敬意信号——"我不只是来做生意的,这里是家。"
黄仁勋台湾最丰富的生态系统。最丰富的生态系统,全世界最好的供应链生态系统。难以置信。感谢大家的到来。今年,我们共同的业务增长惊人。事实上,昨晚有人告诉我,今年台湾的GDP将增长近 10%。
好的,我们有很多要聊的。让我们开始吧。两年前我在这里的时候,就开始和大家谈 AI 如何从生成式 AI 向更多的 AI 浪潮演进。下一波 AI 就是 Agent AI。今天我们可以说,Agent AI 已经到来,有用的 AI 已经到来。
台湾GDP增长近10%
台湾 2025 年 GDP 增速约 6.5%,若 2026 年达到"近 10%"将是金融危机后最强劲的年份之一。这一增速中相当部分来自半导体供应链——TSMC、日月光等为 NVIDIA 制造的先进芯片直接带动出口。黄仁勋把台湾的 GDP 增长与 NVIDIA 供应链挂钩,既是致敬也是话术。
Agent AI 与生成式 AI
生成式 AI(Generative AI)是被动回答问题、生成内容的模型。Agent AI(智能体 AI)则更进一步:模型嵌入一个"编排框架",能自主观察、推理、规划、使用工具并执行行动。黄仁勋认为这是从"AI 能聊天"到"AI 能干活"的质变。
黄仁勋这意味着什么呢?这是 GitHub。这当然是 Agent AI 最早落地的应用之一——软件编程。最有价值的职业之一,极其庞大的生态系统。3000 万到 4000 万职业软件开发者。可能还有几百万学生和爱好者。但就说 3000 到 4000 万靠写代码谋生的软件开发者。
这代表了他们中的绝大多数。这是 GitHub。Pull request 是他们下载软件并修改的动作,commit 是他们推送回去的动作。好,如果你看这个:2023 年 commit 数是 3 亿。2024 年 4 亿。2025 年 5 亿。在 2026 年头几个月,已经接近翻了三倍。
这意味着什么?3000 万软件开发者,代表着每年约 3 万亿美元的 GDP 产出——这就是他们的工资,3 万亿美元的年薪,为其他行业创造经济增长。假设全球 100 万亿美元的产业受此影响,由 3 万亿美元的薪资驱动。而现在这 3 万亿美元的薪资正产出接近三倍的成果——实际上相当于 9 万亿美元的生产力,来自 3 万亿美元的薪资。你能理解这意味着什么吗?这个差距绝对是惊人的。这就是 AI 的潜力,这就是 AI 的承诺。
软件工程师的数量实际上在增加。人们说 AI 会减少工作岗位。完全是胡说。它正在让更多的软件工程师被雇用,原因非常简单。如果你能雇一个软件工程师,然后产出 9 万亿美元的生产力,你为什么不想多雇一些?如果那条线是平的,那人们显然会减少雇用。但正因为产出如此惊人,人们想要雇用更多的软件工程师。这迟早会反映在我们的经济数据中。
GitHub commit 三倍增长
2023 年 3 亿 → 2024 年 4 亿 → 2025 年 5 亿 → 2026 年初已近三倍。这是黄仁勋论证"有用 AI 到来"的核心证据链。注意:commit 数暴增部分源于 AI 辅助编码产生大量自动提交,并非全部代表"有效"产出——但生产力提升趋势确实显著。
AI 不减少工作,反增就业
与主流"AI 取代程序员"叙事相反,黄仁勋的逻辑是:当边际产出大幅提升时,雇主的理性选择是增加投入而非缩减编制。这类似工业革命早期纺织机的效应——每台机器产出更多布匹,但雇用的工人反而更多了。关键前提是产出能转化为新收入。
黄仁勋所以第一件事是,有用的 AI 已经到来。那从产业视角来看这意味着什么?从产业视角看,这意味着 token 现在有了巨大的需求。因为如果你能做到这些,你就想要生产更多。而 token 现在已经成为盈利单元。Token 现在是有利润的营收单元。
因为现在能盈利了,AI 公司想要生成更多 token,建更多 AI 工厂,这正是台湾这边算力需求暴涨的原因。这也正是你们所有人如此忙碌、业务做得如此好的确切原因。事实上,这看起来很像你们其中一些人的股价走势。
计算范式已经改变。一切都变了。所以,第一个理念是:有用的 AI 已经到来。AI 现在是利润发生器。AI 现在是 GDP 发生器。而背后是一种全新的计算范式。不仅仅是一个大语言模型,而是一个 Agent。今天我们要谈论的几乎所有事情都将基于此。让我花一分钟给大家解释我在说什么。
Token 即营收单元
这是全场演讲最重要的投资逻辑之一。黄仁勋将"token"从技术概念提升为经济概念:每生成一个 token 就产生一笔可计价的营收。这意味着 AI 基础设施的投资回报可以用"每瓦 token 产出"来量化——越多 GPU、越高能效 = 越多利润。这套逻辑为 NVIDIA 持续涨价提供了需求侧支撑。
黄仁勋这里面是一个 Agent。这是一个 Agent 应用。在过去,这里是应用程序。这里是代码。这里是操作系统。应用程序——代码在应用程序内部运行——在操作系统之上。今天变成了 Agent,它由一个或多个大语言模型构成,位于一个编排框架(harness)之中,这个框架帮助它做有意义的工作。
这是输入。当输入到来时,它必须理解、观察、推理、行动、使用工具。那个工具可以是电子表格、网页浏览器、数据处理引擎或数据库引擎。这个编排框架在每一次信息传递中——无论是处理上下文、理解正在发生的事情、推理该做什么、制定计划然后执行——都在做路由调度。
所以这本质上就是一个 Agent。它处理短期记忆——称为工作记忆——以及长期记忆,就像我们人类一样有长期记忆。因此记忆管理系统至关重要。这整个系统就叫做 Agent。大语言模型负责思考,而编排框架把一切连接在一起,就像一个操作系统。
好,这就是新的计算模型,这就是 Agent。它能做出不可思议的事情。这就是重大突破。大语言模型终于能够很好地思考、推理、规划、使用工具,再加上我们现在有了管理记忆、编排工具的框架——两者同时成熟并汇聚在一起,我们现在能做出惊人的事情。让我给大家举几个例子。
Agent 四要素
黄仁勋将 Agent 拆解为四个部分:模型(大脑,负责思考推理)、编排框架/Harness(身体,连接一切)、工具(工作坊中的设备)、运行时(操作系统,承载全局)。这与传统"应用-代码-操作系统"的三层架构形成对比。
KV 缓存与记忆管理
KV 缓存(Key-Value Cache)是大语言模型推理时的"工作记忆"——存储已处理的上下文以避免重复计算。Agent 系统的记忆远比单次对话复杂:需要压缩、检索结构化/非结构化数据、管理本体关系。黄仁勋认为这将"彻底革新存储系统"。
黄仁勋这是一个提示词(prompt),这是生成的代码,然后输出就是这个。这是输入,这是输出。大家觉得怎么样?相当惊人,对吧?顺便说一下,我们这里用的是 Claude Code,但 Codex 同样做得非常好。
再看另一个例子。这是输入:"创建一个 GIF 动画——NVIDIA 绿色圆点在黑色背景上散开,组成台北 101 大楼,变形为 GTC 文字,再变形为 2026,变形为 NVIDIA 眼睛 logo,然后散开,循环播放。"对,你们看到了。
下一个:我的遥控器电池盖丢了。它长这样。创建一个 CAD 文件——它使用了工具——创建一个可以 3D 打印的 CAD 文件来做一个新的。明白了吗?
这就是新的计算范式。我们过去是启动一个应用程序,点击和打字。现在我们用向 AI 解释我们想要什么——我们的意图——来取代它,AI 生成代码或使用工具,产出所需的结果。这就是未来计算机的工作方式。这就是 Agent AI。我们为此准备了两年,现在它已经到来。
黄仁勋当然一大突破是工具的使用。很多人说:"Jensen,AI 来了,Agent AI 来了,所以所有软件公司都要完蛋了。"我说恰恰相反。因为将会有如此多的 Agent,世界不再受限于人的数量,因此这些 Agent 会比以往使用更多的工具。现在是做软件公司最好的时代。但软件必须以 Agent 能使用的方式呈现。
这是一个重大突破。事实上你们知道,NVIDIA 的宝藏就是我们所有的 CUDA 库。我称它们为 CUDA-X 库。这是 NVIDIA 的宝藏。今天,我们能够将这些 CUDA-X 库提供给 Agent,而 Agent 使用它们甚至比人类更高效。
视频旁白20 年前,我们打造了 CUDA——加速计算的统一架构。我们重新发明了计算。上千个 CUDA-X 库帮助开发者在每个科学和工程领域实现突破。CUDA-X 库就是 Agent 的工具。cuLitho 用于计算光刻。cuOpt 用于决策优化。cuDSS 用于稀疏直接求解器。AIQ 用于结构化和非结构化文档的深度研究。Ariel 用于 AI 无线接入网。Parabricks 用于基因组学。它们的基础是算法,而算法是美的。
黄仁勋让我们为数学鼓掌。数学是美的。
Agent 救了软件公司
市场叙事常认为 Agent 会"消灭中间件",但黄仁勋的逻辑相反:Agent 数量远超人类 → 工具消费量激增 → 软件公司受益。前提是软件需要提供 Agent 可调用的接口(如 MCP 协议)——不能被 Agent 调用的软件才会被淘汰。
CUDA-X 库
NVIDIA 将旗下上千个领域加速库统称为 CUDA-X:涵盖计算光刻(cuLitho)、基因组分析(Parabricks)、优化求解(cuOpt)等。现在每个库都附带"技能"(skills)——一份供 Agent 阅读的使用手册,让 AI 能像人类开发者一样调用这些加速工具。
黄仁勋让我们回到这里。这就是 Agent。它是终极的解耦式和分布式计算模型。为了处理这个 Agent,需要激活许多不同的计算机。Agent 由模型、编排框架、工具和技能以及运行时组成。所有这些运行在数据中心的不同位置。
你可以把模型想象成大脑。编排框架是身体。它使用的工具,运行在运行时中——可以把它想象成一个工作坊。所以这是一个人——一个工人在工作坊里使用工具。当然,这一切都在极大的规模上发生。每一个步骤都在计算机的不同部分运行。
你能看到,大语言模型在思考——上下文处理、观察、理解环境、推理、制定计划、执行计划。每一次这个过程发生,整整一个 Grace Blackwell NVLink 72 机架都会被激活。它在用大语言模型思考。每当它使用工具,就激活 CPU——那个工具可能是 C 编译器、Python、JavaScript,或者加速计算。今天的 Agent 还只是工具的简单使用者。明天,它们将成为非常复杂的工具使用者——这正是我刚才展示的 CUDA-X 库将大受 Agent 欢迎的原因。
工具运行在 CPU 和 GPU 以及大语言模型上。安全编排框架运行在 CPU 和安全处理器上——就是 NVIDIA 的 BlueField DPU。所有这些的编排运行在 CPU 上——这是整个编排框架,CPU 在调度所有工作。最难的部分之一是记忆——KV 缓存,记住什么、压缩什么、怎么检索。结构化数据?非结构化数据?所有数据之间的本体论关系是什么?这整个处理过程极其复杂。AI 的记忆系统将导致存储系统被彻底革命。
解耦式计算
传统应用在单台机器上运行;Agent 计算则是解耦的:模型推理在 GPU 机架上、工具执行在 CPU 上、安全隔离在 DPU 上、记忆管理在存储系统上。这种分布式异构架构正是 NVIDIA 推出"Vera Rubin 系统"而非单颗芯片的根本原因。
黄仁勋正如你能看到的,这种计算模型、这种计算范式、这种叫做 Agent 的新应用,与过去应用程序的运行方式有着根本性的不同——过去是一堆软件装在一个二进制文件里,跑在操作系统上。
正是这种解耦的、分布式的、异构计算问题,正是我们打造下一代 Vera Rubin 的原因。Vera Rubin 不是一颗芯片。Vera Rubin 不仅仅是一颗 GPU。它始于 GPU,但 Vera Rubin 是不可思议的。
这整个东西就是 Vera Rubin,端到端。它有 GPU——Vera Rubin NVLink 72。它由 Vera CPU 来编排——我马上会详细介绍。存储系统是革命性的——Vera 配合 CX9,以及我们叫做 Doka 的软件栈。安全处理器在里面,所有东西都是加密的——静态加密、传输加密、使用中也加密。整个系统都遵循机密计算。
这些系统中的每一个单独拿出来都是一次完整的革命。Vera Rubin 是我们公司历史上最宏伟的工程。全公司 40000 名工程师都参与了 Vera Rubin 的工作。更不用说你们所有人——你们所有人都参与了这个系统的创造。Vera Rubin 确实是一个奇迹,它不只是一颗芯片,而是非常多颗。甚至不止于此。
Vera Rubin 系统
Vera Rubin 以美国天文学家维拉·鲁宾命名(发现暗物质旋转曲线证据)。它不是单颗 GPU,而是一个多机架规模的完整系统,包含五个子系统:NVL72 GPU 机架、Vera CPU 机架、Groq LPX 低延迟推理系统、BlueField 4 STX 存储/安全系统、Spectrum-X 网络系统。
40000 工程师全参与
黄仁勋强调全公司投入是为了传递一个信号:Vera Rubin 不是某个事业部的产品,而是 NVIDIA 整体战略的集中体现。这种"all-in"叙事也在暗示竞争对手很难仅凭单颗芯片与 NVIDIA 的系统级集成抗衡。
黄仁勋很久以前,NVIDIA 曾是一家 GPU 公司。但这些年来,我们演进成了一家系统公司。你们现在看到的是有史以来设计的最复杂、最彻底的从头设计的系统。但最终,我们的客户、我们的合作伙伴不是想买计算机。他们想建 AI 工厂。这正是为什么 NVIDIA 真的在再一次转型自己。
你能看到我们的技术现在已经覆盖到整个基础设施尺度。我们的合作伙伴也在基础设施尺度上——发电厂、冷却系统、电网供应商。这么多工业企业现在都是我们生态系统的一部分,因为最终,我们要构建的是一个完整的栈——就像 GPU 一样,就像我们构建 Grace Blackwell NVLink 72 一样——现在我们在构建一个全栈系统,让客户能够打造令人惊叹的 AI 基础设施。
视频旁白全世界都在竞相建造 AI 工厂——人类历史上最大规模的基础设施建设。AI 工厂极其复杂,每一层——芯片、机架、网络、电力、散热、电网——都必须从端到端协同设计,因为算力就是营收。NVIDIA DSX 是蓝图,是建造和运营 AI 工厂以达到最大效率和最大盈利能力的参考设计。
NVIDIA 再定位
GPU 公司 → 系统公司 → AI 基础设施公司。这三次定位跃迁每次都伴随 TAM(可触达市场)的数量级扩大。作为"基础设施公司",NVIDIA 不仅卖芯片,还卖整套设计蓝图、运维软件、甚至电力管理方案——这把竞争壁垒从"芯片性能"提升到"整厂效率"。
DSX
继 RTX(GPU 品牌)和 DGX(AI 系统品牌)之后,NVIDIA 推出 DSX——AI 基础设施品牌。DSX 包含 DSXSim(用 Omniverse 数字孪生预验证工厂设计)、DSX OS(运维系统)、DSX Max LPS(电力优化)、DSX Flex(电网协调)。
视频旁白它始于 DSXSim。借助 DSXSim Omniverse 蓝图,合作伙伴可以在第一个机架落地之前就设计和验证一座 NVIDIA Vera Rubin AI 工厂。他们规划布局、设计网络、验证每一个集成点、在数字孪生中测试每一个变更。
工厂上电后,DSX OS 接管——配置、运营、监控、修复基础设施。将已安装的系统转化为可信赖的、多租户的、高弹性的 AI 就绪算力。
今天的 AI 工厂电力过度配置高达 40%。DSX Max LPS 让运营者能在同一电力预算内安全地部署更多 GPU,增加数十亿美元的年营收。突破性的 45 摄氏度热液冷却技术使用更少的水和能源,更多的电力流向能产生营收的计算。令人难以置信。
动态电力分配将电力从一个机架转移到另一个,回收闲置瓦特,将其送到工作正在进行的地方。机架内功率平滑抹平峰值电流尖峰和功率浪涌。在整个工厂中,AI Agent 团队与 DSX Max LPS 协同工作,持续协调散热和电力以满足工作负载需求。
DSX AI 工厂是灵活的能源资产,与电网协同运行。DSX Flex 读取实时电网信号,在电网需要减负时动态调整工厂功率。
在本十年结束前,将有 100 吉瓦的 AI 工厂上线。NVIDIA DSX AI 工厂以最高效率运行,产出最低成本的 token,并让电网变得更强大。
100 吉瓦 AI 工厂
100 GW 相当于约 100 座核电站的发电量,或美国总装机容量的约 8%。按黄仁勋提到的"每吉瓦 500-1000 亿美元"计算,这意味着本十年 AI 基础设施总投资将达到 5-10 万亿美元。这个数字解释了为什么电力/散热/电网成为 AI 投资的第一层。
电力浪费高达 40%
当前 AI 数据中心普遍"过度配置"电力以应对峰值需求,导致 40% 电力被浪费。DSX 的电力优化方案(动态分配、功率平滑、电网协调)本质上是将"浪费的瓦特"转化为"额外的 GPU 和营收"——这是一种不需要多建电厂就能增加算力的方式。
黄仁勋我以前给大家看过生态系统幻灯片——NVIDIA 的计算层和软件栈如何集成到第三方平台和库中,服务终端市场。那是计算生态系统。而这是 AI 工厂生态系统。这在你们所有人的更下游。你们在我的上游,我的下游是这个生态系统。
因为 NVIDIA 最终不仅仅是在造 GPU、造系统,我们在帮助客户建造这些极其复杂的 AI 工厂、AI 基础设施。这些设施每一座在 1 吉瓦级别,最初是 200 到 300 亿美元。现在已经到了 500 到 600 亿美元,很快就会到 800 到 1000 亿美元每吉瓦。1000 亿美元投入一座 AI 工厂——它必须第一次就成功,必须立刻运转起来。资本成本惊人,复杂度惊人。
我们过去在电脑里设计芯片,然后在电脑里模拟系统。今天,你们刚才看到的,一切都在 Omniverse 里构建。我和大家一起研究 Omniverse 很长时间了。这就是梦想成真。我们可以在数字框架、数字模拟器、数字世界里构建这些巨型系统,远远早于我们破土动工、投入资金。
因为我们在整个栈上所做的工作——包括我们的系统和软件——这就是为什么我们能和小公司合作,让它们成为世界级的 AI 云。我马上要给大家展示的每一家公司最近都还是小公司。而现在 CoreWeave 已经价值 500 到 700 亿美元,增长极其迅速。最近我们和 Nebius 合作,它们同样增长飞快。
这些云服务商各有了不起的客户。Cursor——软件编程公司。Black Mountain Labs——图像生成。World Labs——世界基础模型。Revolut——领先的金融服务 AI 公司。Shopify。还有 NScale,客户包括英国电信、Google。Google 在使用我们的一家 AI 云。Thinking Machines——一家前沿实验室。韩国的 Naver Cloud,服务韩国银行、现代等。印度的 Yoda。新加坡建设、澳大利亚部署的 Together AI。印尼的 Indosat。台湾的 GMI。
AI 将在所有地方运行。每一家公司都将以它驱动。每一个地区都将建造它。
每吉瓦 1000 亿美元
AI 工厂造价从 200-300 亿迅速攀升到 1000 亿美元/GW,反映了两个趋势叠加:系统复杂度提升(从 GPU 机架到全栈基础设施)+ 供需紧张推高价格。按"100 GW 将上线"计算,总投资达万亿美元量级。
小公司的大估值
CoreWeave 从初创到 500-700 亿美元估值,Nebius(Yandex 分拆)快速增长——NVIDIA 基础设施栈让"租 GPU 建云"成为可行商业模式。这对投资者意味着:AI 云是 NVIDIA 生态中增长最快的客户群,但其估值高度依赖 NVIDIA 的供给分配。
黄仁勋所有这些公司、所有这些机遇都需要几样东西。当然,他们需要计算栈——这整个底层是 NVIDIA 闻名于世的东西。所有硬件和软件、库以及我们与全球第三方开发者生态的连接,让任何人都能建立起一座 AI 云。但 AI 云现在太复杂了。这是软件版本、计算机科学版本。而资金版本、资产版本就是我之前展示的那个——一座巨大的工厂。光有这些能力还不够,这正是为什么 NVIDIA 已经成为一家 AI 基础设施公司。
把这件事做好、变得非常擅长帮助客户建造和部署 AI 工厂至关重要。原因就在这里。算力现在就是营收。算力就是利润。营收和利润的缺失就是亏损。
所以,必须认识到,一座 AI 基础设施上线——它可能快速上线,也可能拖很久。它的吞吐量可能高,也可能低。它的弹性和可靠性可能好,也可能差。它的使用寿命可能长,也可能短。这代表着 500 到 600 亿,很快到 1000 亿美元,这条曲线至关重要。
这正是为什么与 NVIDIA 合作是如此好的选择。因为我们全面集成的能力——我们不只是画了一张 PPT。我们创建了整个基础设施,连接了一切,自己建了几十亿美元的设施来确保一切运转良好。因此,我们从下单到出第一个 token 的时间、到第一次推理的时间、到训练启动的时间,都快得多。
"买得越多,赚得越多"
这是黄仁勋全场最核心的销售逻辑:算力 = 营收,每瓦性能 = 营收,所以选便宜但低效的芯片不划算。这套逻辑的隐含假设是 token 需求无限且价格稳定——只要这个假设成立,NVIDIA 的高价就可以用"单位经济更优"来辩护。
黄仁勋第二,我们的每瓦吞吐量、每瓦 token 产出绝对是世界顶尖的。原因是我们集成了一切,从头设计一切,模拟整个系统,使用极致的协同设计。就像我刚才展示的 Vera Rubin 机架一样,一切都是为了交付这种不可思议的吞吐量而设计的。
如果你的数据中心、你的工厂有 1 吉瓦电力,那就不会更多了。1 吉瓦就是 1 吉瓦,这就是你全部的发电能力。如果你有 1 吉瓦的电力,那么每瓦吞吐量就是营收,因为每一个 token 都是有利润的,每一个 token 都是营收。这就是未来。算力就是营收。每瓦性能就是你的营收。选错了架构——仅仅因为芯片更便宜——说不通。你需要确保你的每瓦营收——买得越多,赚得越多。
第三是可靠性。如果你有机会看看这些数据中心,里面有无数运动部件,数百万根线缆。所有这些计算机和谐地、可靠地工作的能力极低。这极其困难。我们现在已经在极大规模上运营了很长时间。这种经验很重要。平均中断间隔时间——极其重要。
最后,这一点非常难。这些系统的寿命——软件一直在变。4 年前——也就是 Hopper 的时间跨度——AI 已经完全变了。6 年前——Ampere 的时间跨度——AI 完全变了。我们从讨论 CNN 开始,然后讨论 Transformer,然后讨论混合专家模型。现在我们在讨论 Agent 系统。每一代,每隔几个月,软件行业都在推出新技术。如果你的架构不灵活,如果你的生态系统不丰富,那这条曲线就不可能很长。
你无法预测你的系统能用多久。我能。NVIDIA 的系统遍布全球。软件开发者从 NVIDIA CUDA 起步,因此生态系统、有用资产的寿命就会更长。差异本质上就是成本。如果资产寿命长,TCO(总拥有成本)就低。这就是差别所在。这就是"买得越多,赚得越多"。
"你预测不了,我能"
这是全场最霸气的一句话,也暗藏 NVIDIA 最深的护城河:CUDA 生态系统。因为开发者在 CUDA 上投入了代码和工具链,每一代新模型技术(CNN → Transformer → MoE → Agent)都首先在 CUDA 上实现——这让 NVIDIA 硬件的"有效寿命"远超竞品。TCO 优势不是芯片层面的,而是生态层面的。
便宜芯片反而更贵
黄仁勋直接攻击了"用更便宜的芯片替代 NVIDIA"的逻辑:如果每瓦 token 产出更低、资产寿命更短、可靠性更差,那么总成本(TCO)反而更高。这是对所有竞品(AMD MI300X、Google TPU、自研芯片)的统一回应。
黄仁勋你们所有人都在和我一起经历这一切,对吗?你们所有的需求,你们的工厂在拼命运转,全台湾的人都在拼命工作,因为每个人都想赚钱。他们认识到有用的 AI 来了,有利润的 AI 来了。算力需求极其高涨,而算力是瓶颈。所以,让我们超级努力地工作,帮助全世界到处建起 AI 工厂。这就是为什么这件事如此重要。我太高兴了。
我现在站在你们面前。Vera Rubin 已经全面投产。
我们为 Vera Rubin 打造的供应链是 Grace Blackwell 的两倍规模。而且,过去组装一个 Grace Blackwell 机架需要两个小时,现在只需要 5 分钟。所以不仅产能更高,吞吐速度也快得多。我们需要这一切来支撑需求。
这个生态系统非凡卓越。数百万平方英尺的厂房面积已经上线,支持 Grace Blackwell,现在正在准备、正在爬坡 Vera Rubin。我要感谢你们所有人。Vera Rubin 现在已经全面投产。谢谢。
2 小时 → 5 分钟
机架组装时间从 2 小时降至 5 分钟,这不仅是制造效率的提升,更直接影响"上线速度"——在"算力即营收"的逻辑下,更快上线 = 更早产生收入。新的 PCB 中板设计取消了所有线缆,实现"免线缆组装"。
供应链翻倍
Vera Rubin 的供应链规模是 Grace Blackwell 的两倍——这意味着台湾封装(TSMC CoWoS)、基板(欣兴、南亚电路板)、组装(鸿海、广达)等环节的产能需求翻倍。对 AI 供应链投资者而言,这是持续增长的强信号。
视频旁白大语言模型生成答案。现在 AI Agent 能做工作。但处理 Agent AI 是一种完全不同的问题。Agent 观察、推理、规划、使用工具。它们管理海量上下文,在工作记忆和长期记忆之间切换。它们按需启动子 Agent——专家。
NVIDIA Vera Rubin 是一个多机架 pod 级别的系统,专为处理 Agent AI 而构建,现已全面投产。跨供应链的制造、自动化和编排,简直是奇迹。我们的旅程始于推出第一台 AI 超级计算机 NVIDIA DGX-1。在接下来的十年,我们把每一颗芯片和每一个系统都推到了极限——从 Pascal 和第一代 NVLink,到 Grace Blackwell——第一台机架级 AI 超级计算机。而现在,Vera Rubin——第一台多机架 pod 级超级计算机,为 Agent 时代而生。
它始于台积电。构成 Vera Rubin 的 7 颗新芯片通过数百道工序成型。3 纳米制程,CoWoS-R 和 CoWoS-L 封装,来自美光、SK 海力士和三星的 HBM4 内存。Vera Rubin 计算板——6 万亿个晶体管,一块板上超过 18000 个组件。Vera Rubin NVL72 负责思考——提示词和上下文理解、推理和规划。
新的模块化计算托盘,采用全新 PCB 中板设计——超级芯片、ConnectX-9 超级网卡、BlueField-4 DPU 全部就位——无需线缆,确保 AI 工厂级别的弹性。18 个计算托盘、9 个热插拔 NVLink 交换托盘、新型高效歧管、液冷母排——承载超过 5000 安培的电流,相当于 20 辆电动车全力加速。总计 130 万个组件构成这一第三代 MGX 机架设计。
祝贺微软的 Vera Rubin NVL72 工程机架投入运营。祝贺戴尔和 CoreWeave 同样完成了他们的 Vera Rubin NVL72 工程机架搭建。
然后是 Vera CPU 机架——256 颗 CPU 置于一个液冷机架中,编排模型、调度内存、启动工具。在鸿海和广达,Groq 3 LPX 成型——256 颗 Groq 3 LPU 分布在 16 个托盘中,40 PB/s 的 SRAM 带宽用于超低延迟。NVL72 以最高吞吐生成 token,Groq LPX 以最低延迟生成 token。
Vera BlueField 4 STX——AI 的记忆所在。存储处理由 BlueField 4 加速,连接内存、存储和芯片内安全。NVIDIA Spectrum-X 以太网光子——全球首款搭载 200 Gbps 共封装光学的以太网交换机。TSMC 的 Cook 工艺、芯片级封装和磷化铟上的超高功率激光二极管。
Vera Rubin。五个互联的机架级系统。为 AI Agent 打造的超级计算机。150 家台湾供应链合作伙伴,数百万平方英尺厂房面积,数百个站点——芯片、封装、系统和数据中心被推到了尺寸、功率和规模的极限。这就是我们所说的极致协同设计。我们和台湾一起做到的。我们一起为 AI 时代重新发明了计算。台湾从一开始就与我们同在,今天也在这里,与我们一起将 Vera Rubin 带给全世界。谢谢台湾。
6 万亿晶体管
单块 Vera Rubin 计算板集成 6 万亿个晶体管、18000+ 组件。对比:人类大脑有约 860 亿个神经元;全球半导体年产晶体管数约 10^21 个。一个 NVL72 机架的 130 万组件已接近一架波音 747 的零件数。
Groq LPX 低延迟推理
Vera Rubin 系统中的 Groq LPX 是专为超低延迟推理设计的子系统,配备 40 PB/s SRAM 带宽。它与 NVL72 形成互补:NVL72 追求最高吞吐(批量处理 token),Groq LPX 追求最低延迟(单次响应最快)。Agent 系统需要两者兼顾——思考要深(吞吐),工具响应要快(延迟)。
5000 安培
液冷母排承载 5000+ 安培电流,相当于 20 辆电动车同时全力加速。这说明 AI 机架的电力密度已远超传统数据中心——也是为什么液冷、电力管理成为 AI 基础设施投资的关键赛道。
黄仁勋女士们先生们,Vera Rubin。Vera Rubin 不只是为 AI 而建。Vera Rubin 不只是为了运行 AI。Vera Rubin 是为了运行 Agent 而建。这是一个 Agent 系统。想象一下其中的复杂度——这正是为什么 Agent 是最后一个计算机科学突破。这么多年来 Agent 才终于实现了它的潜力。理所当然,运行它的计算机也应该是世界上最先进的。这就是 Vera Rubin。
工程团队,能把系统推出来吗?这是 Vera Rubin NVLink 72。这是 Groq LPX——下次 GTC 我会更详细地介绍它。这是 Vera CPU 机架,256 颗 CPU,全部液冷。这是 Vera BlueField 存储处理系统,也是安全系统。当然,这是我们的 Mellanox 网络——全球首款共封装光学。这就是 Vera Rubin,所有不可思议的技术汇聚在一起。
当我们建造 Hopper 时,我们是为预训练而建的。预训练是当时最重要的工作负载。然后当我们做 Grace Blackwell 时,所有人都说:"Jensen,你知道,NVIDIA 预训练确实很强。但推理太简单了。"记得吗?人们曾经说:"推理太简单了,我们也能做。"
但你们知道,推理等于金钱。模型——MoE 模型太复杂了。要同时做到极短响应时间、高交互性和高吞吐量,极其困难。这就是我们创造 NVLink 72 的原因。今天,NVIDIA 的 token 成本是全世界最低的。不是低 10%,而是数量级的差距。全因为我们做了极致的协同设计。全因为我们理解了推理的计算模型、计算范式。
现在,Vera Rubin 超越了推理。它是在一个 Agent 系统中的推理。这就是 Vera Rubin——没有线缆、没有软管、没有风扇。上次我给大家看的时候,到处都是线缆,线缆确实很壮观。但现在中间有一块 PCB 连接两侧。过去两小时的组装现在五分钟搞定。Vera Rubin 的可靠性和弹性将是史无前例的。
"推理太简单"的打脸
黄仁勋回忆 Grace Blackwell 发布前市场说"推理很简单,谁都能做"。事实证明:大规模推理(特别是 MoE 模型的低延迟推理)极其困难,NVLink 72 的跨机架互联是关键差异。这是对所有宣称"推理不需要 NVIDIA"的竞品的现身说法式反驳。
无线缆设计
Vera Rubin 的"无线缆、无软管、无风扇"设计不仅是美学,更是可靠性和制造效率的根本提升。线缆是数据中心故障的首要来源之一——数百万根线缆中任何一根松动都可能导致计算中断。PCB 中板直连设计从根本上消除了这一风险。
黄仁勋我想后面大概有 2000 人在拉那些系统。Vera CPU——为 AI 时代而建的 CPU。
迄今为止所有的 CPU 都是为人类设计的。我们是使用者。我们也是租赁者。我们使用 CPU 的方式,是生活在一个以秒计量的世界里。我们在云上租 CPU 的方式——你的 CPU 核心越多,就能租出去越多。旧 CPU 的使用场景和经济模型与 Agent 有着根本性的不同。
Agent 是不耐烦的。它们不生活在以秒计量的世界里,它们生活在以纳秒计量的世界里。当它使用一个工具时,它希望响应时间尽可能快。当它访问数据库时,结果必须尽快返回。Agent 每等待一刻,就无法进入下一步、下一步、再下一步。
至关重要的是,我们必须让 CPU 延迟尽可能低、交互性尽可能强。所以,我们为 AI 时代创造了 Vera CPU。
在我们的系统内部,它有三种用途。第一种——在 Vera Rubin 机架里用于思考。Vera Rubin 机架里已经有两颗 CPU。如你所知,我们正在建造和销售数百万颗 Vera Rubin。我们已经卖出了数百万颗 Grace Blackwell。NVIDIA 已经是世界上最大的 CPU 制造商之一。
Vera Rubin 机架里有两颗 CPU——一颗 Grace BlueField 用于安全和隔离,Vera 计算核心用于编排 AI 模型、工具使用、访问数据库。数据服务器就在这里——Vera BlueField,有史以来最快的存储系统。这些系统至关重要,因为 Agent 正以极快的速度访问内存。
存储服务器和 CPU 现在是数据中心最昂贵部分的关键路径。AI 工厂的经济学就是 token,而 token 就在这里产生。当然你希望尽可能多地制造和生成 token。这正是为什么 Vera CPU 面临巨大压力——这也是为什么我们从头开始构建了一个全新架构,一个世界从未见过的 CPU。我们称它为 Vera。这是为 Agent 设计的 CPU。过去所有的 CPU 都是为人类设计的,这颗 CPU 是为 Agent 设计的。
CPU 不够用了
在 GPU 主导叙事中,CPU 常被视为"够用就行"。黄仁勋翻转了这个逻辑:在 Agent 系统中,CPU 是瓶颈——它负责编排、工具调用、安全隔离、内存管理,每一个环节的延迟都直接影响最昂贵的 GPU 利用率。CPU 太慢 = GPU 闲置 = 浪费营收。
"秒"vs"纳秒"的世界
人类感知延迟的阈值是 ~100ms;Agent 的"感知"在纳秒级(10^-9 秒)。10 亿倍的时间尺度差异意味着传统为人类优化的 CPU(追求多核多租户)必须被为 Agent 重新设计的 CPU(追求单线程低延迟)取代。这是 NVIDIA 进入 CPU 市场的根本理由。
黄仁勋好,有四个要点需要记住。第一个要点:Vera 的每时钟周期指令数(IPC)必须非常出色,因为我们需要延迟短。单线程性能——不是吞吐量——单线程性能必须是世界顶级的、绝对的最佳。Vera 的 IPC 是世界最高的。10 条指令每时钟周期取指、译码并执行。
第二:CPU 移入移出数据的带宽必须绝对世界顶级。每核带宽。第三是总带宽。记住,我之前说过,Agent 系统从根本上是解耦和分布式的。当计算是解耦和分布式的时候,网络就成了问题。因此,我们必须在 CPU 核心之间、CPU 和存储之间、CPU 和 GPU 之间尽可能快地移动数据。系统内外的带宽必须绝对世界顶级。
这是很长时间以来第一颗真正达到理论极限的 CPU,连接所有 CPU 核心的互联网络达到了光速——3.6 TB/s。没有 chiplet 税,没有芯片边界穿越——因为 CPU 核心之间需要极高带宽通信。它们不是按核出租的,而是全部协同工作。
Vera 的横截面带宽远超同类。它是第一颗支持 PCIe Gen 6 的。也是第一颗搭载 LPDDR5 的,1.2 TB/s 带宽——外部带宽是最高性能 x86 CPU 的两到三倍,内部带宽也是三倍。每核带宽和总带宽都是世界顶级。
记住我之前展示的——CPU 核心数量将会相当高。原因很简单:过去我们为人类造 CPU,只有十亿人。未来将有数十亿 Agent,而这些 Agent 使用 CPU 时极度没有耐心——因为它们旁边的 GPU 成本太高、太宝贵。因此,这些 CPU 必须既高性能又极致节能,这样我们才能在工厂里塞进尽可能多的 CPU,而不占用 token 生成的电力——因为 token 就是赚钱的方式。
这四个属性——每时钟指令数/单线程性能、每核带宽、芯片内外总带宽、能效——定义了 Vera。与最高性能的 x86 相比,完全是碾压级。在真实单线程性能上,同样碾压级。在 CPU 上实现 5% 的提升已经很了不起。实现 10% 更了不起。但这种级别的性能加速在 CPU 上前所未闻。
10-wide 与 Chiplet 税
10-wide 指每时钟可取指、译码、执行 10 条指令——这是极高的指令级并行度。Chiplet 税指多芯片拼接(chiplet)设计中,跨芯片通信的额外延迟和带宽损耗。Vera 选择单片(monolithic)设计,牺牲制造良率换取零 chiplet 延迟——这对纳秒级延迟敏感的 Agent 工作负载至关重要。
NVIDIA 进军 CPU 市场
Vera CPU 是 NVIDIA 对 Intel/AMD x86 霸权的正面挑战。差异化定位不是通用计算,而是"Agent CPU"——专为低延迟、高带宽、高能效的 Agent 工作负载优化。如果 Agent 真的成为主流计算范式,CPU 市场的竞争格局将被重塑。
视频旁白生成式 AI 改变了 CPU 的角色。CPU 现在是指挥家,GPU 是交响乐团。传统 CPU 为不同时代而生——最大化每插槽核心数,切片、虚拟化、按小时出租。在 Agent 时代,CPU 成为 GPU 利用率的瓶颈,直接影响 token 吞吐量、延迟和用户体验。
NVIDIA Vera 是为 Agent 循环而建的 CPU,结合了 NVIDIA 自研的数据中心 CPU 核心和可扩展一致性互联网络,在性能核心和带宽之间取得恰当平衡,最大化 AI 工厂的产出。
Vera 的核心是 NVIDIA Olympus 核心,为现代数据中心工作负载而生——分支密集的 Python 运行时、工具调用和沙箱代码执行。每颗核心都经过吞吐量调优。神经网络分支预测器每周期评估两个已采取分支。10-wide 译码引擎每周期引入更多工作。大型乱序执行引擎保持指令流动。先进的预取器配备创新图引擎,预判下一条数据路径。
Vera 是首颗使用 LPDDR5X 内存同时纠正多个错误而不损失带宽的 CPU。Vera 实现比 x86 低 40% 的峰值内存延迟,确保核心在检索、分析和沙箱执行中持续获得数据供给。
NVIDIA 第二代可扩展一致性互联网络将全部 88 颗 Olympus 核心统一在一个单片网格上,内存和 IO 使用独立 die。核心不被分割到 chiplet 上,实现比传统 CPU 快 50% 的核心间通信。内存一致性 NVLink 芯片间互联将 GPU 直接连接到互联网络上。NVLink 芯片间互联还可以将 Vera 扩展到多插槽,实现 CPU 之间的超大带宽。Vera 交付 x86 CPU 1.8 倍的 Agent 沙箱性能。独立的 Vera 机架运行 Agent 沙箱、工具、代码和数据管线。与 Rubin GPU 紧密耦合,Vera 保持加速工作流持续运转。
Olympus 核心
Olympus 是 NVIDIA 自研的 ARM 架构数据中心 CPU 核心(Grace 用的是 Neoverse V2)。关键创新:神经网络分支预测器(用 AI 预测代码分支)和图引擎预取(预判数据访问模式)。这些设计专门针对 Python 运行时和工具调用——Agent 工作负载的典型特征。
88 核单片网格
88 颗 Olympus 核心放在单片 die 上(非 chiplet 拼接),这在大核心数 CPU 中极为罕见。对比:AMD EPYC 9005 用 CCD chiplet 实现 192 核。单片设计的代价是良率更低、制造更贵,但换来了零 chiplet 延迟和 3.6 TB/s 的超高核间带宽。
黄仁勋这将成为我们新的重大增长引擎。评测已经出来了,表现相当好。相当不错。
Grace 和 Vera 也是 AI 世界中获得认证最多的 CPU,因为每一个数据中心、每一个云、每一个企业、每一家与 NVIDIA 合作做 AI 的公司都已经认证了 Grace。整个软件栈已经为 Grace 优化过了。每家公司都将认证 Vera。Vera 将成为世界上优化程度最高的 Agent CPU。
在 Grace Blackwell 转型期间,最大的风险是从外部 x86 CPU 切换到 Grace Blackwell。那个转型极其危险。但我们以令人难以置信的执行力完成了。现在 Grace 与 Grace Blackwell 完全画等号。当人们说 Blackwell,他们就是说 Grace Blackwell,因为它已经无处不在。每家公司的软件栈、安全栈都已经为它优化了。
来看一些性能数据。加速是一回事。要加速 SQL 是极其困难的。SQL——有史以来最著名的领域特定语言。在 CUDA 之前、在 OpenGL 之前,就有 SQL。IBM 发明的。今天,它是全球的结构化数据库引擎。所有人都用 SQL。这是 SQL 运行快了三倍。不是快 10%,不是快 25%,是三倍。
下一个是实时流处理。记住,你的 AI 不仅要读文档,还要监控遥测数据——特别是在工厂里、在证券交易所里。你要持续监控数据流。涌入的数据爆发进入 CPU。这是 Vera CPU 为纽约证券交易所运行实时流处理——快了 6 倍。纽约证券交易所总裁 Lynn Martin 非常慷慨地与我们合作。这个系统在全世界实时运行。Vera CPU 六倍性能——全靠带宽、单线程指令执行、核间带宽和外部带宽。Vera 是彻底革命性的。
SQL 3x,流处理 6x
在 CPU 领域,实际工作负载 3-6 倍加速极为罕见——通常代际提升只有 10-20%。黄仁勋特意选了两个"最难加速"的场景:SQL 查询(全球最通用的数据库语言)和纽约证券交易所的实时流处理(对延迟极度敏感)。如果这些数字属实,Vera CPU 确实代表了 CPU 架构的代际跃升。
从 x86 切换的"极度危险"
Grace Blackwell 是 NVIDIA 首次将 GPU 系统的 CPU 从 Intel/AMD x86 切换为自研 ARM(Grace)。这意味着整个软件栈需要重新适配——任何兼容性问题都可能导致客户拒绝采用。黄仁勋坦承这"极其危险",但成功执行后,Grace 已成为 NVIDIA AI 系统的标配,为 Vera 的推广铺平了道路。
黄仁勋X 倍的提升通常是 GPU 才有的话题。在 CPU 的真实工作负载上谈论 X 倍提升,相当罕见。我为团队感到非常骄傲。你们做了这么出色的工作。我们有一个非凡的路线图即将到来。
但真正令人兴奋的是,几乎所有人都在支持 Vera。他们和我们一样兴奋。Vera 开辟了一个全新的市场。Agent 是一种新的工作负载。我们过去为人类造 CPU,现在需要为 Agent、为 Agent 系统造 CPU。它们的属性不同,为什么旧 CPU 还能一样呢?
我们正在建造数百万颗 Vera。与我们一起推向市场的有台湾的 ODM 和电脑制造商、所有 OEM,你们能看到那些早期采用者。早期采用者就是那些 Agent 公司。
这是一个全新市场的开端,一个从未存在过的市场。它不会挤占旧市场,这是一个新市场——为 Agent 设计的 CPU。这个市场肯定会比上一个更大。原因是 Agent 的数量将远超人类,而且 Agent 非常不耐烦。NVIDIA Vera CPU。谢谢。
CPU 的增量市场
黄仁勋强调 Vera 不是替代现有 CPU 市场,而是开辟新增量——"Agent CPU"。这个叙事如果成立,意味着 NVIDIA 不需要从 Intel/AMD 手中夺取份额,而是在一个全新的市场从零起步。对投资者而言,关键问题是:Agent CPU 的 TAM 多大?"肯定比上一个更大"是黄仁勋的预判。
黄仁勋这是最重要的一张幻灯片。要点是:这就是应用范式,这就是未来十年的计算范式。Agent 加编排框架,编排大语言模型。每家公司都会运行它。每家公司都将成为 Agent 公司。每家公司内部都会有 Agent 运行。每家公司都会看到 Agent 需要自己的操作系统。每家公司都在问我们:"我们怎么安全地运行 Agent?怎么为自己的工作负载构建 Agent?"
所以,我们推出了 NVIDIA 企业 AI Agent 工具包。你们一直在目睹我公开地构建这个。企业需要四样东西来构建 Agent 即服务或构建 Agent 来运营。
第一,你需要模型——当然,大语言模型越聪明越好、越便宜越好、越快越好。第二,你需要一个编排框架来编排一切。第三,模型想使用工具,这些工具附带技能。第四,你需要一个运行时——操作系统来整合一切。
它包含你可以修改的模型——NVIDIA 的世界级开放模型。你可以运行任何人的 Agent——Claude Code,了不起的 Agent;Codex,了不起的 Agent。你可以把它们运行在叫做 OpenShell 的编排框架里,它在企业内部高度安全。OpenShell 保护 Agent,确保它遵守安全策略。隐私受保护。权限被授予。身份受保护。NVIDIA OpenShell 是开源的。Red Hat、Canonical、微软都将采用它。
运行时完全针对 NVIDIA AI 平台优化——无处不在。你可以在任何云、本地或设备上运行 OpenShell。你有模型可以修改或直接使用;你有 Agent;OpenClaw、Hermes——另一个了不起的 Agent 编排框架——可以在本地或任何地方运行。这四样东西代表了现代企业的操作系统。
OpenShell
OpenShell 是 NVIDIA 开源的 Agent 安全编排框架——相当于 Agent 的"容器+安全沙箱"。它管理 Agent 的权限、隐私、身份和安全策略。Red Hat(RHEL)、Canonical(Ubuntu)、微软(Windows)的采用意味着它可能成为 Agent 安全的事实标准。
平台而非模型
黄仁勋点名 Claude Code 和 Codex 作为"了不起的 Agent",说明 NVIDIA 不打算自己做最好的模型,而是做最好的平台。Agent 工具包 = 模型 + 编排 + 工具 + 运行时,每个环节都有开源选项——这与苹果"围墙花园"形成鲜明对比,更像安卓生态的逻辑。
黄仁勋我最喜欢的 Agent 用例之一是芯片设计。这是 NVIDIA 做的最重要的事情。所以我们当然要和 Cadence 合作,打造一个超级 Agent——芯片设计超级 Agent。它由 Codex 或 Claude Code 编排,输入是 RTL 和架构图、原理图或规格说明以及需要修复的问题。
视频旁白Cadence 和 NVIDIA 正在合作构建芯片设计 Agent。数十万颗 NVIDIA 芯片汇聚成驱动全球前沿 AI 模型的 AI 工厂。设计这些芯片及其运行的系统是最困难的工程挑战之一——数万亿晶体管、三维电路、微观尺度。每个门、每根线同步到皮秒级别,必须完美协同,不容任何差错。物理原型太慢太贵,工程师在数字领域工作。
每颗芯片始于一组架构规格,然后转译为 RTL——芯片设计的语言。RTL 必须通过仿真验证。一个 bug 就能让芯片延迟数月。在 NVIDIA,数千名工程师、每年数十亿计算小时、数百万测试——编写、运行、调试。一个需要团队数周的周期。
为了压缩这个周期,Cadence 和 NVIDIA 构建了设计验证 Agent。Codex 编排流程,Cadence ChipStack 启动 RTL 验证循环——由 Nemotron 驱动、NVIDIA OpenShell 保护——调用 RTL 生成、测试台创建、回归测试和调试的专家子 Agent。系统自我驱动。ChipStack Agent 运行数百次 Cadence Xcelium 仿真和 Jasper 形式化验证。设计缺陷被揭露,代码 bug 被修复。过去需要数周的工作,现在只需数小时。验证周期加速超过 40 倍。
黄仁勋从数周到数小时。NVIDIA 有数千名芯片设计师。我们将雇用数十万个 Cadence 超级 Agent 与我们一起工作,这样我们可以加速公司、更加雄心勃勃、创造更多惊人的产品、跑得更快。
验证周期 40 倍加速
芯片验证是半导体设计中最耗时的环节,通常占整个项目周期的 60-70%。40 倍加速意味着过去 4 周的验证可以在 1 天内完成——这不仅节省成本,更关键的是缩短了芯片上市时间,让 NVIDIA 能更快推出下一代产品。
Cadence 的战略价值
NVIDIA 选择 Cadence(而非 Synopsys)作为首个芯片设计 Agent 合作伙伴,可能强化 Cadence 在 AI 驱动 EDA 工具领域的竞争优势。黄仁勋还强调这些工具"必须在 CUDA 上加速"——因为 Agent 不耐烦,工具响应必须即时。
黄仁勋好的基础模型是起点——Cadence 可以在此基础上调优、成为 Cadence 工作流和专业知识的专家,创造出拥有 Cadence 专有知识的超级 Agent。他们需要从一个卓越的模型开始。我们叫它 Nemotron。NVIDIA 致力于为世界构建开放模型,让你们所有人都能创建自己的 Agent。
今天我们发布 Nemotron 3 Ultra。我们的下一个开放模型,它非常聪明。Nemotron 模型不仅给你模型,还给你我们训练模型所用的所有数据。我们有一个了不起的合作伙伴联盟——大家互相贡献数据。Nemotron 在全球最大的长时推理模型、长时任务解决和工具使用数据集上训练。从模型到训练脚本到数据,全部完全开放。这就是开放模型的最佳状态。目标很简单:你可以拿走所有这些,添加你自己的数据,让它更好,让它成为你的。
Nemotron 3 Ultra 快了 5 倍。这是全球首个基于 SSM(状态空间模型)与混合专家模型(MoE)混合架构的模型。架构极其快速。我们让它思考更快——当你思考更快时,你可以在同样的成本下思考更久。五倍快。它的成本也低了 30%——总推理时间/总 FLOPS 的成本比世界上最具成本效益的开放模型还低 30%。
前沿级聪明。五倍更快。30% 更便宜。完全开放。我们完全致力于此。这是 Nemotron 3,我们目前正在开发 Nemotron 4。
这整套工具包——从模型、编排框架、工具和技能到运行时——让全世界每一家企业都有能力创建自己的 Agent,就像 Cadence 用他们的超级 Agent 做到的那样。我们正在与很多公司合作——Cadence、CrowdStrike、达索、Palantir、SAP、ServiceNow。人们总说"Agent 会颠覆这些市场"。我说完全相反——你们现在能看到了。Agent 将为我的合作伙伴和朋友们创造有史以来最大的机遇。
SSM + MoE 混合架构
Nemotron 3 Ultra 采用状态空间模型(SSM)+ 混合专家模型(MoE)的混合架构——这在开放模型中是首创。SSM 擅长长序列的高效处理(类似 Mamba),MoE 提供稀疏激活的参数效率。两者结合实现"又快又便宜又聪明"。
Agent 不颠覆,而是赋能
市场叙事常将 AI Agent 视为 SaaS 公司的威胁("Agent 替代应用")。黄仁勋的观点相反:SAP/ServiceNow/Palantir 等企业软件公司将通过 Agent 工具包创建自己的超级 Agent,反而获得更大市场。前提是它们拥有专有数据和工作流知识——这些是开放模型无法替代的。
黄仁勋好了,第一,Vera Rubin 全面投产。第二,Vera CPU——为新一代 Agent 设计的 CPU。第三,NVIDIA 企业 AI 工具包,让每一家企业和企业软件公司都能构建 Agent。
在座的很多人,你们很多朋友和合作伙伴,你们的公司就是从这里起步的。在很多方面,这里是现代计算机产业的起点——40 年了。NVIDIA 33 岁了。PC 产业在我们来的时候已经发展到了 Windows 1、Windows 2、Apple 1、Apple 2。当我们加入时,Windows 3.1 就是 PC。而 Windows 95 让 PC 变得"个人"——它把 PC 从企业带到了消费电子。每个人都该有一台,每个人都有了。
这个计算平台做了几件极其聪明的事:Windows 不仅是解耦的,它被恰当地抽象了。系统 BIOS、开放芯片组、带驱动程序的操作系统——驱动可以在运行时连接和安装——以及多媒体 API 的抽象层,把 PC 打开成了我们今天所知的样子。每一个元素都是使 PC 如此流行的关键。
40 年后,微软和 NVIDIA 将重新发明 PC。这将是新的 PC。明天晚上我会和 Satya(纳德拉)在一起,我们会更多地谈论我们一起做的工作。微软和 NVIDIA,过去三年一直在做这件事——花了这么长时间来彻底重新发明 PC 的工作方式。
我之前提到的那个计算范式——Agent——将在 AI 云中运行,在企业内部运行,也将在你的 PC 上运行。当 PC 上有了自主 Agent 会发生什么?一个帮助你的 Agent,理解你,你可以和它说话,它可以看着你,你可以让它重新整理文件、帮你做研究。
新的操作系统当然是旧的操作系统加上大语言模型。大语言模型在很多方面是 DirectX 的现代版。它有输入输出,理解提示词,理解计算机视觉,能生成视频、声音。它是 PC 的智能延伸。在此之上,应用程序将被 Agent 运行时取代。这就是现代应用和 Agent。
"LLM 是新的 DirectX"
DirectX 是微软 1995 年推出的多媒体 API 层,让游戏和多媒体应用能跨硬件运行——它催生了 GPU 产业(NVIDIA 就是受益者)。黄仁勋将 LLM 比作"现代 DirectX":一个新的抽象层,将"智能"标准化为 PC 的基础能力。如果这个类比成立,LLM 运行时将像 DirectX 一样成为 PC 的标配。
PC 市场的新周期
如果 PC 真的因 Agent 迎来"40 年首次重生",这意味着一个巨大的换机周期。当前全球 PC 年出货量约 2.5 亿台,如果 AI PC 的普及速度接近智能手机对功能机的替代,这将是 NVIDIA 进入消费端最大的市场机会。
视频旁白它始于一个火花。一个为 AI 时代重新构想 PC 的创意——四十年来的首次。在 Agent 的世界里,个人电脑将变成什么?Agent 原生运行,连接到本地或云端的模型。你的个人 AI,在安全沙箱中运行,持续运转,完成工作。芯片和操作系统必须进化。
介绍 RTX Spark。我们 33 年所学的一切,浓缩进一颗芯片。Blackwell RTX GPU 配备 6144 个 CUDA 核心、1 PFLOPS 的 AI 性能。与联发科合作打造的 20 核定制 Grace CPU,通过 NVLink 融合。128 GB 统一内存。台积电 3 纳米制程。700 亿晶体管。与微软紧密合作——一个为 Agent 而生的 Windows 平台。我们正在重新发明个人电脑。用于创作。用于游戏。用于 Agent。这是个人计算革命的黎明。它始于 NVIDIA RTX Spark。
黄仁勋就是它了。当然,我必须给大家展示最美的部分——视频游戏。也是最贴近我们内心的。这是《极限竞速》(Forza)。这是 007——新的 007 游戏,我很期待玩。我长得有点像他。
女士们先生们,NVIDIA RTX Spark 笔记本电脑。
好的,这是世界上有史以来最令人惊叹的芯片。这是我们与联发科合作打造的 N1X。这是一颗漂亮的芯片。坦率地说,这颗芯片需要 33 年才能造出来。原因是 100% 的 NVIDIA 软件栈在这里运行。你想做数字生物学?没问题。地震处理?没问题。天体物理学?没问题。所有与 CUDA 相关的——所有物理学、生物学、基因组学、AI,没问题。所有计算机图形学,没问题。NVIDIA 创建过的每一个应用和 Windows 运行过的每一个应用。微软和 NVIDIA 精心优化了一切,让这台电脑运行世界上创建过的所有东西——加上它现在还运行 Agent。一台不可思议的电脑。
RTX Spark / N1X 芯片
N1X 是 NVIDIA 与联发科合作的 ARM 架构 SoC:20 核 Grace CPU + 6144 CUDA 核心 Blackwell GPU,通过 NVLink 融合,128GB 统一内存,3nm 工艺,700 亿晶体管。"统一内存"意味着 CPU 和 GPU 共享内存池,特别适合运行本地大模型。对比:Apple M4 Ultra 有 192GB 统一内存但无 CUDA 生态。
700 亿晶体管 · 1 PFLOPS
700 亿晶体管和 1 PFLOPS(千万亿次浮点运算)放在一颗笔记本芯片上,意味着今天一台 RTX Spark 笔记本的 AI 算力超过 2018 年全球最快的超级计算机。这为在本地运行 70B 参数模型提供了可能。
黄仁勋我希望大家在看下一个视频时记住——想象这一切都将在你的 PC 上运行。那台电脑可以有一个本地的 Nemotron 3 Ultra 模型或 Nemotron 3 Super 模型,也可以有云端的 Claude Code 或 Codex 或其他模型,它将做出令人惊叹的事情。
视频旁白每座房子都始于一个想法。从想法到设计需要大量工具、专业知识和时间。现在,一个在 RTX Spark 上本地运行的 Agent 可以帮我用笔记本上的工具设计一座房子——在 OpenShell 沙箱中运行 Hermes 编排框架,连接云端的 Claude Sonnet。我选择场地,分享我的概念草图和灵感风格板,以及一个文字描述需求和设计意图的提示词。
我的 Agent 开始工作。使用笔记本上的工具,它打开 Rhino 开始建模场地——塑造地形、退缩线和建筑包络。然后提出针对成本、舒适度和质量优化的建筑形态。定义了形态后,Agent 生成室内布局——墙壁、流线、房间开始成形。我随时可以跳进来调整。门窗和结构构件被自动放置。Agent 检测到自己的错误并修复它们。
我批准后,Agent 将模型从 Rhino 导出到 Blender。材质和对象属性带着设计上下文完整转移。我微调材质。然后选择镜头。Blender 渲染房屋,Agent 使用 Flux 2 模型的生成式 AI 使其照片级真实。多个视角、多种光照条件。曾经复杂的工作流程,现在由我的 Agent 引导和简化——在 RTX Spark 上与我协作。设计,以想象力的速度。
本地 + 云端混合
这个演示展示了 Agent PC 的核心模式:Hermes 编排框架在本地运行,Claude Sonnet 在云端思考,Rhino/Blender 在本地执行。这不是纯本地也不是纯云端——而是混合模式。对用户而言,感知是无缝的;对 NVIDIA 而言,这意味着无论计算在哪里发生,都需要 NVIDIA 的芯片。
MCP 与工具调用
演示中 Agent 打开 Rhino、调用 Blender、使用 Flux 2 生成图像——这些都是通过工具调用协议实现的。MCP(Model Context Protocol)允许 Agent 发现和调用第三方软件的 API,类似于"Agent 的浏览器"。Adobe 也在为 RTX Spark 构建 MCP 服务器。
黄仁勋开发者们对此非常兴奋。这是一台不可思议的电脑。Adobe 重新设计了 Photoshop 和 Premiere 的核心架构,为 RTX Spark 发布。在已经很快的基础上再快两倍。而且它设计为 Agent 友好型——通过 MCP 服务器,它现在可以与你笔记本上的 Agent 交互。
这不仅仅是一款产品。RTX Spark 只是一个开始。事实上,微软和 NVIDIA 正在重新发明所有 PC。今天,我们宣布一条全新的产品线——三款革命性的 Windows 机器,覆盖台式机、笔记本和工作站。全部 100% Windows 兼容、100% CUDA、100% NVIDIA AI Tensor Core。这是 40 年来首次完全重新设计、重新发明的 PC 产品线。
这是 RTX Spark 笔记本。这是台式机——MSI 的。看看它多漂亮。这个 Agent 可以 24/7 运行,没有计量焦虑。你可以下载你的 Agent,把它养在这里。它一直在运行,连接你的整个家——笔记本、显示器、所有摄像头、烘干机、热水器、安防系统——全部连接到这里。这成为你的个人 AI Agent。
它会越来越越来越聪明。今天有 Nemotron 3 Ultra,明天有 Nemotron 4,然后 Nemotron 5、6,我们不断让它越来越聪明。它在家里帮你做事。你想订旅行?没问题。
如果你想要一个强大的系统——这是 DGX Station for Windows。兼容 Windows,运行 Windows 里的一切。它有 768 GB 内存。你可以运行万亿参数的模型。不可思议。20 PFLOPS。8 TB/s 内存带宽。它就放在你桌旁。如果你是大语言模型开发者、Agent 开发者,把它放在桌旁就有了所有需要的算力,部署时再推到云上。
DGX Station: 768GB / 20 PFLOPS
768GB 内存足以装下当前最大的开源模型(如 Llama 3.1 405B 的完整精度);20 PFLOPS 的算力超过一个中型 GPU 集群。"放在桌旁"的开发者工作站以前需要一个机房才能实现的能力,这对 AI 创业者和研究者意味着本地开发不再需要云租赁。
"没有计量焦虑"
"Meter-free"——无计量焦虑——直击云端 AI 用户的痛点:按 token 付费让人"不敢多想"。本地 Agent PC 24/7 运行没有额外成本,这改变了使用行为:用户会让 Agent 持续工作而非按需唤醒。对 NVIDIA 而言,这意味着卖出更多硬件(一次性收入)而非依赖云服务(持续分成)。
黄仁勋如果你看到这些并思考,就会发现正在发生一些深刻的事情。记得 15、20 年前,我们有一个概念叫"电话"。今天我们有一个概念叫"PC"。今天,当你想到你的手机,你用它做的唯一一件事反而不是打电话。你做所有其他事情。所以"电话"对你的意义与过去完全不同了。
我确信将来会发生同样的事——10 年后的 PC 和你今天理解的 PC 将完全不同。
这是我的推测。我完全可以想象,就像今天每个家庭都有家庭影院、大电视、割草机、洗碗机一样,有一天每个家里都会有一台 AI 超级计算机。它运行你所有的 Agent、所有的助手,它们一直在为你做各种事情。你必须在家里放一台,就像你有家庭影院、音响、游戏机一样,你也会有 AI Agent 计算机在家里运行。
随着时间推移,它会变得更像 R2-D2 之于你,更像 C-3PO 之于你,而不是像一台 PC。
毫无疑问,这次计算机的重新发明和手机变成智能手机一样意义重大。这是那段旅程的开始。这是一条新产品线的开端。我们有路线图——每一代架构都会有台式机、笔记本、工作站。我感到无比荣幸的是——全球 100% 的 PC 产业都加入了我们来重新发明 PC。一条新产品线,一个新开端。谢谢。
手机类比
黄仁勋用"电话 → 智能手机"的转型来类比"PC → AI Agent 电脑"。类比的精妙之处在于:智能手机做的事与打电话毫无关系——同理,未来的"PC"可能与今天的"启动应用-点击-打字"毫无关系。如果这个类比成立,整个 PC 产业将经历类似手机产业 2007-2017 年的重构。
家庭 AI 超级计算机
"每家都有 AI 超级计算机"听起来激进,但想想 2005 年说"每个人口袋里有一台超级计算机"同样不可思议。黄仁勋的愿景是 Agent 需要始终在线运行——这与云端的按需模式根本不同,需要本地永续算力。
黄仁勋如你所知,Agent AI 就是一个数字机器人。它理解、推理、规划、行动并使用工具。Agent AI 将在所有这些计算机上运行。我们在做人形机器人计算机、各种机器人计算机、自动驾驶汽车计算机、卫星。GeForce 有张量核心,我刚谈了一整条新 PC 产品线。农业设备、制造设备、重工业设备都将具备 Agent 能力。你甚至会有一个小小的 Agent 助手。未来的基站、无线电台也将是 Agent 化的——理解流量、协调其他基站以使用最少的能源、提高频谱效率。
一切都将运行 Agent。今天 NVIDIA 主要在中心位置。但我相当确定,随着时间推移,将有数百亿、上千亿的 Agent 系统、Agent 计算机在全球运行。
最大的问题是数据。语言模型方面,我们训练用的互联网上所有英语和所有语言,都是从我们的视角出发的——我们写的,我们读的。但要为机器人创建数据,必须从机器人的感知、视角出发。而全世界大多数视频数据是第三人称的,不是第一人称的。所以,Agent 系统、机器人系统、物理 AI——数据是最难的问题。
你们看到我们沿着这个阶梯一步步走上来。我们从遥操作开始——基本上是人类示范,这与强化学习人类反馈的突破没有什么不同。然后我们使用模拟——Omniverse 就在这里——这与强化学习可验证奖励没有什么不同。我们用这些系统来引导物理 AI 模型。最终,我们能够从第三人称视频学习,将其重新投影为第一人称。通过引导,我们获得了一个世界基础模型,它能从任何视角理解物理世界——第三人称、第一人称、由外向内、由内向外,都没关系。这是一个巨大的突破。
物理 AI 的数据难题
语言模型用互联网文本训练;但机器人需要"第一人称"视角数据——它看到什么、做了什么、结果如何。互联网上大部分视频是"第三人称"(旁观者拍摄),无法直接用于机器人训练。解决路径:遥操作采集 + Omniverse 仿真 + 第三人称到第一人称的视角转换 = 世界基础模型。
数百亿 Agent 设备
黄仁勋预判"数百亿到上千亿 Agent 系统"——这远超当前约 40 亿台 PC 和 80 亿部手机的保有量。如果卫星、基站、农机、工业设备都成为 Agent 计算设备,NVIDIA 的 TAM 将扩大一个数量级。当然,这些边缘设备不需要高端 GPU,更可能用 Jetson 系列。
黄仁勋今天我们发布 Cosmos 3。Cosmos 3 是物理 AI 的前沿。我们在语言模型的前沿——很多人在做。但在物理 AI 方面,我们绝对是全球最强的。我为团队完成的工作感到非常骄傲。这是你们所有工作的基础模型。
当你想创造一个机器人、工厂机器人或任何涉及物理世界的机器人,你现在有了一个伙伴——Cosmos 3。它可以理解和推理,可以生成,可以在环路中模拟,甚至可以作为策略本身。它在全球各大排行榜上名列前茅。
视频旁白现实世界是无限的、不可预测的。物理 AI 需要数据,但真实世界数据无法规模化。对于物理 AI,算力就是数据。这是 Cosmos,物理 AI 的开放前沿全能模型,基于全新的混合 Transformer 架构。像素、动作、声音和语言流入自回归 Transformer——它推理、规划并指导扩散 Transformer——后者生成下一步。
开发者在不同机身和用例上对 Cosmos 进行后训练。作为 VLM,Cosmos 观察物理世界,理解正在发生什么。作为世界模型,Cosmos 从图像、文本或视频生成物理精确的合成视频。作为模拟器,Cosmos 为策略训练和评估闭合回路。作为 NVIDIA Omniverse 的基础——动作条件化的世界模型——Cosmos 逐帧预测未来。后训练后的 Cosmos 成为世界动作模型——感知、推理、规划、生成动作——适用于各种机器人、一切运动的事物。
黄仁勋一种新的数据,一种新的老师,由算力生成。这就是"数据 + 算力 = AI";现在有了 AI,算力就是数据。Cosmos 是一个了不起的开放模型系统——和 Nemotron 一样,我们开放模型、开放数据,甚至开放我们如何训练它,让你们可以为自己增强它。
Cosmos 3 架构
Cosmos 3 采用混合 Transformer:自回归 Transformer(理解、推理、规划)+ 扩散 Transformer(生成下一帧)。它同时处理像素、动作、声音和语言四种模态——这是"全能模型"(omnimodel)的含义。四种能力:VLM(视觉理解)、世界模型(合成视频)、模拟器(策略评估)、世界动作模型(直接控制机器人)。
"算力就是数据"
传统认知:数据是 AI 的燃料,算力是 AI 的引擎。黄仁勋翻转了这个关系:有了足够强的 AI 模型,算力可以"生成"训练数据——用 Cosmos 合成物理世界的模拟数据来训练机器人。这意味着"数据壁垒"可能被"算力壁垒"取代——而算力壁垒恰好是 NVIDIA 的优势。
黄仁勋模型本身是 AI 栈中最容易理解的部分,但 AI 栈非常复杂——有数据生成器、模型、模拟器和运行时。就像 Agent 系统一样,自动驾驶汽车本质上也是物理 AI Agent 机器人——一辆自动驾驶汽车也有这样复杂的栈。
今天我们发布 Alpamayo 2——自动驾驶汽车的开放模型。我们与全球汽车制造商合作。看看这些签约使用 NVIDIA Hyperion 的品牌——这代表了全球约 80% 的汽车。我们还连接到出行服务——全球约 97% 的出行服务正在与我们对接。当我们在 Hyperion 运行时上部署 Alpamayo、配合 Halos 操作系统,就能连接全球所有这些服务。
演示视频"嘿,梅赛德斯,去我最爱的三明治店。"——"正在为您导航。"——"车道畅通,出发。因前方有静止前车阻挡车道,向左微调。减速在停车标志处停车。让行行人,因行人在我们车道内。让行左方切入车辆。向左微调避开右侧停车。保持与前车距离。在停车标志处停车。让行横穿交通。保持与前车距离。向左微调避开右侧卡车。向右微调避开左侧卡车……您的目的地在右侧。"
黄仁勋如果让它一直说话,会把你逼疯。但我们很高兴它一直在自言自语——那叫思考。Alpamayo 是全球首个推理型自动驾驶汽车。
推理型自动驾驶
传统自动驾驶是"感知 → 规划 → 控制"的管线式架构。推理型自动驾驶(Alpamayo)让车辆在行驶中持续"思考"并输出自然语言推理链——为什么要变道、为什么要让行。这不仅提高了决策质量,更提供了可解释性——对监管合规和乘客信任至关重要。
80% 汽车 + 97% 出行服务
全球 80% 汽车制造商签约 NVIDIA Hyperion + 97% 出行服务对接——这两个数字意味着 NVIDIA 在自动驾驶基础设施层的覆盖率接近垄断。但注意:"签约"不等于"量产部署"——从签约到每辆车上路用 NVIDIA 芯片还有很长的路。
黄仁勋我们为自动驾驶汽车创造的技术同样适用于人形机器人。当然还有很多新突破需要实现。NVIDIA Isaac GR00T 是我们的人形机器人栈——模型、数据生成、模拟、运行时,包括操作系统。每一个系统——无论是云端 Agent、PC Agent、自动驾驶汽车还是机器人——都是完全相同的模式。在每一个场景中,我们都完整地构建一切,垂直集成,极致协同设计,然后开放给所有人使用你们喜欢的部分。
但缺失的一件事是:我们需要一个机器人系统的参考平台。这些机器人系统太复杂了——这么多电机、这么多传感器、这么脆弱。我们需要一种方式来交付参考平台,就像我们对 PC、DGX 和云所做的那样。今天我们发布 NVIDIA Isaac GR00T 参考人形机器人——完全垂直集成。
每只手 25 个自由度,由 Sharpa 制造。机器人总共 31 个自由度。6 英尺高,150 磅重。就像我一样。第一个数字矮一点,第二个数字大一点。否则差不多。这个平台运行新的 Thor 计算机和我们整个软件栈——数据生成栈、模拟栈、运行时——全部集成在一个为所有人设计的机器人中。
视频旁白AI 的下一个飞跃是通用机器人——人形机器人。但构建一个很难。每个团队都从头开始,拼凑模拟器、遥操作系统、数据管线和训练基础设施。研究开始前需要数月搭建。NVIDIA Isaac GR00T,人形机器人的开放开发平台。开放模型、模拟和训练库、数据生成器,加上机器人计算机。完全就绪,数小时内可启动。
在 Isaac Lab 中搭建模拟环境。用 Isaac Teleop 在真实或模拟机器人上捕获示范。用 Omniverse 和 Cosmos 生成合成数据——把一次示范扩展为数千次。在 Isaac Lab Arena 中训练和评估策略。通过 Isaac ROS 部署,运行在 Jetson Thor 上。每个元素都是模块化、开放的。用我们的,或换成你自己的。
机器人时代从这里开始。NVIDIA Isaac GR00T。
Isaac GR00T 参考机器人
这是 NVIDIA 首次推出完整的人形机器人硬件参考设计——不仅仅是软件栈,而是包含机械结构、传感器、计算机和软件的完整机器人。31 自由度、每手 25 自由度的灵巧手——这是当前人形机器人中最高规格之一。定位类似 PC 产业的"参考设计":提供标准方案,合作伙伴在此基础上定制。
为高校和研究者而建
黄仁勋明确说这个参考机器人"为高等教育和大学研究者"设计——因为从零搭建一个人形机器人对学术团队来说"疯狂地困难"。这是 NVIDIA 在机器人领域复制其"DGX 策略":先让研究社区用上标准硬件,培养生态,再向商业客户扩展。
黄仁勋让我来总结我告诉大家的内容。计算机产业已经被彻底改变了。在过去六个月里,一切都变了。一切都变了,因为 Agent 实现了,与最前沿的模型融合,使 AI 终于能做有用的工作。
这个计算范式将一遍又一遍地重复。Agent 的计算范式——模型、使用工具和技能的编排框架、运行在运行时中——这个运行时取决于它是在云端、本地、PC 上还是机器人上。但计算范式对所有这些完全相同。你会使用不同的编排框架,因为你的偏好。你会使用不同的模型,因为你的偏好。你会为你的专有用途改进它们。你会创造超级 Agent,可以租给其他人帮助他们工作。
这个 Agent 平台——NVIDIA 有企业 AI 工具包。这是你们所有人参与 AI 的绝佳方式,对我们来说也是绝佳的增长机遇。
Vera Rubin 全面投产。Grace Blackwell 为处理 AI 特别是推理而生。Vera Rubin 为运行 Agent 而生。它全面投产了。它远不止一颗 GPU——它是整个解耦的、分布式的 Agent 处理系统。NVIDIA 真的已经成为一家基础设施公司。不仅仅是 GPU 公司,不仅仅是系统公司,而是基础设施公司——帮助你获得最大营收、最大利润,并尽快到达那里。
Agent 世界——这种新的计算方式——你现在为 Agent 而非人类建造 CPU。为 Agent 设计的 CPU 有自己特殊的要求。我们的 NVIDIA Vera 是革命性的。我对它的发展非常高兴。订单已经让它成为我们公司历史上最快、最成功的产品发布。
NVIDIA 和微软创造了一条全新的 PC 产品线。这是一个新的开始。同样的 Agent 处理模式还将运行在各种设备上——PC、机器人、卫星、基站、工厂,在云端、本地、边缘。这个模式——Agent AI 系统,Agent 计算范式——将在全世界的计算机中复制。我们对个人电脑的认知很可能会彻底改变。
我要感谢你们所有人的合作和友谊。没有我们共同做的一切,就没有今天。我为你们过去一年如此成功感到骄傲。明年会更好。我还有最后一样东西给大家。
"最快最成功的产品发布"
黄仁勋说 Vera CPU 的订单已使其成为"公司历史上最快最成功的产品发布"——这是一个极其强烈的需求信号。考虑到 Grace Blackwell 本身已经供不应求,Vera 的订单量可能意味着 NVIDIA 的 CPU 业务将从零增长为年营收数百亿美元的产品线。
统一范式的战略意义
黄仁勋反复强调"同一个计算范式在所有设备上重复"——这是 NVIDIA 最深层的战略叙事。如果 Agent 计算范式真的是统一的(云/PC/车/机器人都是模型+编排+工具+运行时),那么 NVIDIA 只需要做好一套技术栈,就能覆盖所有市场。这是"一次投入,多次变现"的平台经济学。
歌曲表演(多位表演者以说唱形式总结全场要点)
"COMPUTEX 的主题演讲来了。Jensen 向世界展示了下一步。有用的 AI 已经到来,Agent 在你身边工作。"
"Agent 曾经被误解,只有好莱坞明星才有经纪人。现在我们都有了团队来实现梦想,从客厅开始建公司。但它们需要这么多算力——我们听到了。"
"这就是为什么我们创造了 Vera。Rubin 定律就是事实——最便宜的 token 来了。推理速度快十倍——比 007 还多特工。BlueField 保管 Agent 的记忆。"
"现在来聊聊 CPU。快 50%?太离谱了。不是对 Vera 来说——它就是为 Agent 而生。NVLink 融合聪明地整合了一切。"
"Vera Rubin 全面投产。Nemotron Ultra 快五倍。OpenShell 守护栏杆。你的代码迁移、审查完毕——这首歌还没唱完就搞定了。"
"AI 是五层蛋糕——营收,别搞错了。全球 AI 云配着大把吉瓦。每瓦都为你优化,蛋糕你也能吃到。RTX 标志着这一年——40 年来最大的 PC 时刻。Agent 驱动工作流,Windows 去哪它就去哪。编排框架跑在 CPU,模型飞在 GPU。Cosmos 建造机器人需要的世界。Alpamayo 推理驾驶。GR00T 学会移动。"
"未来是光明的,来看看下一步。"
黄仁勋谢谢台湾。欢迎来到 COMPUTEX。大家谢谢(Dàjiā xièxie)。COMPUTEX 精彩继续。感谢大家一年的精彩。感谢你们的友谊和支持。谢谢。保重。COMPUTEX 精彩继续。
说唱总结环节
GTC Taipei 以定制说唱表演收场已成传统——由多位表演者用韵文总结全场发布要点。这一非正式环节的歌词准确概括了演讲核心:Vera Rubin 量产、Vera CPU、Nemotron Ultra、RTX Spark、Cosmos、Alpamayo、GR00T。"五层蛋糕"指黄仁勋经典的 AI 产业五层架构(能源→芯片→基础设施→模型→应用)。
五个核心要点
- "有用的 AI 已至,每个 token 都是利润单元"——黄仁勋将 token 从技术概念提升为经济概念,建立"算力 = 营收 = 利润"的投资逻辑链。GitHub commit 近三倍增长是核心论据。推论:只要 token 需求持续增长且有利可图,AI 基础设施投资就有刚性需求支撑。
- Vera Rubin 全面量产——不是一颗芯片,是完整系统——GPU + CPU + 存储 + 安全 + 网络五大子系统构成多机架 pod 级超级计算机。供应链是 Grace Blackwell 的两倍,组装时间从 2 小时压缩到 5 分钟。NVIDIA 从"GPU 公司"到"系统公司"再到"AI 基础设施公司"的转型正式完成。
- Vera CPU 开辟全新市场——为 Agent 而非人类设计——88 核 Olympus 单片设计、10-wide 译码、3.6 TB/s 核间带宽、LPDDR5X 1.2 TB/s。SQL 快 3 倍,纽约证券交易所流处理快 6 倍。关键论点:Agent 活在纳秒世界,传统 CPU 是瓶颈,这是一个从未存在过的新增量市场。
- PC 40 年来首次重生——RTX Spark + 微软全线合作——N1X 芯片(700 亿晶体管、128GB 统一内存、1 PFLOPS),100% Windows + CUDA 兼容。从笔记本到台式机到 DGX Station(768GB/20 PFLOPS)。黄仁勋预判 PC 将经历类似"功能机→智能手机"的范式转变,最终每家都有一台"AI 超级计算机"。
- 统一的 Agent 计算范式——一套技术栈覆盖所有场景——"模型 + 编排框架 + 工具 + 运行时"在云端、企业、PC、汽车和机器人上复用。Nemotron 3 Ultra(SSM+MoE 混合,5x 快/30% 便宜)、Cosmos 3(物理 AI 基础模型)、Alpamayo(推理型自动驾驶)、Isaac GR00T(参考人形机器人)——每个子系统都遵循同一模式。NVIDIA 的终极叙事:我们不卖芯片,我们卖"让每个 token 最盈利"的整套基础设施。