两场平台变革同时发生:黄仁勋用六颗新芯片重定义 AI 工厂
这是黄仁勋 2026 年的开年演讲,也是 NVIDIA 近年来信息密度最高的 CES 主题演讲之一。在近 90 分钟里,他完成了一次完整的 AI 产业全景扫描:从两场同时发生的平台变革(AI + 加速计算)出发,经过开源模型爆发(DeepSeek R1、Nemotron)、agentic AI 拐点、物理 AI 三台计算机架构,到重磅发布——全球首个"会思考"的自动驾驶 AI Alpamayo(开源+端到端,与梅赛德斯合作 Q1 上路),最终以Vera Rubin 全平台六颗全新芯片的正式量产收场。
产品发布之外,战略信号更值得关注:NVIDIA 正从芯片公司转向全栈 AI 基础设施平台——自建 DGX 超算训练开源模型、将 AI 注入 Cadence/Synopsys/Siemens 的工业仿真、用 Cosmos 世界模型批量生产合成训练数据。黄仁勋反复强调的核心等式是:10 万亿美元的旧计算正在被 AI 计算取代,每一层都要重建——这就是 NVIDIA 如此繁忙的原因。
技术上,Vera Rubin 的极致协同设计是演讲高潮:六颗芯片全部重新设计、NVFP4 自适应精度张量核心、45 度热水冷却、机密计算加密、功率平滑——在摩尔定律放缓到每年仅增 1.6 倍晶体管的约束下,仍实现了训练 3.5 倍、推理 5 倍于 Blackwell 的性能。此外,BlueField-4 KV 缓存上下文存储是全新品类,每颗 GPU 额外获得 16TB 上下文记忆。
主持人准备好了吗?开始。
黄仁勋你好,拉斯维加斯。新年快乐。欢迎来到 CES。我们大概有 15 场主题演讲那么多的内容要塞进今天这一场里。很高兴见到你们所有人。这个礼堂里坐了 3,000 人。外面庭院里还有 2,000 人在看我们。四楼——本来应该是 NVIDIA 展区的地方——又有 1,000 人在看这场演讲。当然,全球数百万人也将通过直播观看,以此拉开新年的序幕。
CES 2026
国际消费电子展(Consumer Electronics Show),每年 1 月在拉斯维加斯举办。NVIDIA 的 CES 主题演讲已成为全球科技界的年度开幕式,黄仁勋连续多年在此发布重磅产品。2026 年场地设在 Mandalay Bay,溢出观众达数千人。
黄仁勋每隔 10 到 15 年,计算机行业就会重置。一次新的平台变革就会发生。从大型机到 PC,PC 到互联网,互联网到云,云到移动。每一次,整个应用世界都瞄准一个新平台。这就是为什么叫平台变革。你为一台新计算机编写新的应用程序。但这一次,有两场平台变革同时发生。
当我们迈向 AI 时代,应用将构建在 AI 之上。起初人们以为 AI 就是应用,事实上 AI 确实是应用,但你还将在 AI 之上构建应用。除此之外,你运行软件的方式、开发软件的方式,都发生了根本性变化。计算机行业的整个软件栈正在被重新发明。你不再编程软件,而是训练软件。你不在 CPU 上运行它,而是在 GPU 上运行它。
以前的应用是预录制、预编译、在你的设备上运行的,现在应用理解上下文,每一个像素、每一个 token 都从零开始完全重新生成,每一次都是如此。计算已经因为加速计算、因为人工智能而被从根本上重塑。五层蛋糕的每一层都在被重新发明。
五层蛋糕架构
黄仁勋标志性的产业框架:第一层能源(电力/散热/电网)、第二层芯片系统(GPU/CPU/互联)、第三层基础设施(云/数据中心)、第四层模型(训练/推理)、第五层应用。每一层都在被 AI 重构——这是 NVIDIA 全栈战略的理论基础。
两场变革叠加
黄仁勋强调"同时发生"是有策略的:历史上每次平台变革(PC/互联网/移动)催生万亿市场,两场叠加意味着投资规模翻倍。第一场是 AI 成为应用平台(取代搜索/推荐),第二场是加速计算取代通用计算(GPU 取代 CPU)。投资者需要理解的是,这不是一波过去的热潮,而是结构性重建。
黄仁勋这意味着什么呢?这意味着过去十年大约 10 万亿美元的计算正在被现代化为这种新的计算方式。这意味着每年数千亿美元——大约两千亿美元的风险投资正在涌入,用以改造和发明这个新世界。这意味着一百万亿美元的产业,其中百分之几的研发预算正在转向人工智能。
人们问:"钱从哪里来?"钱就从那里来。从 AI 的现代化转型、从传统方法到人工智能方法的研发预算转移,以及大量涌入这个行业的投资——这就解释了我们为什么这么忙。去年也不例外。去年是不可思议的一年。去年……有一张幻灯片要出来。
这就是你不排练会发生的事情。这是今年的第一场主题演讲。我希望这也是你们今年的第一场主题演讲,否则你们就太忙了。这是我们今年的第一场主题演讲。我们得先把蜘蛛网清理掉。
10 万亿 vs 100 万亿
10 万亿美元指过去十年全球 IT 基础设施的存量投资(数据中心、服务器、软件许可等)。100 万亿美元指全球各行业年产值总和(约等于全球 GDP)。黄仁勋的计算:如果各行业将研发预算的几个百分点转向 AI,就是万亿级的年度支出——这为 NVIDIA 的增长叙事提供了"天花板极高"的论据。
三个资金来源
黄仁勋把 AI 投资的资金来源拆成三层:(1) 存量 IT 更新换代;(2) VC 新增投资(年 2000 亿美元级);(3) 传统行业研发预算转移。对投资者的启示:即使 VC 热潮退温,前两个来源(企业 IT 更新 + 研发预算转移)是结构性的、不可逆的。
黄仁勋2025 年是令人难以置信的一年。好像所有事情都在同时发生,事实上可能确实如此。首先当然是扩展定律。
2015 年,我认为第一个真正能产生影响的语言模型出现了,它叫 BERT,影响巨大。2017 年,Transformer 出现了。又过了五年,到 2022 年,ChatGPT 时刻到来,它唤醒了全世界对人工智能可能性的认知。一年之后,一件非常重要的事情发生了。ChatGPT 的第一个 O1 模型——第一个推理模型——完全是革命性的,它发明了一种叫做测试时扩展的东西,这其实是非常常识性的东西。
我们不仅通过预训练让模型学习,还通过强化学习进行后训练让它学会技能。现在我们还有测试时扩展,换个说法就是"思考"。你在实时思考。人工智能的每一个阶段都需要海量的计算,而计算定律持续扩展。大语言模型不断变得更好。
AI 三阶段计算需求
黄仁勋梳理了 AI 计算的三波浪潮:(1) 预训练——在海量数据上学习世界知识;(2) 后训练/强化学习——学会推理和使用工具的技能;(3) 测试时扩展(推理时思考)——每次推理都消耗更多计算来"深思熟虑"。三波叠加意味着总计算需求呈指数增长。
BERT 到 ChatGPT 七年
从 BERT(2018 实际发布)到 ChatGPT(2022),Transformer 架构经历了近五年的默默发展。黄仁勋回溯这段历史是为了说明:当前的 AI 投资周期不是突发泡沫,而是十年技术积累的必然爆发——这是他反驳"AI 过热"论调的常用论据。
黄仁勋与此同时,另一个突破发生了,这个突破发生在 2024 年。Agentic 系统开始浮现。到 2025 年,它开始无处不在地扩散。Agentic 模型拥有推理、查找信息、做研究、使用工具、规划未来、模拟结果的能力,突然之间开始解决非常非常重要的问题。我最喜欢的 agentic 模型之一叫做 Cursor,它彻底改变了我们在 NVIDIA 做软件编程的方式。Agentic 系统从此将真正起飞。
当然,还有其他类型的 AI。我们知道大语言模型不是唯一的信息类型。宇宙中任何有信息、有结构的地方,我们都可以教一个大语言模型——一种语言模型——去理解那些信息,理解它的表征,并将其转化为 AI。其中最大、最重要的一类是物理 AI——理解自然法则的 AI。
物理 AI 是关于 AI 与世界互动的,但世界本身也有信息,编码过的信息,那叫做 AI 物理。在物理 AI 的情况下,你有 AI 与物理世界交互;而 AI 物理,是 AI 理解物理定律。
Cursor 与 agentic AI
Cursor 是 2024 年爆火的 AI 编程工具,基于大模型实现代码自动补全和重构。黄仁勋在 CES 上点名 Cursor 表明:agentic AI 的第一个大规模商业验证发生在软件开发领域——NVIDIA 自己就是重度用户。这个信号说明 AI 不再是实验室技术,而是改变了全球最大科技公司的日常工作流。
物理 AI vs AI 物理
黄仁勋做了一个微妙但重要的区分:物理 AI(Physical AI)= AI 在物理世界中行动(自动驾驶、机器人);AI 物理(AI Physics)= AI 理解物理定律(天气预报、蛋白质折叠、流体仿真)。两者共享同一个基础设施——Omniverse 仿真 + Cosmos 世界模型——但应用场景完全不同。
黄仁勋最后,去年最重要的事情之一是开放模型的进步。当开源、开放创新、全世界每一家公司和每一个行业的创新同时被激活时,我们就知道 AI 将无处不在。去年,开放模型真正起飞了。
事实上,去年我们见证了 DeepSeek R1 的进步——第一个开源的推理系统。它让世界大吃一惊,它点燃了整场运动。真的非常令人兴奋的工作。我们对此非常高兴。现在我们在全世界有各种各样的开放模型系统,我们现在知道开放模型也已经达到了前沿水平。
虽然仍然稳定地落后前沿模型六个月,但每六个月就有新模型出现,而且这些模型越来越聪明。正因如此,你可以看到下载量爆炸式增长。下载量增长如此之快,因为初创公司想参与 AI 革命,大公司想参与,研究人员想参与,学生想参与。几乎每一个国家都想参与。智能——数字形式的智能——怎么可能落下任何人?
开放模型去年确实彻底改变了人工智能。整个行业将因此而重塑。
黄仁勋赞美 DeepSeek
NVIDIA CEO 在全球最大消费电子展上公开赞扬中国 AI 公司 DeepSeek——"我们对此非常高兴"。这看似反常,逻辑却很清晰:DeepSeek R1 证明了开源模型能达到前沿水平,而开源模型扩散 = 更多公司训练自己的模型 = 更多 GPU 需求。对 NVIDIA 而言,谁建模型不重要,用什么训练才重要。
开源终将超过闭源
黄仁勋预判开源模型的总 token 生成量将"遥遥领先"于闭源。这对投资者意味着:长期来看,AI 的价值更多在基础设施层(芯片/云)而非模型层——因为模型在被商品化,而训练和运行模型的算力需求在不断膨胀。
黄仁勋其实,我们前些年就有了这个想法。你可能听说过,几年前我们就开始建造和运营自己的 AI 超级计算机。我们叫它们 DGX Cloud。很多人问:"你们要进军云计算业务吗?"答案是不。我们建造这些 DGX 超级计算机是为了自己用。
结果是,我们有数十亿美元的超级计算机在运行,这样我们就可以开发自己的开放模型。我对我们正在做的工作非常满意。它开始在全世界和所有行业引起关注,因为我们正在许多不同领域做前沿 AI 模型研究。
我们在蛋白质方面做的工作——在数字生物学方面——La-Proteina 能够合成和生成蛋白质。OpenFold3 能理解蛋白质的结构。EVO 2,理解和生成多种蛋白质——也就是细胞表征的开端。Earth-2,理解物理定律的 AI,我们在 ForeCastNet 和 Corrdiff 上做的工作真正彻底改变了人们做天气预报的方式。
NVIDIA 为何自建超算
NVIDIA 投资数十亿美元自建 DGX Cloud 的战略意图:(1) 吃自己的狗粮——用最前沿的硬件训练自己的模型,积累实战经验反馈芯片设计;(2) 建立开源模型壁垒——开源模型吸引开发者生态,锁定 NVIDIA 平台;(3) 示范效应——向客户证明"我们自己就用 GPU 训练一切"。
NVIDIA 科研矩阵
这里列出的是 NVIDIA 自研模型的全景:La-Proteina/OpenFold3/EVO 2(生物蛋白质)、Earth-2/ForeCastNet/Corrdiff(气候预测)。它们都是开源的,表明 NVIDIA 不是在做产品,而是在定义 GPU 加速科学计算的标杆用例。
黄仁勋Nemotron。我们正在做突破性的工作。第一个混合 Transformer-SSM 模型,速度极快,因此可以思考很长时间或者很快地思考——不需要很长时间就能产生非常非常聪明的答案。Nemotron 3 是突破性的工作,你们可以期待我们在近期推出其他版本的 Nemotron 3。
Cosmos,一个前沿的开放世界基础模型,理解世界如何运作的模型。GROOT,一个人形机器人系统——关节运动、移动能力、行走能力。这些模型、这些技术正在被集成,在每一个案例中,都是面向世界开放的前沿人形与机器人模型。
今天我们还将谈一谈 Alpamayo,我们在自动驾驶汽车方面所做的工作。我们不仅开源了模型,还开源了我们用来训练这些模型的数据,因为只有这样,你才能真正信任这些模型是如何产生的。我们开源所有模型。我们帮助你从中创建衍生版本。我们有一整套库。我们叫它们 NeMo 库、PhysicsNeMo 库、Clara 库、BioNeMo 库。每一个库都是 AI 的全生命周期管理系统,让你能处理数据、生成数据、训练模型、创建模型、评估模型、为模型设置护栏,一直到部署模型。每一个库都极其复杂,全部开源。
混合 Transformer-SSM
Nemotron 3 结合了 Transformer(擅长长距离注意力)和 SSM(状态空间模型,如 Mamba)的优点。SSM 在推理时计算复杂度为线性(O(n)),远低于 Transformer 的二次方。这意味着同等算力下可以"思考"更长时间——对 agentic AI 的长推理链极为关键。
黄仁勋所以现在,在这个平台之上,NVIDIA 是一个前沿 AI 模型建造者,而且我们以一种非常特殊的方式来做。我们完全以开放的方式来做,这样我们就能让每一家公司、每一个行业、每一个国家都成为这场 AI 革命的一部分。我为我们在这方面所做的工作感到无比自豪。事实上,如果你注意图表的话,图表显示我们对这个行业的贡献无人能及,你将看到我们实际上会继续这样做,甚至加速。
这些模型也是世界一流的。所有系统都宕掉了。这在圣克拉拉从来不会发生。是因为拉斯维加斯吗?一定是外面有人中了头奖。所有系统都宕掉了。好的。我想我的系统还是宕着的,但没关系。我即兴发挥好了。
这些模型不仅是前沿级别的,不仅是开放的,还在排行榜上名列前茅。这是我们非常自豪的一个领域。它们在智能方面名列前茅。我们有重要的模型能够理解多模态文档——也就是 PDF。世界上最有价值的内容都被锁在 PDF 里,但需要人工智能才能找出里面有什么、解读里面的内容并帮你阅读。所以我们的 PDF 检索器、PDF 解析器是世界一流的。我们的语音识别模型,绝对是世界一流的。我们的检索模型——基本上就是搜索、语义搜索、AI 搜索,现代 AI 时代的数据库引擎——世界一流。我们持续登顶排行榜。这是我们非常自豪的一个领域,所有这一切都是为了你们构建 AI agent 的能力。这真的是一个突破性的开发领域。
PDF 是被低估的战场
黄仁勋特别强调 PDF 能力并非偶然。全球企业知识的绝大部分以 PDF 存在——财报、合同、研报、技术文档。能解析 PDF 的 AI 才能真正进入企业工作流。这也是 NVIDIA 的 Nemotron 模型切入企业市场的关键差异化:不是聊天更好,而是能"读"企业知识。
现场系统宕机
黄仁勋在台上遭遇幻灯片系统全面宕机,他淡定地说"我即兴发挥好了"。这段插曲在 CES 现场引发笑声,但也说明了大规模现场演示的技术复杂性——讽刺的是,他正在演讲的公司制造着全球最强大的计算系统。
黄仁勋起初,ChatGPT 出来的时候,人们说:"天哪,它产生了非常有趣的结果,但它幻觉严重。"它之所以产生幻觉,当然是因为它能记住过去的一切,但它无法记住未来和当下的一切,所以它需要通过研究来获得根基。它必须在回答问题之前做基本的研究。
推理的能力——判断"我需要做研究吗?需要使用工具吗?如何把一个问题分解成多个步骤?"——其中每个步骤都是 AI 模型知道怎么做的事情,合在一起就能将它组合成一系列步骤来执行它从未做过的、从未被训练去做的事情。这就是推理的奇妙能力。我们能遇到一个从未见过的情境,把它分解成我们知道如何处理的情境和知识或规则,因为我们过去经历过。所以 AI 模型现在能够推理的能力,是极其强大的。
Agent 的推理能力打开了所有这些不同应用的大门。我们不再需要在第一天就训练 AI 模型知道一切,正如我们不需要在第一天就知道一切一样,而是应该能够在每一种情境中推理如何解决那个问题。大语言模型现在已经实现了这个根本性的飞跃。使用强化学习、思维链、搜索、规划以及各种不同技术和强化学习,使我们拥有了这个基础能力,而且它现在也已经完全开源了。
推理 vs 记忆
黄仁勋做了一个精辟区分:早期 LLM 靠记忆(预训练数据)回答问题,所以对"未来"和"当下"无能为力;而推理模型靠分解+组合来处理从未见过的情况。这个区分解释了为什么 O1/R1 系列模型虽然更贵,但在企业场景(合同审核、财务分析)中远比聊天机器人有用。
不需要第一天就全知
"不再需要在第一天训练 AI 知道一切"——这否定了早期 AI 行业"更大数据 = 更好模型"的粗暴共识。推理能力使模型可以在小规模专业知识上做到大规模泛化,这对 AI 应用开发者的启示是:不必追求海量数据,而应专注于教会 AI 推理。
黄仁勋但真正了不起的是另一个突破,我第一次看到它是在 Aravind 的 Perplexity 那里。Perplexity,这家 AI 搜索公司,真正的创新型公司。当我第一次意识到他们在同时使用多个模型时,我觉得这完全是天才之举。当然我们会这样做。当然,一个 AI 也会在推理链的任何一个环节调用全世界所有伟大的 AI 来解决它想解决的问题。这就是为什么 AI 确实是多模态的——它理解语音、图像、文本、视频、3D 图形和蛋白质。它是多模态的。
它也是多模型的,意味着它们应该能使用最适合任务的任何模型。因此它在定义上就是多云的,因为这些 AI 模型分布在各种不同的地方,而且它也是混合云的,因为如果你是一家企业公司,或者你造了一个机器人,无论那个设备是什么,有时候它在边缘,有时候在一个无线基站,也许在企业内部,或者在一个医院——你需要数据就在你旁边实时可用。无论这些应用是什么,我们现在知道这就是未来 AI 应用的样子。
或者换一种说法——因为未来的应用是建立在 AI 之上的——这就是未来应用的基本框架。这个基本框架、这个 agentic AI 的基本结构——能做我说的这些事情、是多模型的——现在已经给各种 AI 初创公司装上了涡轮。因为所有的开放模型和我们提供的所有工具,你也可以定制你的 AI,教你的 AI 别人没有在教的技能。没有其他人在让他们的 AI 变得那样聪明或智能。你可以自己做。这就是我们用 Nemotron、NeMo 和所有开放模型做的事情的目的。你在前面放一个智能路由器,这个路由器本质上是一个管理者,根据你给它的提示词的意图,决定哪个模型最适合那个应用、最适合解决那个问题。
Perplexity 的多模型创新
Perplexity 由前 OpenAI 研究员 Aravind Srinivas 创立,最早实现了"一次搜索调用多个模型"的架构——用一个模型理解查询,另一个搜索网页,第三个综合答案。黄仁勋点名赞扬,因为这个架构天然需要更多 GPU:每个用户请求触发多个模型推理。
四"多"架构 = 4x 计算
多模态 + 多模型 + 多云 + 混合云——这"四多"架构的投资含义是:每个 AI 请求消耗的计算量是早期单模型时代的数倍到数十倍。更多模型被调用、更多数据在网络间流动、更多边缘设备需要推理芯片。这是 NVIDIA 增长叙事的核心乘数效应。
黄仁勋好了,当你想想这个架构,你有什么?当你想想这个架构,一方面你突然有了一个完全可定制的 AI——你可以教它做你自己公司的独门技能,那些属于领域机密的东西,你拥有深厚领域专长的地方,也许你有训练那个 AI 模型所需的所有数据。另一方面,你的 AI 在定义上永远处于前沿。你一方面始终处于前沿,另一方面始终是定制的,而且它应该直接就能跑。所以我们想做一个最简单的例子给你们看。这整个框架我们叫做 Blueprint,我们有集成到全球企业 SaaS 平台中的 Blueprint,我们对进展非常满意。但让我们给你们看一个任何人都能做的简短示例。
演示视频让我们来建一个个人助理。我希望它能帮我管理日历、邮件、待办清单,甚至看管我的家。我用 Brev 把我的 DGX Spark 变成个人云,这样无论我是用云端 GPU 还是 DGX Spark,都能用同一个界面。我用一个前沿模型的 API 来快速上手。我希望它帮我处理邮件,所以我为我的 agent 创建了一个邮件工具。我希望邮件保持私密,所以我会添加一个在 Spark 上本地运行的开放模型。现在,对于任何工作,我希望 agent 为正确的任务使用正确的模型,所以我会用一个基于意图的模型路由器。这样,涉及邮件的提示会留在我的 Spark 上,其他的都可以调用前沿模型。我希望我的助理与我的世界互动,所以我把它接到 Hugging Face 的 Reachy Mini 机器人上。我的 agent 通过工具调用控制 Reachy 的头、耳朵和摄像头。我想给 Reachy 一个声音,我很喜欢 ElevenLabs,所以我会接上他们的 API。
Reachy嗨,我是 Reachy,运行在 DGX Spark 上。
演示者嘿,Reachy,我今天的待办清单有什么?
Reachy你今天的待办:买食品杂货——鸡蛋、牛奶、黄油,还有给 Jensen 发新脚本。
演示者好的。给 Jensen 发那个更新。告诉他我们会在今天结束前给他。
Reachy收到。
演示者Reachy,这里也有一张草图。你能把它变成建筑渲染图吗?
Reachy当然可以。
演示者漂亮。现在做一段视频,带我参观一下房间。
Reachy给你。
演示者太棒了。用 Brev,我可以分享对我的 Spark 和 Reachy 的访问权限,所以我要分享给 Ana。
Ana嘿,Reachy,Potato(一只狗)在干什么?
Reachy它在沙发上。我记得你不喜欢这样。我会叫它下来。Potato,下沙发。
演示者有了开源的所有进步,看到你能构建什么真的令人难以置信。我很期待看到你们创造的东西。
DGX Spark
NVIDIA 桌面级 AI 超级计算机,搭载 Grace Blackwell 芯片,面向个人开发者和小团队。这是 NVIDIA 首次将数据中心级 AI 算力缩小到桌面设备——战略意图是让每个开发者/企业都拥有本地 AI 推理能力,将隐私敏感的工作负载留在本地。
隐私路由的商业逻辑
演示中"邮件留在本地、其他走云端"的意图路由架构,精确瞄准了企业采用 AI 的最大阻力——数据隐私。NVIDIA 的解法是:卖你一台本地设备 + 一个路由器,让你两全其美。这同时卖出了两份硬件(本地 Spark + 云端 GPU 时间)。
黄仁勋这不是很不可思议吗?令人惊叹的是,这些现在已经完全微不足道了。完全微不足道了,然而就在几年前,所有这些还是不可能的。绝对不可想象。
这个基本框架、这种使用语言模型构建应用的基本方式——使用预训练的、专有的、前沿的语言模型,与定制化的语言模型结合,放入一个 agentic 框架、一个推理框架中,让你能够访问工具和文件,甚至连接到其他 agent——这基本上就是现代 AI 应用或者说现代应用的架构,而我们创建这些应用的速度是极其快的。
注意,如果你给它以前从未见过的应用信息,或者结构不完全如你预想的那样,它仍然可以通过推理来理解数据、理解信息、尝试理解如何解决问题——这就是人工智能。好的。所以这个基本框架现在正在被集成,我刚才描述的一切,我们有幸与全球一些领先的企业平台公司合作。例如 Palantir,他们整个 AI 和数据处理平台今天正在被 NVIDIA 集成和加速。ServiceNow,全球领先的客户服务和员工服务平台。Snowflake,全球顶级的云数据平台,正在那里做令人难以置信的工作。CodeRabbit,我们在整个 NVIDIA 都在使用 CodeRabbit。CrowdStrike 正在创建 AI 来检测和识别 AI 威胁。
NetApp,他们的数据平台现在在上面有 NVIDIA 语义 AI 和 agentic 系统,用于客户服务。但重要的是,不仅这是你现在开发应用的方式,这将成为你的平台的用户界面。无论是 Palantir 还是 ServiceNow 还是 Snowflake 还有很多其他我们合作的公司,agentic 系统就是界面。它不再是你往格子里输入信息的 Excel。也许不再只是命令行。所有多模态信息现在都成为可能,而你与平台交互的方式更加——如果你愿意这么说的话——简单,就像你在与人交互。所以这就是企业 AI 被 agentic 系统彻底改变的景象。
Agentic = 新用户界面
"agentic 系统就是界面"——这是本场演讲中最重要的产品判断之一。它意味着企业软件的交互范式将从表单/仪表盘/SQL 查询转向自然语言对话。对投资者的启示:传统 SaaS 公司如果不集成 agentic AI,将面临界面级别的颠覆;NVIDIA 通过与 Palantir/ServiceNow/Snowflake 合作,卡住了这个转型的基础设施层。
NVIDIA 企业生态矩阵
黄仁勋列出的合作伙伴覆盖了企业 AI 的全场景:Palantir(政府/国防数据分析)、ServiceNow(IT 服务管理)、Snowflake(云数据仓库)、CodeRabbit(代码审查)、CrowdStrike(网络安全)、NetApp(存储)。每一家都在将 NVIDIA 加速计算集成到核心产品中。
黄仁勋下一个主题是物理 AI。这是你们已经看到我谈论了好几年的领域。事实上,我们已经为此工作了八年。问题是:你怎么把一个在计算机内部有智能的东西——通过屏幕和扬声器与你交互的东西——变成能与世界互动的东西?意思是它能理解世界如何运作的常识。
物体恒存性——如果我看向别处再看回来,那个物体还在那里。因果性——如果我推它,它会翻倒。它理解摩擦力和重力。它理解惯性——一辆沉重的卡车在路上行驶需要更多时间才能停下来,一个球会持续滚动。
这些概念对一个小孩子来说都是常识,但对 AI 来说,完全是未知的。所以我们必须创建一个系统,让 AI 学习物理世界的常识、学习它的定律,同时也要能从数据中学习——而数据是相当稀缺的——还要能评估那个 AI 是否在正常工作,也就是说它必须在一个环境中进行仿真。如果一个 AI 不能仿真物理世界对其行动的反馈,它怎么知道自己正在执行的动作是否与它应该做的一致?对其行动的反馈进行仿真非常重要。否则,没有办法评估它。每次都不一样。
八年投入的耐心
黄仁勋说"工作了八年"(即 2018 年前就开始),这早于绝大多数公司对物理 AI 的投入。八年前 NVIDIA 就在押注自动驾驶和机器人——那时候连深度学习能不能做图像分类还有争议。这解释了为什么 NVIDIA 在 Omniverse/Cosmos/GROOT 上有如此深的积累。
数据稀缺问题
物理 AI 面临的核心挑战不是算力,而是数据。你不能像训练语言模型那样从互联网刮取物理世界的数据——每个场景(下雨天的交叉路口、搬运易碎物品的机器人)都需要实际发生才能采集。这就是为什么合成数据(Cosmos)和仿真(Omniverse)成为 NVIDIA 物理 AI 战略的核心。
黄仁勋所以,这个基本系统需要三台计算机。第一台计算机,当然是我们知道的 NVIDIA 制造的训练 AI 模型的那台。第二台计算机,我们知道是用来推理模型的。推理模型本质上是一台机器人计算机,运行在汽车里、机器人里、工厂里,或者任何边缘位置。但还必须有第三台计算机,它是为仿真设计的,而仿真是 NVIDIA 几乎所有工作的核心。这是我们最得心应手的领域。仿真确实是我们在物理 AI 方面所做的几乎一切工作的基础。
所以我们有三台计算机和运行在这些计算机上的多个软件栈、多个库来使它们有用。Omniverse 是我们基于物理学的数字孪生仿真世界。Cosmos,正如我之前提到的,是我们的基础模型——不是语言的基础模型,而是世界的基础模型,而且它也与语言对齐。
你可以说"球怎么了?"它会告诉你球正在街上滚动。这是一个世界基础模型。然后当然还有机器人模型。我们有两个。一个叫做 GROOT。另一个叫做 Alpamayo,我马上要讲。
三台计算机 = 3x 硬件
物理 AI 需要三台计算机的框架是 NVIDIA 增长叙事的关键放大器:(1) 训练集群(数据中心 GPU)+ (2) 推理芯片(车载/机器人端 Orin/Thor)+ (3) 仿真集群(Omniverse 数字孪生)。每个物理 AI 客户需要购买三倍的 NVIDIA 硬件——这解释了为什么黄仁勋如此看好机器人和自动驾驶赛道。
Cosmos 世界基础模型
Cosmos 不是 LLM——它是视频/3D 场景的基础模型,在互联网级视频、真实驾驶数据和 3D 仿真上预训练。它能从一张图片生成合理的视频、从 3D 场景描述生成多相机环境、从驾驶遥测数据生成环绕视频。本质上是把计算变成数据——用 GPU 算力生产训练 AI 所需的合成数据。
黄仁勋现在,我们必须为物理 AI 做的最重要的事情之一是创建用来训练 AI 的数据。这些数据从哪里来?不像语言——因为我们创造了大量被认为是真实的文本供 AI 学习——我们怎么教 AI 物理学的真实性?有很多很多视频,但远远不够捕捉我们需要的多样性和交互类型。所以这就是天才们聚到一起、把计算变成了数据的地方。
现在,使用基于物理定律、以真实性为条件的合成数据生成,我们可以选择性地、巧妙地生成数据,然后用来训练 AI。比如,输入到 Cosmos AI 世界模型的是一个交通仿真器的输出。这个交通仿真器本身不够 AI 学习。我们可以把它输入 Cosmos 基础模型,生成基于物理、物理上合理的环绕视频,AI 就可以从中学习了。这类例子有很多。让我给你们看看 Cosmos 能做什么。
旁白物理 AI 的 ChatGPT 时刻近在咫尺,但挑战是明确的。物理世界是多样的、不可预测的。收集真实世界的训练数据缓慢而昂贵,而且永远不够。答案是合成数据。它始于 NVIDIA Cosmos——一个面向物理 AI 的开放前沿世界基础模型,在互联网级视频、真实驾驶和机器人数据以及 3D 仿真上预训练。Cosmos 学会了世界的统一表征,能够对齐语言、图像、3D 和动作。它执行物理 AI 技能,如生成、推理和轨迹预测。从单张图片,Cosmos 生成真实的视频。从 3D 场景描述,生成物理上连贯的运动。从驾驶遥测和传感器日志,生成环绕视频。从规划仿真器,生成多相机环境。或者从场景提示,让边缘案例栩栩如生。开发者可以在 Cosmos 中运行交互式闭环仿真。当采取行动时,世界会做出反应。Cosmos 进行推理。它分析边缘场景,将它们分解为熟悉的物理交互,并推理接下来可能发生什么。Cosmos 把计算变成数据,训练自动驾驶车辆应对长尾场景,教机器人如何适应每一种情况。
计算 = 数据
"把计算变成数据"是本场演讲最颠覆性的概念之一。传统思维是:先有数据,再用计算训练模型。但 Cosmos 颠倒了这个关系——用 GPU 算力直接"生产"训练数据。这意味着 NVIDIA 的 GPU 不仅是训练工具,还是数据工厂。越买越多的 GPU,就能生成越多越好的数据,就能训练越强的模型——一个自增强飞轮。
下载量百万级
黄仁勋后来提到 Cosmos 被下载了"数百万次"。作为一个开源世界模型,这个数字表明全球自动驾驶和机器人开发者正在快速采纳 NVIDIA 的合成数据方案——这些用户最终都需要 NVIDIA GPU 来运行 Cosmos 生成数据。
黄仁勋我知道。这太不可思议了。Cosmos 是全球领先的基础模型——世界基础模型。它被下载了数百万次,在全球各地使用,为物理 AI 的新时代做好准备。我们自己也在使用它。我们用它来创建我们的自动驾驶汽车。通过使用它进行场景生成和评估,我们可以有效地行驶数十亿、数万亿英里,但都是在计算机内部完成的,我们取得了巨大的进展。
今天,我们宣布 Alpamayo——全球首个具备思考和推理能力的自动驾驶 AI。Alpamayo 是端到端训练的,字面意思上从摄像头输入到执行器输出。摄像头输入,大量大量的里程由它自己驾驶、由人类演示驾驶完成,我们还有大量里程由 Cosmos 生成。此外,数十万个样本被非常非常仔细地标注,以便我们教汽车如何驾驶。
Alpamayo 做了一件真正特别的事。它不仅接受传感器输入并驱动方向盘、刹车和油门,它还会推理它即将采取的行动。它告诉你它要做什么行动,它得出那个行动的理由,然后当然还有轨迹。
所有这些都是直接耦合的,由人类训练数据和 Cosmos 生成数据的大量组合非常具体地训练出来的。结果真的令人难以置信。你的车不仅按你期望的方式驾驶——它驾驶得如此自然,因为它直接从人类演示者那里学习——而且在每一个场景中,当它遇到一个情境时,它都会告诉你它要做什么,并推理它即将要做的事。
端到端自动驾驶
Alpamayo 采用"感知到控制"的端到端架构——从原始摄像头图像直接输出方向盘/油门/刹车指令,中间没有传统的模块化分解(感知 → 规划 → 控制)。这是自动驾驶的范式转变,类似于 Tesla FSD 的 V12 方向,但 Alpamayo 额外增加了推理/解释能力——它不仅做决策,还能说出为什么。
开源 + 梅赛德斯 = 平台战略
Alpamayo 同时做了两件事:开源模型(让所有车企都能用)+ 与梅赛德斯独家合作量产。这是经典的平台战略——开源吸引生态,独家合作证明量产能力。对投资者的意义:NVIDIA 的自动驾驶业务不再是"卖芯片给车企",而是"卖完整的软硬件栈 + 运营服务",价值量级完全不同。
黄仁勋这之所以如此重要,是因为驾驶的长尾。我们不可能简单地收集每一种可能场景的数据,涵盖在每一个国家、每一种情况下可能发生的所有事件、所有人群。然而,每一个场景——如果被分解成一堆其他更小的场景——对你来说很可能是相当正常的、你能理解的。所以这些长尾场景会被分解成相当正常的情况,而汽车知道怎么处理。它只需要进行推理。好,我们来看看。你们即将看到的一切都是一次性完成的。全程不碰方向盘。
车载语音正在规划前往您目的地的路线。请系好安全带。……您已到达目的地。
黄仁勋我们八年前就开始研究自动驾驶汽车,原因是我们很早就推断出深度学习和人工智能将重新发明整个计算栈。如果我们想理解如何引导自己、如何引导行业走向这个新未来,我们必须学会构建整个栈。
长尾 = 推理的杀手场景
黄仁勋用"长尾分解"来解释为什么推理对自动驾驶至关重要:你不可能穷举所有可能的驾驶场景(一只松鼠在高速上、暴雨中的施工区...),但你可以把每个复杂场景分解成若干已知的简单场景,然后推理如何组合应对。这恰好是推理模型(O1/R1 系列)的核心能力——也解释了为什么自动驾驶需要测试时扩展(更多思考时间)。
现场演示约 3 分钟
视频从 52:19 到 55:10,展示了约 3 分钟的全自动驾驶。黄仁勋特别强调"一次性完成、全程不碰方向盘"——这在 CES 主题演讲上现场播放自动驾驶的实录片段,信心水平远超通常的产品 PPT。
黄仁勋正如我之前提到的,AI 是一个五层蛋糕。最底层是土地、电力和外壳。对于机器人来说,最底层就是汽车。上面一层是芯片——GPU、网络芯片、CPU,所有这些东西。再上面一层是基础设施。在物理 AI 的情况下,正如我提到的,那个基础设施就是 Omniverse 和 Cosmos。再上面是模型。我刚刚展示的模型叫做 Alpamayo,今天 Alpamayo 正式开源。
这项令人难以置信的工作,花了几千人的心血。我们的自动驾驶团队有几千人,让你们有个概念。我们的合作伙伴 Ola——我想 Ola 就在观众席某处。梅赛德斯五年前就同意与我们合作来实现这一切。我们想象着有一天,道路上的十亿辆汽车都将是自动驾驶的。你可以从某人那里编排和租赁一辆 robotaxi,或者你可以拥有一辆自己驾驶的车,或者你可以选择自己开,但每一辆车都将具备自动驾驶能力。每一辆车都将由 AI 驱动。所以在这个情况下,模型层是 Alpamayo,上面的应用是梅赛德斯-奔驰。
几千人的 AV 团队
NVIDIA 自动驾驶团队"几千人"——这个规模已经与 Waymo(约 2,500 人)或 Cruise 相当。NVIDIA 不是在做一个芯片产品线,而是在运营一个完整的自动驾驶公司,只不过它把模型开源、与车企合作部署。
十亿辆 = 万亿美元市场
全球约 14 亿辆在用乘用车。如果每辆车都需要"AI 驱动"——即使只是高级辅助驾驶——每辆车 500-2000 美元的 NVIDIA 芯片,这就是一个 7000 亿到 2.8 万亿美元的总可寻址市场。这是 NVIDIA 下一个"数据中心级别"的增长引擎。
黄仁勋这就是 NVIDIA 第一个完整栈的全栈努力。我们为此工作了这么长时间,我非常高兴 NVIDIA 的第一辆自动驾驶汽车将在 Q1 上路,然后 Q2 进入欧洲。美国是 Q1,欧洲是 Q2,我想亚洲是 Q3 和 Q4。而且强大的是,我们将不断用 Alpamayo 的下一个版本和之后的版本来更新它。我现在毫不怀疑,这将成为最大的机器人产业之一,我很高兴我们在这方面做了工作。它教会了我们大量关于如何帮助世界其他地方构建机器人系统的知识。
在这个特定情况下,是双 Orin,下一代将是双 Thor。这些处理器是为机器人系统设计的,专为最高级别的安全能力而设计。这辆车刚刚获得评级。刚刚投产。梅赛德斯-奔驰 CLA 刚刚被 NCAP 评为全球最安全的汽车。据我所知,它是唯一一个每一行代码、芯片、系统、每一行代码都经过安全认证的系统。整个模型系统基于……传感器是多样且冗余的,驾驶软件栈也是如此。
Alpamayo 栈是端到端训练的,拥有令人难以置信的技能。然而,在你永远驾驶它之前,没有人知道它会不会完美安全。所以我们设置护栏的方式是用另一个软件栈——一整个 AV 栈在下面。那整个 AV 栈被构建为完全可追溯的。我们花了大约五年,实际上是六七年,来构建那个第二个栈。
这两个软件栈互相镜像。然后我们有一个策略和安全评估器来决定:这是一个我非常有信心、能推理出安全驾驶方案的情况吗?如果是,我就让 Alpamayo 来驾驶。如果这是一个我不太有信心的情况,安全策略评估器决定要回退到更简单、更安全的护栏系统,那就回到经典 AV 栈。我们是世界上唯一同时运行两个 AV 栈的汽车,所有安全系统都应该有多样性和冗余性。
端到端 + 传统栈并行
业界通常认为端到端 AI 驾驶和传统模块化 AV 栈是互斥的两条路线。NVIDIA 的做法反常识地把两者并行运行——端到端 Alpamayo 负责高性能驾驶,传统 AV 栈作为安全网。这类似于航空工业的"fly-by-wire + 机械备份"思路,是取得安全认证的关键设计选择。
Orin → Thor 芯片路线
Orin(2022 年量产,254 TOPS)是 NVIDIA 当前的车载 AI 芯片,装在梅赛德斯 CLA 上。Thor(下一代,2000 TOPS)将提供 8 倍算力提升。双芯片配置是为了安全冗余——一颗出故障,另一颗接管。
黄仁勋我们的愿景是,终有一天,每一辆汽车、每一辆卡车都将是自动驾驶的,我们一直朝着那个未来努力。这整个栈当然是垂直集成的,在梅赛德斯的案例中。我们一起构建了整个栈。我们将部署这辆车。我们将运营这个栈。我们将终身维护这个栈。
然而,像我们作为一家公司做的其他所有事情一样,我们构建了整个栈,但整个栈对生态系统是开放的。与我们合作构建 L4 和 robotaxi 的生态系统正在扩大,遍布全球。我完全预期这将成为……这对我们来说已经是一个巨大的业务了。这是一个巨大的业务,因为他们用它来做训练数据处理和训练模型。他们用它来生成合成数据。在一些公司的案例中,他们基本上就是造车载芯片的。有些公司与我们全栈合作,有些公司只用部分。所以不管你决定用多少。我唯一的要求是——尽可能在任何地方用一点 NVIDIA——但整个系统是开放的。
现在,这将成为第一个大规模主流的 AI、物理 AI 市场。我认为我们都同意,它已经完全到来了。从非自动驾驶到自动驾驶的这个拐点大概就在此时发生。在未来十年,我相当确信,全世界非常非常大比例的汽车将是自动或高度自动的。但我刚才描述的这个基本技术——使用三台计算机、使用合成数据生成和仿真——适用于每一种形式的机器人系统。它可以是一个只有关节的机器人、一个操纵器。也许是一个移动机器人,也许是一个完整的人形机器人。
所以,下一段旅程,机器人系统的下一个时代将是机器人,这些机器人将有各种不同的尺寸。我请了一些朋友来。他们来了吗?嘿,伙计们。快点。我还有很多东西要讲。快来。你告诉 R2-D2 你要来这里了吗?还有 C-3PO?好的。过来。它们里面有小的 Jetson 计算机。它们在 Omniverse 里面受训。这样吧,让我们给大家看看你们在里面学习当机器人的仿真器。你们想看吗?好的,我们来看看。请播放。
是不是很神奇?你们就是这样学会当机器人的。全部在 Omniverse 里面完成。机器人仿真器叫做 Isaac——Isaac Sim 和 Isaac Lab。任何想建造机器人的人……没有人会像你们这样可爱,但现在我们有了所有这些朋友在建造机器人。我们在建造大的。就像我说的,没有人像你们这样可爱,但我们有 Nurabot、AGIBOT 在那里、LG 在这里——他们刚刚宣布了一款新机器人。Caterpillar,他们有史上最大的机器人。那个把食物送到你家。那个连接到 Uber Eats。还有 Surf Robot。我喜欢那些家伙。Agility、Boston Dynamics,令人难以置信。你们有手术机器人。你们有 Franka 的操作机器人。你们有 Universal Robotics 的机器人。数量令人难以置信的不同类型的机器人。
"用一点 NVIDIA"
黄仁勋半开玩笑半认真的这句话揭示了 NVIDIA 的平台锁定策略:不要求全栈采用,但只要你用了任何一个组件(芯片/仿真/模型/数据生成),你就进入了 NVIDIA 生态。每个组件都与其他组件紧密集成,用得越多越好用——这是经典的"楔入"策略。
机器人生态全景
台上展示的机器人代表了 NVIDIA 机器人平台的客户谱系:AGIBOT(中国人形机器人)、Agility(仓库物流机器人 Digit)、Boston Dynamics(Atlas/Spot)、Caterpillar(矿山/建筑巨型机器人)、Universal Robotics(协作机械臂)、Franka(精密操作)。覆盖从手术室到矿场的全场景。
黄仁勋所以这是下一个篇章。我们将来会更多谈论机器人,但最终不只是关于机器人。最重要的产业之一——将被物理 AI 和 AI 物理彻底改变的产业——就是最初让我们所有人成为可能的产业。在 NVIDIA,没有我即将要讲的这些公司,NVIDIA 就不可能存在。我很高兴它们所有人——从 Cadence 开始——都将全面加速。CUDA-X 集成到 Cadence 所有的仿真和求解器中。他们将使用 NVIDIA 物理 AI 进行不同的物理工厂和工厂仿真。AI 物理正在被集成到这些系统中。
所以无论是 EDA 还是 SDA,未来还有机器人系统,我们基本上会把让你们这些机器人成为可能的同一技术,彻底改变这些设计栈。
Synopsys。没有 Synopsys——Synopsys 和 Cadence 在芯片设计世界里完全是不可或缺的。Synopsys 在逻辑设计和 IP 方面领先。Cadence 在物理设计——布局布线、仿真和验证方面领先。Cadence 在仿真和验证方面令人难以置信。两者都在进入系统设计和系统仿真的世界。未来,我们将在 Cadence 和 Synopsys 里面设计你们的芯片。我们将在这些工具里面设计你们的系统并仿真全部东西。这就是你们的未来。你们将在这些平台里面诞生。
今天我们宣布,Siemens 也将做同样的事情。我们将把 CUDA-X、物理 AI、agentic AI、NeMo、Nemotron 深度集成到 Siemens 的世界中。原因是这样的。首先,我们设计芯片,未来全部将由 NVIDIA 加速。你们会对此非常高兴。我们将拥有 agentic 芯片设计师和系统设计师与我们一起工作、帮助我们设计,就像我们现在有 agentic 软件工程师帮助我们的软件工程师写代码一样。
我们将在这里面创造你们,但然后我们必须建造你们。我们必须建造制造你们的工厂。我们必须设计组装你们所有人的制造线,而这些制造工厂本质上将成为巨大的机器人。不可思议。然后你们将在计算机里被设计,在计算机里被制造,在计算机里被测试和评估——远在你们需要处理重力之前。
EDA 市场被加速
CUDA-X 集成进 Cadence/Synopsys 的意义:芯片设计周期可能从 18-24 个月压缩到 12 个月以内。这对半导体行业是革命性的——更快的设计周期意味着更快的产品迭代。对投资者:Cadence(市值约 800 亿美元)和 Synopsys(市值约 700 亿美元)的增长可能因 NVIDIA AI 加速而提速。
Siemens 工业数字孪生
Siemens 是全球最大的工业自动化公司之一,其 Xcelerator 平台覆盖从 EDA(Mentor)到 CAE 仿真到数字孪生工厂。NVIDIA 与 Siemens 的合作意味着物理 AI 将从芯片设计延伸到整个制造业——设计、制造、运营全部在 GPU 加速的数字孪生中完成。
旁白物理 AI 的突破让 AI 从屏幕走向我们的物理世界,而且恰逢其时——因为世界正在建造各种工厂:芯片工厂、计算机工厂、救命药物工厂和 AI 工厂。随着全球劳动力短缺加剧,我们比以往任何时候都更需要由物理 AI 和机器人驱动的自动化。这里——AI 与世界上最大的物理产业相遇的地方——是 NVIDIA 与 Siemens 合作的基础。
近两个世纪以来,Siemens 构建了世界的工业,现在它正在为 AI 时代重新发明工业。Siemens 正在将 NVIDIA CUDA-X 库、AI 模型和 Omniverse 集成到其 EDA、CAE 和数字孪生工具与平台的产品组合中。我们一起将物理 AI 带入完整的工业生命周期——从设计和仿真到生产和运营。我们站在新工业革命的起点——由 NVIDIA 和 Siemens 为下一个工业时代构建的物理 AI 时代。
"新工业革命"的野心
NVIDIA + Siemens 的联合宣言"新工业革命的起点"——这不仅仅是一个产品合作,而是对全球制造业数字化方向的定义。Siemens 在制造业的地位类似于 NVIDIA 在 AI 芯片中的地位——两个垄断级玩家的结合,目标是让每一条生产线、每一座工厂都运行在 GPU 加速的数字孪生之上。
全球制造业 = 16 万亿
全球制造业增加值约 16 万亿美元/年。如果 NVIDIA+Siemens 的物理 AI 方案能将制造效率提升哪怕 1%,就是 1600 亿美元的价值创造——这还没有算劳动力替代带来的成本节约。
黄仁勋太不可思议了,对吧?好的,紧紧抓住。如果你看看世界上的模型,毫无疑问 OpenAI 今天是最大的 token 生成者。生成的 OpenAI token 比其他任何东西都多。第二大群体可能是开放模型。我猜随着时间推移,由于有这么多公司、这么多研究者、这么多不同类型的领域和模态,开源模型将遥遥领先成为最大的。
让我们谈谈一个非常特别的东西。你们想吗?让我们谈谈 Vera Rubin。Vera Rubin——对,说吧。她是一位美国天文学家。她是第一个观察到……她注意到星系尾部的运动速度和星系中心一样快。我知道,这完全说不通。牛顿物理学会说,就像太阳系一样,离太阳更远的行星绕太阳转得比离太阳更近的行星慢。因此,除非有看不见的物体,否则这没有意义。我们叫它们……她发现了暗物质——占据空间却看不见的东西。所以 Vera Rubin 就是我们为下一台计算机命名的人。是不是个好主意?
Vera Rubin 其人
Vera Rubin(1928-2016),美国天文学家,通过观测星系旋转曲线提供了暗物质存在的最有力证据之一。NVIDIA 用她命名下一代平台,延续了用科学家命名芯片架构的传统(Hopper = Grace Hopper,Blackwell = David Blackwell)。命名选择也有隐喻:暗物质看不见但占据了宇宙质量的 85%——正如 AI 推理"看不见"但将消耗绝大部分算力。
黄仁勋Vera Rubin 是为了应对我们面临的这个根本性挑战而设计的。AI 所需的计算量正在飞速增长。对 NVIDIA GPU 的需求正在飞速增长。它飞速增长是因为模型每年增长 10 倍——一个数量级。更不用说,正如我提到的,O1 的推出是 AI 的拐点。推理不再是一次性回答,而是一个思考过程。
为了教 AI 如何思考,强化学习和非常大量的计算被引入后训练。这不再是监督微调——也叫模仿学习或监督训练。现在你有了强化学习——本质上是计算机自己尝试不同的迭代、学习如何执行一个任务。
预训练、后训练、测试时扩展的计算量因此而爆炸。现在,每一次推理,不再只是一次性产出若干 token,你可以看到 AI 在思考——我们欣赏这一点。它思考得越久,往往产生越好的答案。所以测试时扩展导致生成的 token 数量每年增长 5 倍。
更不用说,与此同时,AI 竞赛正在进行。每个人都在试图到达下一个级别。每次到达下一个前沿时,上一代 AI token 的成本就开始下降——每年下降约 10 倍。每年 10 倍的下降实际上告诉你另一件事。它在说竞赛如此激烈。每个人都在试图到达下一个级别,而有人确实到达了。所以一切都是计算问题。你计算得越快,就能越早到达下一个前沿。
所有这些事情同时在发生。所以我们决定,我们必须每一年推进计算的最前沿,一年都不能落下。我们一年半前就开始出货 GB200。现在,我们正在全面量产 GB300。如果 Vera Rubin 要赶上今年,它现在就必须在生产中。所以今天,我可以告诉你们,Vera Rubin 正在全面量产。你们想看看 Vera Rubin 吗?好的,来吧。请播放。
三重指数增长
黄仁勋列出了三个同时发生的指数增长:(1) 模型规模 10x/年(从数十亿到万亿参数);(2) 推理 token 量 5x/年(测试时扩展 = 更长的思考链);(3) token 成本下降 10x/年(刺激更多用量)。三者叠加意味着总计算需求每年增长 50-100 倍——远超摩尔定律每年 ~1.6 倍的晶体管增长。
年度迭代的战略意义
"一年都不能落下"——NVIDIA 宣布从此每年发布新一代架构(而非过去的 2 年周期)。对投资者的意义:(1) 资本支出将持续高企;(2) 客户升级周期缩短 = 更频繁的购买;(3) 竞争对手更难追赶,因为追赶 2 年差距比 1 年更容易。GB200 → GB300 → Vera Rubin 三代产品在不到 2 年内依次投产。
旁白Vera Rubin 恰逢其时,迎接 AI 的下一个前沿。这是我们如何建造它的故事。这个架构——一个由六颗芯片组成的系统,被设计为一体工作,源自极致协同设计。从 Vera 开始——一款定制设计的 CPU,性能是前一代的两倍——以及 Rubin GPU。Vera 和 Rubin 从一开始就被协同设计,以双向、一致的方式更快、更低延迟地共享数据。然后,17,000 个组件在一块 Vera Rubin 计算板上汇聚。高速机器人以微米精度放置组件,然后 Vera CPU 和两颗 Rubin GPU 完成组装,能够交付 100 petaflops 的 AI 算力——是其前代的五倍。
AI 需要高速数据。ConnectX-9 为每颗 GPU 提供 1.6 Tbps 的横向扩展带宽。BlueField-4 DPU 卸载存储和安全工作,让计算完全专注于 AI。Vera Rubin 计算托盘——完全重新设计,没有线缆、没有软管、没有风扇——配备一颗 BlueField-4 DPU、八颗 ConnectX-9 网卡、两颗 Vera CPU 和四颗 Rubin GPU,是 Vera Rubin AI 超级计算机的计算构建单元。
接下来,第六代 NVLink 交换机——数据传输量超过全球互联网——连接 18 个计算节点,将最多 72 颗 Rubin GPU 扩展为一个整体运行。然后,Spectrum-X 以太网光子学——全球首个具备 512 通道和 200 Gbps 共封装光学能力的以太网交换机——将数千个机架横向扩展为一座 AI 工厂。从设计开始到现在,投入了 15,000 个工程师年。第一台 Vera Rubin NVL72 机架上线。六颗突破性的芯片,18 个计算托盘,9 个 NVLink 交换托盘,2200 亿个晶体管,重近两吨。AI 下一个前沿的一次巨大飞跃。Rubin 来了。
15,000 工程师年
15,000 工程师年的研发投入,相当于 3,000 名工程师全职工作 5 年。这几乎等于一些中型半导体公司的全部工程团队规模。对标来看:AMD 全公司约 26,000 名员工——NVIDIA 仅在 Vera Rubin 一个项目上的研发投入就相当于 AMD 一半员工干五年。
六颗芯片一览
(1) Vera CPU——88 核定制 ARM 处理器;(2) Rubin GPU——下一代 AI 加速器;(3) ConnectX-9 NIC——1.6Tbps 网卡;(4) BlueField-4 DPU——数据处理单元/存储加速;(5) NVLink 6 Switch——400Gbps GPU 互联交换;(6) Spectrum-X Switch——共封装光学以太网交换机。六颗全部重新设计,这在 NVIDIA 历史上前所未有。
黄仁勋你们觉得怎么样?这是一个 Rubin Pod——1,152 颗 GPU 在 16 个机架里。每个机架有 72 颗 Rubin。每颗 Rubin 实际上是两个 GPU 裸片连在一起。我会给你们看的,但有好几件事——好吧,我稍后再告诉你们。我不能一下全说完。
我们设计了六颗不同的芯片。首先,我们公司内部有一条规矩,而且是一条好规矩:每一代新产品不应该有超过一到两颗芯片变化。但问题是这样的。正如你们看到的,我们描述了每颗芯片的晶体管总数,而我们知道摩尔定律已经大幅放缓。所以我们每年能获得的晶体管增量不可能跟上 10 倍更大的模型。不可能跟上每年多 5 倍的 token 生成。不可能跟上 token 成本如此激进的下降。
除非我们部署激进的、极致的协同设计——基本上在所有芯片、整个栈上同时进行创新——以让行业继续进步的速度前进,否则不可能跟上。这就是为什么我们决定这一代别无选择,必须重新设计每一颗芯片。
现在,我刚才描述的每一颗芯片都可以单独开一场发布会,在过去可能有一整家公司专门做那个。每一颗都是完全革命性的、同类最佳的。Vera CPU,我为它感到骄傲。在功耗受限的世界里,Grace CPU 的性能是同类最先进 CPU 的两倍。在功耗受限的世界里,每瓦性能是两倍。它的数据传输速率是疯狂的。它是为处理超级计算机而设计的。Grace 是一颗令人难以置信的 CPU。现在,Vera 在单线程性能、内存容量等所有方面都有了巨大提升。它是一颗巨大的芯片。
这就是 Vera CPU。这一颗 CPU,连接到 Rubin GPU。看看这个东西。它是一颗巨大的芯片。真正特别的是——我来一个一个讲。这可能需要三只手,不,四只手来展示。好的,这是 Vera CPU。它有 88 个 CPU 核心,设计为多线程的,但 Vera 的多线程设计使得 176 个线程中的每一个都能获得完整性能。所以它本质上就像有 176 个核心,但只有 88 个物理核心。这些核心使用一种叫做空间多线程的技术设计,而 I/O 性能令人难以置信。
打破自己的规矩
NVIDIA 内部规矩是"每代最多换 1-2 颗芯片",Vera Rubin 却换了全部 6 颗——这是黄仁勋承认摩尔定律放缓已经严重到必须打破惯例。以往靠工艺进步(更小的制程 → 更多晶体管)就能提升性能,现在只能靠全栈协同设计来弥补。对投资者:这意味着 NVIDIA 的研发壁垒在加深——竞争对手需要同时在 6 个领域追赶,而非 1-2 个。
空间多线程
传统多线程(如 Intel 超线程)让两个线程共享一个核心的资源,常导致性能互相干扰。Vera 的空间多线程(Spatial Multithreading)设计让每个线程拥有独立的执行资源,88 物理核心 = 176 个全速线程——这在 ARM 服务器 CPU 中是首创。
黄仁勋这是 Rubin GPU。浮点性能是 Blackwell 的 5 倍,但重要的是——看最底行。最底行——它只有 Blackwell 1.6 倍的晶体管数量。这告诉你当今半导体物理的一些东西。如果我们不做协同设计,如果我们不做跨整个系统每一颗芯片级别的极致协同设计,我们每年最多能交付 1.6 倍的性能——因为那是你拥有的晶体管总数。
即使你每个晶体管能多榨出比如说 25% 的性能,也不可能用全部新增晶体管获得 100% 的良率。所以 1.6 倍差不多就给每年的性能进步设了一个天花板,除非你做一些极端的事情——我们叫它极致协同设计。
我们做的其中一件事,也是一个伟大的发明,叫做 NVFP4 张量核心。我们芯片里的 Transformer 引擎不仅仅是一个我们塞进数据通路的 4 位浮点数。它是一整个处理器、一个处理单元,知道如何动态地、自适应地调整其精度和结构来处理 Transformer 的不同层,使你能在可以降低精度的地方实现更高的吞吐量,在需要的时候回到最高精度。
这种动态切换的能力——你不可能在软件中做到这一点,因为显然运行得太快了——所以你必须能在处理器内部自适应地做到这一点。这就是 NVFP4。当有人说 FP4 或 FP8 时,对我们来说几乎没有意义,原因是让它工作的是张量核心的结构和所有的算法。NVFP4,我们已经发表了论文。它能够保留的吞吐量和精度水平完全令人难以置信。这是突破性的工作。如果未来行业要求我们把这种格式和结构变成行业标准,我不会感到惊讶。这完全是革命性的。这就是我们如何能在只有 1.6 倍晶体管的情况下交付如此巨大的性能飞跃。
1.6x 晶体管 → 5x 性能
晶体管数量只增加了 60%,但推理性能提升了 5 倍。这意味着每个晶体管的效率提升了约 3 倍——这几乎全部来自 NVFP4 自适应精度和极致协同设计。对比:Intel 每代 CPU 通常在同制程下只能提升 10-15% 的单核性能。NVIDIA 的架构创新幅度是 CPU 行业的 20 倍。
NVFP4 自适应精度
传统做法:整个模型统一用 FP16 或 FP8 运行。NVFP4 是一个硬件级的"精度调度器"——它实时分析 Transformer 每一层的数据特征,在可以容忍低精度的地方(如注意力头的值矩阵)用 FP4 加速,在需要高精度的地方(如层归一化)自动回到 FP8/FP16。这不是软件能做的——切换速度必须匹配 GPU 的时钟周期。
黄仁勋现在,一旦你有了一个出色的处理节点——这就是处理节点——里面是……好,让我来展示。这个,哇,超级重。你必须是一个身体状况非常好的 CEO 才能做这份工作。好的。
这个东西,我猜大概——我不知道——两百磅。我觉得这很好笑。算了,没人笑。好的。
看看这个。这是上一代。我们彻底改变了整个 NGX 机箱。上一代节点有 43 根线缆。这一代?零线缆。6 根管子变成只有这里的两根。组装时间从两小时降到五分钟。从 80% 液冷变成 100% 液冷。真的是一个突破。
好的。这就是新的计算机箱。连接所有这些到机架顶部交换机的、负责东西向流量的是 Spectrum-X 网卡。这是世界上最好的网卡,毫无疑问是 NVIDIA 的 Mellanox——很久以前加入我们的那次收购。他们为高性能计算设计的网络技术是世界上最好的,无与伦比。算法、芯片设计、所有互联、所有运行其上的软件栈、他们的 RDMA——绝对无与伦比,世界最佳。现在,它还能做可编程 RDMA 和数据通路加速,让我们的合作伙伴——比如 AI 实验室——可以创建自己的数据移动算法。完全是世界一流的。ConnectX。
ConnectX-9 和 Vera CPU 是协同设计的,我们之前从未透露过,也从未在 CX9 之前发布过,因为我们是为一种新型处理器协同设计的。CX8 和 Spectrum-X 彻底改变了以太网为人工智能服务的方式。AI 的以太网流量强度更高、要求更低的延迟。瞬时流量爆发与以太网通常见到的完全不同。所以我们创建了 Spectrum-X,也就是 AI 以太网。两年前,我们发布了 Spectrum-X。NVIDIA 今天是世界历史上最大的网络公司。如此成功,在如此多的部署中使用,它正在席卷整个 AI 领域。
最大网络公司
"世界历史上最大的网络公司"——这个头衔以前属于 Cisco。NVIDIA 通过收购 Mellanox(69 亿美元,2019 年)然后在 AI 网络上创新,在短短两年内从零做到了全球最大的数据中心网络供应商。Spectrum-X 的成功根源在于:AI 训练的网络流量模式(all-reduce 突发)与传统数据中心完全不同,传统交换机应对不了。
25% 吞吐提升 = 50 亿美元
黄仁勋后面提到的算术:一座 1GW 数据中心价值约 500 亿美元。Spectrum-X 提升 25% 网络吞吐——等效于多出 125 亿美元的算力。即使只算 10%,也是 50 亿美元——而 Spectrum-X 网络设备的成本远低于此。这就是"网络免费"的逻辑。
黄仁勋性能是令人难以置信的,特别是当你有一个 200 兆瓦数据中心或 1 吉瓦数据中心时——这些都是数十亿美元。假设一座 1 吉瓦数据中心是 500 亿美元。如果网络性能让你额外多交付 10%——在 Spectrum-X 的情况下,交付 25% 的吞吐提升并不罕见——如果我们只多交付 10%,那就值 50 亿美元。网络完全免费。这就是为什么所有人都用 Spectrum-X。这真的是不可思议。
现在,我们将发明一种新型数据处理。Spectrum-X 是负责东西向流量的。我们现在有一个新的处理器叫做 BlueField-4。BlueField-4 让我们能把一个非常大的数据中心隔离成不同部分,让不同用户使用不同部分,确保一切都可以被虚拟化。你把大量的虚拟化软件、安全软件、南北向网络软件卸载出去。BlueField-4 随每一个计算节点标配。
BlueField-4 有一个第二个应用我马上要讲。这是一个革命性的处理器,我对它非常兴奋。
这是 NVLink 6 交换机,就在这里。这个交换机,机架里有四个。每一颗交换芯片拥有历史上最快的 SerDes。全世界刚刚做到 200 Gbps,这是 400 Gbps 每秒的交换机。这之所以重要,是因为我们需要让每一颗 GPU 在完全相同的时间与其他每一颗 GPU 通话。这个机架背板上的交换机让我们能移动相当于全球互联网数据量两倍的数据,以两倍的速度。你取整个地球互联网的横截面带宽——大约每秒 100 TB。这是 240 TB 每秒。作为对比参考。这就是为了让每一颗 GPU 能在完全相同的时间与其他每一颗 GPU 协同工作。
240 TB/s = 2x 全球互联网
单个 NVL72 机架的内部带宽(240 TB/s)是全球互联网总带宽(~100 TB/s)的 2.4 倍——集中在一个两吨重的机柜中。这个数字说明了为什么 AI 训练对网络的要求与传统数据中心完全不是一个量级。
400G SerDes
SerDes(Serializer/Deserializer)是芯片间高速通信的核心 IP。400Gbps 是业界从未量产过的速度——当前主流为 112G-224G。NVIDIA 在 NVLink 6 交换机中实现 400G,意味着它在 I/O 技术上领先行业一到两代。这也是为什么竞争对手很难复制 NVLink 的互联性能。
黄仁勋然后在此之上——好,这是一个机架。每个机架,你可以看到,晶体管数量是 1.7 倍……能帮我转一下吗?通常大约两吨,但今天是两吨半,因为他们发货时忘了把水排掉。所以我们从加利福尼亚运来了很多水。你能听到它在吱嘎响吗?你转两吨半的时候就会响。哦,你能转动它。哇。我们不会让你转第二次的。
好的。后面是 NVLink 脊柱。基本上是两英里的铜缆。铜是我们知道的最好的导体。这些都是屏蔽铜缆、结构化铜缆。计算系统中使用铜缆最多的一次。我们的 SerDes 驱动铜缆从机架顶部一直到底部,速度 400 Gbps。不可思议。所以,这里面有两英里的铜缆总量,5,000 根铜缆,这让 NVLink 脊柱成为可能。这就是真正开启 NGX 系统的革命。
现在,我们决定创建一个行业标准系统,让整个生态、我们所有的供应链都能在这些组件上标准化。大约 80,000 种不同的组件构成这些 NGX 系统,如果每年都要换一遍那完全是浪费。每一家主要计算机公司——从富士康到广达、纬创,到惠普和戴尔和联想——都知道怎么造这些系统。所以,虽然 Vera Rubin 的性能高得多,而且非常重要的是——功率是 Grace Blackwell 的两倍,但我们把它塞进了同一个系统里。
然而——这就是奇迹——进入系统的空气流量大致相同。非常重要的是,进入的水温仍然是 45 度摄氏度。45 度的话,数据中心不需要水冷机。我们基本上是用热水冷却这台超级计算机。效率极其惊人。所以,这是新的机架。晶体管多 1.7 倍,但推理峰值性能是 5 倍,训练峰值性能是 3.5 倍。
热水冷却超算
"用热水冷却超级计算机"听起来违反直觉——但 45°C 的水比传统冷冻水(7-12°C)消除了制冷设备的能耗,通常占数据中心总能耗的 30-40%。NVIDIA 能用热水冷却是因为 GPU 的工作温度可以高达 80-85°C,45°C 的水仍然提供了足够的温差。这一设计节省约 6% 的全球数据中心用电——按全球数据中心年耗电 500TWh 计算,相当于省下 30TWh,足够供电 300 万户家庭。
80,000 种组件
一套 NGX 系统包含 8 万种组件——复杂度堪比一架商用飞机(波音 737 约 36.7 万个零件)。NVIDIA 将其标准化为行业通用平台,让富士康/广达/戴尔等都能制造——这是"开放标准、锁定架构"的平台策略。
黄仁勋它们在顶部通过 Spectrum-X 连接。哦,谢谢。这是世界上第一颗使用台积电新工艺的量产芯片——我们共同创新的工艺叫做 Coop。它是一个集成硅光子工艺。这让我们能把硅光子直接集成到芯片上。这是 512 端口、200 Gbps。这就是新的以太网 AI 交换机——Spectrum-X 以太网交换机。看看这颗巨大的芯片。但真正了不起的是,它直接连接了硅光子。激光从这里进来,激光从这里进来。光学器件在这里,它们连接到数据中心的其他部分。
就像我之前提到的,几年前我们推出了 Spectrum-X,彻底改变了网络的方式。以太网非常容易管理,每个人都有以太网栈,全世界每个数据中心都知道怎么处理以太网。我们当时唯一使用的是 InfiniBand,用于超级计算机。InfiniBand 延迟非常低,但它的软件栈、整个可管理性对以太网用户来说非常陌生。所以我们决定首次进入以太网交换机市场。Spectrum-X 一飞冲天,让我们成为如我所说的世界最大网络公司。下一代 Spectrum-X 将延续这一传统。
但正如我之前所说,AI 重新发明了整个计算栈的每一层。当 AI 开始部署到企业中时,它也将重新发明存储的方式。AI 不用 SQL,AI 用语义信息。当 AI 被使用时,它会创建临时知识、临时记忆——叫做 KV 缓存——键值组合——基本上是 AI 的缓存、AI 的工作记忆。AI 的工作记忆存储在 HBM 内存中。每一个 token,对于每一个 token,GPU 读入整个模型、读入整个工作记忆,然后产生一个 token,把那一个 token 存回 KV 缓存。然后下一次它再这样做——读入整个内存、流过 GPU、然后生成另一个 token。
它重复这样做,一个 token 接一个 token。显然,如果你和 AI 有一段长对话,随着时间推移,那个记忆、那个上下文记忆会增长得非常大。更不用说模型在增长,我们使用 AI 的轮次在增加。我们想让这个 AI 陪伴我们一辈子,记住我们与它的每一次对话,对吧?记住我让它做的每一项研究。当然,共享这台超级计算机的人数也会继续增长。所以这个上下文记忆——它原本能装进 HBM——已经不够大了。
共封装光学(CPO)
传统做法是光模块插在交换机的前面板上。Coop 工艺把硅光子直接集成到交换机芯片封装内,消除了插拔连接器的损耗和延迟。这是业界首次在数据中心以太网交换机上量产共封装光学——标志着光互联从"可拔插模块"向"片上光子"的范式转变。
KV 缓存 = 新存储品类
黄仁勋正在定义一个全新的存储市场:AI 上下文记忆存储。传统存储(SAN/NAS/对象存储)是为文件和数据库设计的,而 KV 缓存需要极低延迟、极高带宽的键值访问。这对 NetApp、Pure Storage、三星等存储公司意味着全新的产品线——而 BlueField-4 DPU 是这个新存储栈的控制平面。
黄仁勋去年我们创建了 Grace Blackwell 的超快内存——我们叫它快速上下文记忆——这就是为什么我们把 Grace 直接连到 Hopper,又把 Grace 直接连到 Blackwell——这样我们就能扩展上下文记忆。但即使那样也不够。所以下一个方案当然是走网络——南北向网络——到公司的存储上去。但如果你同时有大量 AI 在运行,那个网络就不够快了。所以答案很明显,要做不一样的事情。
我们创建了 BlueField-4,这样我们就能拥有一个极快的 KV 缓存上下文记忆存储,就在机架里面。行业对此非常兴奋,因为对于今天做大量 token 生成的所有人——AI 实验室、云服务商——KV 缓存在网络上移动造成的流量是一个痛点。把创建一个新平台、一个新处理器来运行整个 Dynamo KV 缓存上下文记忆管理系统,并把它放在离机架非常近的地方——这完全是革命性的。
所以,它就在这里。这是所有计算节点。每一个都是 NVLink 72。所以这是 Vera Rubin NVL72,144 颗 Rubin GPU。这是存储在这里的上下文记忆。每一个后面是四颗 BlueField,每颗 BlueField 后面是 150 TB 的上下文记忆。当你分配到每颗 GPU 时,每颗 GPU 将额外获得 16 TB。现在,在这个节点内部,每颗 GPU 本质上有 1 TB。有了这个紧邻的后备存储——在完全相同的东西向流量上、完全相同的 200 Gbps 数据速率上、横跨这个计算节点的整个网络——你将额外获得 16 TB 的记忆。这是管理平面。这些是连接所有东西的 Spectrum-X 交换机。这里的交换机连接到数据中心的其余部分。这就是 Vera Rubin。
1TB → 16TB 上下文
每颗 GPU 从 HBM 内的 ~1TB 上下文记忆扩展到 16TB——16 倍的上下文窗口容量。这意味着 AI 可以在一次会话中"记住"相当于数万篇论文的内容,或者同时为数千名用户维护独立的对话上下文。这是解锁"终身 AI 助理"(记住你所有历史对话)的硬件基础。
Dynamo KV 缓存管理
Dynamo 是 NVIDIA 的推理编排系统(2025 年发布),负责管理多 GPU 间的 KV 缓存分配、迁移和回收。把 Dynamo 运行在 BlueField-4 DPU 上,意味着KV 缓存管理不再消耗 GPU 计算资源——DPU 专门处理数据搬运,GPU 专注于 token 生成。这是"计算与数据管理分离"的架构创新。
黄仁勋这个系统有几件事非常令人难以置信。首先,我提到了这整个系统的能效是两倍——本质上是两倍的温度性能。虽然功率是两倍、能量使用是两倍,但计算量是数倍高于此,而流入的液体温度仍然是 45 度。这让我们能节省全球数据中心约 6% 的用电。这是一个很大的事情。
第二件大事是这整个系统现在是机密计算安全的——意味着所有东西在传输中、在静止时和计算期间都是加密的,每一条总线都被加密。每条 PCI Express、每条 NVLink、CPU 到 GPU 之间的每条 NVLink、GPU 到 GPU 之间——全部加密。所以它是机密计算安全的。这让公司可以安心地让别人部署他们的模型,但确保没有其他人能看到。
还有一件令人难以置信的事。由于 AI 工作负载的性质,它的计算层叫做 all-reduce,会瞬间飙升。同时使用的电流量、能量真的超出图表范围。通常会飙升 25%。我们现在有跨整个系统的功率平滑,这样你不需要过度配置 25%,或者如果你过度配置了 25%,你不需要让 25% 的能量白白浪费或闲置。现在你可以填满整个功率预算,不需要额外配置。
6% 数据中心用电节省
全球数据中心年耗电约 500TWh(约占全球用电的 2%)。节省 6% = 30TWh,按 $0.05/kWh 计算是 15 亿美元/年的电费。随着 AI 数据中心占比快速增长,这个节省比例对应的绝对金额将持续膨胀——能效本身就是 Vera Rubin 的强力卖点。
机密计算全加密
传统做法只加密"传输中"和"静止"的数据。Vera Rubin 实现了"计算中"也加密——数据在 GPU 内部处理时仍然是加密状态。这对企业和政府客户至关重要:他们可以把自己最敏感的模型和数据放在第三方云上运行,而云运营商无法窥视。这直接打开了金融、医疗、国防等高安全需求市场。
功率平滑
AI 训练的 all-reduce 操作会导致所有 GPU 同时进入高负载,造成功率瞬间飙升 25%。传统方案是过度配置 UPS 和电力,浪费大量资源。NVIDIA 的功率平滑技术在系统级别重新调度计算,避免同时峰值——相当于"电力削峰填谷",让数据中心可以把省下的 25% 电力预算用来装更多 GPU。
黄仁勋然后最后,当然是性能。让我们来看看性能。这些图表只有建造 AI 超级计算机的人才会喜欢。每一颗芯片的完全重新设计、每一个系统的完全重新设计、重写整个栈——才让这一切成为可能。
基本上,这第一列是训练 AI 模型。你训练 AI 模型越快,你就能越快把下一个前沿推向世界。这是你的上市时间。这是技术领导力。这是你的定价权。在绿色的情况下,这本质上是一个 10 万亿参数模型。我们从 DeepSeek 放大而来,所以叫 DeepSeek++,在 100 万亿 token 上训练一个 10 万亿参数模型。这是我们对构建下一个前沿模型所需资源的仿真预测。
下一个前沿模型——Elon 已经提到 Grok 的下一个版本 Grok 5 是 7 万亿参数,所以这是 10 万亿。绿色是 Blackwell。这里,Rubin 的情况是,注意吞吐量高得多,因此只需要 四分之一的系统数量就能在我们给定的时间内——一个月——训练完模型。时间对每个人都是一样的。你能多快训练那个模型、能训练多大的模型——就是你如何率先到达前沿。
第二部分是你的工厂吞吐量。Blackwell 还是绿色。工厂吞吐量很重要,因为你的工厂——以 1 吉瓦为例——是 500 亿美元。一座 500 亿美元的数据中心只能消耗 1 吉瓦的功率。所以如果你的每瓦吞吐量很好而不是很差,那直接转化为你的收入。你数据中心的收入直接与第二列相关。Blackwell 大约是 Hopper 的 10 倍。Rubin 大约又是 10 倍。
token 的成本,多划算地生成 token——Rubin 大约是十分之一。正如在 Blackwell 的情况下一样。
这就是我们如何让每个人都到达下一个前沿、把 AI 推到下一个层次。当然,也是高效节能、高效经济地建造这些数据中心。
10 万亿参数模型
10 万亿参数——比 GPT-4(传言约 1.8 万亿 MoE)大 5-6 倍,比 Grok 5(7 万亿)大 43%。这是 NVIDIA 预测的"下一个前沿"的规模。如果用 Blackwell 训练需要 4 倍于用 Rubin 的系统量——这是 Rubin 最强力的销售论据:不升级就慢 4 倍到达前沿。
每代 10x = 竞争力不可让渡
Hopper → Blackwell → Rubin,每一代在推理吞吐/训练效率上都实现约 10 倍提升。这意味着不升级的客户每隔一年就落后 10 倍——在 AI 竞赛中,这等于被淘汰。"算力 = 定价权"的等式在这里变得具体:你的数据中心每瓦吞吐量直接等于你的收入。这解释了为什么云厂商愿意以万亿级 CapEx 追逐最新一代 NVIDIA GPU。
黄仁勋所以,这就是今天的 NVIDIA。我们提到我们制造芯片,但如你所知,NVIDIA 现在建造整个系统,而 AI 是全栈的。我们正在从芯片到基础设施、到模型、到应用的每一层重新发明 AI。我们的工作是创建整个栈,让你们所有人都能为世界其他地方创造不可思议的应用。
感谢大家的到来。祝大家 CES 愉快。
在我让你们走之前——我们有一大堆幻灯片不得不留在了剪辑室的地板上,所以我们有一些花絮。我觉得你们会喜欢的。CES 快乐,各位。
花絮视频(以下为演讲准备过程中的幕后花絮剪辑)
"咔!""NVIDIA CES 现场直播,第四条。""录音杆。开拍。""抱歉伙计们。""平台变革,嗯?应该可以了。""再来一次。""绿色的色调。一种明亮的、快乐的绿。""世界上最强大的 AI 超级计算机,你可以把它插在墙上——就挨着我的烤面包机。""嘿伙计们,我又卡住了。太抱歉了。""这张幻灯片永远不会好使。把它剪了吧。""喂?你能听到我吗?""所以就像我说的,路由器——因为不是每个问题都需要最大最聪明的模型。只要对的那个就行。""不不不。一个都别丢。这个新的六芯片 Rubin 平台组成一台了不起的 AI 超级计算机。""来,小家伙。哦不,不要碰扩展定律。""车上有一只松鼠。准备好让松鼠走开。礼貌地请松鼠挪一下。""你知道吗,今天最好的模型都是混合专家模型。""嘿。""人都去哪了?"
"全栈"的终极定义
黄仁勋的总结把 NVIDIA 定位为"从芯片到应用的 AI 全栈公司"。这不是营销口号,而是事实:Vera CPU(处理器)→ Rubin GPU(加速器)→ NVLink/Spectrum-X(网络)→ Omniverse/Cosmos(仿真/合成数据)→ Nemotron/NeMo(模型/框架)→ Blueprint(应用框架)→ Alpamayo(应用)。从硅片到软件到服务,没有第二家公司能覆盖这个完整栈。
花絮片段
演讲最后播放的幕后花絮是 CES 主题演讲的传统环节,展示了黄仁勋在准备过程中的 NG 镜头。"车上有一只松鼠"等片段为演讲增添了轻松氛围——在近 90 分钟的高密度技术信息后,花絮起到了减压和人格化的作用。
五大要点
- 两场平台变革同时叠加,10 万亿美元旧计算正在被重建。加速计算取代通用计算 + AI 成为应用平台,每一层"五层蛋糕"都在被重新发明。模型每年 10 倍增长、token 生成量每年 5 倍增长、token 成本每年降 10 倍——三重指数同时发生,算力需求远超摩尔定律供给。
- Alpamayo 开源:自动驾驶进入"会思考"的端到端时代。全球首个具备推理能力的端到端自动驾驶 AI,Cosmos 合成数据 + 人类演示训练,与梅赛德斯 CLA 合作 2026 Q1 美国上路、Q2 欧洲、Q3-Q4 亚洲。双栈安全架构(端到端 Alpamayo + 传统 AV 护栏)实现冗余。
- Vera Rubin 六颗芯片全新设计,正式全面量产。在摩尔定律仅提供 1.6 倍晶体管增量的约束下,通过 NVFP4 自适应精度张量核心和极致协同设计实现推理 5 倍、训练 3.5 倍于 Blackwell 的性能飞跃。45°C 热水冷却、零线缆托盘、机密计算全加密、功率平滑——每一项都是系统级创新。
- BlueField-4 开辟全新 AI 存储品类:每颗 GPU 16TB 上下文记忆。KV 缓存从 HBM 溢出是 AI 推理的关键瓶颈。BlueField-4 DPU + 机架内存储让上下文记忆从 1TB 扩展到 16TB/GPU,运行 Dynamo KV 缓存管理系统,解锁终身 AI 助理等长上下文场景。
- NVIDIA 从芯片公司完成向全栈 AI 平台的转型。自建 DGX 超算训练开源模型(Nemotron/Cosmos/GROOT/Alpamayo),将 AI 注入 Cadence/Synopsys/Siemens 工业仿真,"算力 = 数据 = 模型 = 收入"的飞轮已经转起来。开源策略锁定平台,年度迭代拉开竞争距离。