芯片只卖一次,软件维护一辈子
CES 2026 主题演讲落幕后,黄仁勋在拉斯维加斯接受了 Tom's Hardware 等媒体的专场问答。这不是一场关于跑分和发布新卡的对话——黄仁勋谈的是 AI 基础设施"建完之后怎么办":机架宕机一次亏多少钱、功率峰值为何比平均功耗更要命、为什么推理经济学正在重塑 NVIDIA 的优先级、以及开放模型为何不蚕食而是做大了整个市场。
贯穿全场的核心信息只有一句:峰值性能仍然重要,但它不再是唯一的驱动力。NVIDIA 正在为"持续运行、容忍故障、在真实约束下高效运转"的系统做优化——这是从建设阶段向运营阶段过渡的信号。对于 AI 产业链投资者而言,这场问答揭示了 NVIDIA 下一阶段的竞争壁垒不在芯片本身,而在系统级效率与生态锁定。
Tom's Hardware 报道当 NVIDIA CEO 黄仁勋在 NVIDIA CES 2026 主题演讲上发言时,话题跨越了 Rubin、功率交付、推理经济学、开放模型等领域。随后,Tom's Hardware 有机会在内华达州拉斯维加斯坐下来,参加了一场黄仁勋本人的媒体问答专场。
虽然我们不能全文分享会议记录,但我们深入挖掘了黄仁勋在专场中最重要的一些表态,部分内容经过编辑以保证行文流畅和清晰。总的来说,建议各位先熟悉 NVIDIA CES 2026 主题演讲中公布的话题,再深入阅读以下问答精华——其中会引用黄仁勋在台上讨论过的内容。
黄仁勋在问答中的回答有助于厘清 NVIDIA 如何着手大规模 AI 部署的下一阶段,始终强调的重点是:系统安装之后如何保持高产出。还记得我们之前那场 Computex 黄仁勋问答的读者,一定会想起这位 CEO 关于 AI 基础设施部署的宏大"五十年计划"愿景。
NVIDIA 正在为持续推理工作负载、受限的电力环境、以及必须在模型和部署模式不断变化时仍然保持有用的平台而设计。其他评论还包括在另一场面向分析师的问答中对 SRAM 与 HBM 部署方案的讨论。灵活性方面的优先级解释了近期在可维护性、功率平滑、统一软件栈和支持开放模型方面的架构选择——它们有助于描绘出 NVIDIA 如何在当前正在展开的初始建设阶段之后,思考 AI 基础设施的规模化问题。
CES 2026 主题演讲
2026 年 1 月 6 日,黄仁勋在 CES 发表了约两小时的主题演讲,发布了 Vera Rubin 平台(NVIDIA 下一代数据中心架构)、RTX 50 系列消费级显卡、Cosmos 物理 AI 世界模型等。本场问答紧随演讲之后,是更深层的商业逻辑阐释。
"五十年计划"回响
黄仁勋在 2025 年 Computex 问答中首次提出"部署 AI 基础设施是一项跨越五十年的事业"。此处再次暗示:NVIDIA 不把 AI 视为一轮采购周期,而是一个持续运营的长期基础设施命题——这与传统芯片"卖出即完工"的商业模式截然不同。
Tom's Hardware 报道贯穿整场问答最一致的主题是 NVIDIA 对在真实环境下保持系统高产出的关注——黄仁勋把大部分时间花在了讨论宕机、可维护性和维修问题上。这一点在 NVIDIA 定位其即将推出的 Vera Rubin 平台时尤为明显。
黄仁勋"想象一下,今天我们有一台 Grace Blackwell 200 或 300。它有 18 个节点、72 块 GPU,以及一个配备九个交换机托盘的 NVLink 72。如果任何电缆或交换机出了问题,或者链路没有我们希望的那么稳固,甚至半导体疲劳随时间推移出现了,你最终都会想要更换某个部件。"
Tom's Hardware 报道黄仁勋没有照本宣科地背诵性能指标,而是反复描述了机架下线的经济影响,以及在组件故障时最大限度减少中断的重要性。在 NVIDIA 客户如今运营的规模下,故障是不可避免的。GPU 会坏、互联会退化、电力交付会波动。NVIDIA 正在试图回答的问题是:如何防止这些故障级联扩散为持续性的停机。
黄仁勋"当我们今天更换某个部件时,我们实际上是把整个机架都拿下来。它归零了。那个价值约 300 万美元的机架,从满载利用率变成零,一直保持停机状态,直到你更换了 NVLink 或任何节点并重新启动。"
Grace Blackwell 200/300
GB200 NVL72 是 NVIDIA 当时最先进的 AI 超级计算节点:72 块 Blackwell GPU 通过 NVLink 互联,配合 Grace CPU,组成一个液冷机架。18 节点 × 4 GPU/节点 = 72 GPU。九个交换机托盘负责 GPU 间的高速通信。任何一个故障点都可能迫使整机架停机。
300 万美元/机架
单个 NVL72 机架报价约 $3M。如果一个大型客户部署了 100 个机架,总投资 $3 亿。假设每个机架每小时产出 $50 的推理收入,一次 8 小时停机意味着 $400 的直接收入损失——听起来不多,但规模放大后(故障频次 × 机架数 × 修复等待),年化成本极为可观。
运维才是真战场
当 CEO 把大部分 Q&A 时间用来谈维修而非性能,说明 AI 基础设施已经进入"运营密集"阶段。对投资者而言,关注点应从"谁的芯片最快"转向"谁的系统最少停机、最快恢复"——这是 NVIDIA 构建下一层竞争壁垒的方向。
Tom's Hardware 报道Rubin 的托盘式架构正是为了回答这个问题而设计的。通过将机架拆分为模块化、可维护的单元,NVIDIA 的目标是把维修变成一项常规操作。目标不是零故障——那是不可能的——而是快速恢复,让系统的其余部分在更换故障组件时继续运行。
黄仁勋"所以今天,有了 Vera Rubin,你只需把 NVLink 抽出来,系统继续运行。如果你想给任何链路交换机更新软件,你可以在运行中更新。这让我们能够让系统更长时间地保持运行状态。"
Tom's Hardware 报道这种对可维护性的强调同样影响了 Rubin 的组装和部署方式。更快的组装速度和标准化的托盘减少了系统在安装和维修期间的闲置时间。在一个机架代表数百万美元资本投入并持续产生收入的世界里,闲置时间是昂贵的——因此 NVIDIA 可以理解地把正常运行时间视为与吞吐量同等重要的核心性能指标。
托盘式架构
Vera Rubin 引入了"托盘"(tray)设计:GPU 计算板、NVLink 交换机、网络模块各自封装在可热插拔的标准托盘中。故障时抽换单个托盘即可,无需整机架断电——类似服务器硬盘热插拔,但扩展到了 GPU 和互联层。这是数据中心从"整体维修"到"在线维修"的关键一步。
黄仁勋"一切都归结于一个事实:过去组装这个节点需要两个小时。但现在,Vera Rubin 只需要五分钟。从两小时缩短到五分钟,这在我们的供应链中是完全颠覆性的。"
黄仁勋"没有任何线缆——而不是 43 根线缆——并且 100% 液冷而不是 80% 液冷,这带来了巨大的差异。"
2 小时 → 5 分钟
组装时间缩短 24 倍。这不只是工厂效率问题——在大规模部署中,每个新建数据中心可能同时组装上千个节点。如果每个节点省 115 分钟,1,000 个节点就省近 2,000 工时。更重要的是维修场景:现场更换从"需要专业团队半天"变成"运维人员五分钟搞定"。
零线缆是真的
Blackwell 一代的 NVL72 机架内部有 43 根铜缆做 GPU-to-GPU 互联。Vera Rubin 通过背板直连(midplane)设计彻底消除了这些线缆。线缆不仅增加组装时间,还是最常见的故障源之一(接触不良、弯折损伤)。消灭线缆 = 消灭一整个故障类别。
供应链瓶颈松绑
如果组装时间不再是瓶颈,NVIDIA 的交付速度将主要受限于晶圆产能(台积电)和封装产能(CoWoS),而非系统集成。这对 NVIDIA 的季度出货节奏有直接利好,也意味着下游超大规模客户的资本开支可以更快转化为可用算力。
Tom's Hardware 报道讨论没有集中在平均功耗上,而是反复回到瞬时需求——这正是大规模 AI 部署越来越频繁遇到麻烦的地方。
现代 AI 系统的功率会剧烈且不可预测地飙升,特别是在推理突发期间,工作负载快速上下波动。这些短暂的峰值迫使运营商按最坏情况来配置电力交付和散热设施——即使这些最坏情况只是短暂出现。这导致了数据中心内的闲置产能,基础设施是为那些持续时间不够长、无法证明其花费合理的峰值而建造的。
NVIDIA 对 Rubin 的回答是在系统层面攻克这个问题,而不是把它推给上游设施。通过在机架内部管理功率行为,NVIDIA 试图在功率需求冲击更广泛的电力分配系统之前就把这些需求峰值抹平。考虑到每块 Rubin GPU 的 TDP 高达 1,800 瓦,这意味着协调计算、网络和内存子系统的功耗方式,使机架向数据中心呈现一个更可预测的负载曲线。这实际上允许运营商更接近其持续功率极限运行,而不是围绕那些本来决定一切——从变压器规格到电池备份——的瞬态冲击来设计。
黄仁勋"当我们训练这些模型时,所有 GPU 都在协调工作,这意味着在某个时刻它们全部同时开启峰值,或者全部同时降下来。由于系统中的电感效应,那个瞬时电流波动确实相当大。可以高达 25%。"
瞬时功率 vs 平均功率
平均功率(TDP)是芯片的"标签功耗",数据中心按此规划总供电。但 AI 训练/推理中,所有 GPU 同步执行矩阵运算时功率可瞬间飙升 25%,远超稳态值。就像一栋楼所有空调同时启动会让电网跳闸——数据中心面临同样的物理学约束。
Rubin GPU: 1,800W
单块 Rubin GPU TDP 达 1,800W。一个 NVL72 机架(72 块 GPU)仅 GPU 部分稳态功耗就达 ~130kW,峰值可冲到 ~162kW。整个机架加上 CPU、网络、内存,满载接近 200kW——相当于约 65 户普通家庭的用电量集中在一个冰箱大小的柜子里。
25% 峰值的物理学
GPU 同步训练时,所有芯片在同一时钟周期执行相同操作(AllReduce 同步屏障),导致功率负载高度相关。系统中导线的电感(inductance)会放大这种阶跃变化,产生远超 TDP 标称值的瞬时电流。这是纯粹的物理限制,不是软件能轻易解决的。
Tom's Hardware 报道一个能提供略低峰值吞吐量但能持续维持的机架,比一个短暂命中更高数字然后因功率限制而被迫降频或停机的机架更有用。随着推理工作负载变得持续且与收入直接挂钩,这种一致性将愈发有价值。
同样的逻辑也有助于解释 NVIDIA 持续推动更高温度液冷的原因。在更高冷却液温度下运行降低了对冷水机组的依赖——冷水机组是数据中心中最耗电的设备之一。这也扩大了这些系统可以部署的环境范围,特别是在水资源可用性、散热基础设施或电网容量原本会成为限制因素的地区。
黄仁勋"对于大多数数据中心,你要么过度配置大约 25%——意味着你让 25% 的电力闲置——要么就放一整排电池来吸收冲击。Vera Rubin 通过系统设计和电子技术来实现这一点,那种功率平滑让你可以接近 100% 全时运行。"
Tom's Hardware 报道综合来看,对功率平滑、负载管理和更高温度散热的强调指向了效率提升来源的转变:NVIDIA 正在为可预测性、利用率和基础设施效率做优化。一个能在接近极限的状态下持续运行、而不迫使数据中心其余部分围绕它过度建设的系统,最终比一个纸面上更快、但受制于电力交付现实的系统提供更多价值。
更慢但更赚钱
黄仁勋其实在说:峰值跑分高不如稳定产出高。一个峰值 100 token/s 但频繁因功率问题降频到 60 的系统,不如一个稳定跑 85 token/s 的系统值钱——因为后者的总产出更高、可预测性更强、基础设施成本更低。这完全颠覆了传统芯片评测的思维方式。
25% 电力被"晾着"
假设一个 100MW 数据中心,如果必须为峰值预留 25% 余量,实际可用功率仅 75MW——相当于白白浪费了 25MW 的供电基础设施投资(变电站、馈线、UPS、发电机)。Rubin 的片上功率平滑如果真能消除这一余量,等于让同一座数据中心"免费"多出 25% 的有效算力。
散热和电力是价值链
黄仁勋反复强调功率和散热不是"配套问题"而是"核心约束"。对投资者而言:液冷系统(Vertiv、Cooler Master、曙光节能等)、高温冷却液技术、以及数据中心电力基础设施(变压器、UPS、母线槽)都处于 AI 基础设施价值链的关键卡位。
Tom's Hardware 报道黄仁勋反复回到推理这个话题上,将其视为现代 AI 部署的决定性工作负载。训练仍然重要,但它是间歇性的;而推理持续运行、直接产生收入、并且暴露系统中的每一个低效之处。这一转变正在驱使 NVIDIA 远离传统的性能指标(如 FLOPS),转向与时间维度产出挂钩的指标。重要的是一个系统每瓦、每美元能生成多少有用的 token,而不是它跑单个基准测试能有多快。
黄仁勋"今天,在代币经济学(tokenomics)下,你通过生成的 token 来变现。如果在一个数据中心内,在有限的电力下,我们能生成更多的 token,那么你的收入就上去了。这就是为什么每瓦 token 数和每美元 token 数在最终分析中至关重要。"
Tom's Hardware 报道虽然业界对用更便宜的内存层级来做推理的兴趣日益增长,黄仁勋也强调了碎片化软件生态系统的长期成本。更换内存模型可能带来短期节省,但会产生长期义务——需要在工作负载演进过程中持续维护兼容性。
黄仁勋"做芯片是昂贵的,"黄仁勋说,"但 IT 行业最昂贵的部分是上面的软件层。芯片只卖一次,但当你构建软件时,你要永远维护它。"
Tom's Hardware 报道NVIDIA 的策略,正如黄仁勋所阐述的,是即使牺牲一些理论上的效率也要保留灵活性。AI 工作负载变化太快,狭义优化的系统无法长期保持相关性。通过保持统一的软件和内存模型,NVIDIA 相信自己可以在模型架构、上下文长度和部署模式等方面发生变化时吸收这些变化,而不会造成产能闲置。
黄仁勋"与其优化十七个不同的栈,你优化一个栈,而那一个栈跑在你的整个机队上。当我们更新软件时,整个 AI 工厂的尾端性能都会提升,"黄仁勋解释说。
CUDA 护城河的本质
"芯片只卖一次,软件维护一辈子"是黄仁勋对 CUDA 护城河最精炼的阐述。竞争对手(AMD ROCm、Intel oneAPI、Google TPU/JAX)不只需要做出性能匹配的芯片,还需要复制并长期维护一整套软件栈。这就是为什么即使单芯片性价比接近,客户仍然选择 NVIDIA 的核心原因——切换成本不在芯片里,在软件里。
"十七个栈"的陷阱
如果为不同工作负载(大模型训练、小模型推理、长上下文、短上下文、多模态……)各做一套定制化栈,每个栈都需要独立维护、测试、安全更新。NVIDIA 的策略是用一个通用 CUDA 栈覆盖全部场景——每次更新惠及所有部署,运维成本按机队规模摊薄而非线性增长。
灵活 > 极致效率
黄仁勋承认统一架构会牺牲一些理论效率——对特定工作负载做定制优化确实能跑更快。但他认为 AI 模型变化太快,"最优化"的系统六个月后就可能变成"次优"。保留通用性意味着用小幅即期损失换取大幅长期价值——这对习惯"跑分决定一切"思维的硬件评测人来说是反直觉的。
Tom's Hardware 报道其明显含义是,NVIDIA 正在将持久性(durability)置于专精化(specialization)之上。系统被设计为在其生命周期内处理广泛的推理工作负载,而非在某个时间点的单一快照上表现卓越。
黄仁勋"模型的规模每年增长 10 倍。生成的 token 数量每年增长 5 倍,"黄仁勋解释说,随后补充道,"如果你静止不动两年或三年,考虑到技术发展的速度,那就太久了。"
10 倍/年 的模型膨胀
如果模型参数量每年增长 10 倍:2024 年的 1.8 万亿参数(GPT-4 级)→ 2025 年 ~18 万亿 → 2026 年 ~180 万亿。token 生成量每年增长 5 倍意味着推理算力需求是两者的乘积——每年增长约 50 倍。这解释了为什么超大规模客户的 CapEx 年年创新高。
"两三年太久"
传统服务器的折旧周期通常是 5-7 年,有些甚至更长。黄仁勋暗示 AI 加速器的有效生命周期远短于此——不是因为硬件物理损坏,而是因为新模型架构对硬件的需求变化太快。这实际上在为 NVIDIA 的"一年一代"节奏(Hopper → Blackwell → Vera Rubin → Feynman)做合理化论证。
Tom's Hardware 报道黄仁勋还谈到了开放模型的崛起,并讨论了他如何看待它们作为推理需求日益增长的推动力。
黄仁勋"去年最大的惊喜之一是开放模型的成功。它们真的起飞了,以至于今天每生成四个 token 中就有一个来自开放模型,"黄仁勋说。
Tom's Hardware 报道开放权重模型降低了整个部署栈的摩擦,使实验变得更便宜。它们还缩短了迭代周期,允许超大规模企业之外的组织以有意义的规模部署推理。这不仅仅是多元化了谁在运行 AI 模型,而且实质性地改变了推理运行的频率和运行的地点。
Tom's Hardware 报道从 NVIDIA 的角度来看,重要的不是模型是专有的还是开放的,而是它创造了多少推理活动。开放模型倾向于在更广泛的环境中扩散——从企业集群到区域云服务商和本地部署。
四分之一是开放模型
到 2026 年 1 月,开放模型(以 Meta Llama 3.x、Mistral、Qwen 等为代表)已占全球推理 token 生成量的 25%。一年前这个比例还远低于此。增长主要来自企业自建推理和中小云厂商部署——这些场景此前被闭源 API 的高定价挡在门外。
NVIDIA 为何不怕开源
开放模型表面上减少了对 OpenAI/Anthropic 等闭源 API 的依赖,但每一次本地部署都需要 GPU。调用 OpenAI API 时,GPU 是 Microsoft 买的;自己跑 Llama,GPU 得自己买。所以开放模型的成功直接转化为 NVIDIA 的更多硬件销售——"用谁的模型我无所谓,只要跑在我的 GPU 上"。
Tom's Hardware 报道每一个单独部署的规模可能更小,但聚合效应是总 token 量的扩张。更多端点更频繁地生成 token 推动了对计算、网络和内存的持续需求,即使每个部署的平均利润率更低。
黄仁勋"这极大地推动了对 NVIDIA 和公有云的需求,这解释了为什么现在 Hopper 在云端的价格实际上在上涨。"
Tom's Hardware 报道开放模型通常运行在最大的超大规模环境之外,但它们仍然需要高效、可靠的硬件。通过专注于系统级效率和正常运行时间,NVIDIA 正在将自己定位为服务更广泛的推理场景,而无需单独的产品线。
Tom's Hardware 报道归根结底,黄仁勋的评论表明 NVIDIA 将开放模型视为对其业务的补充。它们扩大了市场而不是蚕食市场——前提是底层基础设施能够高效地支持它们。
黄仁勋"总的来说,全世界正在产生的需求确实相当可观。"
Hopper 涨价了
按常理,新一代 Blackwell 发布后,上一代 Hopper(H100/H200)的云端租赁价格应该下降。但黄仁勋说价格反而在涨。原因:开放模型爆发带来的推理需求增长速度超过了新增供给。这是 NVIDIA 最强有力的需求论证——连过时产品都供不应求,何况新品。
做大蛋糕 > 分蛋糕
NVIDIA 面对开放模型的态度堪称教科书式的平台策略:不关心谁赢了模型层的竞争(OpenAI vs Meta vs DeepSeek),因为无论哪方获胜,都在 NVIDIA 的 GPU 上跑。这类似于 iOS/Android 之争中高通的位置——参与所有阵营,不下注任何一方。对投资者而言,AI 模型层的开放化竞争实际上在加固而非削弱 NVIDIA 的基础设施垄断地位。
Tom's Hardware 报道纵观关于 Rubin、功率交付、推理经济学、开放模型和地缘政治的讨论,黄仁勋的评论描绘了一幅一致的画面:NVIDIA 正在为保持高产出、容忍故障、在真实约束下高效运转的系统做优化。峰值性能仍然重要——它永远都重要——但它看起来不再是唯一的驱动因素。
运营效率成新壁垒
全场问答的隐含信息:AI 基础设施正在从"建设期"进入"运营期"。建设期的竞争看谁的芯片最快、谁能最先拿到台积电产能;运营期的竞争看谁的系统最稳、维护最省、每瓦产出最多。NVIDIA 正在用系统设计(模块化、功率平滑、统一栈)把竞争维度从"芯片跑分"拉到"全栈运营效率"——而在后者的赛场上,它的领先幅度远大于芯片本身。
五条核心要点
- 运营效率取代峰值性能成为核心指标。黄仁勋把大部分 Q&A 时间用来谈宕机、维修和功率管理,而非跑分。Vera Rubin 的设计核心是模块化热插拔(五分钟组装、零线缆、在线维护),目标是让机架在故障不可避免的现实下最大化正常运行时间。
- 功率瓶颈比算力瓶颈更紧迫。AI 系统的瞬时功率飙升可达 25%,迫使数据中心过度配置 25% 的供电能力。Rubin 的片上功率平滑技术旨在消除这一余量,让同一座数据中心的有效算力"免费"增加 25%。
- "芯片只卖一次,软件维护一辈子"——CUDA 护城河的本质。NVIDIA 选择统一软件栈覆盖全场景,牺牲针对特定工作负载的极致效率,换取长期灵活性和运维成本摊薄。AI 模型每年增长 10 倍、token 量增长 5 倍的速度让专精化系统很快过时。
- 开放模型做大蛋糕而非蚕食蛋糕。每四个推理 token 中已有一个来自开放模型,但这些部署全部需要 GPU。开放模型使推理从集中在少数超大规模客户扩散到企业和区域云,总需求大增——连上一代 Hopper 的云端价格都在涨。
- AI 基础设施从"建设期"转入"运营期"。竞争维度正从"谁的芯片最快"转向"谁的系统最稳、维护最省、每瓦产出最多"。NVIDIA 正在将竞争壁垒从单点性能扩展为全栈运营效率——在这个维度上,其领先幅度远大于芯片本身。