AI产业链地图·知识库 公司深度研究 · AMD
🚧 网站建设中 → 产业链图谱
AMDAMD.US
0/2
公司深度研究 · AMD AMD.US

三门稳生意,一门大赌注:市场为那个赌注付了 4,000 亿美元

从一个 AI 机架的钱怎么分讲起,把这家公司拆到你能自己算出「市场在为哪一部分定价」 —— 五个单元,节节带测验

主角是一家在主战场上明确处于劣势的公司:数据中心 GPU 份额还不到 5%,市盈率却有 121 倍。它的四个分部里三个是稳的、一个是赌的——而 AMD 为了这个赌注,把公司近 20% 的股权当成产品折扣发给了两个客户。

5 个单元 · 每节 1 个主题 + 5 道题即时反馈 · 全部做完出成绩单(低于 60 分的节次标红,可一键跳回重读) · 正文里带虚线的词点开即看知识库词条 · 默认你懂金融、但对这个行业一无所知

Unit 01 / 05

CPU 和 GPU:两门被装进同一个分部的生意

从一个 AI 机架讲起,看清楚这两门生意的经济学有多不一样,以及一台机器的钱都被谁分走了。

阅读 约 25 分钟分节 4 节测验 20 题(每节 5 题)

这一单元不谈估值,只做一件事:AMD 财报里那个叫「数据中心」的筐打开。读完你会知道中央处理器和图形处理器为什么是两门完全不同的生意——一个是数据中心的必需品、份额稳定爬升,另一个是高增长但至今份额不到 5% 的挑战者,而它们被记在同一行收入里。你还会知道怎么读一张 AI 加速卡的规格表——为什么「标称算力是对手的 4 倍」这句话几乎没有信息量,以及为什么 AMD 每卖出一台机器,都要给自己的竞争对手 Broadcom 付两次钱

一.1

两门生意,一个筐

AMD 财报里最大的那一行,装着两件经济学完全相反的东西

约 7 分钟·2,003 字·5 题
01

先看一张最普通的财报表

四行数字,藏着这门课全部的问题

我们从 AMD 2026 年第二季度的分部收入开始。这是一张任何人都能在财报里找到的表, 没有任何玄机——但正是这张表,决定了后面十六节要讲什么。

分部2026Q2 收入占比这门生意在卖什么
Data Center 数据中心$67.18 亿58.2% 服务器用的中央处理器(EPYC)+ 人工智能加速卡(Instinct)
Client 客户端$30.62 亿26.5%个人电脑用的中央处理器(Ryzen)
Gaming 游戏$7.79 亿6.8%游戏主机芯片、独立显卡
Embedded 嵌入式$9.77 亿8.5%工业、通信、汽车用的可编程芯片
合计$115.36 亿100%同比 +50.1%,环比 +12.5%

先记住那个 58.2%。这家公司近六成的收入来自「数据中心」这一行, 所以市场对 AMD 的全部想象,基本都压在这一行上。

但问题恰恰在这里:这一行是一个筐。里面装着两样东西, 它们都是「硅」,都卖给数据中心,会计上被记在同一行—— 可是从赚钱的方式、增长的确定性、到毛利率的方向,它们几乎是相反的。

如果你不把它们分开,就会犯下读这家公司最常见的错误: 用其中一门生意的坏消息,去否定另一门生意的好消息,反过来也一样。

02

CPU:数据中心的必需品

核少、每核强,擅长有先后依赖的复杂逻辑

CPU(中央处理器)是通用计算的大脑。它的物理特征是核心数量少、但每个核心很强, 适合处理那种「必须一步做完才能做下一步」的任务——跑操作系统、管数据库、调度网络和存储。

这门生意有一个非常好的属性:它是必需品。哪怕一台服务器上塞满了昂贵的 AI 加速卡, 也仍然要配中央处理器,因为总得有人负责把数据喂给那些加速卡、管理它们、和外界通信。 你可以不买 AI 加速卡,但你不可能不买 CPU。

服务器 CPU 市场长期是 Intel 和 AMD 的双寡头。而过去五年, 这个双寡头之间发生了一件缓慢但极其稳定的事——份额在持续转移。

年份202120222023202420252026E2027E2028E
AMD 服务器 CPU 份额12%17%21%23%24%26%28%30%

请注意这条曲线的形状:它没有一年是往下走的。 从 12% 到 24%,用了四年时间翻倍;机构预测到 2028 年达到 30%。

这种「每年挪一两个百分点、连续五年不回头」的份额曲线,在投资上有一个特别的含义: 它是所有增长故事里确定性最高的一类。因为它背后不是某个爆款产品, 而是产品力的持续代际领先——客户换机器时一批一批地改换门庭,换过去就很难换回来。

03

GPU:高增长,但份额还不到 5%

核多、每核弱,擅长同一件事同时做几千遍

GPU(图形处理器)原本是为了画图设计的。画一帧游戏画面,要同时算几百万个像素的颜色, 每个像素的计算都很简单、而且互不依赖——所以 GPU 的设计思路是塞进去几千个弱小但同时干活的核心

这个特征后来被发现恰好命中了神经网络的数学结构(大量的矩阵乘法), 于是 GPU 从「显卡」变成了「AI 算力的主力」。今天 AI 数据中心里真正的大钱,在这里。

但 AMD 在这个战场上的位置,和它在 CPU 战场上完全不同: 截至 2025 年,AMD 的数据中心 GPU 份额还不到 5%

这就是这门课和前十六门最大的不同

前面十六门课的主角,要么是各自战场的赢家(NVIDIA台积电Broadcom), 要么占着一个别人进不来的独特位置。

AMD 是唯一一个在主战场上明确处于劣势的主角—— 份额不到 5%,软件生态落后,硬件靠堆料。但市场给了它 121 倍的市盈率 (2026-08-12 的滚动十二个月口径)。

这门课要回答的核心问题就是:这 121 倍里, 哪一部分是为那三门稳生意付的,哪一部分是为这个赌注付的?第 16 节会给出一个具体的数字。

04

把两门生意并排放,差别一目了然

同一个分部,两种命运

对比项服务器 CPU(EPYC)AI 加速卡(Instinct)
当前市场地位双寡头之一,份额 24%(2025)挑战者,份额 <5%(2025)
份额趋势连续五年上升,无一年回落基数极低,波动取决于大客户订单
需求驱动企业换机 + 智能体工作负载大模型训练与推理的资本开支
对毛利率的影响顺风(管理层口径)逆风(略低于公司平均)
竞争壁垒指令集生态 + 五代架构积累软件生态落后,硬件靠更贵的制程和封装
确定性

看完这张表,再回头看第一张表里那个 67.18 亿美元,感觉应该完全不一样了: 它不是一个数字,是两个数字被加在了一起,而这两个数字的性质截然相反。

更麻烦的是,AMD 官方并不披露这两块各占多少。所以想知道答案,只能自己推。 第 14 节我们会用三条公开信息把它反推出来——先剧透一个结论: 至少在 2026 年,这个筐里 CPU 比 GPU 还大。

这个结论会让很多人意外,因为市场把 AMD 当成一只「AI 加速卡股」在交易, 股价跟着 Helios 机架的消息上下波动。但从收入结构上看, 它现在仍然主要是一家卖中央处理器的公司。

05

一个反直觉的新变量:AI 反过来在拉动 CPU

智能体越多,中央处理器越不够用

传统认知里,AI 的兴起对 CPU 是中性甚至偏负面的——预算都被 GPU 抢走了。 但 2026 年出现了一个新变量,几家研究机构几乎同时指向它。

关键词是 智能体 AI。 它和「问一句答一句」的聊天机器人不同:一个智能体接到任务后,会把它拆成几十上百步—— 读文件、调用工具、跑一段代码、等结果回来、再决定下一步做什么。

而这些步骤里,有大量是串行的、逻辑分支复杂的、在等输入输出的。 这正是中央处理器擅长、而图形处理器不擅长的形态。 换句话说:每多一个真正跑在生产环境里的智能体,就多一份 CPU 需求。

这个判断有多硬

它不是某一家的孤证。美国银行 2026 年 4 月的报告标题直接就叫 《CPU 重生——智能体驱动增长》,6 月又出了一篇《智能体崛起,上调 CPU 市场规模》; 国内券商也在 5 月给出了同方向的服务器 CPU 市场规模测算。

更硬的证据是价格。已有研究提到 CPU 进入了涨价周期—— 注意是涨价,不只是放量。在一个双寡头市场里,涨价通常意味着供需关系发生了实质变化。

管理层自己的口径也很激进:服务器 CPU 收入 2026 年增长超过 80%、2027 年在更高的基数上再增长超过 70%; 整个服务器 CPU 市场规模到 2030 年的复合年增长率约 50%

如果这些数字成立,那么本节开头那个「确定性高、增速平稳」的印象要修正一下: 这门老生意现在既确定、又高速。而它在市场的叙事里几乎是隐形的。

这一节埋下的三个伏笔

① 这个筐到底怎么拆——第 14 节用三条公开信息反推,并做加总校验。

② 为什么 AI 加速卡是毛利率逆风——第 2 节和第 4 节会给出物理层面的原因, 它比「新产品良率低」这个常见解释要结构性得多。

③ 那 121 倍市盈率里,为「赌注」付了多少——第 16 节给出具体数字。

这一节要带走的一句话 AMD 财报里最大的一行叫「数据中心」,2026 年第二季度收入 67.18 亿美元,占公司总收入 58.2%。但这一行里装着两门生意:服务器 CPU(份额连涨五年、毛利率顺风、确定性高)和 AI 加速卡(份额还不到 5%、毛利率低于公司平均、确定性低)。把它们混着看,会得出完全错误的结论——整门课都在处理这件事带来的后果,第 14 节会用三条公开信息把这个筐彻底拆开。

检验一下:两门生意,一个筐

5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。

一.2

一台机器的钱,都被谁分走了

AI 算力已经不按「一张卡」卖,而是按「一个机架」卖

约 6 分钟·1,897 字·5 题
01

先纠正一个过时的印象

今天没人「买一张卡」了

很多人对 AI 芯片的想象还停留在「买一张显卡插进机箱」。这个画面在 2020 年还算准确, 今天已经完全不对了。

原因是模型太大了。一个前沿模型的参数放不进任何一张卡的显存,必须拆开放在几十张卡上, 而这几十张卡在计算过程中要频繁地互相交换中间结果——频繁到什么程度? 频繁到「卡与卡之间的通信速度」变成了比「单张卡算得多快」更关键的瓶颈。

于是整个行业的售卖单位变了:从「一张卡」变成了「一个机架」—— 几十颗芯片连同交换机、电源、液冷管路一起,作为一个整体交付。 这是理解今天 AI 硬件生意的第一个前提。

02

AMD 的机架长什么样

Helios:72 颗加速卡 + 18 颗 CPU + 12 颗交换芯片

项目Helios(AMD)GB300 NVL72(NVIDIA 上一代)VR NVL72(NVIDIA 新一代)
加速卡数量72 颗 MI455X72 颗72 颗
中央处理器18 颗 VeniceGraceVera
标称密集算力(每卡)20,000 TFLOPS5,00017,500
单卡显存432GB(12 层堆叠)288GB288GB
单卡显存带宽23.3 TB/s8.0 TB/s22.2 TB/s
单卡功耗2,500W1,400W2,300W
整机全包功耗约 257kW约 153kW约 236kW
单卡总持有成本$3.10 / 小时$2.32 / 小时$3.62 / 小时

第一眼看这张表,AMD 是全面领先的:算力是上一代对手的 4 倍,显存多 50%,带宽也最高。 很多多头论证就是从这张表出发的。

但这张表最重要的信息其实在最后两行。整机功耗 257 千瓦—— 这是一台机器的功耗,相当于几十户家庭的用电。而单卡每小时的总持有成本 3.10 美元, 比上一代对手的 2.32 美元贵了三分之一。

换句话说:AMD 提供了更强的标称性能,同时也消耗了更多的电、花掉了更多的钱。 到底划不划算,取决于那个「标称」有多少能兑现——这是第 3 节的全部内容。

03

这台机器的钱,分给了谁

把产业链摊开看

下面这张图把 AMD 在产业链上的位置摊开。看的时候请特别注意上游那一格里出现的 Broadcom—— 它同时是 AMD 的供应商和竞争对手,这个双重身份会在第 4 节引出一个结构性的问题。

上游 A · 制造与封装 —— AMD 没有自己的工厂,这一格全靠外部
先进制程晶圆 ← 最大的单项成本MI455X 的计算芯片和 Venice 处理器都用台积电 2 纳米,是全球首批采用者。领先一档的代价是更贵、良率爬坡更险,而且议价权在代工厂那边
先进封装 ← 产能是全行业硬约束MI455X 用 5.5 倍光罩尺寸的 CoWoS-L,是目前最大的商用封装;还是唯一采用 SoIC-X 混合键合的产品。⚠️ 封装产能要和英伟达抢,拿到多少直接决定能出多少货
上游 B · 存储与互连 —— 这一格藏着 2027 年最大的毛利率变量
高带宽存储 ← 单卡 12 层堆叠、432GB⚠️ 2027 年存储厂商要把这块的利润率追平普通内存,涨价几成定局。AMD 能转嫁,但加成率低于公司平均毛利率——所以转嫁本身就会拉低整包毛利率
SK海力士 三星电子 美光(存储三雄之一)
机内交换与信号中继 ← 本节最该记住的一格⚠️ AMD 没有自研交换芯片,只能买 Tomahawk 6;又因为信号电路偏弱,每台机器还要额外买 550 颗以上的重定时器。同一个供应商,同时是定制芯片战场上的对手(第 4 节详解)
机间网络 ← 约 8,000 美元 / 每卡机架与机架之间的连接,靠光模块和交换机。这一格的钱不归 AMD,但它决定了一个集群能建多大
中际旭创 300308 白盒以太网 / Arista 等方案
AMD AMD.US
服务器 CPU(EPYC,份额连涨五年)+ AI 加速卡(Instinct,份额 <5%)
2026Q2 数据中心分部收入 $67.18 亿 · 占公司总收入 58.2%
同层 · 两条战线上的对手,性质完全不同
通用加速卡赛场 ← AMD 是挑战者数据中心 GPU 份额不到 5%。硬件规格已经可比,差距在软件生态和系统协同设计上(单元二整个单元讲这件事)
中央处理器赛场 ← AMD 正在系统性获胜份额从 2021 年 12% 升到 2025 年 24%,连续五年无回落。这是全公司确定性最高的一块
定制芯片赛场 ← 第二条战线大客户自己设计专用芯片,直接挤压通用加速卡的份额。⚠️ 这条战线上的主要玩家之一,正是 AMD 在上游必须依赖的那家供应商
下游 · 四个买家决定这门生意的成败
签了股权协议的两家 ← 单元四的主角各签约 6 吉瓦采购,同时各获得最多 1.6 亿股、行权价 1 美分的认股权证。⚠️ 这两家的订单是「激励」不是「承诺」——可在多个里程碑退出
没有股权协议就下单的两家 ← 更硬的信号微软 2023 年曾放弃 AMD、连跳两代,如今调头部署新机架;Anthropic 公开宣布部署 2 吉瓦。⚠️ 不拿权证的客户下单,才是产品力本身的证据(第 17 节列为首要跟踪项)
04

毛利率沿着这条链怎么分布

一个反复出现的规律

把上面那张图上的各环节按毛利率排一下,会看到半导体行业一个反复出现的规律: 越靠近「稀缺的能力」,毛利率越高;越靠近「可替代的制造与组装」,毛利率越低。

环节谁在收钱毛利率量级AMD 的处境
先进制程晶圆台积电首批用 2 纳米,拿不到议价权
先进封装台积电产能要和对手抢
高带宽存储存储三雄周期性极强2027 年涨价,只能部分转嫁
机内交换 + 重定时Broadcom无替代供应商
机间网络光模块厂等约 8,000 美元 / 每卡
机架组装代工厂个位数AMD 2025 年主动卖掉了这块
整机销售AMD略低于公司平均 56%管理层口径
注意最后一行的措辞

管理层的原话是:AI 加速卡的毛利率略低于公司平均水平,并预期随着机架良率提升会改善

前半句是事实,后半句是预期——而且这个预期只对了一半。 良率确实会提升,但压制毛利率的因素里,至少有两个和良率无关: 一个是存储涨价(周期问题),一个是必须外购交换和重定时(架构问题)。

良率提升解决不了架构问题。这是第 4 节要展开的核心判断。

最后留意一个容易被忽略的细节:那个「机架组装、毛利率个位数」的环节,AMD 曾经买下来过,然后立刻卖掉了。

2025 年 3 月它花 44 亿美元收购了一家做数据中心基础设施的公司,两个月后就把其中的 制造业务以 30 亿美元转手卖出。它要的是设计能力和交付团队,不要工厂。

这个动作和它 2009 年卖掉自己的晶圆厂,是同一种思路——只保留高毛利、可复用的能力, 把重资产、低毛利的环节推给别人。第 10 节会完整讲这笔交易, 以及为什么说「没有这一买一卖,就没有 Helios」。

这一节要带走的一句话 AI 算力现在按机架卖:AMD 的机架产品叫 Helios,一台里面装 72 颗加速卡、18 颗中央处理器、12 颗交换芯片。这台机器的钱分给了一长串公司:台积电拿制程和封装、SK海力士等拿高带宽存储、Broadcom 拿交换和信号中继、光模块厂拿网络——AMD 自己拿的是整机溢价关键结论:加速卡这门生意的毛利率略低于公司平均,而且 2027 年还有一个已知的下压因素(存储涨价)——第 4 节讲清楚为什么。

检验一下:一台机器的钱,都被谁分走了

5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。

一.3

规格表上最没用的那个数

标称算力是对手的 4 倍,有效算力却更低——这中间发生了什么

约 6 分钟·1,654 字·5 题
01

先讲一个类比

标称油耗和实际油耗

买车的人都知道,厂商标的百公里油耗和你自己开出来的油耗,几乎从来对不上。 原因不是厂商造假,而是标称值是在理想工况下测出来的—— 恒定车速、平坦路面、没有空调、没有堵车。

芯片的算力标称值也是一样的道理。厂商标的是理论峰值: 假设所有计算单元一刻不停地满负荷工作、数据永远及时到位、没有任何等待。 现实中这个假设从来不成立。

业内用一个专门的指标来描述这件事:模型浮点利用率。 公式很简单——有效算力 ≈ 标称算力 × 利用率。 而不同芯片的利用率可以差得非常远,这正是本节要讲的东西。

02

把两个数放在一起看

标称领先 14%,有效落后 16%

整机指标(每台机架 72 颗芯片)Helios(AMDVR NVL72(NVIDIA 新一代)谁领先
标称密集算力(整机合计)1,4401,260AMD 领先 14%
有效训练算力(第三方折算)476.8567.0NVIDIA 领先 19%
隐含的利用率33.1%45.0%差距在这里
整机全包功耗约 257kW约 236kWNVIDIA 更省

这张表是本节的全部。同一台机器,用两把不同的尺子量,排名会反过来。

标称算力上 AMD 领先 14%,是它所有宣传材料的基础; 但把利用率折算进去之后,有效算力反而落后 19%。 中间那一行「隐含利用率」是两者相除得到的:33.1% 对 45.0%

更值得注意的是提供这组折算的机构的态度。它是全球对 AMD 软件栈跟踪最深的第三方之一, 自称连续多个季度是 AMD 的头号缺陷提交者——而它在报告里明确写道: AMD 历史上倾向于高报理论算力规格,实际可达的利用率相当低。

这不是在说 AMD 造假

标称算力的算法是公开的、可复算的,AMD 没有虚报。问题在于这个数字本身信息量很低。

利用率取决于什么?取决于软件能不能把计算单元喂饱—— 算子库有没有针对这颗芯片调优、数据搬运和计算能不能重叠、多卡之间的通信会不会让计算单元空等。 而这些恰恰是单元二要讲的软件生态问题。

所以「硬件已经追上、只差软件」这个流行说法是不准确的: 软件不行的后果,会直接体现在硬件的有效性能上。它们不是两件事。

03

AMD 的领先是买来的,不是设计出来的

用更多的硅,换温和的性能优势

为了拿到那个「标称领先 14%」,AMD 付出了什么?看一下这颗芯片的物料清单。

技术选择AMD MI455X业界状况
逻辑制程台积电 2 纳米,全球首批所有竞品加速器平台仍在 3 纳米
封装尺寸5.5 倍光罩CoWoS-L,业界最大——
三维堆叠唯一采用 SoIC-X 混合键合其他家未采用
单封装逻辑硅面积3,470 平方毫米单封装出货量中最大
高带宽存储12 层堆叠、432GB对手 8 层、288GB
桥接技术业界首颗采用有源局部硅互连此前均为无源

这一串「第一」「最大」「唯一」看起来很像技术领先。但第三方机构给出的评语相当不客气: 这些性能优势相对于多出来的硅含量而言其实相当温和,根源是 AMD 在芯片微架构设计上对 NVIDIA 的欠账。 原文甚至说,AMD 是被迫在硅上激进,用来弥补这个缺陷

这句话的分量很重,值得拆开理解。它的意思是: 同样一块硅,NVIDIA 能榨出更多有效性能;AMD 榨不出来,只好多用硅。

而「买来的领先」和「设计出来的领先」在投资含义上完全不同: 买来的领先成本更高(更贵的制程、更大的封装、更多的存储),而且可以被对手复制—— 对手只要愿意付同样的成本,随时可以把这个差距抹平。它不构成护城河。

04

换算到钱上:一个会反转的结论

同一组数据,两种算法,两个相反的答案

现在把算力换算成成本。行业通用的口径叫 总持有成本——买下并运行一台机器的全部代价, 包括设备摊销、资金成本、电费、托管和运维。

下面这张表是本节最有价值的东西:同一组总持有成本数据, 分母用标称算力还是有效算力,得出的结论完全相反。

口径Helios(AMD)GB300(上一代)VR NVL72(新一代)结论
每卡每小时总持有成本$3.10$2.32$3.62AMD 居中
每单位标称算力的小时成本$0.16$0.46$0.21AMD 大幅领先
每单位有效算力的小时成本$0.47$0.93$0.46优势消失,NVIDIA 略胜

看中间那一行,AMD 的每单位算力成本只有上一代对手的三分之一,比新一代对手也低两成半—— 这是所有看多论证里最漂亮的一个数字。

再看下面那一行:换成有效算力后,0.47 对 0.46,优势不是缩小,是没了。

这就是为什么本节要专门讲「怎么读规格表」。你会在无数报告和社交媒体上看到中间那一行, 但很少看到下面那一行——而两行用的是同一份原始数据,区别只在于分母选了哪个。

给读者的一条可迁移的方法

以后看到任何「每单位算力成本」「性价比领先几倍」的说法,先问一句: 分母是标称还是有效?

如果对方答不上来,或者只给了标称口径,那这个结论就不能直接用于比较。 这不是吹毛求疵——本节的例子里,两种口径给出的是方向相反的答案。

同样的方法适用于本课后面的每一个数字。第 16 节我们会用它来检查一个估值结论。

最后要公平地说一句:这不意味着 Helios 是一台差机器。 它的有效算力成本和 NVIDIA 新一代基本持平(0.47 对 0.46),这本身已经是巨大的进步—— 要知道两年前 AMD 在这个对比里还差着一个量级。

真正的问题在别处:如果性价比只是「持平」,那么客户为什么要冒软件生态不成熟的风险去换供应商? 答案在单元四——因为 AMD 给了一个持平之外的东西:股权。

这一节要带走的一句话 读 AI 芯片规格表的第一课:标称算力几乎没有信息量,真正该看的是「标称 × 实际利用率」得到的有效算力MI455X 标称密集算力是上一代对手的 4 倍,但按第三方折算后,整机有效训练算力 476.8,反而低于 NVIDIA 新一代的 567换算到成本上,结论会反转:按标称算力算,AMD 的每单位算力成本只有对手的三分之一;换成有效算力,这个优势完全消失——这就是为什么规格表要读两遍。

检验一下:规格表上最没用的那个数

5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。

一.4

每卖一台机器,给对手付两次钱

一个良率提升永远解决不了的结构性问题

约 6 分钟·1,740 字·5 题
01

先理解机架内部的两种网络

纵向扩展和横向扩展

第 2 节说过,AI 算力按机架卖,因为芯片之间要频繁交换数据。但「交换数据」这件事, 其实分成性质完全不同的两层,成本和技术难度差一个量级。

纵向扩展与横向扩展—— 前者指一个机架内部、几十颗芯片之间的超高速互连, 要做到任何一颗芯片都能像读自己的显存一样去读别人的显存; 后者指机架和机架之间的网络,速度要求低一两个数量级。

难的是前者。它决定了「一台机器最大能有多大」,也是整个 AI 硬件里技术含量最高、 最需要软硬件协同设计的一环。而 AMD 恰恰在这一环上没有自己的产品。

02

第一次付钱:交换芯片只能外购

因为市面上只有一家能做

Helios 机架里有 12 颗交换芯片,负责把 72 颗加速卡两两连通。这 12 颗芯片, AMD 全部买自 Broadcom

为什么不自己做?因为做不出来,而且短期内也没有第二个卖家。第三方分析明确指出: Broadcom 是目前唯一一家出货这个速率等级交换芯片的商用供应商,所以 Broadcom 是 AMD 唯一的选择。

AMD 走的是开放互连标准路线, 宣传上说这能带来「更广泛的生态和更多供应商选择」。理论上确实如此,实际上目前只有一家。NVIDIA 走的是自研专有路线,交换芯片是自己设计的。

开放标准的代价,在这里第一次显形

第三方分析给了一个很具体的例子:一颗交换芯片总共有 512 条通道, 但 Helios 只用得上其中 432 条,剩下 80 条闲置——因为这颗芯片不是为 72 颗加速卡的架构量身定制的, AMD 只是用了市面上唯一买得到的那颗

对照 NVIDIA:它的交换芯片规格是按 72 颗芯片的需求专门设计的, 带宽被整除、一条通道都不浪费

这就是「协同设计」和「买现成的」之间的差别—— 它不体现在任何一张规格表上,只体现在有多少资源被白白浪费掉。

03

第二次付钱:550 颗信号中继芯片

本节最该记住的一个数字

接下来是更麻烦的一件事。芯片之间靠铜缆传信号,而高速信号在铜缆上会衰减。 衰减到一定程度,接收端就分辨不出 0 和 1 了。

解决办法有两个:要么把信号发得足够干净、让它撑到终点, 要么在半路上加一颗芯片,把衰减的信号重新整形。 后者叫重定时器

发信号的电路叫串行解串器。 而 AMD 的这个电路——按第三方的评估——是它公认的弱项。

对比项AMD HeliosNVIDIA 对应机架
机内交换芯片外购 Broadcom,12 颗自研
交换芯片通道利用512 条里只用 432 条按需定制,无浪费
背板是否需要信号中继约 85% 的链路需要完全无源,零颗
每台机器的中继芯片数量550 颗以上0
中继芯片的供应商Broadcom不适用
机内铜互连物料成本约 $68,928 / 台——

请盯住「550 颗以上」和「零颗」这一对数字。这 550 颗芯片不提升任何性能—— 它们不让机器算得更快,只是让信号别出错。纯粹是补丁成本。

而且它们还要占电、占空间、增加装配复杂度。第三方分析写得很直白: 这些中继器会给整个系统增加额外的成本和功耗预算, 还会让服务器组装变得复杂,因为组装机架时调校所有这些中继器是一件非常繁琐的工作

回想第 2 节那个「整机功耗 257 千瓦,比对手高」的数字——现在你知道它的一部分来自哪里了。

04

还有一个设计选择,让事情更糟

1,728 根飞线

Helios 的内部布线用了一种叫「飞线」的做法——不走电路板走线,而是用一根根独立的线缆连接。 好处是信号完整性更好,坏处是可维护性差、影响散热,而且装配困难

规模有多大?光是交换机托盘那一侧,就有 1,728 根线缆需要从背板连接器布到交换芯片周围。 每一根都是装配环节的一个潜在失效点。

最有讽刺意味的是:NVIDIA 上一代产品也用过飞线,正是因为吃过苦头, 新一代已经改成了无线缆设计。而 AMD 是参考 NVIDIA 上一代的架构做的 Helios—— 等 NVIDIA 宣布改用无线缆时,AMD 已经来不及改了。

于是第三方给出了这样一个判断

它把「机架量产爬坡慢」列为 AMD 面临的两大风险之首,理由是三条: 没有采用无线缆托盘设计、高达 85% 的背板需要信号中继、以及机架量产过程中遇到的背板可靠性挑战。

原文用了一个很形象的说法:AMD 正在经历「机架量产地狱」

05

为什么说这是架构问题,不是良率问题

本节最重要的一句话

第 2 节留了一个伏笔:管理层说加速卡毛利率「随着机架良率提升会改善」。现在可以把它讲完了。

良率提升能解决的是「做十台坏三台」这类问题——熟练了、工艺稳定了, 坏的比例就下降,成本自然降。这确实会发生。

但良率提升解决不了「每台都要装 550 颗中继芯片」这个问题。 无论良率多高,这 550 颗都得买、都得装、都得供电。 它的根源在于信号电路的设计能力不足,要解决它必须等下一代甚至下下代的自研电路, 或者等 AMD 自己做出交换芯片——那是以年为单位的事。

所以对这条毛利率逆风,正确的预期是:它会长期存在,而且它的受益方是 AMD 在另一个战场上的对手。

把三节的线索接起来

第 2 节:加速卡毛利率略低于公司平均,而存储 2027 年还要涨价。

第 3 节:性能优势是靠更贵的制程、更大的封装、更多的存储买来的。

第 4 节:还要给对手付两次钱,而且这部分成本和良率无关。

三条合起来是同一件事:AMD 这门加速卡生意, 在成本结构上天然比对手吃亏。它能不能成,不取决于硬件——硬件已经堆到极限了—— 而取决于软件生态能不能把有效算力提上来,以及客户愿不愿意为「第二供应商」本身付溢价。 这正是单元二和单元四要回答的两个问题。

这一节要带走的一句话 AMD 没有自研的机内交换芯片,只能买 Broadcom 的——这是第一次付钱。又因为它的高速信号电路偏弱,机内高达 85% 的链路需要额外加装信号中继芯片,每台机器 550 颗以上,同样只能向 Broadcom 买——这是第二次付钱。对照 NVIDIA:交换芯片自研,背板完全无源、一颗中继都不需要。而 Broadcom 同时是定制芯片战场上挤压 AMD 份额的对手。这是架构问题不是良率问题——良率提升解决不了它。

检验一下:每卖一台机器,给对手付两次钱

5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。

Unit 02 / 05

CUDA 是什么,它为什么正在搬家

全球跟踪 AMD 软件最深的第三方,三次改判自己的结论;而真正的战场已经换了地方。

阅读 约 20 分钟分节 3 节测验 15 题(每节 5 题)

这一单元回答全课最难的一个问题:AMD 能不能追上 NVIDIA」这个问题,到底该看什么指标。你会先搞懂所谓「CUDA 护城河」护的根本不是软件本身,而是「所有人的代码都已经写在上面了」这个既成事实;然后你会看到一家第三方研究机构如何把自己的判断从「0% 机会」一路改到「很大的成功机会」,以及它给出的三条可验证的理由——其中一条是人工智能编程代理本身正在削薄这条护城河。最后是这一单元真正的重点:护城河搬家了。战场已经从「单机跑得快不快」,移到了「多机分布式推理能不能稳定地组合起来工作」——而在这个新战场上,差距比旧战场大。

二.1

护城河护的不是软件

是「全世界的代码都已经写在上面了」这个既成事实

约 6 分钟·1,719 字·5 题
01

一个被说滥了、但很少被说清楚的词

「CUDA 护城河」到底是什么

只要讨论 AMD 能不能挑战 NVIDIA,一定会出现「CUDA 护城河」这个词。 但大多数讨论到此为止,没有再往下问一句:这条护城河具体是由什么构成的?

先说 CUDA 是什么: 它是 NVIDIA 2007 年推出的一套软件平台,让开发者能用接近 C 语言的方式给图形处理器写程序。 在它出现之前,想让显卡做通用计算,得把计算任务伪装成画图任务,极其别扭。

现在关键的问题来了:CUDA 之所以难以撼动,是因为它写得特别好吗?

不完全是。真正的原因平淡得多,也可怕得多:二十年下来, 全世界几乎所有的深度学习框架、算子库、推理引擎,它们的默认实现都是 CUDA 版本的。 一个研究者写论文的代码、一家公司的生产系统、一个开源项目的示例——默认都跑在 CUDA 上。

所以护城河的宽度可以被量化

如果护城河的本质是「所有人的代码都写在上面了」,那么它的宽度就等于:

把这些代码迁到另一个平台,需要多少工程师小时。

这个定义看起来平平无奇,但它有一个极其重要的推论: 护城河的宽度不是常数。它会随着「一个工程师小时能干多少活」而变化—— 如果有什么东西让迁移变便宜了,护城河就变窄了,而这跟 AMD 做对了什么没有关系。

第 6 节会告诉你,2026 年恰好发生了这样一件事。

02

AMD 的对应产品:ROCm

以及一段不太光彩的历史

AMD 对标 CUDA 的软件栈叫 ROCm。 它的历史相当不光彩,而且这段历史直接解释了今天客户为什么犹豫。

最有说服力的证据来自客户的行为。2023 年,微软在采购了 AMD 上一代加速卡之后, 放弃了 AMD——理由是两条:当时采购的高带宽存储不可靠,以及软件质量太差。 放弃的结果是,微软连续跳过了 AMD 后面两代产品。

这件事的分量要这样理解:微软是全世界最有能力自己评估软硬件的买家之一, 而且它有极强的动机去扶持 NVIDIA 之外的第二供应商——毕竟谁也不想只有一个卖家。 即便有这样的动机,它还是走了。

03

把「软件不行」翻译成具体的东西

三个可以检查的层次

「软件不行」是一句模糊的话。要判断 AMD 到底追到了什么程度, 必须把它拆成可以逐项检查的层次。业内实际用的是下面这三层。

层次问的问题怎么检查AMD 的现状
① 能不能跑新模型发布当天,这块卡能不能跑起来看社区有没有可用配方已基本解决
② 跑得快不快同样的模型,吞吐和延迟差多少看第三方跑分单机已接近对手
③ 稳不稳、能不能组合多种优化同时打开还能不能正常工作门禁测试的对等率差距最大的一层

第三层需要多解释两句,因为它是本单元的胜负手。

门禁测试指的是自动化测试里最硬的一档: 不通过就不允许把代码合进主干。它和普通测试的区别在于强制力—— 普通测试挂了可以先合进去以后再修,门禁测试挂了就是合不进去。

为什么只看这一档?因为厂商很爱展示「非门禁测试通过率 95%」这类数字, 但那个数字不阻止任何一行坏代码进入主干。 只有门禁的覆盖率和通过率,能说明软件质量的真实水位。

一个可以自己上网核对的数字

在 Kubernetes 推理场景下(这是全世界大多数推理部署实际使用的编排层), AMD 第一方网卡的门禁自动化测试,对 NVIDIA 对应产品的对等率是 0%

第三方特意说明了原因:这不是 AMD 的工程师不想做, 而是内部测试集群的容量投入不足,工程师被卡住了。 而且原定 2026 年某个时间点达成对等的计划,已经错过了

04

为什么第三层最难,也最重要

组合爆炸

第一层和第二层的难度是线性的:多支持一个模型、多优化一个算子,工作量可以估算。

第三层不是。它的难度是组合式的:一个真实的生产部署要同时打开好几项优化—— 某种数值精度、某种并行策略、某种推测解码、某种网络拓扑。 每一项单独都能工作,但它们两两、三三组合起来时,可能出现只在特定组合下才暴露的缺陷。

第三方报告里记录了一个非常典型的例子:某个模型在并发数为 64 时,准确率会从 94% 掉到 80% 左右, 而其他所有并发数都正常。更早还有过一个更严重的版本:同一条路径会 安静地输出「流畅但错误」的内容,评测得分直接为零—— 根源是某个计算核里一块内存没有初始化。

「安静地输出流畅但错误的内容」——这句话值得停一下

硬件崩溃、程序报错,这些都是好的失败——你立刻知道出事了。

而「跑得好好的,只是答案是错的」是最坏的一类失败。 在生产环境里,它可能几个月都不被发现。

这解释了一个经济学问题:为什么客户换供应商时如此保守。 省下的硬件钱是确定的,而承担的风险是「可能有一类你根本不知道自己踩上了的错误」。 这就是护城河真正的形状——它不是技术壁垒,是信任壁垒。

本节最后留一个引子。既然护城河的宽度等于「迁移需要多少工程师小时」, 那么它至少有两种被削薄的可能:

第一种,让工程师小时变得更便宜、更多。 如果有一种工具能让一个人干出十个人的活,护城河就窄了——这是第 6 节。

第二种,战场换了地方。如果竞争的关键从「已有代码能不能迁过来」 变成了「新出现的能力谁先做出来」,那么存量代码的优势就不再是决定性的—— 但这也可能对 AMD 更不利,因为新战场上大家都得从头做,而对手跑得更快。这是第 7 节。

这一节要带走的一句话 所谓「CUDA 护城河」,护的不是 CUDA 这个软件本身有多好,而是二十年下来「全世界的人工智能代码都写在它上面了」这个既成事实。所以这条护城河的宽度有一个可以量化的定义:把这些代码迁到别的平台,需要多少工程师小时这个定义很重要——它意味着护城河可能被两件事削薄:一是迁移成本下降(第 6 节:编程代理),二是战场本身换了地方(第 7 节)。

检验一下:护城河护的不是软件

5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。

二.2

从 0% 到「很大的机会」

一家公开记录过自己说错的机构,三次修改了同一个结论

约 7 分钟·2,218 字·5 题
01

先说为什么这家机构的判断值得单独讲一节

一个公开记录过「我曾经说 0%」的机构

市场上看多 AMD 的声音很多,看空的也不少。为什么本课要专门花一节, 讲一家第三方研究机构的观点变化?

因为它满足三个条件,而绝大多数研究做不到:

第一,它是一手的。这家机构自称是 AMD 每个季度的头号缺陷提交者, 日常使用 AMD 各代加速卡,有几十名 AMD 工程师在处理它提交的问题。 它的判断来自实际使用,不是来自调研纪要。

第二,它公开记录过自己的错误。它的第一篇 AMD 软件文章给出的结论是 「0% 的机会」——白纸黑字。一个愿意留下这种记录的机构, 后来的改口比一贯看多者的改口更有信息量。

第三,它改口的时机是逆向的。第二次改判(从 0% 上调到「有实质机会」) 发生在市场对 AMD 的情绪处于谷底的时候,当时多数人认为这个判断过于乐观。

02

三次改判的完整时间线

以及每次改判的理由

阶段结论当时的理由
第一篇 AMD 软件文章0% 的机会软件是坏的,进展乏味,看不到追赶的可能
《AMD 2.0》有实质机会领导层能推动改变(而非委员会式决策);公司终于意识到软件的重要性并有了紧迫感
2026 年 7 月最新一篇很大的成功机会三条理由,见下文。但附带一个前提句
那个前提句很重要,不能省略

最新一篇的原意是:我们把判断从「非零概率」再次上调到「很大的成功机会」—— 只要 AMD 解决我们在下文列出的两个主要风险

这是一个有条件的乐观,不是无条件的看多。 引用这个结论时如果把前提句去掉,意思就变了——而这恰恰是市场传播中最常发生的事。

那两个风险是什么?一个是第 4 节讲过的机架量产爬坡另一个是内部缺乏稳定的测试集群(本节第 05 段)。

03

理由一:最有能力自己判断的买家回来了

四家客户,两种性质

第 5 节讲过微软 2023 年放弃 AMD 的事。现在讲后续:微软调头了。 它已宣布将部署 AMD 新一代机架,而第三方判断, OpenAI 会是这批机架的主要终端客户

同期还有另外三家:Anthropic 公开宣布将部署 2 吉瓦的 AMD 芯片OpenAI 和 Meta 各签下 6 吉瓦

这四家客户的共同点是:它们是全世界最有能力自己评估软硬件的买家, 不需要听任何人的推荐。它们同时转向,本身就是一个信号。

但这四家必须分成两组来看

第一组(微软、Anthropic):没有拿到股权协议就下单。 这一组的分量重得多——它们是被产品本身说服的

第二组(OpenAI、Meta):下单的同时,各自拿到了最多 1.6 亿股、 行权价 1 美分的认股权证。

把这两组混为一谈,是评估 AMD 时最容易犯的错误。 单元四会完整算清第二组那笔账——先给一个数:股权返还的价值, 相当于这两家客户付款金额的 94.4%

04

理由二:编程代理正在削薄护城河本身

本节最重要、也最反直觉的一段

第 5 节给护城河下过一个定义:它的宽度 = 把代码迁到别的平台需要多少工程师小时。 现在这个定义要发挥作用了。

第三方给出的核心论证是这样的:写代码和测代码,已经不再是去年那种护城河了。 通过让 AI 代理承担原本由人类工程师完成的工作,所谓 CUDA 护城河的重要性被削弱, 而这帮助 AMD 抵消了 NVIDIA 在工程师人数上的优势。

它还给出了自己的一手证据:这家机构用编程代理为几个新发布的前沿模型做首发日适配—— 代理自动从网上拉取配方、搭好流水线、监控运行状态;遇到引擎报错时能自己定位根因, 要么自动迭代重跑、要么找人介入。文中列出了四个已经合并进上游开源项目的具体修复

它对这件事的评语是:这种迭代速度,在三到六个月前、以一个两个半人的团队,根本不可能做到。

这段论证之所以重要,是因为它指出了一件很少被说破的事: 护城河变窄这件事,可能跟 AMD 做对了什么完全无关。

NVIDIA 的护城河建立在「迁移很贵」之上,而迁移的成本主要是人力。 当一种新工具让人力成本大幅下降时,护城河就自动变窄了—— 受益者是所有落后者,而 AMD 恰好是落后者里位置最好的那个。

AMD 自己也在押这条路。它在 2026 年的发布会上推出了一整套面向代理的工具: 一个自动写和调优计算核的代理,加上一个编排器—— 后者会先分析真实服务负载找出瓶颈,派代理去优化, 并且强制要求端到端的对照验证通过才算数。已有的实测战果是某个场景下 约 21.8% 的端到端提升

一个有趣的细节:防作弊比生成更花工夫

第三方在读这套工具的源码时发现,相当一部分工程量花在了防止代理作弊上: 要防止它偷偷给没打补丁的版本打分、要剥掉它对测试脚本的改动以免它靠改考卷通过、 还要有一份禁用库清单,防止它把「优化」变成偷偷调用一个已经调好的现成库。

第三方的总结是:生成一个计算核是容易的,让人相信那个数字才是难的。

这句话可以直接搬到投资上——本课后面每一个数字, 我们都会说明它是怎么被验证的。第 12 节会用两条独立路径算同一个数来做交叉验证。

05

理由三:单机性能确实追上来了

以及那个还没解决的风险

第三条理由是最实在的:在几个主流模型的单机服务场景下, AMD 上一代加速卡的性能已经接近 NVIDIA 的对应产品; 某个模型的交互性能在 30 天内提升了最高 18 倍。 文档、复现配方、部署指南也比一年前深了不止一个层次。

但紧接着就是那个尚未解决的风险,也是前提句里的第二条: AMD 内部缺乏稳定的图形处理器集群,供开发团队和自动化测试使用。

第三方记录的具体情况是:某个关键开源推理引擎的门禁测试进度「大幅倒退」, 原因是公司管理层把集群从内部团队手里调走了,去满足别处的容量缺口。 而工程师们的首要抱怨,正是集群不稳定、总被搬来搬去。

这个风险的性质,比它听起来严重

注意第 04 段的逻辑:AI 代理能加速软件开发——但代理本身也要消耗算力。 第三方明确指出:过去一个工程师需要几台机器,现在一个人可以同时跑几十个代理, 每个代理又要跑自己的测试。

于是出现了一个尴尬的循环:AMD 最有希望用来追赶的那个工具, 恰恰需要它最缺的那个资源。

第三方给的量化是:即便算上今年新增的几千颗芯片, 内部可用容量仍比对手用于内部开发的稳定集群少一个数量级以上

最后补一个耐人寻味的技术细节,它比任何评论都更能说明谁在定义标准。

业界目前有两套互相竞争的四位数值格式 (低精度数值格式): 一套是 NVIDIA 随其新架构推出的,另一套是 AMD 一直主推的开放标准。 按理说 AMD 应该坚持自己那套。

但第三方在拆解 AMD 最新架构时发现:它的矩阵计算单元原生支持了对手的那套格式, 而且相关的调度代码已经写好并接入了运行时。

这是一个很诚实的信号:当你不得不原生支持对手定义的格式时, 说明客户的模型是按对手的标准做的。标准的话语权,仍然在对面。

这一节要带走的一句话 全球跟踪 AMD 软件最深的第三方,对「AMD 能否追上」的判断经历三次改判:0% 机会 → 有实质机会 → 很大的成功机会三条可验证的理由:① 最有能力自己判断的四家客户回来了(微软调头、Anthropic 2 吉瓦、OpenAI 和 Meta 各 6 吉瓦);② AI 编程代理正在削薄护城河本身③ 单机性能确实追上了但它同时列出了两个必须解决的风险——而且给出的结论有一个前提句:「只要 AMD 解决下面这两个风险」

检验一下:从 0% 到「很大的机会」

5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。

二.3

护城河搬家了

AMD 在追赶上一场战争,而竞争前沿已经换了地方

约 7 分钟·2,075 字·5 题
01

先看模型这两年变成了什么样

越来越稀疏,越来越依赖搬运

要理解「护城河搬家」,得先看被服务的对象——模型——变成了什么样。

前沿模型正在集体走向一种叫「混合专家」的结构:模型里养着很多个「专家」子网络, 但每处理一个词只激活其中很少几个。这样做的好处是参数量可以做得极大, 而每次计算的开销却不按比例增长

关键在这个结构的演化方向:激活的专家数量一直固定在 4 到 10 个之间, 而专家总数却在飞速扩张——128 个、256 个、384 个,现在到了 512 个。 与此同时,很多新模型还把缓存压缩到只相当于一两个注意力头的大小。

这个演化方向决定了竞争的胜负手换了

当模型是「稠密」的时候,跑得快不快主要看单颗芯片的矩阵乘法有多强—— 这是硬件和算子库的功夫。

当模型变得极度稀疏时,瓶颈换了: 怎么把 512 个专家摊到几十台机器上、怎么在毫秒内把数据路由到正确的专家、 怎么在机器之间搬运缓存而不让计算单元空等。

前者是「一颗芯片的问题」,后者是「一个分布式系统的问题」。 竞争前沿就是这么搬走的。

02

新战场上的两项关键能力

PD 分离和宽专家并行

新战场上有两项能力是入场券,它们的名字听起来很技术,但道理都很朴素。

第一项是 PD 分离。 大模型推理分两个阶段:先读完你的整段提示词(算力密集),再一个字一个字往外吐(显存带宽密集)。 这两件事对硬件的需求完全不同,混在一台机器上跑会互相干扰。 拆到不同机器上,各自按需配置,效率会高很多。

第二项是宽专家并行。 与其在每台机器上都复制一整套专家,不如把 512 个专家摊到 64 张卡上,每张卡只放 8 个。 省下来的显存可以拿去装缓存,从而跑更大的并发批次。 公开数据显示,这项优化能带来每卡吞吐最高 2.28 倍的提升。

请记住这两个名字。它们是本节判断 AMD 位置的两把尺子。

03

时间差有多大

两年

时间开放的 CUDA 生态AMD
2024 年初已在出货 PD 分离 + 宽专家并行
2025 年 11 月前沿实验室与算力服务商已在生产环境普遍部署官方文档仍称双批次重叠「仍在开发中」
2025 年 12 月 – 2026 年 1 月官方发布分离式推理相关文档
2026 年 1 月第一个公开可用的 PD 分离 + 宽专家并行配方落地
2026 年 2 月双批次重叠合入开源引擎;数天后因破坏测试被要求回退

把这张表读一遍,时间差是大约两年。而且注意最后一行: 迟到的功能合进去几天就被要求回退,因为它弄坏了持续集成。

第三方对这一现象的总结很精准:这就是 AMD 推理软件故事的缩影—— 原料越来越齐了,但太多关键优化仍然来得太晚、落地时很脆弱, 还需要再打磨一轮才能变成客户可以默认信赖的东西。

04

在最新的 Helios 硬件上,情况更严峻

本节最硬的一段证据

上面说的还是 AMD 上一代硬件。而第 2 节讲的那台 Helios 机架,用的是一颗全新架构的芯片—— 它和上一代的指令集完全不同,意味着此前调好的算子几乎要重写一遍

第三方逐层检查了这颗新芯片上的软件状态,结论是:

软件层次新架构上的状态
深度学习框架支持代码已合入,但只是编译期的架构管道,且没有任何自动化测试
计算核库是全栈中推进最快的一层,但关键的专家并行核仍未完成
分布式通信框架集成路径尚未接通,宽专家并行跑不起来
开源推理引擎只构建镜像、无测试任务、无精度门禁,因为上游根本没有这颗芯片的测试机
AMD 自研引擎缓存搬运的一半已经在做,但没有专家并行;官方配方仍是单机
第三方的原话总结

从底到顶——框架、计算核、通信库、引擎——Helios 有了架构使能, 以及分离式推理的前一半;而宽专家并行,哪儿都没有。

配合第 4 节那个「机架量产地狱」,可以得到一个完整的图景: 这台机器的硬件还在爬坡,跑在它上面的分布式软件也还没到位。

要公平地补一句:这是 2026 年 7 月的快照,而这类工作推进得很快。 第三方自己也说,一旦某个集成路径被接通,宽专家并行「应该就能工作」—— 它不是做不出来,是还没做完。

但对投资判断来说,「还没做完」和「已经做完」之间的差别是决定性的, 因为客户下的是真金白银的订单,他们要的是能默认信赖的东西,不是「应该能工作」。

05

一个几乎没人讨论的事实

ROCm 最关键的几块,是在中国建的

第三方报告里有一段信息,在中文和英文的讨论中都极少被提及,但它的投资含义很重。

原文明确写道:AMD 最好的顶尖工程师大多在上海; 负责分布式通信、缓存卸载、分离式应用前置部署的几个团队, 主要都在上海ROCm 软件栈里最重要的几块,很多是在中国建的。 其中那个分布式通信框架,被明确记为由一支位于中国的工程团队从第一性原理构建

为什么这件事重要?因为市场讨论 AMD 的地缘政治风险时, 几乎只讨论一件事:能不能把芯片卖到中国——那是收入端的风险。

这条事实指向的是研发端

如果人员流动、出口管制或合规要求触及这部分团队,受影响的不是某个季度的收入, 而是追赶 CUDA 的速度本身

而按本单元的全部论证,追赶速度恰恰是这家公司估值的核心假设

这是本课认为市场目前几乎没有定价的一个风险维度。 它不一定会发生,但它应该出现在风险清单上——第 17 节会把它列进去。

06

所以,正确的问法是什么

把整个单元收口

单元二从「CUDA 护城河是什么」出发,走到这里可以给出一个结论了。

「AMD 能不能追上 NVIDIA」这个问题,如果理解成「ROCm 好不好用」,就已经问错了。 按第 6 节的证据,单机层面 ROCm 确实追上来了——但那是上一场战争。

正确的问法是:AMD 的分布式推理栈,能不能默认地、跨模型跨拓扑地组合工作?

注意「默认地」和「跨模型跨拓扑地」这两个限定词。第三方说得很清楚: 差距已经不是「这些零件从来没法一起工作」, 而是 AMD 还不能假定它们在各种模型、各种数值格式、各种并行策略、 各种网络拓扑下都能一起工作,而不需要特例处理。

这就是第 17 节跟踪清单里最重要的一条

它是可以被外部验证的:去看开源推理引擎和 ROCm 的公开仓库, 查新架构上的宽专家并行有没有进入默认的门禁测试。

这一条如果被验证,单元四那笔股权交易就是划算的—— 因为它换来的不只是 12 吉瓦订单,而是一个能自我维持的生态。

如果长期不被验证,那笔交易就只是用公司 16.41% 的所有权, 换了一批一次性的大单。这笔账第 13 节会算得清清楚楚。

这一节要带走的一句话 第三方最核心的一句判断:AMD 的软件故事已经不再是「ROCm 是坏的」,而是 ROCm 终于在紧迫地往前跑,但竞争前沿跑得更快。战场已经从「单机跑得快不快」,移到了「多机分布式推理能不能默认地、跨模型地组合工作」。时间差是硬的:开放生态 2024 年初就在出货这套能力,AMD 第一个公开可用的配方 2026 年 1 月才落地;而在最新的 Helios 硬件上,关键的宽专家并行能力「哪儿都没有」

检验一下:护城河搬家了

5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。

免 费 部 分 到 此 结 束
还有 3 个单元、10 节没解锁

你刚读完的是AMD这门课的前 2 个单元(7 节 · 35 题), 讲清楚了这家公司是做什么的、靠什么赚钱。
剩下的部分是这门课真正花功夫的地方:

  • 两次濒死,两次靠一个架构翻身3 节 · 15 题 · 4,563 字
  • 把公司 20% 的股权,当成产品折扣发出去3 节 · 15 题 · 4,485 字
  • 市场为「赌」的那一部分,付了多少钱4 节 · 20 题 · 6,825 字
登录 / 免费注册 →

注册免费,测验成绩存进账号;解锁其余单元凭会员兑换码 · 返回课程目录

还没有兑换码?扫码领 ¥100 券,直接加入知识星球
  • 📡Serenity 实时订阅 全网订阅第一「白毛股神」一手推文,分钟级中译直推邮箱,每天约 20~30 条,含她付费订阅才有的独家内容
  • 💼白毛持仓 · 完整台账 她公开推文里亲口说过的持仓,整理成一张带原话出处的表:75 只在持 · 43 只明确否认 · 16 只已清仓,每条带首次披露日、成本锚与最后确认日,新披露实时上表。不是荐股,是「她说过什么」的可核对记录
  • 📈大行研报 · ima 知识库对话 境内外一线投行研报每日汇入腾讯 ima 知识库(AI 相关精选 7,000+ 份、境内外日增 30+),你在库里通过 AI 对话随问随答、带出处,等于雇个 7×24 研究助理
  • 🗺️知识库全开 + 深度报告解析 1,151 公司 / 694 概念全词条 + 全景图谱,外加 86 篇机构深度报告可视化解读、巨头供应链拆解、产业大事件复盘
  • 🎓两套课程全解锁 金融人的产业链大课 18 讲(能源→芯片→基础设施→模型→应用,每周上新)+ 公司深度研究 27 门(英伟达 / 台积电 / SK 海力士 / 博通 / 中际旭创…一家公司一门课,分单元、节节带测验、给成绩单)
  • 💬会员微信群 入圈后可加入会员微信群,会员之间日常交流,我也在群里
微信扫码领优惠券并加入知识星球
全站会员 ¥599 / 年
扫码自动领 ¥100 优惠券 · 到手 ¥499
9 月 30 日 12:00 到期 · 仅剩 18 天