一.1
为什么训练大模型不能用普通处理器
同一件极简单的事重复上万亿次——这件事需要一种完全不同的芯片
约 5 分钟·1,549 字·5 题
01
先从一件所有人都见过的事说起
你的笔记本电脑里那颗处理器,为什么跑不动大模型
家用电脑里的中央处理器是个全能选手。它要能打开网页、能放视频、能解压文件、
能同时伺候几十个后台程序,所以它的每个核心里都塞满了各种功能部件——
预测你下一步要干什么的电路、临时存数据的高速缓存、处理各种奇怪指令的模块。
这些东西让它「什么都能干」,代价是真正做算术的那部分只占很小一块面积。
而训练一个大模型要干的事,单调到有点荒谬:把一大堆数字两两相乘,再把结果加起来,
然后换一批数字再来一遍,重复上万亿次。这件事没有分支、没有意外、没有需要临时决定的地方。
拿全能选手去做这种活,就像雇一个会五国语言的人去流水线上拧螺丝——
他确实能拧,但你为那五国语言付的钱全浪费了。
于是就有了另一条思路:既然要干的活这么单一,那就把芯片上所有用不着的功能砍掉,
把腾出来的面积全部换成算术单元。同样大的一块硅片,全能处理器上可能只有几十个计算核心,
专用芯片上可以放上万个。这就是 领域专用架构的全部逻辑,
也是这门生意存在的理由。
02
专用到什么程度,是一道取舍题
越专用越快,也越容易被下一代算法抛下
| 芯片类型 | 能干什么 | 同样面积的算力 | 风险 |
| 中央处理器(CPU) | 什么都能干 | 最低 | 几乎没有——算法怎么变它都能跑 |
| 通用图形处理器(GPU) | 擅长大规模并行计算,也能跑别的 | 高 | 低 |
| 领域专用架构(本课主角) | 专为神经网络的算子设计 | 更高 | 算法结构大变时可能失效 |
| 彻底定制的专用集成电路 | 只能跑一种固定的活 | 最高 | 高——模型一换就成废铁 |
这张表从上到下是一条连续的光谱,没有哪一档天然正确。
往下走一格,性能和能效就好一截;同时,能跑的活也窄一截,被下一代算法淘汰的概率也高一截。
真实世界里大家都在这条线上找位置:做通用芯片的往下挪(在通用核心里加专门算矩阵的单元),
做专用芯片的往上挪(留出可编程的余地,好让新出现的算子也能跑)。
本课主角的产品线落在中间偏专用那一档:专为神经网络设计,但保留足够的可编程性。
这个位置决定了它的两条命脉——一条是硬件的能效,一条是软件能不能及时支持新模型。
第 11 节会看到,后面这条在中国市场里的分量,比很多人以为的重得多。
03
训练和推理,是两门不同的生意
一个是一次性投入,一个是长期开销
这两个词在新闻里经常混着用,但对芯片生意来说它们完全不同。
训练是把一个模型从随机数练成能用的东西,要把海量数据反复喂进去,
上万张卡连成一个集群跑上几周甚至几个月。它的特点是一次性、规模极大、对卡与卡之间的通信极度敏感——
一万张卡要像一台机器那样协同,任何一张掉队全队都得等。
推理是模型练好以后,每一次有人提问、每一次生成一段文字,都要算一遍。
单次计算量比训练小得多,但它是经常性的:用的人越多,账单越长。
所以推理关心的不是「峰值能有多快」,而是「跑完同样一批请求,一共花了多少钱」——
电费、机器折旧、运维全算在内。
这个区别之所以要在第一节就讲,是因为它直接决定了谁有机会。
在训练场景里,制程落后、互联带宽不足是硬伤,很难用别的东西补;
而在推理场景里,只要单位成本划算,规格差一点未必要命。
行业的共识是推理的总量会超过训练,而中国市场的需求结构又比全球更偏推理——
这条线索会在第 3 节变成一条可以跟踪的判据。
04
客户买到手的东西长什么样
不是一颗芯片,是一块卡,甚至一整个机柜
最后一件事关系到这门生意的形态。芯片厂商卖出去的,从来不是一颗光秃秃的硅片。
芯片要先焊到一块电路板上,配上高带宽内存、供电、散热和对外的接口,
变成一块能插进服务器的加速卡;很多时候还要再往上走一层,
把几十上百块卡装进机柜、连好网络、装好软件、调通一个真实的模型,整套交给客户。
这个形态问题看着琐碎,其实决定了后面几节的很多现象。卖芯片,发货就能确认收入;
卖整套系统,要装完、调通、验收才算数——于是收入天然会一阵一阵地来,很不平滑。
同样,卖系统意味着仓库里囤的不只是芯片,还有内存、板卡、整机部件,
存货的金额会比纯芯片生意大得多。第 13 节和第 15 节都会回到这两句话上。
到这里,这门生意的轮廓有了:做一种专用到恰到好处的芯片,
把它做成卡和机柜卖给需要算力的人,赚的是「同样一笔算力预算,我这边更划算」的钱。
下一节把这块卡拆开,看看里面到底有什么、哪几样是自己能决定的、哪几样不是。
这一节要带走的一句话 大模型的计算在数学上极其单调:把一堆数字乘起来再加在一起,重复上万亿次。通用处理器擅长「什么活都能干」,代价是每个核心都配了一大堆用不上的零件;AI 加速器的做法正好相反——砍掉用不上的部分,把省下的面积全换成算术单元和内存带宽。越专用,同样的电和同样的硅片能算得越多,但能干的活也越窄。这门生意还要分清两件事:训练是一次性把模型练出来,推理是此后每一次使用都要付的经常性开销——行业公认推理的总量会超过训练,而推理更看单位成本、不看峰值规格。最后记住一个形态问题:客户买到手的不是一颗裸芯片,是一块能插进服务器的卡,甚至是一整个机柜。这三件事(专用化、推理为主、按系统交付)是后面十六节的地基。
检验一下:为什么训练大模型不能用普通处理器
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。
一.2
拆开一块 AI 加速卡,里面有什么
计算、内存、互联、软件——四样东西,只有一样完全握在自己手里
约 5 分钟·1,406 字·5 题
拿一块 AI 加速卡在手上,你看到的是一块比显卡厚一些的板子:中间一颗盖着金属散热壳的大芯片,
周围一圈供电元件,边上是插进服务器的金手指和几个高速接口。真正决定它值不值钱的,是四件事。
第一件是计算。芯片上有多少个算术单元、每个单元一个时钟周期能做几次乘加、
支持到多低的数值精度。这里有个外行常搞错的地方:近几年算力的提升相当一部分不是来自「跑得更快」,
而是来自用更粗的数字格式做同一件事——原来用 32 位小数表示一个权重,
后来发现 16 位够用、再后来 8 位甚至 4 位也够用(低精度格式)。
位数减半,同样的电路吞吐量就能翻倍。这条路走到哪一步,各家差别很大。
第二件是内存。算术单元再多,数据喂不上去也是空转。
大模型的权重动辄几百 GB,全靠芯片旁边那圈 HBM(把内存芯片垂直堆起来、
用极宽的通道贴着计算芯片放)来供数据。推理场景下的瓶颈,很多时候根本不在算力而在内存带宽——
所以卡的规格表上,「多少 GB、多少 GB/s」这两个数往往比峰值算力更能说明问题。
第三件是互联。一张卡装不下一个大模型,就得几十上百张连起来用。
卡与卡之间每秒能传多少数据,决定了这堆卡是「一台大机器」还是「一堆各干各的小机器」。
第四件是软件——留到第 4 段单独说,因为它是这四件里性质最特别的一件。
02
把本课主角的产品线排开看
三代之间的跳跃,能直接读出这门生意的进展
| 产品 | 制程 / 代工 | 内存 | 内存带宽 | 片间互联 | 整卡功耗 |
| 思元 220(边缘) | 16nm · 境外代工 | 8GB 普通内存 | 400 GB/s | — | 15 W |
| 思元 370 | 7nm · 境外代工 | 48GB 低功耗内存 | 614 GB/s | 200 GB/s | 250 W |
| 思元 590 | 7nm · 境外代工 | 96GB HBM3 | 1,600 GB/s | 425 GB/s | — |
| 思元 580 | 12nm · 境内代工 | 96GB HBM3 | 1,600 GB/s | 425 GB/s | 560 W |
| 思元 690(下一代) | 7nm · 境内代工 | 96GB HBM3 | 2,400 GB/s | 1,200 GB/s | 580–750 W |
规格来自一家覆盖机构 2026 年 6 月的行业对照表;思元 690 的推出时点与性能提升幅度为同一机构的预测。
这张表有三条线索值得一条条读。第一条是制程和代工地的变化:
早期几代都用境外代工厂的 7nm,而思元 580 和下一代思元 690 已经落在境内代工厂。
这不是技术偏好,是被迫的——第 10 节会讲清楚原因,也会讲清楚它同时带来的代价和保护。
第二条是内存。从 8GB 普通内存到 48GB 低功耗内存,再到 96GB 的 HBM3,
这条线跳得比制程还猛。把它和上一段那句「推理瓶颈常在内存」连起来看,
HBM 的可得性是这门生意里一条很硬的约束,第 12 节会专门讲。
第三条最值得记住:思元 690 相对思元 590,制程一样是 7nm,
内存容量一样是 96GB,但内存带宽从 1,600 提到 2,400 GB/s、片间互联从 425 提到 1,200 GB/s——
接近三倍。这说明代际进步不一定要靠制程:
在拿不到更先进制程的前提下,把带宽和互联做上去,一样能把系统性能往前推一大截。
这句话是理解整个第三单元的钥匙。
03
第四件事:软件为什么要单独说
它是唯一完全握在自己手里的一样,也是客户最难甩掉的一样
模型是用一种通用的语言写的,芯片认的却是自己那套指令。中间需要一整层东西
把模型的每一个算子翻译成这颗芯片跑得最快的写法,还要负责把计算切到多张卡上、
调度数据搬运、处理精度转换——这一层就是所谓的软件栈。
本课主角的这一层叫 NeuWare。
它的分量有多重,看一件事就知道:客户把一个模型从 A 家的卡搬到 B 家的卡上,
要重新适配、重新调优、重新验证结果一致性,运维工具链和人员熟练度也要重新积累。
这堆工作量就是迁移成本。它不靠合同锁定,靠的是「换一次太麻烦」这件事本身。
但这道护城河有个必须说清楚的性质:它会随时间自己变浅。
对手的软件生态越成熟、迁移工具越好用,客户搬一次的代价就越小。
所以「客户黏性」在这门生意里是一条真实但有保质期的理由,
需要定期重新确认,不能一次性接受。第 11 节整节都在讲这件事。
四样东西,只有一样完全在自己手里
把这一节收个尾:计算要看代工厂给不给先进制程,内存要看存储厂卖不卖 HBM,
互联和封装要看封测产能,只有软件是自己写的。
一家芯片设计公司最值钱的资产(设计能力、软件栈、客户关系)恰恰都不在工厂里,
而它最硬的约束(能造多少)恰恰不在自己手里。
这个错位是本课后面几乎所有现象的根源——
收入为什么会一阵一阵地来、存货为什么会突然翻倍、
为什么赚了钱现金却是负的,追到最后都能追到这一句上。
这一节要带走的一句话 一块加速卡由四件东西决定成败。计算:算术单元的数量与精度,取决于芯片面积和制程。内存:HBM 决定「数据喂得够不够快」,推理场景下瓶颈往往在这里而不在算力。互联:卡与卡之间的带宽决定几百张卡能不能像一台机器。软件:模型必须先被翻译成这颗芯片认识的指令,这一层决定客户换供应商要付多少工作量。把本课主角的产品线排开看,三代之间的跳跃很清楚——早期边缘产品 16nm、8GB 普通内存;思元 370 走到 7nm、48GB;思元 590 上 96GB HBM3、内存带宽 1,600 GB/s、片间互联 425 GB/s;而下一代思元 690 把内存带宽拉到 2,400 GB/s、片间互联 1,200 GB/s(机构预计 2026 年四季度推出,性能提升约 2.2 倍)。四样东西里,只有软件完全握在自己手里——制程要看代工厂、HBM 要看存储厂、封装要看封测产能。这就是这门生意最硬的一条约束。
检验一下:拆开一块 AI 加速卡,里面有什么
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。
一.3
谁在买国产 AI 芯片,他们凭什么下单
需求=算力投资 × 国产化率 × 自己的份额,三个因子各有各的决定者
约 6 分钟·1,704 字·5 题
01
把需求拆成三个相乘的因子
看懂一门生意的需求,先看它由几个人决定
「AI 需求很好」这句话对做投研没什么用,因为它没告诉你该盯什么。
把它拆开会清楚得多:一家国产 AI 芯片公司能卖多少,等于中国这一年在 AI 算力上花的总钱数,
乘以其中有多大比例用国产芯片,再乘以它自己在国产里占多少份额。
三个因子相乘,而它们的决定者完全不是同一批人。
这样拆的好处是,每个因子都能找到自己的观察对象。总投资看的是互联网大厂的资本开支公告
和国家级算力项目的落地节奏;国产化比例看的是管制政策和供给条件;
份额看的才是这家公司自己的产品、交付和客户关系。
三个因子里,前两个几乎不由公司自己决定——
这一点在第 13 节讲景气传导时会再次变得很重要。
02
第一个因子:这个池子有多大
一家机构把 2030 年的预测一次上调了 36%
$910 亿
中国 AI 芯片市场 · 2030 年预测
一家机构 2026 年 7 月,从原先的 $670 亿上调 36%
约 23%
2025–2030 年年均增速
同一机构口径
42% → 70%
境内自给率 · 2025 → 2030 年
同一机构预测
先说这组数字怎么读。它们来自同一家机构,本课没有取得第二家的同口径数据做交叉验证,
所以它们只能当量级参照,不能当共识。但即便如此,那个「一次上调 36%」的动作本身就有信息量——
它说明这个行业的规模判断在短时间内被显著改写过,
而任何基于旧数字做的推算都跟着失效了。看到这类大幅上调,
第一反应不该是「更好了」,而是「原来的判断错在哪,新的判断会不会也一样不稳」。
池子的钱从两个口子进来。一个是互联网大厂的资本开支:
阿里巴巴、腾讯控股、字节跳动这类公司既要训练自家模型,
也要把算力做成云服务卖出去,它们的采购逻辑是标准的投资回报——算得过来就买。
另一个是国家级算力基础设施:电信运营商、国企和地方政府建智算中心,
动机里包含公共服务和数据主权,采购节奏与商业周期并不同步。
03
第二个因子:其中多少用国产
这个因子几乎不由厂商决定
国产化率是这三个因子里最特别的一个:
它的涨跌主要不取决于国产芯片变好了多少,而取决于境外产品还能不能买到、买到之后能不能用。
一家机构给出的路径是 2025 年 42%、2030 年 70%。行业里更常被引用的一组口径是
2024 年约三成、2025 年上半年过四成、2027 年目标过半——不同来源口径不同,
但方向一致:这条线在快速上行,而推着它走的力量在产业之外。
这带来一个必须说清楚的不对称:这个因子对国产厂商是普惠的,对单家公司却不构成竞争优势。
管制收紧,所有国产厂商一起受益;管制放松或者境外产品以某种方式重新可得,
所有国产厂商一起承压。所以「国产替代」这四个字本身不是任何一家公司的护城河,
它只是把池子分给谁的规则,不决定池子里谁分得多。第 10 节会把这件事讲透。
04
第三个因子:买方凭什么选你
判据从「跑分」换成了「这活儿多少钱能干完」
| 判据 | 看什么 | 谁占优 |
| 绝对峰值性能 | 单卡算力规格 | 境外产品(境内产品在芯片层面仍落后约两代) |
| 总拥有成本 | 购置 + 电力 + 运维的全部支出 | 有机构的调研结论:境内产品明显更低 |
| 每 token 成本 | 跑完一个真实推理任务花多少钱 | 领先的境内芯片可接近持平 |
| 软件迁移的一次性投入 | 把模型搬过来要多少工作量 | 境外生态更成熟 |
总拥有成本和
每 token 成本是这张表最要紧的两行,
因为它们把「芯片好不好」这个技术问题,翻译成了「这活儿多少钱能干完」这个经济问题。
一家机构的调研结论是:大型模型开发者表示,只要每 token 成本有竞争力,他们愿意部署境内加速卡。
这条判断接上第 1 节那句「需求越偏推理,制程落后的杀伤力越小」,逻辑就闭合了。
但这张表还有另外两行,方向是反的。制程落后通常意味着单位算力功耗更高,电费那一栏是吃亏的;
软件迁移的一次性投入也明确更高。所以「总拥有成本更低」这个结论,
很大程度上依赖购置价格的优势足够大,大到能盖住电费和迁移成本这两块。
而购置价格的优势一半来自自己便宜,一半来自境外产品在境内因供给受限而溢价——
后面这一半不是自己挣来的,也随时可能变。
把这件事变成可跟踪的东西,方法是换掉观察对象:如果买方看峰值性能,你该盯发布会的规格参数;
如果买方看部署经济性,你该盯的是竞品的定价与能效、境外产品在境内的实际售价、下游的推理用量。
第 16 节的跟踪表里「同业新品发布与定价」这一行就是从这里来的——
不是看对手发布了什么规格,是看对手定了什么价。
买方的两种性格,会写进报表
一家机构估计,2026 年互联网公司约占本课主角出货量的 60%、
政府相关机构约占 15%(同一口径下,另一家国产厂商的互联网占比只有 23%,
差别很大)。这两类买方的性格完全不同,而性格会直接写进报表:
互联网客户按项目和投资回报下单,节奏相对可预期但议价凶;
政府与国企类项目走预算和招标流程,可能在商业需求疲软时仍然采购,
这是稳定性的来源;但同时预算周期和验收节奏会让收入确认变得很不规则。
第 13 节那个「收入为什么一阵一阵地来」,一部分答案就在这里。
这一节要带走的一句话 国产 AI 芯片的需求可以拆成三个相乘的因子,每个因子的决定者完全不同。第一个是中国的 AI 算力总投资——由互联网大厂的资本开支和国家级算力项目决定;一家机构 2026 年 7 月把中国 AI 芯片市场的 2030 年规模预测从 $670 亿上调到 $910 亿(上调 36%,对应 2025–2030 年年均约 23%)。第二个是国产化率——同一家机构预计境内自给率从 2025 年的 42% 升到 2030 年的 70%;这个因子几乎不由厂商决定,由管制与政策决定。第三个才是自己的份额,决定它的判据这几年变了:买方越来越按总拥有成本和每 token 成本下单,而不是按峰值规格。买方本身也分两类性格:互联网公司(约占本课主角 2026 年出货的 60%)按投资回报算账,政府与国企(约 15%)按项目和预算走——后者是稳定性的来源,也是收入不规则的来源。
检验一下:谁在买国产 AI 芯片,他们凭什么下单
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。
一.4
产业链全景:钱在这条链上怎么分
上游三道坎都不在自己手里,下游两类买方性格不同
约 5 分钟·1,629 字·5 题
01
先把整条链摊开
这张图是全课的地基,后面每一节都会回来定位
前三节讲了这门生意为什么存在、一块卡里有什么、需求由谁决定。
这一节把整条链摊开:从上游的制造资源,到中间的设计与集成,再到下游的买家,
每个环节谁在做、谁最稀缺、谁受制于谁。
先看图,然后我们一段一段解释它为什么长这样。
上游 · 四样都要外购,前三样是硬约束
晶圆代工 ← 能造多少的上限早期几代用境外代工厂,思元 580 与下一代思元 690 已落在境内代工厂;良率与产能爬坡是公开的挑战(第 10、13 节)
存储 ← 推理场景真正的瓶颈
96GB HBM3 是当前主力卡的标配;有机构把「内存可得性」列为 2026 年二季度交付延后的原因之一(第 12、13 节)
先进封装 ← 多芯粒方案的前提
拿不到更先进制程时,把多颗芯粒封在一起是主要的绕行路线(第 12 节)
设计工具与 IP ← 画得出来才造得出来设计工具与可复用模块同样受管制影响,属于外生约束
↓产能不在自己手里 —— 第 2 节那句「四样只有一样在自己手里」的具体形状
寒武纪 · 芯片设计 + 软件栈 + 板卡与集群系统
本课主角 · 思元系列加速卡与智能计算集群系统;2025 年出货 11.7 万张(2024 年 3.9 万张、2023 年 2.6 万张)
↓以卡、整机与整柜交付 —— 要装完调通验收才确认收入(第 7、13 节)
下游 · 两类买方,两种性格
互联网云厂商既训练自家模型也对外卖算力;按投资回报下单。一家机构估计约占本课主角 2026 年出货的 60%
运营商 · 国企 · 地方政府国家级算力基础设施,走预算与招标流程;约占 15%。采购节奏与商业周期不同步(第 3 节)
同层 · 三种模式的国产同行(第 14 节逐一拆开)
全栈自有自己设计、自有制造体系、自带软件与整机,国产份额第一
设计外包代工与本课主角同一种模式:设计自己做、制造靠代工,因此共用同一条产能瓶颈
云厂自研自用买方自己下场做芯片——既是同行也是客户,关系比单纯竞争复杂
看懂一张产业链图的办法,是问「哪一格最难替代」。
在全球的 AI 芯片链上,最稀缺的通常被认为是设计与软件生态;
但在中国这条链上,答案不一样——最稀缺的是上游那三格:先进制程的产能、HBM、先进封装。
设计公司这几年冒出来一大批,而能给它们造芯片的地方就那么几家、能给的产能就那么多。
这个判断有一个直接的推论,对理解报表很关键:因为制造是外购的,设计公司的成本里没有晶圆厂的折旧,
所以毛利率可以做得很高——本课主角的季度毛利率在 55% 上下。
但同样因为制造是外购的,它能卖多少不完全由自己决定。
换句话说,这门生意用「利润率的弹性」换来了「产量的不确定」:
销量下滑时成本会跟着降(不像自有晶圆厂那样折旧刚性),
销量想上去时却可能被产能卡住。第 13 节会看到这件事在 2026 年真实发生。
同一条链上,它和上游代工厂是两门相反的生意
本课主角向中芯国际这样的代工厂买产能,两家挨在一起,生意性质却正好相反。
代工厂只造别人设计的芯片、赚加工费,最重的资产是自己的晶圆厂,
产品卖爆了它也拿不到溢价,但客户分散所以单个产品卖不动影响有限;
设计公司卖的是产品,卖得好拿得到溢价,卖不动直接冲击自己,
而它最值钱的东西(设计能力、软件栈、客户关系)一样都不记在账上。
记住这个对照——第 15 节读账本时,它能解释毛利率、资产结构和现金流的大部分差异。
03
同层的三种模式,瓶颈完全不同
把「国产 AI 芯片」这个大筐拆开
图的最下面一层把国产同行按模式分成了三类,这个分法比按公司名字排要有用得多。
全栈自有的那一家,设计、制造体系、软件和整机都在自己的盘子里,
所以它的瓶颈是自己的产能扩张速度,不与别人抢代工排期。
设计外包代工这一类——本课主角和大多数新兴厂商都在这里——
瓶颈是共用的:大家排的是同一条产线的队,谁的订单大、谁的良率高、谁绑得早,谁就拿得多。
云厂自研自用是第三类,性质最微妙:做芯片的公司同时是买芯片的公司。
它自研的量每多一张,市场上就少一张外购需求;但它的自研产品通常只够自用、且不对外卖,
所以它既不是纯粹的对手,也不是纯粹的客户。下游买方自己下场,是这门生意长期最容易被低估的一种压力——
它不表现为价格战,而表现为「某个大客户的订单以后不再增长了」。
三种模式的具体差异、各自的强项与软肋,第 14 节会逐一拆开。
下一节先回答一个更基础的问题:中国为什么会同时冒出这么多家 AI 芯片公司——
这个格局不是自然形成的,它有明确的历史成因。
这一节要带走的一句话 这条链的形状是:上游是晶圆代工、存储(HBM)、先进封装和设计工具与 IP——四样都要外购,其中前三样对国产厂商都是硬约束;中游是芯片设计公司,把设计变成卡和机柜;下游是互联网云厂商与国家级算力项目两类买方。利润的分配跟着稀缺性走:稀缺的是先进产能和 HBM,不是设计能力——所以这门生意的毛利率可以很高(外购件不含折旧,卖的是产品溢价),但产量上限握在别人手里。同层的国产同行按三种模式分类:全栈自有产能(华为昇腾)、设计外包代工(本课主角与多数新兴厂商)、云厂自研自用(平头哥、昆仑芯)——三种模式的瓶颈完全不同,第 14 节会逐一拆开。
检验一下:产业链全景:钱在这条链上怎么分
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。
一.5
中国为什么会同时冒出这么多家 AI 芯片公司
这个格局不是竞争自然选择出来的,是一道外部命令劈出来的
约 5 分钟·1,542 字·5 题
01
先看全球:这是一个极度集中的行业
而集中的原因不在硅片上
放眼全球,数据中心 AI 加速卡这门生意的格局简单得惊人:一家公司拿走八到九成,
第二名在一成出头,其余所有人加起来是个位数。这种集中度在制造业里非常罕见,
更罕见的是它的成因——领先者的优势主要不来自芯片本身,来自芯片外面那层软件。
道理并不复杂。研究人员写模型时用的是各种框架和库,这些东西十几年来都是围绕
CUDA 生态发展起来的:几百万开发者熟悉它,学校用它教课,
无数论文的开源代码默认它能跑,出了问题网上一搜就有答案。
一家新厂商就算做出一颗性能相当的芯片,也要面对「没人会用、没人愿意花时间学」这道墙。
这就是为什么这门生意的第一名换人非常难——要换掉的不是一块硬件,是一整套工作习惯。
把这件事记牢,因为它会反复出现:在 AI 芯片这门生意里,
硬件规格决定你能不能进候选名单,软件生态决定你能不能被真的用起来。
第 11 节整节都在讲中国厂商怎么应对这道墙。
02
那中国这条支线是怎么长出来的
不是打赢的,是被外力劈出来的
如果只有市场竞争,国产 AI 芯片大概率不会有今天这个热度——毕竟前一段刚说过,
生态的墙有多高。真正把这条支线劈出来的是另一件事:从 2022 年起,
高端 AI 芯片对中国的出口被逐级收紧。先是最高端的型号不许卖,
厂商推出降规格的特供版本,特供版本很快又被纳入管制;能拿到的产品越来越少、越来越贵。
这件事对买方的含义是直接的:不是「国产更好了所以换国产」,
而是「想买的买不到,只能在境内找替代」。
这个区别看起来只是措辞,实际上决定了整个行业的性质——
需求不是被产品创造的,是被约束挤出来的。所以它有两个特点:
一是来得快(买方等不起),二是管制方向一旦变化,
这部分需求的稳固程度也会跟着变。
与此同时,管制也从反方向打在国产厂商身上:被列入管制名单的公司,
拿不到境外的先进制程产能、先进设计工具和部分关键物料。
本课主角在 2022 年底被列入名单,从那以后它的产品必须在境内找制造资源。
所以「管制」对它是一体两面的东西:一面是需求侧的保护,一面是供给侧的枷锁——
第 10 节会把这两面各自量化到能跟踪的程度。
03
于是出现了一个很少见的格局
需求端被保护,供给端却挤满了人
| 维度 | 全球 | 中国 |
| 第一名的位置 | 一家占数据中心加速卡八到九成 | 境外产品 2024 年仍约占一半(含合规渠道) |
| 国产第一 | — | 华为昇腾,2024 年中国市场约 23% |
| 参与者数量 | 有分量的不超过五家 | 十家以上仍在融资、扩产、上市 |
| 国产化率 | — | 2024 年约 三成 → 2025 年上半年 四成以上 |
| 胜负手 | 软件生态 | 产能 + 交付 + 生态,三件都要 |
中国市场份额与国产化率为多家产业研究机构的口径综合,不同来源统计范围不同,仅作量级参照。
这张表最该注意的是「参与者数量」那一行。一个需求被政策保护、增速极高的市场,
会在短时间内吸引远超它能容纳的供给——这不是中国独有的现象,
任何一个被补贴或保护催起来的行业都会这样。
华为昇腾凭自有制造体系和全栈方案占住国产第一,
后面跟着一长串设计公司:本课主角、海光信息、摩尔线程、
沐曦股份、壁仞科技、燧原科技、天数智芯,
再加上云厂自研的 平头哥半导体 和 昆仑芯。
为什么这么多家现在都还活着?因为池子在快速变大。
当国产化率从三成往四成、五成走,而总盘子本身又在以年均两成以上的速度扩张时,
每家都能拿到一点增量,谁也不觉得挤。这种时候的份额数据几乎没有区分度——
它反映的是谁拿到了产能,而不是谁的产品更好。
但这个状态不会永远持续。理由在第 4 节那张图上写得很清楚:
这些设计公司排的是同一条代工产线的队,而下游真正有大规模采购能力的客户就那么几家。
池子扩张的速度一旦慢于供给增加的速度,收敛就会开始,
而收敛时被淘汰的,未必是产品最差的,很可能是拿不到产能或者绑不住客户的。
一句要带走的话:「国产替代」不是买入理由
一家覆盖这个板块的机构给过一个很直接的提醒:这个板块不应该被当成一个整体的政策主题来看待,
因为同一个赛道里的公司,在两个维度上的差距可能非常大——
一个是经济性(总拥有成本、每 token 成本、每块钱买到多少性能),
一个是执行力(能不能拿到代工产能、软件生态成不成熟、客户关系深不深、路线图可不可信)。
翻译成读者能用的话就是:「国产替代」四个字说明这个行业有机会,
不说明其中任何一家公司值得买。单元二开始,我们就用这两个维度来看本课的主角。
这一节要带走的一句话 全球 AI 加速芯片的格局极度集中:数据中心加速卡里 NVIDIA 占八到九成,核心壁垒是 CUDA 生态——几百万开发者、十几年积累的代码与工具都长在上面,护城河不在硅片上,在软件的惯性里。而中国这条支线之所以存在,不是因为有人在生态上打赢了,是因为高端 AI 芯片的出口在 2022 年之后被逐级收紧,买方被迫在境内找替代。结果是一个很少见的格局:需求端被保护、供给端却挤满了人——全栈自有的 华为昇腾 是国产份额第一(2024 年中国市场约 23%),后面跟着一长串设计公司,而它们排的是同一条代工产线的队。中国市场的国产化率从 2024 年约三成升到 2025 年上半年四成以上,池子在快速变大,所以现在还看不出谁被淘汰——但产能是共用的、客户是有限的,这个格局迟早要收敛。
检验一下:中国为什么会同时冒出这么多家 AI 芯片公司
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。