AI产业链地图·知识库 AI深度报告解析 · 长鑫存储·首覆
🚧 网站建设中 → 产业链图谱
中国存储 · 野村 长鑫存储(688825.SS)首次覆盖

王冠上的那颗 DRAM:
长鑫存储上市当天,野村首次覆盖就给了买入

7 月 27 日,长鑫存储(CXMT,688825.SS)以每股 8.66 元登陆科创板,募资 579 亿元(行使超额配售选择权后最多 666 亿元)。同一天,野村(Nomura)发出首次覆盖报告,给「买入」、目标价 116 元。这个数字之所以刺眼,是因为按发行价算,它隐含 +1,239.5% 的空间。但报告真正的重量不在那个百分号上,而在它前面二十页的推演:智能体 AI 把内存需求变成了一道乘法题,而扩产是一道加法题。野村的判断是——这道差在 2030 年前补不上;补不上的那几年,全球 DRAM 的份额表会被重排一次。
作者 Donnie Teng · Frank Fan · CW Chung(野村 亚洲科技 / 半导体团队,NIHK) 日期 2026 年 7 月 27 日 来源 Nomura 野村国际(香港)· Global Markets Research(机构研报)
CNY 116
目标价 · 20× 2028F EPS 5.79 元
发行价 CNY 8.66 · 报告口径隐含 +1,239.5%(对标的是发行价,不是上市后市价)
60%+
全球内存需求 bit 复合增速(2026–30F)
同期行业供给扩张仅 30–40% · 长鑫自身 40–45%
10% → 18%
长鑫 DRAM bit 产量全球份额(当前 → 2028F 末)
对照:美光当前 20%+ · 野村称「份额会逐渐逼近美光」
280 → 550
产能 kwpm(2025 年末 → 2028F 年末)
每扩 1kwpm 约需 US$1 亿 · 另在上海建 50kwpm HBM 封装

这是一份典型的首次覆盖(initiation)——31 页,把行业推演、公司拆解、产能模型、供应链清单、估值与风险一次铺完。但它的结构有个不太常见的地方:整整前十页不讲长鑫,讲的是全球内存的供需缺口。等到第 12 页才第一次正经提到这家公司。这个顺序本身就是论点:野村不是把长鑫当成一个「国产替代」故事来卖,而是先证明「谁扩产谁就赢」,再论证长鑫是那个扩得最快的。

本文按这个顺序拆:先是需求端的乘法题,再是供给端的加法题,然后才是长鑫这家公司——它的家底、技术、产能、估值、以及那条最该被认真对待的风险线。文末专门留一节讲该冷静的地方,因为这份报告里有几个数字,很容易被读成它并不成立的意思。

01

一道乘法题:智能体把内存需求推成了指数

并发任务数 2030F 比 2026F 增 50 倍 ÷ 效率技术打掉的 3–4 倍 = 内存用量仍涨 10 倍以上

报告开篇给了一个物理事实:在 AI 与高性能计算里,内存才是主要的性能瓶颈——处理器的进步速度快过内存,I/O 受限、信号完整性下降,处理器越来越多的时间是在等数据。行业为绕开这道墙搞出的一整套办法,本质上都是在给内存想辙:HBM 把 DRAM 裸片直接垂直堆到封装里、片上缓存把热数据搬到最近处、存内计算干脆把算力挪到存储旁边、CXL 让处理器池化共享内存、光互连绕开铜的物理极限,再加上模型压缩把模型直接塞进片上缓存。

真正让需求变成指数的是推理取代训练成为主要负载之后的事。野村把一次智能体任务拆成八个阶段,逐段标出它吃的是哪一层内存——这张拆解是全篇的推演底座:

Stage 1

用户请求抵达 · 瓶颈在 CPU

提示词被分词、批处理、排队;编排器解析请求并准备执行计划。这一阶段几乎不碰 GPU 内存。

Stage 2

模型权重加载 · 瓶颈在 I/O

权重从 NVMe SSD 读出装进加速器内存,大模型靠张量/流水线并行分摊到多颗 GPU。野村给的量级:4.5 万亿参数的模型里约 0.51 万亿是活跃 MoE 专家权重(FP16 约 1TB)驻留 HBM,非活跃专家退到 HBF 或 DDR5,完整检查点落 SSD。

Stage 3

预填充 / 提示词处理 · 瓶颈在内存与算力

全部输入 token 并行过一遍 Transformer,注意力矩阵算完、KV 缓存初始化。报告给的经验值:每个 token 的 K、V 张量约 300KB(跨模型规模加权平均)。

Stage 4

推理与规划 · KV 缓存开始滚雪球

模型生成思维链、决定调哪些工具。每多一个 token,KV 缓存就长一截,内存压力随序列长度增长。溢出路径:HBM → HBF(温,1.6TB/s)→ DDR5(6–12 小时复用)→ SSD(24 小时冷存)。

Stage 5

工具执行 · 回到 CPU 侧

调用网页搜索、代码沙箱、文件 I/O、API。这一阶段主要跑在 CPU 上,几乎不碰 GPU 内存——但每次工具调用会唤起 20–50 台后端通用服务器(搜索、数据库、RAG)。

Stage 6

上下文整合 · 最吃内存的环节之一

工具返回的结果被分词、追加进对话,模型重新处理被撑大的上下文窗口。KV 缓存显著变大

Stage 7

多步迭代 · 内存压力的峰值

智能体循环把 4→6 阶段重复 N 遍,上下文一轮比一轮长。峰值出现在这里,可能顶到 HBM 的容量上限。野村测算:单次任务峰值内存约 1.5–5.3TB(未压缩)。

Stage 8

响应生成 · 收尾

最后的自回归解码产出输出 token,反分词、格式化,经 API 网关流式返回。完整 KV 缓存被读出,开始进入分层迁移的生命周期。

据 Nomura《ChangXin Memory Technologies — The DRAM in the Chinese crown; initiate at Buy》(2026-07-27) 第 5–7 页正文与 Fig. 4、Fig. 6(Nomura research)归纳 · 仅供学习研究。

拆完八阶段,报告顺势给了一张AI 内存分层表——这是理解「为什么 DRAM 是那个卡口」最快的一张图。每一层都在速度和容量之间做交易,而中间那两档(HBM 与主机 DDR)恰恰都是 DRAM:

层级容量带宽延迟角色
寄存器 / 缓存(SRAM)~MB 级~30+ TB/s< 1 nsGPU 流处理器内部的片上寄存器与暂存,计算单元间共享
HBM(DRAM)24–192 GB~3.3 TB/s~100 ns堆叠 DRAM,装权重、激活值、KV 缓存
HBF(NAND 闪存)最高 512 GB~1.6 TB/s~微秒高带宽闪存,容量是 HBM 的 8–16 倍 尚未量产
主机 DDR(DRAM)256 GB – 2 TB~100 GB/s~80 ns系统主内存,暂存数据与工具运行时
NVMe SSD(NAND)TB – PB~7–14 GB/s~微秒–毫秒检查点、数据集、任务产物的持久存储
网络聚合带宽400–3,200 Gb/s~微秒节点间互连(NVLink、InfiniBand 等),支撑分布式推理
据同报告 Fig. 5「AI memory hierarchy」(Nomura research)· 仅供学习研究。注意 HBF 一行:报告明确标注尚未具备量产条件,它在模型里是「未来可能的缓解手段」而非现实供给。

接下来是这篇报告最讲究的一段——它没有把需求算得很爽,而是先给自己打了折。野村列出六项已在生产环境里跑的内存效率技术,逐项标出压缩倍数,并且诚实地指出它们是乘法叠加的

效率技术压缩倍数作用对象说明
FP8 / INT4 KV 量化2–4×KV 位宽把缓存内存减半,精度影响很小;vLLM 原生支持
GQA 分组查询注意力KV 头数Llama 3:64 个查询头共用 8 个 KV 头,接近无质量损失
PagedAttention2–4×消除显存碎片把分配浪费从 60–80% 压到 <4%;vLLM / SGLang / TensorRT-LLM 的默认项
提示词 / 前缀缓存2–10×重复前缀复用共享提示的 KV 状态。Anthropic 口径成本降 90%,31% 的查询存在相似性
MLA 多头潜在注意力~15×KV 表示DeepSeek 方案:把 K/V 投影进学到的低维潜空间
TurboQuant5–6×KV 位宽(3 bit)Google 方案(PolarQuant + QJL),10.4 万 token 下 NIAH 召回 100%
据同报告 Fig. 7「Major memory efficiency technologies」(Company data, Nomura research)· 仅供学习研究。报告特别提示:这些技术乘法叠加理论上可达 4–40×,但实际节省不太可能超过 5×——因为权重量化(把 FP32/FP16 转成 INT8/INT4)是最大的单一因素,KV 压缩在它之上的增量更小。

把折扣打进去之后,野村逐阶段重算了一遍。以内存压力最大的第 7 阶段(多步迭代)为例:基线峰值 1.5–5.3TB,全部效率技术叠加之后降到 0.5–1.3TB,净压缩约 3–4 倍。全流程合计也是这个量级。这就是这篇报告给自己打的折——四分之一左右。

然后是乘法那一边。野村估计 2030 年的年度并发智能体任务数将是 2026 年的约 50 倍;即便每个任务的内存占用被效率技术压到只剩五分之一,两者相乘,智能体任务的内存用量仍要涨 10 倍以上。落到行业口径:即使非 AI 应用完全不增长,光 AI 一项就能把 2026–30 年的内存需求推到 60% 以上的复合增速(累计 7 倍以上)。

这一节最该记住的一句话

报告的原话是:内存需求实际上是这些变量的乘积函数(用户数 × 采用率 × 任务复杂度 × 推理 token 消耗 × 任务时长 …)。效率技术是除法,而且是有上限的除法(实际不超过 5 倍);用量增长是乘法,而且每一项都还在涨。这就是为什么野村敢把「内存缺口」当成一个可以下注五年的结构,而不是一个季度的景气。它也顺手给了一个更极端的假设:Cloudflare 首席执行官已经说过「机器人流量首次超过人类」——如果 AI 智能体开始自己给自己派活,需求的上限就不再由人的使用时间决定,而只由授权、基础设施和资本开支决定。

会 员 档 案 · 免 费 预 览 到 此
登录后继续阅读全文

免费注册即可阅读最新 3 篇深度报告全文;
会员一码解锁全部档案 + 产业链大课 + 白毛速报实时推送

登录 / 免费注册 →

已是会员?登录后本页自动显示全文 · 返回报告目录