王冠上的那颗 DRAM:
长鑫存储上市当天,野村首次覆盖就给了买入
这是一份典型的首次覆盖(initiation)——31 页,把行业推演、公司拆解、产能模型、供应链清单、估值与风险一次铺完。但它的结构有个不太常见的地方:整整前十页不讲长鑫,讲的是全球内存的供需缺口。等到第 12 页才第一次正经提到这家公司。这个顺序本身就是论点:野村不是把长鑫当成一个「国产替代」故事来卖,而是先证明「谁扩产谁就赢」,再论证长鑫是那个扩得最快的。
本文按这个顺序拆:先是需求端的乘法题,再是供给端的加法题,然后才是长鑫这家公司——它的家底、技术、产能、估值、以及那条最该被认真对待的风险线。文末专门留一节讲该冷静的地方,因为这份报告里有几个数字,很容易被读成它并不成立的意思。
一道乘法题:智能体把内存需求推成了指数
并发任务数 2030F 比 2026F 增 50 倍 ÷ 效率技术打掉的 3–4 倍 = 内存用量仍涨 10 倍以上
报告开篇给了一个物理事实:在 AI 与高性能计算里,内存才是主要的性能瓶颈——处理器的进步速度快过内存,I/O 受限、信号完整性下降,处理器越来越多的时间是在等数据。行业为绕开这道墙搞出的一整套办法,本质上都是在给内存想辙:HBM 把 DRAM 裸片直接垂直堆到封装里、片上缓存把热数据搬到最近处、存内计算干脆把算力挪到存储旁边、CXL 让处理器池化共享内存、光互连绕开铜的物理极限,再加上模型压缩把模型直接塞进片上缓存。
真正让需求变成指数的是推理取代训练成为主要负载之后的事。野村把一次智能体任务拆成八个阶段,逐段标出它吃的是哪一层内存——这张拆解是全篇的推演底座:
用户请求抵达 · 瓶颈在 CPU
提示词被分词、批处理、排队;编排器解析请求并准备执行计划。这一阶段几乎不碰 GPU 内存。
模型权重加载 · 瓶颈在 I/O
权重从 NVMe SSD 读出装进加速器内存,大模型靠张量/流水线并行分摊到多颗 GPU。野村给的量级:4.5 万亿参数的模型里约 0.51 万亿是活跃 MoE 专家权重(FP16 约 1TB)驻留 HBM,非活跃专家退到 HBF 或 DDR5,完整检查点落 SSD。
预填充 / 提示词处理 · 瓶颈在内存与算力
全部输入 token 并行过一遍 Transformer,注意力矩阵算完、KV 缓存初始化。报告给的经验值:每个 token 的 K、V 张量约 300KB(跨模型规模加权平均)。
推理与规划 · KV 缓存开始滚雪球
模型生成思维链、决定调哪些工具。每多一个 token,KV 缓存就长一截,内存压力随序列长度增长。溢出路径:HBM → HBF(温,1.6TB/s)→ DDR5(6–12 小时复用)→ SSD(24 小时冷存)。
工具执行 · 回到 CPU 侧
调用网页搜索、代码沙箱、文件 I/O、API。这一阶段主要跑在 CPU 上,几乎不碰 GPU 内存——但每次工具调用会唤起 20–50 台后端通用服务器(搜索、数据库、RAG)。
上下文整合 · 最吃内存的环节之一
工具返回的结果被分词、追加进对话,模型重新处理被撑大的上下文窗口。KV 缓存显著变大。
多步迭代 · 内存压力的峰值
智能体循环把 4→6 阶段重复 N 遍,上下文一轮比一轮长。峰值出现在这里,可能顶到 HBM 的容量上限。野村测算:单次任务峰值内存约 1.5–5.3TB(未压缩)。
响应生成 · 收尾
最后的自回归解码产出输出 token,反分词、格式化,经 API 网关流式返回。完整 KV 缓存被读出,开始进入分层迁移的生命周期。
拆完八阶段,报告顺势给了一张AI 内存分层表——这是理解「为什么 DRAM 是那个卡口」最快的一张图。每一层都在速度和容量之间做交易,而中间那两档(HBM 与主机 DDR)恰恰都是 DRAM:
| 层级 | 容量 | 带宽 | 延迟 | 角色 |
|---|---|---|---|---|
| 寄存器 / 缓存(SRAM) | ~MB 级 | ~30+ TB/s | < 1 ns | GPU 流处理器内部的片上寄存器与暂存,计算单元间共享 |
| HBM(DRAM) | 24–192 GB | ~3.3 TB/s | ~100 ns | 堆叠 DRAM,装权重、激活值、KV 缓存 |
| HBF(NAND 闪存) | 最高 512 GB | ~1.6 TB/s | ~微秒 | 高带宽闪存,容量是 HBM 的 8–16 倍 尚未量产 |
| 主机 DDR(DRAM) | 256 GB – 2 TB | ~100 GB/s | ~80 ns | 系统主内存,暂存数据与工具运行时 |
| NVMe SSD(NAND) | TB – PB | ~7–14 GB/s | ~微秒–毫秒 | 检查点、数据集、任务产物的持久存储 |
| 网络 | 聚合带宽 | 400–3,200 Gb/s | ~微秒 | 节点间互连(NVLink、InfiniBand 等),支撑分布式推理 |
接下来是这篇报告最讲究的一段——它没有把需求算得很爽,而是先给自己打了折。野村列出六项已在生产环境里跑的内存效率技术,逐项标出压缩倍数,并且诚实地指出它们是乘法叠加的:
| 效率技术 | 压缩倍数 | 作用对象 | 说明 |
|---|---|---|---|
| FP8 / INT4 KV 量化 | 2–4× | KV 位宽 | 把缓存内存减半,精度影响很小;vLLM 原生支持 |
| GQA 分组查询注意力 | 8× | KV 头数 | Llama 3:64 个查询头共用 8 个 KV 头,接近无质量损失 |
| PagedAttention | 2–4× | 消除显存碎片 | 把分配浪费从 60–80% 压到 <4%;vLLM / SGLang / TensorRT-LLM 的默认项 |
| 提示词 / 前缀缓存 | 2–10× | 重复前缀 | 复用共享提示的 KV 状态。Anthropic 口径成本降 90%,31% 的查询存在相似性 |
| MLA 多头潜在注意力 | ~15× | KV 表示 | DeepSeek 方案:把 K/V 投影进学到的低维潜空间 |
| TurboQuant | 5–6× | KV 位宽(3 bit) | Google 方案(PolarQuant + QJL),10.4 万 token 下 NIAH 召回 100% |
把折扣打进去之后,野村逐阶段重算了一遍。以内存压力最大的第 7 阶段(多步迭代)为例:基线峰值 1.5–5.3TB,全部效率技术叠加之后降到 0.5–1.3TB,净压缩约 3–4 倍。全流程合计也是这个量级。这就是这篇报告给自己打的折——四分之一左右。
然后是乘法那一边。野村估计 2030 年的年度并发智能体任务数将是 2026 年的约 50 倍;即便每个任务的内存占用被效率技术压到只剩五分之一,两者相乘,智能体任务的内存用量仍要涨 10 倍以上。落到行业口径:即使非 AI 应用完全不增长,光 AI 一项就能把 2026–30 年的内存需求推到 60% 以上的复合增速(累计 7 倍以上)。
报告的原话是:内存需求实际上是这些变量的乘积函数(用户数 × 采用率 × 任务复杂度 × 推理 token 消耗 × 任务时长 …)。效率技术是除法,而且是有上限的除法(实际不超过 5 倍);用量增长是乘法,而且每一项都还在涨。这就是为什么野村敢把「内存缺口」当成一个可以下注五年的结构,而不是一个季度的景气。它也顺手给了一个更极端的假设:Cloudflare 首席执行官已经说过「机器人流量首次超过人类」——如果 AI 智能体开始自己给自己派活,需求的上限就不再由人的使用时间决定,而只由授权、基础设施和资本开支决定。
免费注册即可阅读最新 3 篇深度报告全文;
会员一码解锁全部档案 + 产业链大课 + 白毛速报实时推送。
已是会员?登录后本页自动显示全文 · 返回报告目录