AI产业链地图·知识库 AI深度报告解析 · CS-4 拆解
🚧 网站建设中 → 产业链图谱
SemiAnalysis · 第二层芯片系统 · 推理硬件 · 晶圆级引擎

2,000 倍的带宽
30 倍的速度

2026 年 8 月 19 日,SemiAnalysis 发出对 Cerebras 新一代机器 CS-4 的拆解,署名五人:Myron Xie、Bryan Shan、Wega Chu、Jordan Nanos、Dylan Patel
CS-4 是 Cerebras 的第四代机柜,用的却还是第三代那片 5 纳米晶圆——WSE-3,一颗芯片就是一整片晶圆。芯片没换,性能翻倍:靠的是把时钟频率翻倍,而时钟之所以能翻倍,是因为往这片晶圆里灌了远比上一代更多的电,并且把供电和散热重做了一遍。
Cerebras 最爱说的数字是 43 PB/s 的片上内存带宽,宣称约为英伟达 Rubin 的 2,000 倍。而它自己给出的速度提升是「最高 30 倍」,SemiAnalysis 的独立估算是 20–40 倍。这中间几十倍的落差不是营销注水,是这套架构的物理事实——本篇要讲清楚它从哪来。以及那个这一代完全没有改善、却决定你要买 20 台还是 40 台的数字:每片晶圆 44 GB。
作者 Myron Xie、Bryan Shan、Wega Chu、Jordan Nanos、Dylan Patel 日期 2026 年 8 月 19 日 来源 SemiAnalysis(付费订阅)
01

同一片晶圆,翻倍的只是时钟

这一代的全部故事,可以用三句话说完

先把整份报告的骨架摆出来,后面每一节都是在给这三句话补细节:

  • 一、硅片没变。CS-4 用的是和 CS-3 一模一样的 5 纳米 WSE-3。在一个「换代靠换制程」的行业里,这是件反常的事。
  • 二、翻倍靠灌电。Cerebras 把时钟频率翻倍,代价是给晶圆喂进去多得多的功率;能喂进去,是因为 CS-4 把供电与散热技术重做了。时钟翻倍带来三件事同时翻倍:内存带宽、理论峰值算力、片外 I/O 带宽。而在推理这件事上,真正决定「一个用户每秒能收到多少字」的是内存带宽
  • 三、有一样东西没跟着翻。每片晶圆的 SRAM 容量仍是 44 GB——因为它由晶圆上物理存在的存储单元数量决定,不换硅片就不可能变。报告称这是沿用 WSE-3 的主要代价,而低内存容量本来就是 Cerebras 架构最核心的取舍。

报告对客户价值的总结很直白:同样的硬件开支,换到接近两倍的交互速度和两倍的 token 收入——「对客户来说这是不用想的选择」。但 SemiAnalysis 同时把话说到了另一头:Cerebras 仍然是一个非常昂贵的方案,它赌的是客户愿意为「快」多付很多钱。

44GB
每片晶圆的 SRAM 容量
与 CS-3 完全相同——本篇的主角
时钟、内存带宽、峰值算力、片外 I/O
片外 I/O 由 1.2 Tb/s 升至 2.4 Tb/s
3 片
每个机柜容纳的晶圆数
CS-3 为 2 片
≈4,000
SemiAnalysis 估算的 tokens/秒/用户
CS-3 约 2,000;Blackwell 现实值约 100
据 SemiAnalysis《Cerebras's Next Generation CS-4: Fast Just Got Faster》(2026 年 8 月 19 日)正文各节。44 GB、2.4 Tb/s、3 片/机柜、4,000 与 2,000 tokens/秒/用户均为报告原文给出;Blackwell 的 100 为报告给的「合理并发下的现实值」(其理论上限 200,报告注明「没人真的那样跑」)。仅供学习研究。
02

补课:什么是晶圆级引擎,以及为什么 SRAM 是它的命门

本节不是报告原文,是本站为不熟悉这套架构的读者垫的地基

要理解后面所有的数字,先要理解 Cerebras 到底是一种什么东西——因为它和英伟达不是同一类产品的两个牌子,而是两条不同的路。

常规做法:小芯片 + 外挂内存。一颗 GPU 从一片 300 毫米晶圆上切下来,一片晶圆能切几十上百颗。模型权重放不进芯片里,就外挂一圈 HBM——高带宽内存。计算的时候,数据要从 HBM 搬进芯片再搬回去,这一来一回就是 GPU 推理的主要瓶颈。

Cerebras 的做法:不切。整片晶圆就是一颗芯片,面积是单颗 GPU 的几十倍。它不外挂 HBM,而是把存储直接做在晶圆上,用的是 SRAM——那种平时只用来做 CPU 高速缓存的存储。好处是带宽极高、延迟极低,数据几乎不用出门;代价也直接:SRAM 每比特占的硅面积远大于 DRAM,所以整整一片晶圆也只装得下 44 GB。

对照一下量级就明白这个取舍有多极端:一片 Cerebras 晶圆的存储容量,和一张高端 AI 加速卡的显存是同一个数量级——但它的物理面积是后者的几十倍。Cerebras 用几十倍的面积,换来的不是容量,是带宽。

为什么这个取舍恰好对上了「推理」(本站补充)

报告里反复出现一个词:算术强度(arithmetic intensity)。它指的是「每从内存搬一个字节,能顺带做多少次计算」。
训练的算术强度高——一批数据进来要做大量矩阵运算,算力是瓶颈。
而推理的解码阶段算术强度极低:每生成一个字,都要把模型的相关权重完整读一遍,却只做很少的计算。并发用户越少(低批量),这个比例越难看——算力大量闲置,全在等内存。
这就是 Cerebras 的立足点:它把带宽堆到极致,专攻低算术强度的低批量解码。报告的原话是,SRAM 架构使这片晶圆「特别适合运行低算术强度的核函数,例如低批量解码」。
反过来说,它的短板也由此注定:预填充(prefill)阶段是算力密集的,Cerebras 的性能曲线并不适合——报告明确说,在所有解耦配置里,Cerebras 都只担任解码芯片。

登录 / 免费注册 →

注册免费,可读注册层内容;解锁全部档案凭会员兑换码 · 返回报告目录

还没有兑换码?扫码领 ¥100 券,直接加入知识星球
  • 📡Serenity 实时订阅 全网订阅第一「白毛股神」一手推文,分钟级中译直推邮箱,每天约 20~30 条,含她付费订阅才有的独家内容
  • 💼白毛持仓 · 完整台账 她公开推文里亲口说过的持仓,整理成一张带原话出处的表:75 只在持 · 43 只明确否认 · 16 只已清仓,每条带首次披露日、成本锚与最后确认日,新披露实时上表。不是荐股,是「她说过什么」的可核对记录
  • 📈大行研报 · ima 知识库对话 境内外一线投行研报每日汇入腾讯 ima 知识库(AI 相关精选 7,000+ 份、境内外日增 30+),你在库里通过 AI 对话随问随答、带出处,等于雇个 7×24 研究助理
  • 🗺️知识库全开 + 深度报告解析 1,151 公司 / 694 概念全词条 + 全景图谱,外加 86 篇机构深度报告可视化解读、巨头供应链拆解、产业大事件复盘
  • 🎓两套课程全解锁 金融人的产业链大课 18 讲(能源→芯片→基础设施→模型→应用,每周上新)+ 公司深度研究 27 门(英伟达 / 台积电 / SK 海力士 / 博通 / 中际旭创…一家公司一门课,分单元、节节带测验、给成绩单)
  • 💬会员微信群 入圈后可加入会员微信群,会员之间日常交流,我也在群里
微信扫码领优惠券并加入知识星球
全站会员 ¥599 / 年
扫码自动领 ¥100 优惠券 · 到手 ¥499
9 月 30 日 12:00 到期 · 仅剩 18 天