8 张 B200 跑赢 72 卡的机柜
SemiAnalysis 说,一个编译器正在抢 Cerebras 和 Groq 的饭碗
这份报告的起点是一条榜单上的异常值:在「单个用户每秒能收到几个字」这项指标上,一台 8 卡 B200 服务器,超过了 72 张卡用铜背板互联起来的 GB300 NVL72 旗舰机柜。
赢的不是新硬件。赢的是一个叫 TileRT 的编译器——它把原本上千次分别启动的 GPU 内核,静态编译成一个从头跑到尾的常驻内核。
数字很硬:1k 输入/1k 输出场景下 494.2 tokens/s/user,是传统引擎同精度最佳成绩的 3.6 倍;换算成钱,比同精度的传统方案每 token 便宜 61%,同时快 3.1 倍。
但 SemiAnalysis 真正想问的不是「快多少」,而是一个更要命的问题:如果软件能在你本来就要买的 GPU 上,随时切出一个「速度档」,那么 Cerebras、Groq、SambaNova 这些专用推理芯片,卖的到底还是什么?
赢的不是新硬件。赢的是一个叫 TileRT 的编译器——它把原本上千次分别启动的 GPU 内核,静态编译成一个从头跑到尾的常驻内核。
数字很硬:1k 输入/1k 输出场景下 494.2 tokens/s/user,是传统引擎同精度最佳成绩的 3.6 倍;换算成钱,比同精度的传统方案每 token 便宜 61%,同时快 3.1 倍。
但 SemiAnalysis 真正想问的不是「快多少」,而是一个更要命的问题:如果软件能在你本来就要买的 GPU 上,随时切出一个「速度档」,那么 Cerebras、Groq、SambaNova 这些专用推理芯片,卖的到底还是什么?
01
为什么会有人愿意为「快」多付钱
先说清楚这场比赛比的是什么,不然后面所有数字都读不出味道
过去两年,AI 推理的竞赛口径基本只有一个:每张卡每秒能产出多少 token。这个指标决定成本,成本决定毛利,一切都很清楚。
2026 年出现了第二条赛道。报告开篇给的证据是商业性的:各家开始卖溢价「快速模式」,而用户真的愿意为更低的延迟、更快的出字速度多付钱——这意味着它可能带来更高的毛利率,而不只是更好的体验。
需求从哪来?报告点了两类:实时助手与全双工语音。它举的例子是 OpenAI GPT-Live——能同时听和说,于是响应延迟不再是一个后台指标,而是用户立刻能感觉到的东西,报告转述业界的形容是「像钢铁侠的贾维斯」。
正因为这条需求出现了,前沿实验室开始认真评估专门为超低延迟造的推理系统——Cerebras、NVIDIA 旗下的 Groq LPU 都在被评估之列。它们的共同特点是:牺牲最大批量吞吐,换单用户的极致速度。
而这份报告要讲的事情是:有人用纯软件的方式,在标准 GPU 上闯进了这条赛道。
登录 / 免费注册 →
注册免费,可读注册层内容;解锁全部档案凭会员兑换码 · 返回报告目录
还没有兑换码?扫码领 ¥100 券,直接加入知识星球
- 📡Serenity 实时订阅 全网订阅第一「白毛股神」一手推文,分钟级中译直推邮箱,每天约 20~30 条,含她付费订阅才有的独家内容
- 💼白毛持仓 · 完整台账 她公开推文里亲口说过的持仓,整理成一张带原话出处的表:75 只在持 · 43 只明确否认 · 16 只已清仓,每条带首次披露日、成本锚与最后确认日,新披露实时上表。不是荐股,是「她说过什么」的可核对记录
- 📈大行研报 · ima 知识库对话 境内外一线投行研报每日汇入腾讯 ima 知识库(AI 相关精选 7,000+ 份、境内外日增 30+),你在库里通过 AI 对话随问随答、带出处,等于雇个 7×24 研究助理
- 🗺️知识库全开 + 深度报告解析 1,151 公司 / 694 概念全词条 + 全景图谱,外加 86 篇机构深度报告可视化解读、巨头供应链拆解、产业大事件复盘
- 🎓两套课程全解锁 金融人的产业链大课 18 讲(能源→芯片→基础设施→模型→应用,每周上新)+ 公司深度研究 27 门(英伟达 / 台积电 / SK 海力士 / 博通 / 中际旭创…一家公司一门课,分单元、节节带测验、给成绩单)
- 💬会员微信群 入圈后可加入会员微信群,会员之间日常交流,我也在群里
全站会员 ¥599 / 年
扫码自动领 ¥100 优惠券 · 到手 ¥499
9 月 30 日 12:00 到期 · 仅剩 18 天
9 月 30 日 12:00 到期 · 仅剩 18 天