SemiAnalysis 算机器人该在哪推理:放数据中心成本不到机载芯片一半,难在无线网络
- SemiAnalysis 按一块 B300 带 12 台机器人测算:工业场景下推理放进数据中心,单位算力成本是机器人自带 Jetson Thor 的 46%,家用场景低到 12%。
- 省钱全靠利用率:不计利用率两者单位算力成本几乎一样,差距来自 GPU 按 90%、机载芯片按 40% 满负荷的假设;一块 GPU 至少要带 5 台机器人才划算。
- 实际部署多数仍放机身:Sunday 进家庭测试两天就因 WiFi 抖动放弃云端推理,Agility、Verne 的模型都在机身上跑;波士顿动力是少数把推理层放到谷歌 TPU 上的公司。
SemiAnalysis 2026 年 9 月 14 日发布的长文,作者 Ivan Chiam、Gianluca Bencomo、Zane Fong、Bryan Shan、Dylan Patel、Reyk Knuhtsen。它回答一个问题:通用机器人的「大脑」应该装在机器人身上,还是放在数据中心的 GPU 上。
全文分四块:机器人模型分几层、哪一层能离开机器人;芯片与内存供应链对两条路线的约束;B300、RTX PRO 6000、Jetson Thor 三套方案的总拥有成本;以及五家已经在出货的机器人公司各自怎么选、为什么。
讨论范围:只谈能听懂开放指令、适应陌生场景的通用机器人。工厂里跑了几十年的传统运动控制,以及只干一件事的窄域策略模型,本来就跑在小芯片上,不在讨论之列。
口径说明:原文为英文,本篇为中文重制与注释,金额均为美元。报告正文与表格有两处数字不一致,本站以表格为准并在对应位置注明。凡本站计算或解读之处,均标注「本站」。
机器人模型为什么还小:先定硬件,再让模型去适配
和大语言模型的顺序正好相反
大语言模型的做法是先训练、再想办法部署:模型第一,硬件第二。报告说机器人把这个顺序倒了过来,原因是两条约束。
- 时间:机器人跑的是实时控制回路,不能错过截止时间。聊天机器人慢一点只是让人多等;机器人慢一点,周围环境已经变了,算出来的动作就作废了。
- 成本:用大模型时,屏幕是用户自己的。机器人则要由制造商在每一台上预先装好算力并买单,规模上去之后是数十亿美元量级的资本开支。
所以机器人身上的硬件是固定的,模型要去适配能以合理成本造出来的硬件。报告的原话意思是:前沿机器人模型的能力上限,会被「买得起、跑得了实时」的硬件卡住。
这解释了为什么机器人模型比大语言模型小两到三个数量级。报告也提醒,机器人模型的参数量不像大语言模型那样有意义:大模型实验室按训练预算和推理成本选尺寸,机器人实验室按数据能撑多大、装得进 Jetson 或 H100 延迟预算来选。参数量反映的是约束在哪,不是尺寸最终停在哪。
| 模型 | 机构 | 参数量 | 在哪跑 |
|---|---|---|---|
| π0 | Physical Intelligence | 约 30 亿 | — |
| π0.7 | Physical Intelligence | 50 亿 | 机器人外的一块 H100 |
| GR-3 | 字节跳动 | 40 亿 | — |
| GEN-0 等 | Generalist | 约 100 亿 | — |
| DreamZero | 英伟达 | 140 亿 | 机器人外两块 GB200 才能实时 |
| RoboTTT | 英伟达 | 约 30 亿 | 足够小,可装在机器人上 |
| 对照:大语言模型 | |||
| gpt-oss | OpenAI | 1,200 亿 | — |
| GLM-5 | 智谱 | 7,440 亿 | — |
| Kimi K3 | 月之暗面 | 2.8 万亿 | — |
模型尺寸往哪走,报告没有下结论。DreamZero 是一个基于视频扩散的世界动作模型,140 亿参数要两块 GB200 才能实时跑;几个月后英伟达的 RoboTTT 走了反方向,用约 30 亿参数、靠测试时训练不断更新自身权重,换来几分钟的可用上下文,而且小到能装在机器人上。
报告的判断是「多种方案并存」:有的机器人全部机载,有的把一部分认知放到数据中心。对需要真正智能的通用机器人,SemiAnalysis 倾向于机器人外的算力,理由是能摆脱机身的算力和功耗预算,还能在整个机队之间共享推理资源。代价是网络问题。
哪一层能离开机器人:看它每秒要算多少次
控制频率高于约 100 Hz 的回路永远留在机身上
报告把机器人模型分三层。频率越低的层参数越多,这是整篇论证的出发点。
| 层 | 做什么 | 运行频率 | 参数规模 | 能否放出去 |
|---|---|---|---|---|
| 规划层 | 理解指令和场景,决定下一步做什么:子任务、目的地、抓取姿态、落脚点 | 低于 20 Hz | 数十亿 | 可以 |
| 动作层 | 把规划输出变成短动作序列、身体姿态、速度(视觉运动控制) | 20–100 Hz | 数百万 | 留在机身 |
| 伺服与安全层 | 估计自身状态,应对接触与打滑,保持平衡,驱动电机,急停 | 高于 200 Hz | 数千 | 留在机身 |
算术很直接。100 Hz 的回路每 10 毫秒要出一次结果,一次无线往返就把预算吃光了,模型还没开始算。所以高于约 100 Hz 的层不可能离开机器人。
规划层不一样。5 Hz 的规划器每次决策有 200 毫秒,10–50 毫秒的往返放得下,还有余量。报告认为网络栈调得好,可放出去的边界还能推到 20 Hz 以上。
真正的难点是抖动,不是平均延迟。固定延迟可以提前规划:系统知道这段时间里自己和周围会移动多少。抖动让指令到达的间隔忽长忽短,机器人不知道下一条什么时候来。可以按最坏情况缓冲,把不确定的延迟变成确定的,但那样每个动作都要付最坏情况的代价。报告的结论是:控制住抖动,才能把规划层放出去。
规划层恰好也是算力需求最重的一层,而且泛化要求越高越重:开放任务需要推理,推理模型都大。
机器人能买到的最强芯片,和数据中心差一个数量级
Jetson Thor 的算力约为 GB200 的十分之一,内存带宽约为三十分之一
| 指标 | B200 / GB200 | B300 / GB300 | Jetson AGX Thor |
|---|---|---|---|
| 芯片功耗(W) | 1,000 / 1,200 | 1,200 / 1,400 | 40–130 |
| 代工节点 | 台积电 4NP | 台积电 4NP | 台积电 4NP |
| FP4 稠密算力(每封装 PFLOPs) | 9 / 10 | 14 / 15 | 1.04 |
| 内存 | 192GB HBM3E | 288GB HBM3E | 128GB LPDDR5X |
| 内存带宽 | 8 TB/s | 8 TB/s | 273 GB/s |
以 Jetson Thor 为 1,GB300 各项指标的倍数:
功耗是装不上去的直接原因。报告给的数字:一台人形机器人带约 2 kWh 电池,正常行走功耗几百瓦,峰值连同全部部件一两千瓦,所以机载 GPU 通常是 40–130 W 的 Jetson Thor。一块数据中心级 Blackwell 要 1.2–1.4 kW、需要液冷机架。装到机器人上,这一块芯片的功耗就超过整台机器,散热背不动,电池几分钟就耗光。
供应链:机器人芯片排在晶圆和内存队伍的末尾
英伟达没有理由把稀缺产能让给利润更低、量更小的 Jetson
报告用英伟达自己的出货结构说明这一点:2023–2024 年是 Hopper 爬坡,2025–2026 年 Blackwell 占满出货,Jetson 在图上只是底部一条几乎看不见的细线,到 2026 年也一样。机器人市场还在早期,真正的量在几年之后。
利润率也指向同一个方向。报告称数据中心 Blackwell 毛利率在 70% 中高段,Jetson 模组在 60% 中段。按 SemiAnalysis 加速器模型,Jetson Thor 的物料成本约 $1,103,平均售价约 $3,000,毛利率约 63%。报告认为需求起来后 Jetson 会涨价、利润率会拐头,但眼下英伟达有充分理由把先进制程产能留给数据中心。
| AI 加速器占该节点产能比例 | 2025 | 2026 | 2027 | 2028 | 2029 | 2030 |
|---|---|---|---|---|---|---|
| N3 | 3% | 26% | 56% | 67% | 31% | 22% |
| N2 | — | — | — | 11% | 47% | 64% |
| N5 及更先进合计 | 14% | 20% | 25% | 33% | 37% | 45% |
但报告也说明,机器人自己的晶圆需求并不构成压力。2030 年假设出货 100 万颗 Jetson 级芯片,每颗约 400 mm²,全年只需约 1 万片晶圆,和数据中心 GPU 相比可以忽略。要到每年上千万颗芯片(远在 2030 年之后),供给才会紧。
所以报告换了一个问题:服务同样一支机器人队伍,哪种方案消耗的先进晶圆和内存更少。在产能稀缺时,省硅的方案才能放量。
内存这条更紧。Jetson 每一代的 DRAM 都在翻倍:Xavier 32GB、AGX Orin 64GB、Thor 128GB LPDDR5X。报告指出 DRAM 晶圆总产能虽在增长,但新增部分大多被 AI 加速器的 HBM 吸走,留给 LPDDR 这类普通内存的晶圆池在缩小,而机器人大脑用的正是这一类。
成本账:同样服务 96 台机器人,三套方案各花多少
SemiAnalysis 先实测一块 GPU 能带几台机器人,再算总拥有成本
测什么模型:英伟达的 RoboTTT。它没有公开代码和权重,SemiAnalysis 用真实的 GR00T N1.7 权重,在动作头里插入 16 个测试时训练模块,按论文的计算量和内存特征重建了一个「计时等效」版本。这个版本输出的动作没有意义,测的只是服务成本,不是任务成功率。
RoboTTT 比普通VLA 模型更难批量服务:每台机器人各带 151 MB 的「快权重」状态,每次批量推理前要收集、推理后要写回,共享权重的模型没有这笔开销。
测试条件:每个动作块截止时间 500 毫秒,每台机器人每秒 2 次请求,5 轮、每轮 180 秒。
据此设三个方案,都服务 96 台机器人。机器人的机械部件、外壳等三者共有的部分不计入。
- B300 外置:一台 8 卡 B300 服务器,每卡带 12 台,另配 96 块无线收发卡。
- RTX PRO 6000 外置:每卡只能带 4 台,需要三台 8 卡服务器。
- Jetson Thor 机载:96 台机器人每台一颗 Thor(按每颗 $3,500),各自配底板、512GB 固态盘、散热、增加的电池容量和机载无线,另按约 7% 备件。
| 项目 | B300 外置 | RTX PRO 6000 外置 | Jetson Thor 机载 |
|---|---|---|---|
| 总资本开支 | $554,434 | $436,539 | $394,958 |
| 折旧年限 | 6 年 | 6 年 | 4 年 |
| 资本成本(WACC) | 10.3% | 10.3% | 10.3% |
| 资本成本 / 小时 | $14.19 | $11.17 | $13.80 |
| 运营成本 / 小时(托管、电力等) | $4.44 | $7.48 | $1.17 |
| 总拥有成本 / 小时 | $18.63 | $18.65 | $14.97 |
| 方案总 FP4 稠密算力(PFLOPs) | 120 | 48 | 100 |
| 方案总内存带宽(TB/s) | 64 | 38 | 26 |
| 每单位 FP4 算力成本(未计利用率) | $0.16 | $0.39 | $0.15 |
几点值得注意:
- Jetson 折旧只按 4 年。数据中心机架里的 GPU 不动,机器人身上的芯片整天振动、磕碰,有时还会摔、进水。报告说有运营方给的数字比 4 年还短。报告还提到机器人公司多靠股权融资,资本成本理应更高,但因为已经用更短的折旧年限做了保守处理,三个方案统一用 10.3%。
- RTX PRO 6000 被排除。每单位算力成本 $0.39,是另外两个的两倍多,报告此后只比较 B300 和 Jetson Thor。
- 本站核对:不计利用率时,B300 与 Jetson Thor 每单位算力成本几乎一样($0.155 对 $0.150),Jetson 还略低。按整支队伍的小时账单算,机载方案 $14.97 反而比 B300 方案 $18.63 便宜约 20%。外置方案的优势要在下一步加入利用率后才出现。
决定胜负的是利用率:GPU 按 90% 算,机载芯片按 40% 算
机器人和 GPU 几乎全是固定资产,闲着也照样花钱
报告的逻辑是:设备开不开工账单都一样,每个有效工作小时的成本和开工时间成反比。机载芯片只在自己那台机器人干活时有用,数据中心 GPU 可以被整支队伍轮流用。
机载芯片的实际利用率差别很大:
- 家庭:一家已批量部署的公司告诉 SemiAnalysis,它的机器人每天只干 1–2 小时,占全天 4–8%。家务是零散的,现在的模型能无人看管完成的活也有限。这个数在往每天 4–5 小时(17–21%)走,但家务总有做完的时候,上限很硬。
- 工业:报告能拿到的锚点是 Figure 在宝马工厂的部署,约 11 个月的工作日班次累计约 1,250 个运行小时,每天约 10 小时,利用率约 40%。
| 部署场景 | 每天工作小时 | 利用率 |
|---|---|---|
| 家庭 · 低 | 2 | 8.3% |
| 家庭 · 中 | 5 | 20.8% |
| 家庭 · 高 | 10 | 41.7% |
| 工业 · 低 | 10 | 41.7% |
| 工业 · 中 | 15 | 62.5% |
| 工业 · 高 | 20 | 83.3% |
基准假设:机载芯片按工业场景 40%;B300 一块卡带满 12 台机器人,按 90%(报告把 GPU 利用率定义为实际服务机器人数除以最大批量,上限 90%)。计入利用率后:
B300 外置方案的单位算力成本是 Jetson Thor 机载的 46%。换成家庭场景(机载利用率 10%),降到约 12%。
报告做了一张敏感性矩阵,行是机载芯片利用率,列是 B300 利用率,格子里是「外置成本 ÷ 机载成本」。小于 1 表示放数据中心更便宜,加粗的格子表示机载更便宜:
| 机载利用率 \ B300 利用率 | 60% | 70% | 80% | 90% | 100% |
|---|---|---|---|---|---|
| 10% | 0.17 | 0.15 | 0.13 | 0.12 | 0.10 |
| 20% | 0.35 | 0.30 | 0.26 | 0.23 | 0.21 |
| 30% | 0.52 | 0.44 | 0.39 | 0.35 | 0.31 |
| 40%(基准) | 0.69 | 0.59 | 0.52 | 0.46 | 0.41 |
| 50% | 0.86 | 0.74 | 0.65 | 0.58 | 0.52 |
| 60% | 1.04 | 0.89 | 0.78 | 0.69 | 0.62 |
| 70% | 1.21 | 1.04 | 0.91 | 0.81 | 0.72 |
| 80% | 1.38 | 1.18 | 1.04 | 0.92 | 0.83 |
| 90% | 1.55 | 1.33 | 1.16 | 1.04 | 0.93 |
| 100% | 1.73 | 1.48 | 1.29 | 1.15 | 1.04 |
两边利用率相同的格子(60%/60%、70%/70% … 100%/100%)都是 1.04,也就是机载反而便宜 4%。这和第 05 节未计利用率的数字一致($0.155 ÷ $0.150 ≈ 1.04)。
所以 46% 这个结论完全来自 90% 对 40% 这组利用率假设,不来自硬件本身更划算。GPU 要做到 90%,前提是它服务的机器人比它同时能带的更多,或者机器人分布在不同班次、不同时区,轮流用满这块卡。
如果一家工厂只为自己那 96 台、每台 40% 开工的机器人配一台服务器,GPU 也只会跟着忙 40% 左右,两种方案就回到几乎打平。报告自己也说,只有「机器人数量很少、现场服务器大部分时间闲着」时机载更合适,并建议这种情况按需租用算力,而不是买一整台服务器。
报告还按「每块 B300 带几台机器人」算了一遍(机载利用率固定 40%):从每卡 5 台起,外置方案的单位算力成本就低于 Jetson Thor;带 1 台时约 $1.80,带满 12 台降到约 $0.17。RTX PRO 6000 带满 4 台也只到约 $0.43,始终高于 Thor 的 $0.37。
已出货的公司怎么选:五家里四家把模型留在机身上
决定因素是任务需要多强的泛化、无线环境多差、能不能改客户现场
报告自己承认:纸面上外置更便宜,但还没有哪家量产,今天决定选择的不是总拥有成本。等机队规模变大,成本才开始起作用。
| 公司 | 场景与产品 | 模型 | 推理放在哪 | 主要原因 |
|---|---|---|---|---|
| 波士顿动力 | 汽车厂、仓库;人形机器人 Atlas 今年投产(开发机,非量产) | 推理层参照 DeepMind 的 Gemini Robotics ER,报告估计数千亿参数甚至上万亿 | 拆开:动作层在机载 Jetson Thor,推理层在谷歌 TPU | 工厂任务需要强泛化,这么大的模型机身装不下 |
| Agility Robotics | 仓库、工厂;双足人形 Digit,客户含 GXO、Schaeffler、亚马逊、丰田加拿大 | 第三方基座模型上做后训练 | 机载 Jetson 级芯片;调度、地图、远程升级在云端 | 不想改造客户网络;安全决策必须在本机 |
| Verne Robotics | 仓库、轻制造;轮式双臂 Nemo | 自研端到端策略,估计数十亿参数 | 全部机载(Jetson 级或 RTX 50 系列) | 拣选、打包、装配不需要开放世界推理 |
| Sunday Robotics | 家庭;轮式升降机器人 Memo | 自研基座模型 ACT-1、ACT-2 | 原计划云端,改为全部机载 | 家庭 WiFi 抖动 |
| Weave Robotics | 家庭;叠衣机器人 Isaac 0,今秋出 Isaac 1 | 自研 VLA,也用 Physical Intelligence 模型,均估计数十亿参数 | 报告预计机载 | 模型够小;不要求用户换路由器 |
波士顿动力:把推理层放在无线链路另一端
它把栈分成两层。System 1 是驱动机器人的 VLA,接收摄像头画面和一句短指令(例如「把罐子放进贴绿点的箱子」),输出电机动作,因为动作对延迟和确定性要求高,放在机载 Jetson Thor 上。System 2 是规划者,接收制造执行系统的工单(例如「执行 345 号任务,结果放进 5 号料箱」),拆成 System 1 能执行的步骤。
工厂的「5 号料箱」对 VLA 没有意义,所以 System 2 在机器人视野里给正确的箱子标了一个绿点,这类「翻译」是它的核心工作之一。它还负责监督,发现 System 1 出错并跟踪进度,所以调用频率比外界想的高:通常几秒到十秒一次,有时每秒一两次。System 2 通过公司的机队软件 Orbit 调用,目前在谷歌 TPU 上运行,来自与 DeepMind 的合作。
代价是网络。平均延迟不是问题,问题是偶发的一秒级卡顿会让机器人在任务中途停住。报告说波士顿动力有多个团队专门做网络,覆盖机载无线栈、客户基础设施、频谱和协议设计。另一个问题是数据:机器人等于把客户工厂的视频流传出去。波士顿动力的做法是分层管控,客户在机器人端决定哪些数据可以外传,Orbit 平台有 SOC 2 Type 2 认证,推理那一段走谷歌云的企业级智能体平台。核电站、军方这类客户则无论如何不会让数据离开现场。
Agility:只把能容忍延迟的事放上云
调度、任务分配、场地地图、远程升级、遥操作和训练数据上传在云端平台 Arc 上。这些能放出去,是因为机器人手里已经排着 30–60 秒的工作,十秒收不到下一段任务也不影响。其余全部机载。原因之一是工厂无线环境很差:移动的金属、重型机械、多径干扰,机器人每经过一个货架就失去视距,还要在接入点之间漫游。能做到足够可靠,但要改造客户网络,而 Agility 希望 Digit 直接进现场。
另一个原因是安全。Digit 目前只在物理隔离的工作单元里作业,因为还没有动态平衡的机器人通过在人旁边工作的安全认证。下一代会加专门的人体检测,识别到有人靠近就停下并蹲到地上。报告的结论是:如果安全模型在机器人外面,断网时机器人无法判断出了什么事,只能执行最保守的失效保护,所以复杂的安全决策必须留在机器人上。
Sunday:实验室里用云端,进家庭两天后改为机载
Sunday 的数据来自 Skill Capture Glove,一种和机器人夹爪几何形状一致的手套,让人戴着做家务来采集。它最在意的发现是预训练规模决定后训练能否泛化:不做预训练时,叠衣服在自家实验室成功率 96%,在没见过的家庭只有 14%;用上全部预训练数据后两边都是 100%。ACT-2 在没去过的家庭里叠 9 类衣物,零样本成功率 99.1%。
模型要吸收大规模预训练就不能太小,所以 Sunday 起初按云端推理设计。报告说 ACT-2 进真实家庭测试两天后就改了方向:家庭 WiFi 有信号死角、邻居干扰、配置不当的 Mesh 路由器、上下行不对称。延迟大体没问题,抖动是问题,要在几个小时里保持 99% 成功率,偶发的卡顿承受不起。星链卫星几分钟就划过天空,树或屋檐挡住一次就断一次;5G 路由器也一样掉线。最后模型改为全部跑在机器人内置 GPU 上。
网络墙:现有无线设备是为下载设计的,机器人要的是上传
报告认为问题可以解决,解决一个场景就会有一批部署搬出机身
几乎每家把推理留在机身上的公司给的理由都是网络。报告把难点归为三类:
- 机身本身:机器人是金属做的、会动,电机和电子元件在同一频段产生噪声;机壳会遮挡和反射信号,姿态一变天线位置就变。
- 网络设施:WiFi 和 5G 是按家里几台设备看视频设计的,以下行为主。机器人正相反,要一边移动一边把视频量级的数据往上传。现有接入点和芯片的优先级是反的,很少支持上行多天线,没有让 UDP 流可靠的冗余,接入点之间切换不够快,一切都是统计意义上的,而机器人需要确定性。家庭共用光纤时,邻居开始看视频就会拖慢你的机器人。
- 环境:这是决定能不能外置的核心。自动驾驶是必须机载的典型:覆盖范围太大、无线环境不可控、车速快、延迟预算接近零,而且驾驶的学习难度比人形机器人干活低,模型装得下。外置的前提是中小型、结构化到能控制无线条件的空间,家庭和工厂满足这一条,但依然很难:开洗碗机、启动重型机械都会改变信号;普通路由器在接入点切换时会静默 100 毫秒到数秒,恢复再要几秒,这时人形机器人可能已经摔倒。
报告说传输层问题用常规工程能解决,比如改造过的 WebRTC、不重传的 UDP、多天线重复发送、优先保证数据新鲜,这些做法已经很普遍。真正难的是现有硬件,报告列了四个方向:
① 先改环境:接入点
接入点要做与消费级相反的事:给机器人上行预留固定时隙,排在家庭或工厂其他流量前面;知道每台机器人在哪、要去哪,提前做波束赋形和切换;全场一个授时源;WiFi 与 5G 多链路同时发送;尽量用不拥挤的 6 GHz 频段;接入点切换必须在一次观测间隔内完成,200 毫秒的切换意味着丢好几帧。接入点位置要沿机器人作业路径实测,不能靠猜。
② 减少要传的数据
网络带宽有限。机器人上行流量几乎全部来自图像传感器,所以这首先是感知问题,其次才是网络问题。
③ 把上行做大
主板要为上行设计:4×4 上行多天线(消费级模块只有一到两路),芯片按上行吞吐选型,无线电按接入点分配的时隙准时发送、时隙外保持安静。这要求主板和接入点联合设计。
④ 全部对齐同一个时钟
数据中心 GPU 的成本优势来自批量推理,而批量推理要求多台机器人的观测同时到达。主板用好的晶振加全机队无线授时,能做到亚毫秒同步;GPU 调度按这个节拍预留算力,帧一到齐立刻算,迟到的观测进下一批而不是排队等。报告说这正是外置推理的全部经济逻辑所在。
分工上,报告认为 WiFi 会覆盖家庭和大部分工厂车间;5G(专网或公网)补室外路径、大型场地和 WiFi 拥塞无法控制的地方,两者由同一个调度器管理、能快速互相切换。依赖运营商的场地,还要和运营商谈上行优先级以及到 GPU 集群的专用光纤。
谁会先把大脑搬出机身:报告给了三道筛子
无线条件能不能控制、延迟预算有多宽、任务值不值得用数据中心 GPU
| 筛子 | 适合外置 | 留在机身 |
|---|---|---|
| ① 无线条件可控吗 | 工厂、家庭:空间有边界,网络可以勘测、调优,最终为机器人专门建设 | 在街上移动的机器人、自动驾驶:几乎无法控制无线环境 |
| ② 延迟预算多宽 | 几 Hz 的规划层,有几百毫秒余量;要解决的是抖动 | 约 100 Hz 以上的动作、伺服、安全回路 |
| ③ 任务够复杂吗 | 2,000 亿参数级模型,承担整座汽车厂的杂活,并和同一车间几十台机器人协同 | 跑简单策略的单任务机械臂 |
报告的方向性判断是「随着网络问题被解决,会有更多部署搬出机身」。把全文的条件串起来,这个判断成立需要同时满足:
一是规模。成本优势来自 GPU 被多台机器人轮流用满(第 06 节),小机队、单工厂自建服务器时两种方案接近打平。
二是场景。只有无线条件可控的工厂和家庭适合外置,而且只外置规划层,动作层和安全层永远需要一颗机载芯片(第 02、07 节)。所以即便外置普及,机器人身上的芯片也不会消失,变化的是它需要多大。
三是网络。今天五家里四家选机载,主要原因不是成本而是网络(第 07 节)。报告列出的四个解决方向,大多需要接入点、主板、授时和 GPU 调度联合设计(第 08 节),目前还没有现成产品。
报告同时说明,2030 年前机器人芯片的晶圆需求可以忽略(第 04 节),所以两条路线的选择近几年不会改变先进制程的供需格局。
本篇的成本账里,外置方案用的是数据中心 GPU,机载芯片排队等的是台积电先进制程,推理放在机身外面也属于边缘和云之间的分工问题。下面三篇各补一头。
- 01 SemiAnalysis 实测谷歌 TPUv7:推理性价比比英伟达 B200 高 50%,赢在机时便宜不在芯片更快 同一家机构、同一套 TCO 模型;波士顿动力的推理层正跑在 TPU 上 本篇第 05 节的资本成本、运营成本拆法和那篇一致。那篇讲清楚了机时单价和吞吐各贡献多少成本差,读完再看本篇「利用率决定胜负」会更好理解。
- 02 摩根大通:英伟达 2027 年将占用台积电 N3 产能的 55–60%,今年上半年还不到 10% 下一代 Jetson 要去排队的那条产线 本篇引用 SemiAnalysis 的数字是 2027 年 AI 加速器占 N3 产能 56%,那篇从供给侧给出了N3 的缺口和台积电的扩产、涨价计划。两家口径不同,但方向一致。
- 03 大摩首份边缘 AI 渠道调研:Cloudflare 边缘推理份额 63% 排第一,压过三家云巨头 同一个问题的软件版:推理放离用户多近 本篇讨论机器人的推理放机身还是数据中心,那篇调研的是企业把推理放在边缘网络还是中心云。两篇都说明延迟和数据管控会把推理往近处拉,规模效应会往集中处拉。
四篇合起来看的是同一个问题:一次推理在哪里算,成本和可靠性各差多少。
- 机器人先定硬件再定模型,前沿机器人模型只有 30 亿到 140 亿参数,大语言模型已到万亿级。
- 约 100 Hz 以上的动作和安全回路必须机载;低于 20 Hz 的规划层可以外置,难点是抖动。
- Jetson Thor 算力约为 GB300 的 1/14、内存带宽约 1/29,功耗 40–130 W。
- Jetson 毛利率约 63%,低于数据中心 GPU,且正跟着上 N3、N2,在先进制程里排队尾。
- 一块 GPU 带 7 台以上机器人省晶圆,带 5 台以上省内存。
- 服务 96 台机器人:B300 方案每小时 $18.63,Jetson Thor 方案 $14.97。
- 计入利用率(GPU 90%、机载 40%)后,外置单位算力成本是机载的 46%,家庭场景约 12%。
- 本站核对:两边利用率相同时机载便宜 4%,外置优势完全来自共享带来的高利用率。
- 五家公司里只有波士顿动力把推理层外置,Sunday 因家庭 WiFi 抖动从云端改回机载。
- 网络墙的四个解法:改接入点、减少上传量、做大上行、全机队统一时钟。
本文基于 SemiAnalysis《Where Does a Robot Think — On-Device vs Datacenter Inference》(2026 年 9 月 14 日,作者 Ivan Chiam、Gianluca Bencomo、Zane Fong、Bryan Shan、Dylan Patel、Reyk Knuhtsen)公开正文部分重制并加注释,非全文翻译,含本站核对与解读(已逐处标注)。成本与供应链数据来自 SemiAnalysis AI TCO Model、Accelerator Model、Memory Model;企业案例信息来自报告对各公司的访谈。据 SemiAnalysis · 仅供学习研究,不构成任何投资建议。