卖 token 到底赚不赚钱?
市场只盯着各家大模型的营收规模,却很少有人算清楚一件事:每卖出一百万 token,到底净赚多少。伯恩斯坦(Bernstein)把"AI 推理毛利率"这个黑箱,拆成了两条可计算的公式——并用它逐一量出智谱、MiniMax、通义千问三家的真实赚钱能力。结论反直觉:决定谁赚钱的,不是谁的模型更省算力,而是谁的定价、模态与业务结构更对。
52.4%
智谱 GLM-5.1 推理利润率
GLM-5 为 33.7%,提价覆盖算力成本
69.4%
MiniMax 开放平台毛利率
2025 前 9 月,高度依赖语音合成
$10/M
语音合成 token 定价
是文本 / 代码 token 的 50 倍以上
39%
智谱 KV 缓存命中率(中位)
MiniMax 智能体任务高达约 71%
这是一篇罕见地把"卖 token 赚不赚钱"算到小数点后一位的报告。它不看研发、不看融资,只聚焦最朴素的一笔账——直接推理毛利率 = 每百万 token 收入 − 每百万 token 成本。伯恩斯坦给出的最大洞察是:在中国三家头部模型厂商之间,推理利润率从 −6.8% 到 +52.4% 横跨近 60 个百分点,而拉开差距的主导变量在收入端(定价、模态、业务结构),不在成本端(模型优化、算力效率)。下面我们先把这台"赚钱机器"拆成可调的旋钮,你可以亲手转一转。
01
亲手算一算:推理毛利率计算器
拖动左侧旋钮,右侧实时算出每百万 token 的收入、成本与毛利率。先点三家预设感受差异,再自己调参。
一键载入:
收入端 · Rev/Mtok
语音合成 token 可高达 $10/M,文本 / 代码通常 $1–3/M
智能体任务输入多输出少(占比低),通用对话输出占比高
命中的输入 token 按折扣价计费,命中率越高、单价被摊薄越多
成本端 · Cost/Mtok
中国市场 H20/H100 约 $1.1–1.6;自用算力的云厂商更低
智谱约 1000,MiniMax 轻量化模型约 3000
每百万 token 收入 Rev/Mtok$0.84
每百万 token 成本 Cost/Mtok$0.45
46%
直接推理毛利率 =(Rev − Cost)/ Rev
预设参数为各家公开口径的近似值,用于演示变量敏感性,非精确财报数字。
怎么读这台机器
把输出单价从 $2.4 拉到 $10(语音合成档),毛利率会瞬间冲上 90%+——这正是 MiniMax 高毛利的来源;再把GPU 小时成本从 $1.3 降到 $0.9(阿里云自用算力),毛利率又涨一截——这是通义千问的结构性优势。反过来,光把吞吐量翻倍(模型优化)对毛利率的拉动,远小于动一下定价。收入端的旋钮,比成本端灵敏得多。
会 员 档 案 · 免 费 预 览 到 此
登录后继续阅读全文
免费注册即可阅读最新 3 篇深度报告全文;
会员一码解锁全部档案 + 产业链大课 + 白毛速报实时推送。
已是会员?登录后本页自动显示全文 · 返回报告目录