二.1
AI 的第一笔钱来自广告:AIM+ 支撑三成投放额
这一节讲的是本课和第 10 门课(阿里)最重要的一处分岔
约 4 分钟·1,251 字·5 题
第 10 门课(阿里):AI 先在云里收到钱
MaaS 按 token 收费、外部云收入 +40%、
平头哥芯片对外销售。
特点:AI 本身就是商品——
卖算力、卖模型、卖芯片。
好处是天花板高(新增市场);
风险是要先建起完整能力,才有东西可卖。
两种打法
本课(腾讯):AI 先在广告里收到钱
AIM+ 支撑 30% 的广告主投放额;广告收入 +20%。
特点:AI 是提效工具——
它不产生新的收费项目,只是让原有的生意做得更好。
好处是见效快、不需要等能力齐备;
风险是天花板受限于原有市场的规模。
这两种路子的差别,在报表上长什么样
阿里的 AI 收入是一个新科目(MaaS ARR >80 亿元),可以单独拿出来说。
腾讯的 AI 收入没有单独科目——它藏在「营销服务 +20%」这个数字里。
这带来一个直接后果:腾讯的 AI 变现更难被叙述,也更难被投资者「看见」。
这就是第 1 节讲的那件事的一半原因——
倍数从 18 打到 13,部分是因为它的 AI 收益被藏在既有科目里,讲不出一个独立的故事。
但 Bernstein 的判断正相反:它认为腾讯「通过广告和游戏持续交付实实在在的 AI 投资回报」——
这恰恰是比模型排名更硬的证据。
| # | 驱动 | 数据 |
| ① | AI 广告技术升级 | 自动化投放管理方案 AIM+ 支撑约 30% 的广告主总投放额 |
| ② | 视频号变现规模化 | 总时长 +20% yoy;2026 年 3 月广告加载率提到中个位数(瑞银口径 4–5%),仍远低于同业低双位数 / 高双位数 |
| ③ | 小程序生态 | 小游戏、小短剧工作室持续投放;新增可原生试玩的即时广告格式 |
高盛 1Q26 点评;瑞银口径的广告加载率为 4–5%
第②条里藏着这门课最好算的一笔账
广告加载率(ad load)= 用户刷到的内容里,广告占多少比例。
视频号现在是中个位数(约 4–5%),
而同业是低双位数到高双位数(10%–20% 左右)。
这意味着什么:如果视频号把加载率提到同业水平,
在时长完全不增长的前提下,这块的广告收入还有两到三倍的空间。
而且这个空间不需要任何新技术、不需要新用户、不需要新产品——
它只需要公司愿意在页面上多放广告。
为什么不一次性提上去?因为加载率是用体验换收入的。
提太快会掉用户时长,掉了时长反而总收入下降。
所以这是一个「已知存在、由公司自己控制节奏」的收入储备——
这正是瑞银说「期权价值被低估」的一部分内容。
先讲清楚它在做什么
传统投广告:广告主要自己选人群、定出价、写创意、看数据、反复调。
自动化投放:广告主只给目标(比如「一个新客户我最多出 50 元」),
剩下的选人、出价、换素材全部由系统自动做。
「AIM+ 支撑约 30% 的广告主总投放额」的意思是:
现在每 100 元投在腾讯的广告费里,有约 30 元是通过这套自动化系统花出去的。
为什么这能提升收入:系统调得比人好、比人快,
同样的预算带来更多转化 → 广告主愿意加预算。
高盛把这称为「闭环能力的验证」——
因为转化发生在微信生态内(小程序、小店、视频号),系统能直接看到结果,
而不是把用户送到站外之后就失去追踪。
这就是「AI 提效」最典型的形态:不新增收费项目,
但让同一批广告位卖得更贵。
+20%
营销服务收入同比
4Q25 为 +17%–18%
+57%
AI 相关折旧摊销同比
毛利率下降的直接原因
高盛 1Q26 点评。瑞银的对应表述是广告毛利率同比 −0.5pp
这是本课第一次看到折旧的影子
广告收入涨了 20%,毛利率却环比掉了 4.7 个百分点——这不是价格战,是折旧。
逻辑链:买卡建集群 → 资产入账 → 按年折旧 → 折旧计入服务成本 → 毛利率下降。
AI 相关折旧摊销同比 +57%,而这还只是资本开支刚开始加速的第一个季度。
第 10 节会把这条线拉完:高盛预测折旧摊销
从 2026 年的 676 亿元涨到 2027 年的 963 亿元(+42%)、2028 年的 1,201 亿元。
今天看到的 4.7 个百分点,只是这条曲线的起点。
这一条是本系列的老朋友了——
第 7 门(Alphabet)、第 8 门(Microsoft)、第 10 门(阿里)都讲过同一件事。
不同的是:那三家的折旧压的是云业务的毛利率,这一家压的是广告的毛利率。
这一节要带走的一句话 1Q26 营销服务收入 +20% yoy(4Q25 为 +17%–18%)。驱动有三条:①AIM+ 自动化投放管理方案支撑约 30% 的广告主总投放额;②视频号总时长 +20% yoy,2026 年 3 月广告加载率提到中个位数,仍远低于同业的低双位数 / 高双位数;③小程序生态的即时试玩广告格式。高盛因此把营销服务增速预测从 15%/14% 上调到 18%/18%。但代价也已经出现:广告毛利率环比降 4.7 个百分点,因为 AI 相关折旧摊销同比 +57%。
检验一下:AI 的第一笔钱来自广告:AIM+ 支撑三成投放额
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。
二.2
Hy3:一个被完全重建的团队,和一份不算第一的成绩单
这一节要学会看模型评测——包括怎么看它的局限
约 4 分钟·1,244 字·5 题
| 项 | 值 |
| 发布 | 2026-07-06 正式版并开源(4 月发 preview) |
| 架构 | MoE,295B 总参数 / 21B 激活参数 / 256k 上下文 |
| 腾讯云 API 定价 | 输入 1.0 元 / 百万 token;输出 4.0 元 / 百万 token;缓存命中输入 0.25 元 / 百万 |
| 内部部署 | 131 个内部产品 |
| token 用量 | 至少是 Hy2 的 10 倍 |
| OpenRouter token 用量 | 7.7 万亿,登顶(部分受免费推广帮助) |
| 下一步 | 管理层预期 HY4 参数更大 |
摩根士丹利 2026-07-07、高盛 1Q26 点评、瑞银 1Q26 点评
295B 总参数 / 21B 激活参数 —— 这两个数字要一起读
MoE(Mixture of Experts,混合专家)的做法是:模型里有很多组「专家」,
但每处理一个 token 只激活其中一小部分。
所以这个模型「装了」2,950 亿参数,但每次只「用」210 亿——
大约七分之一。
为什么要这么设计:知识容量看总参数,推理成本看激活参数。
MoE 让模型既能装很多知识,又不必为每个 token 付全额的算力。
这直接对应 API 定价——输入 1.0 元、输出 4.0 元每百万 token,
在国产模型里属于便宜的一档。摩根士丹利用的词是「务实、性价比高的路线」。
而缓存命中输入只要 0.25 元——四分之一价。
这条对 agent 类应用特别重要:agent 会反复带着同一段长上下文去问,
缓存命中率高,实际成本就远低于标价。
SWE-Bench Pro 得分,摩根士丹利 2026-07-07 整理。SWE-Bench 是一套用真实开源项目的 issue 考模型改代码的基准
这张图有三种读法,都对
读法一(进步):三个月从 46 到 57.9。
这是本图最大的一个变化幅度,说明追赶的斜率很陡。
读法二(位置):57.9 排第三,落后头名 4.2 分。
它已经进了第一梯队,但不是领先者。
读法三(差距的意义):57.9 和 62.1 差多少?
这才是最难回答、也最重要的一问。
基准分数是非线性的——在同一个任务集上,
高几分可能意味着「多解决了几个最难的题」,也可能意味着「对基准过拟合」。
所以正确的态度是:用基准判断「有没有进第一梯队」(是),
不用基准判断「谁更好用」(要看产品里的实际表现,见第 7 节)。
高盛的原话(意译):「重建了模型构建体系——基础模型团队在过去六个月被完全重建,
引入 LLM 原生人才,并重新设计了覆盖基础设施、数据、训练与评估的全流程;
评估重心从被刷分的基准转向真实使用场景。」
这段话有两个信息:
① Hy3 的进步不是渐进改良,是换了一套班子和方法——
这解释了为什么三个月能从 46 到 57.9。
② 「评估重心从被刷分的基准转向真实使用场景」这句话,
是公司自己在说「基准分数不完全可信」。
这是一个很有意思的自我设限:它一边发布了一个基准分数,
一边说不要只看基准分数。正确的读法是——那就去看产品里的数字(第 7 节)。
「OpenRouter token 用量 7.7 万亿登顶」听起来是一个很硬的第三方指标——
OpenRouter 是一个聚合各家模型 API 的平台,用量是真实调用出来的。
但高盛在同一句里加了个注脚:「部分受免费推广帮助」。
这个注脚必须留在心里。免费的时候用量第一,
和收费之后用量第一,是两件完全不同的事。
回到本系列反复训练的证据阶梯(第 10 门课第 3 节):
「有人在免费时用它」是弱证据;
「有人在付费时用它」才是强证据。
所以第 17 节的清单里,
盯的不是 OpenRouter 排名,而是腾讯云的 token 收入与企业服务增速。
瑞银引述:优先高价值使用场景,而不是 DAU 增长
管理层的表态是:变现仍在早期,但会优先高价值使用场景,而不是追求 DAU 增长——
因为可变推理成本很高。
这句话在本课里非常重要,它解释了两件事:
① 为什么元宝的 DAU 远不如千问(第 8 节会给数字)——
不是打不过,是不打这个仗。
② 为什么微信 AI 助手用灰度试点而不是一次性全量(第 8 节)——
因为 14 亿人同时用,推理成本是要按人头乘的。
管理层还点了一条自己的独有优势:小程序生态——
它连接了数百万第三方商家,是腾讯在 agent 时代的排他性入口。
可复用的判断:当一家公司说「我们不追 DAU」时,
先问它是「打不过」还是「不划算」。这两者的报表含义完全不同——
前者是竞争力问题,后者是单位经济学的选择。
这一节要带走的一句话 2026 年 7 月 6 日,混元 Hy3 正式版发布并开源:MoE 架构,295B 总参数 / 21B 激活参数 / 256k 上下文。腾讯云 API 定价输入 1.0 元、输出 4.0 元每百万 token,缓存命中输入 0.25 元。SWE-Bench Pro 得分 57.9(preview 版为 46)——高于 DeepSeek V4 Pro 的 55.4,但低于 Qwen 3.7 Max 的 60.6 与 GLM 5.2 的 62.1。OpenRouter token 用量以 7.7 万亿登顶(部分受免费推广帮助),已部署在 131 个内部产品上。基础模型团队在过去六个月被完全重建,评估体系从「被刷分的基准」转向真实使用场景。
检验一下:Hy3:一个被完全重建的团队,和一份不算第一的成绩单
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。
二.3
留存率 60% 和 80%:比模型排名更硬的两个数字
这一节讲怎么用产品指标绕过模型评测的局限
约 4 分钟·1,170 字·5 题
60%+
活跃用户留存率
WorkBuddy / CodeBuddy
80%+
付费用户留存率
WorkBuddy / CodeBuddy
72% → 90%
WorkBuddy 任务解决率
Hy3 上线后;完成时间 −34%
高盛、汇丰 1Q26 点评;任务解决率来自摩根士丹利 2026-07-07
为什么留存率比基准分数更硬
第 6 节讲过:基准分数可能被刷分,公司自己都说「评估重心要转向真实使用场景」。
留存率是另一类证据——
它衡量的是「用过的人还回不回来」。
而且这里给的是两档:
活跃用户留存 60%+——用过的人里有六成还在用;
付费用户留存 80%+——掏过钱的人里有八成继续掏钱。
第二个数字才是关键。免费用户留下来可能只是懒得卸载;
付费用户续费,说明它确实在替人省时间或省钱。
回到证据阶梯:基准分数是「实验室指标」,DAU 是「运营指标」,
付费留存是「实际行为」——最硬的一档。
02
72% → 90% 这一跳,是本课最好的一个闭环例子
摩根士丹利描述的那个循环
「Hy3 的能力持续在腾讯的产品生态中改进;
腾讯的产品矩阵反过来为混元提供了广泛而真实的现实世界反馈用于优化,
而模型能力的提升又惠及所有接入的产品,
形成一个可迁移、可泛化的良性循环。」
具体证据就是那一跳:WorkBuddy 的任务解决率从 72% 提到 90%,
平均完成时间缩短 34%。换的只是底下的模型。
此外 Hy3 也改善了 IMA、Mavis Agent、微信读书、
WeGame AI 游戏助手与代码生成能力;在元宝 Agent 的基准评测中,
Hy3 在综合办公与生活服务 agent 场景上超过了 GLM 5.1 及多个国产模型。
注意最后这一句的口径变化:在 SWE-Bench Pro(通用编程基准)上 Hy3 排第三,
但在「综合办公与生活服务 agent 场景」上它超过了 GLM 5.1。
这不矛盾——不同任务集,不同排名。
可复用的动作:看到「某模型超过某模型」,先问是在哪个任务集上。
好的那一面
Hy3 已部署在 131 个内部产品上。
这意味着模型有131 个真实场景的反馈源——
这正是上面那个良性循环的燃料。
对照第 6 门课(Broadcom)讲的定制芯片逻辑:
负载越固定、场景越明确,优化的空间越大。
模型也一样——有真实场景的模型,比只在基准上刷分的模型更容易变好。
同一个数字
要警惕的那一面
131 个内部产品 ≠ 131 个付费客户。
内部部署不产生外部收入,
但会产生真实的推理成本——这些成本就落在第 2、3 节讲的那条 88 亿元的费用线里。
所以这个数字要这么读:它是「能力在扩散」的证据,
不是「收入在扩散」的证据。
收入那一侧要看的是腾讯云的 token 用量与企业服务增速(第 9 节)。
2026-07-13 野村 2Q26 前瞻里的原话(意译)
「WorkBuddy 在白领与学生用户中获得了令人印象深刻的关注度。
第三方研究机构易观报告称,截至 2026 年 3 月,WorkBuddy 是中国最受欢迎的桌面 AI agent,
月访问量达 885 万。
但该调查同时指出,这是一个高度拥挤的赛道——
主要 AI 平台,尤其是阿里巴巴和字节跳动,都推出了竞争性的桌面 agent。
鉴于中国线上消费者通常表现出低切换成本和较低的付费意愿,
未来几个月竞争可能仍然激烈。目前还没有任何一款桌面 agent 在企业用户中建立起明确的领先地位。」
这段话要和上面的 60%+/80%+ 放在一起读。
留存率高,说明产品对留下来的人有用;
赛道拥挤、切换成本低,说明「留下来的人」这个池子本身随时可能被别人抢走。
两件事都是真的,它们描述的是「现有用户的黏性」和「新增用户的争夺」两个不同的战场。
这一节的落点
本课到这里已经给了三层证据,硬度依次上升:
① 基准分数(SWE-Bench Pro 57.9)——能判断「进没进第一梯队」,
不能判断好不好用;
② 运营指标(131 个内部产品、月访问 885 万、DAU 第一)——能判断能力在扩散,
不能判断有没有收入;
③ 付费留存 80%+——最硬,但样本还小、赛道还拥挤。
三层都不是「AI 已经在赚钱」的证据。
真正的收入证据在第 5 节(广告 +20%)和第 9 节(企业服务 +20%、腾讯云 token 用量),
而不在这一节。
这一节要带走的一句话 WorkBuddy 是中国 DAU 第一的桌面 AI agent(高盛);第三方机构易观(Analysys)称它是 2026 年 3 月中国最受欢迎的桌面 AI agent,月访问 885 万。WorkBuddy 与 CodeBuddy 的留存率:活跃用户 60% 以上、付费用户 80% 以上。Hy3 上线后,WorkBuddy 的任务解决率从 72% 提到 90%,平均完成时间缩短 34%。但野村给了一条冷水:赛道极其拥挤,阿里和字节都推了竞品,中国线上用户切换成本低、付费意愿低,目前没有任何一款桌面 agent 在企业用户里建立起明确领先。
检验一下:留存率 60% 和 80%:比模型排名更硬的两个数字
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。
二.4
把 AI 装进微信,成本要按人头乘
这一节要跟着高盛做一遍自下而上的成本测算——本课最有操作性的一节
约 6 分钟·1,656 字·5 题
| 能力 | 具体 |
| 微信原生功能 | 用语音或文字发消息、发朋友圈、打电话 |
| 调起小程序完成任务 | 预约、点外卖等——但支付这一步仍需用户自己完成 |
| 信息检索 | 结合聊天知识与微信内容生态,找相关视频和文章 |
| 内容生成 | 记笔记、答问题、生成图片 / 海报、编歌单(多模态) |
| 自然语言生成小程序 | 用纯文字指令生成小程序原型,可继续对话调整布局与功能;目前只有创建者自己可见,不能对外分享 |
高盛 2026-06-23《微信 AI agent 进入灰度测试阶段》
两条限制值得单独记
「支付这一步仍需用户自己完成」——
这说明现在的 agent 还停在「帮你操作」,没有到「代你交易」。
为什么这一步最难:一旦 agent 能自己付钱,责任归属、风控、退款全部要重新设计。
它不是技术问题,是产品和合规问题。
「生成的小程序只有创建者自己可见,不能对外分享」——
同样是一条克制的边界。
高盛指出:如果哪天允许分享,这个功能可能解锁微信生态里
AI 增强的用户生成内容。但现在没有。
这两条限制和第 6 节管理层那句「优先高价值场景而不是 DAU」是一致的:
这是一家在 AI 上刻意慢的公司,慢的原因是它的产品承载着 14 亿人的日常通信。
小微用的是 WeLM
根据小微的自我介绍:微信自研的大模型 WeLM 是主模型,
负责日常对话、意图识别和微信内功能调用;
其他国产开源模型(如 DeepSeek)会被选择性调用,处理更复杂的推理 / 分析类问题。
这一点直接引发了市场的疑问——发布后首个交易日股价 −1.6%(恒指 −0.7%)。
高盛把疑问总结成两条:①为什么微信部署的是自己的 WeLM 而不是集团的 Hy 模型;
②全量铺开后,增量推理成本负担有多大。
高盛自己的评论很克制:「腾讯能否最终在 WeLM 与 Hy 两个团队之间
理顺训练成本并实现协同,而不是继续并行运行两个模型,还有待观察。」
两种解释,含义完全不同
解释一(技术 / 产品):微信的场景要求不一样。
日常对话、意图识别、功能调用这些任务,需要的是快和准,不是最强推理;
用一个小而专的模型,成本更低、延迟更短。而复杂推理再外调——这是合理的分工设计。
解释二(组织):两个团队各做各的。
微信事业群历史上一直独立性很强,并行运行两套模型意味着重复的训练与人力投入。
目前的公开信息不足以判断是哪一种——两种可能都存在,也可能同时存在。
可验证的信号(写进第 17 节清单):
如果未来小微改用 Hy,说明是组织问题且已经解决;
如果长期并行且各自迭代,说明是设计选择。
这是本课教的一个通用动作:遇到无法判断成因的现象,
不要选一个解释去相信,而是找出「哪个未来事件能区分这两种解释」。
| 测算要素 | 高盛的做法 |
| 单位推理成本 | US$0.15 / 百万 token |
| 每用户每日 token | 按 四个用户变量自下而上搭出来(agent 交易 / 文本等场景) |
| 情形设定 | 按 2026 年底的渗透率分基准 / 乐观 / 悲观三档 |
| 结论 | 增量推理成本 ≈ 4Q26 预期调整后经营利润的 5%–17% |
高盛 2026-06-23,示例性自下而上分析
这个测算的方法本身,比结论更值得学
它只用了三层:单价 × 用量 × 人数。
单价:每百万 token 0.15 美元——这是一个可以查证、可以随价格变动更新的数;
用量:每个用户每天要消耗多少 token——这个最不确定,所以拆成四个变量分别估;
人数:渗透率——分三档情形。
结果不是一个数字,是一个区间(5%–17%),而且明确挂在「4Q26 调整后经营利润」这个分母上。
为什么要挂分母:因为「几十亿元推理成本」这句话没有信息量——
几十亿元对这家公司是多是少,取决于它当期赚多少。
可复用的动作:把任何一笔新增成本,
换算成「占当期利润的百分之多少」再讨论。绝对金额会骗人,占比不会。
高盛的判断:长期收入上行主要仍绑在现有广告市场里
原话(意译):「关于增量收入,我们仍然认为长期收入上行将主要与现有的在线广告市场规模挂钩
(尤其是围绕交易的部分),因为微信 AI agent 会更充分地进入本地生活、发现和购物场景。」
这句话要读两遍。
第一遍:它没有说微信 AI 助手会开辟一个新的收费市场。
它说的是——AI 助手会让微信在已有的广告市场里拿到更多份额。
第二遍:那么这条线的天花板就是「在线广告市场的规模」,
而不是「AI 服务市场的规模」。
这就把本课第 5 节那条分岔说到底了:
腾讯的 AI 路线是「把已有的生意做得更好」——好处是确定性高、见效快,
代价是天花板由已有市场决定。
对照第 10 门课(阿里):MaaS 是一个新市场,
天花板未知;但也正因为未知,它需要更长时间被验证。
高盛在同一份报告里还说了一句话,值得记住
「市场此前主要关注企业级 AI(因为变现路径更清晰),
但我们认为消费级 AI agent 有可能通过接管流量入口来重塑传统应用,
从而引发操作系统级与应用内生态之间的战略竞争与合作——
而微信在这一点上位置很好,因为它拥有最大的用户基础、社交关系链,以及小程序生态。」
这句话是这门课「期权价值」那一部分的核心。
它没法量化,所以进不了第 3 节那条费用线,也进不了成本测算——
但它正是瑞银说「期权价值被低估」时指的东西。
这一节要带走的一句话 2026 年 6 月,微信内的 AI 助手「小微」开始灰度试点,入口在主页左上角。反直觉的一点:它用的是微信自研的 WeLM,不是集团的 Hy3;复杂推理会选择性调用其他国产开源模型(如 DeepSeek)。市场初期反应平淡(发布后首个交易日股价 −1.6%,恒指 −0.7%)。高盛按每百万 token 0.15 美元的单位推理成本做自下而上测算:全量铺开后的增量推理成本,相当于 4Q26 预期调整后经营利润的 5%–17%。
检验一下:把 AI 装进微信,成本要按人头乘
5 道题,选完立刻出反馈。做错的那道,恰好是这一节你真正学到东西的地方。