AI 基建 · 开卷研究
持续更新 最后更新 2026-08-15
返回研报

首日快照骗了我们:开放权重旗舰模型的托管生态复测,与四大 capex 里的两个口径陷阱

研究问题:2026-08-10 到期的两个判定点各自落在哪一边——①Kimi K3 权重发布后的第三方托管拓扑,是收缩、扩张,还是首日读数本身就不是稳态?②微软、Meta、亚马逊的 2027 资本开支口径是量化上调还是下调推迟,是否首次出现把策略调整归因于开源竞争的管理层表述? 完成日期:2026-08-15 本文承接 研究输出_开放权重模型与硬件需求_2026-07-28.md——那一轮基于权重发布 24 小时内的快照下了推理侧读数。本文用第 19 天的同口径复测推翻其中的可得性部分,训练侧结论不受影响、仍以前一篇为准。 边界声明:本文止于产业基本面,不输出估值/买卖/方向/仓位/目标价。价格、定价、成本一律仅作"叙事-现实 gap"的输入证据(evidence ✓ / conclusion ✗)。 证据等级:A=公司一手(可写实)→ E=不可计分仅记录,怎么读证据分级


行话看不懂?点开名词小注

名词小注(懂投资但不熟 AI 基建的读者先看这段):开放权重(open-weight,模型参数文件可下载、可自行部署,区别于只给 API 的闭源模型);托管商(第三方推理云,替你把模型跑起来、你按用量付费);端点(endpoint,一家托管商对外提供的一条服务通道,同一家可以有多条);总参数(决定内存容量需求);HBM(高带宽内存,贴在 GPU 上的昂贵内存,模型权重必须常驻其中);量化(把每个参数压到更少比特以省内存,bf16 每参数 2 字节、fp8 1 字节、fp4mxfp4 约 0.5 字节,压得越狠越省内存但精度损失越大);上下文长度(模型一次能读多长的输入);uptime(服务可用率);capex(资本开支);融资租赁 / 经营租赁(前者在会计上计入资本开支、后者不计入,同一笔实际支出可因分类不同而进出 capex 口径)。

一、一句话结论

两个判定点都指向同一件事:表面读数是错的——K3 托管商"塌缩 58%"是爬坡期误读(第 19 天只差 15%),微软"下调 2026 capex 150 亿"是会计重分类,亚马逊"上调 200 亿"是内存涨价而非需求增量。

三条更新各自独立、方向不同:推理侧的可得性没有恶化(承接面基本追平上代——但 11 家是否已到稳态未定,19 天内仍在扩张,须等 9 月 15 日复测),而容量门槛实实在在抬高了一档——K3 把旗舰开放权重模型推出了 8 卡 Hopper 商品节点,这使得"托管商数量"与"每套机队变重"这两个此前无法加总的反向效应第一次可以相乘,乘积方向为正——但这只就"生态常驻容量"而言;AI 硬件总需求的符号仍未定,还缺托管商实测利用率这一环。capex 侧则是三家全部只给定性、无一量化,且没有任何一家把策略调整归因于开源竞争

二、关键物理 bound(决定性论据)

上一轮卡住的地方是:托管商数量在降、每套机队在变重,两个方向相反、无法加总,所以符号未定。本轮两个输入同时到位,第一次能把乘积算出来。

输入一:承接面(实测)。 同一天、同一个 OpenRouter 端点接口、同一口径拉两代模型:

Kimi K3(2.8T) Kimi K2.7-Code(1.1T)
第三方托管商 11 家 13 家
全量端点(含原厂) 13 个 15 个
挂牌价(美元/百万 token,输入/输出) 基础档 2.80/14.00 – 3.00/15.00;另有 Morph 高档端点 6.00/22.50 基础档 0.67/3.40 – 0.95/4.00;另有 Moonshot 高档端点 1.90/8.00
上下文长度 11 个端点为 104.9 万,Together 100 万,Sail Research 97.5 万 除 Venice 25.6 万外均为 26.2 万
近 1 日可用率 92.9% – 100% 85.0% – 100%

代际差 −15%(11 对 13),不是首日读到的 −58%(5 对 12)。K3 在 19 天里由 5 家扩到 11 家——爬坡期显著长于两周。11 家是否已到稳态本身未定,故 −15% 应读作"当前差距的一个上界估计"而非终值。

输入二:每套机队的容量门槛(换算)。 按各家披露的量化档换算权重常驻容量,再用"能装下这个容量的最省节点"倒推卡数:

  • K3 在 mxfp4 下约 1.49 TB。8 卡 H100 只有 0.64 TB、8 卡 H200 只有 1.13 TB——任何量化档都装不下,强制上 Blackwell 级(8 卡 B200 = 1.54 TB,勉强)。跑 bf16 的 DeepInfra 更重,权重就要 5.60 TB。
  • K2.7-Code 在 int4 下约 0.58 TB,恰好塞得进 8 卡 H100 的 0.64 TB——还是商品节点。

乘积。 把 11 家与 13 家分别按各自量化档累加:K3 生态常驻下界约 117 张 Blackwell 级卡、约 22.5 TB HBM;K2.7-Code 约 116 张 Hopper 级卡、约 9.3 TB HBM。卡数几乎持平,HBM 约 2.4 倍。

判定 plausible,不是 confirmed。四条限制必须跟着这个数字走:①这是单副本、只算权重的下界,不含上下文缓存、不含吞吐与高可用所需的多副本;②11 家里有 5 家没披露量化档,已按最省的 fp4 假设,方向偏保守;③各家实际用什么卡没人披露,卡型是按"能装下的最省档"倒推的,所以 2.4 倍是下界对下界的比值,量级不精确;④两个数字的稳健性不一样——HBM 倍数在三种合理的换算规则下都落在 2.40–2.42,稳;而"卡数持平"敏感于卡型假设:若把跑 bf16fp8 的那两家按多节点 H200(141GB)而非 B200 倒推,K3 侧就变成 132 卡、对 K2.7 的 116 卡是 +14%,"持平"就不成立了。所以承重的是 HBM 倍数,不是卡数。

三、分段详解

3.1 推理侧:塌缩没有发生,门槛抬高了

前一轮在权重发布 24 小时内看到 5 家第三方,对照上代成熟期的 12 家,读出"模型越大、承接的托管商越少"。第 19 天复测把这个读法证伪了:5 家是起点不是终点

服务质量的收敛更彻底。首日那一轮记录的是"剧烈分化"——可用率从 16.7% 到 99.9%,Nebius 甚至要把上下文从 100 万砍到 8 千。现在 13 个端点里 11 个提供满 104.9 万上下文,可用率最低的一家也有 92.9%。价格也开始往下走:首发时全网统一 3.00/15.00 美元,现在 Morph 报 2.80/14.00、DigitalOcean 与 DeepInfra 报 2.85/14.25——第三方已经在给原厂价打折,这是竞争进入而非退出的标志。

但"经济性恶化"这一半没有被推翻。K3 的 3.00/15.00 对上代的 0.95/4.00,仍是 3 至 4 倍。只是这个倍数现在缺少因果解释:它有多少来自规模、多少来自 K3 特有的两个混淆变量(许可证由 Modified MIT 换成含营收门槛的自定义许可、混合架构首次适配),本轮仍无法拆分。拆分要等阿里 Qwen3.8 权重发布后的跨厂商对照。

3.2 capex 侧:两个口径陷阱

微软(2026-07-29,FY26 Q4)。 日历年 2026 的 capex 预期从约 1,900 亿美元降到约 1,750 亿——降了 150 亿。但这 150 亿一分钱没少花:自 FY2027 起数据中心与办公楼的折旧年限由 15 年延长至 25 年,随之更多未来数据中心租约由融资租赁(计入 capex)转为经营租赁(不计入 capex)。CFO Amy Hood 在电话会上明说,除去这个折旧年限影响,日历年 2026 的投资预期不变。把这个数读成"微软收缩 AI 投入"是错的。

同一次披露还并存着两个 capex 口径:新闻稿现金流量表里的"购置不动产与设备"是 358.02 亿美元,电话会上 Hood 口述的含融资租赁 capex 是 410 亿——差 52 亿。跨公司加总时混用会产生系统性偏差。FY2027 只给了定性:会同比增长,理由是组合内各处的需求信号;FY2027 首季单季超过 500 亿(含租赁重分类影响)。

亚马逊(2026-07-30,Q2 2026)。 2026 年现金 capex 指引由约 2,000 亿上调到约 2,200 亿。CEO Andy Jassy 的归因原话是内存成本上涨把这个数字推高了;CFO Brian Olsavsky 在问答里补了一句,内存、硬盘、固态盘这些组件眼下都处在涨价状态。这 200 亿是价格不是数量。(B 级:两份独立第三方转录逐字一致,亚马逊投资者关系未发布逐字稿。)

这条同时是本库既有判断的一次买方侧独立印证——此前关于常规内存结构性紧张的结论都建立在三家存储厂管理层的口径上,现在最大的买方自己承认在为此多付 200 亿。

2027 侧亚马逊给的是产能语言而非金额:2027 的产能大头已被预订,2028 也已预订一部分;2027 年底的电力产能将是 2025 年的两倍,并称仍在轨。

Meta(2026-07-29,Q2 2026)。 单季 capex(含融资租赁本金)310.8 亿美元,对上年同期 170 亿,同比约 +83%。全年指引由 1,250–1,450 亿收窄上抬为 1,300–1,450 亿——下沿抬了 50 亿,上沿不动。CFO 展望段落全文没有任何 2027 口径:没有金额、没有区间、也没有惯用的定性表述。

3.3 否定发现:三场电话会里没有"开源竞争"

判定点的另一半问的是,是否首次出现把策略调整归因于开源竞争的管理层表述。三家都没有。 两处提到开放权重的地方,方向还是反的:微软 Satya Nadella 在架构灵活性的语境里说支持"开放权重、闭源权重"的模型选择,框架是客户赋能;亚马逊 Jassy 说越来越多公司对开放模型感兴趣、Bedrock 全线纳入是它增长快的原因之一,框架是收入驱动。

这条只断言"这三场公开披露里没出现该归因",不等于竞争压力不存在。Alphabet 未覆盖——它 07-22 就发布了,早于 K3 权重发布日,属事件前证据。

四、区间判断(会怎样、多少、多久)

判断 区间 证据级
K3 第三方托管商当前家数 11 家(2026-08-15 实测;首日 5 家) A(平台一手实测)
K3 第三方托管商稳态家数 10–13 家(前瞻外推,实测只有 5→11 两个点) 推论,low-medium
两代承接面代际差 −15%(上界估计;若继续扩张则趋近 0) A(当前值)/推论(外推部分)
生态常驻 HBM 代际比 约 2.4 倍(下界对下界,三种换算规则下 2.40–2.42) 推论,plausible
K3 对上代单位 token 价格倍数 3.0–3.9 倍(挂牌价,非成交价) A
微软日历年 2026 capex 约 1,750 亿(重分类后口径),底层投资不变 A
微软 FY2027 capex 仅"同比增长",无量化 A
Meta 2026 capex 1,300–1,450 亿(含融资租赁本金) A
Meta 2027 capex 无口径 A(一手全文核对)
亚马逊 2026 现金 capex 约 2,200 亿,其中 200 亿上调归因内存涨价 B

五、最能推翻结论的 3 个条件(监控触发器)

  1. 2026-09-15 三十天复测(对应变量:开放权重旗舰模型的第三方托管商数量)——若 K3 第三方托管商回落到 8 家以下,则本轮的 11 家是峰值而非稳态,−15% 的结论要再修一次;若稳定在 10–13 家,可得性差异实质归零。
  2. 某托管商披露实际卡型或副本数——若多数其实是用多节点 H200 而不是 8 卡 Blackwell 承载 K3,常驻 HBM 2.4 倍的下界估算失真。
  3. Qwen3.8 权重发布后的同口径对照——若其托管商数同样显著少于 1T 级模型,则"规模抬高门槛"跨厂商复现;若与 1T 级持平,则本轮的价格与门槛差异更可能来自 K3 特有的许可证与架构,与规模无关。

第三条同时也是 capex 侧的对照:Q3 2026 财报季若首次出现把投入节奏归因于开源竞争的管理层表述,本文的否定发现即告失效。

六、我不会信的叙事(及为什么)

"微软砍了 2026 年的 AI 资本开支"——150 亿的降幅全部来自折旧年限延长引发的租赁重分类,CFO 在同一场电话会上明示底层投资计划不变。只取金额不取会计说明,就会得到与管理层原话直接矛盾的结论。

"资本开支又上调了,说明 AI 需求再超预期"——亚马逊这 200 亿的官方归因是内存涨价。资本开支本来就是滞后指标,现在还混进了成本推动项;不拆出价格因素就当需求信号读,会双重失真。

"模型越大、托管商越少,开放权重的推理生态在塌缩"——这是本库自己在 07-28 记下的读法,本轮被同口径复测证伪。首日快照不是稳态,爬坡期比两周长得多。这条留在这里也是提醒:事件后 24 小时内的横截面,几乎必然是爬坡态。

"开放权重模型正在逼迫闭源厂收缩投入"——三场电话会零支持,两位 CEO 提到开放权重时都是正面框架。