开放权重模型与 AI 硬件需求:一道判定输入被推迟了七天的题
研究问题:开放权重大模型(Kimi K3 2.8 万亿参数、Qwen3.8 2.4 万亿参数)沿当前轨迹继续发展,未来 6 至 18 个月对 AI 硬件需求是加速还是减速?分训练与推理两个市场,并判断开放与闭源实验室的竞争态势演化。 完成日期:2026-07-20 边界声明:本文止于产业基本面,不输出估值/买卖/方向/仓位/目标价。价格、定价、估值、融资额一律仅作"叙事-现实 gap"的输入证据(evidence ✓ / conclusion ✗)。 证据等级:A=公司一手(可写实)→ E=不可计分仅记录,怎么读证据分级。
⚠️ 本文已被
研究输出_开放权重模型与硬件需求_2026-07-28.md取代——请读新版。 本文的核心结论是"判定输入被推迟七天、当日无法定夺";该输入已于 2026-07-27 到达(Kimi K3 权重与 47 页技术报告发布),新版给出了方向结论。本文保留有两个原因:一是它记录了"判定输入缺失时应如何处理"这一方法,二是 append-only 纪律不改写历史。已知本文有一处数字错误:第五节所述 Kimi K3"约 500 亿激活参数"是当时官方未披露时的推算,实际为 1042 亿(技术报告 Table 1),低估逾五成——更正详见 CLM-2026-0389;该更正使原文"R1 与 K3 不可类比"的结论更强而非削弱。另有两处需按新版修正的判断:一份权重落到"13 至 20 家推理云"的泛化在 3 万亿参数级不成立(K3 首日仅 5 家第三方),"64 颗加速器"的读法应改为随量化格式展开的区间。
行话看不懂?点开名词小注
名词小注(懂投资但不熟 AI 基建的读者先看这段):开放权重(open-weight,模型参数文件可下载、可自行部署,区别于只给 API 的闭源模型;下文与"开源"混用时一律指此义);MoE(混合专家架构,模型总参数很大但每次只激活一小部分,Kimi K3 是 896 个专家里每次激活 16 个);激活参数(每个 token 真正参与计算的参数量,决定算力需求;总参数则决定内存容量需求,两者不可混用);HBM(高带宽内存,贴在 GPU 上的昂贵内存,模型权重必须常驻其中);MXFP4(一种 4 比特量化格式,把每个参数从 16 比特压到约 4.25 比特以省内存);KV cache(推理时缓存的上下文中间态,长上下文场景下曾是内存大头);自托管(self-host,自己买卡把模型跑起来);托管 API(第三方推理云替你跑,你按 token 付费);Jevons 效应(单位成本下降反而使总用量上升)。
一、一句话结论
开放权重模型使 AI 硬件需求加速还是减速,在 2026-07-20 这一天无法由证据定夺——判定它的决定性输入被模型厂明确推迟了七天,因此任何当日给出的方向性论断都建立在推断而非披露之上。 本轮真正的产出不是方向,而是三件事:把被普遍误用的前提校准干净(能力差距的读法、出口管制的机制、历史类比的效力边界);确认开放权重的推理落到了一种此前未被正确描述的部署拓扑;以及锁定三个在二十一天内到期、且全部零成本的判定点。训练侧的核心事实是:Moonshot 官方发布页对 Kimi K3 的训练算力零披露,唯一的训练侧数字是一个没有分母的效率比值。
二、关键物理 bound(决定性论据)
本轮唯一不依赖时点、因而不受"数据过时"质疑的一块,是权重容量的算术。Kimi K3 的 2.8 万亿参数在最激进量化(MXFP4,含 scale 开销约每参数 4.25 比特)下约占 1.49 TB:
| 配置 | 可用 HBM 容量 | 判定 |
|---|---|---|
| 8×H100(80GB) | 0.64 TB | unsupported(装不下) |
| 8×H200(141GB) | 1.13 TB | unsupported(装不下) |
| 8×B200(192GB) | 1.54 TB | inconclusive(勉强装下权重,余量仅 0.05 TB,不足以服务) |
| 8×B300(288GB) | 2.30 TB | plausible(可容,余 0.82 TB) |
Moonshot 官方发布页的部署建议原文是"we recommend deploying Kimi K3 on supernode configurations with 64 or more accelerators"。对照上表可知,64 颗是效率建议而非容量硬约束——8×B300 已能装下权重。付费研究机构把官方的 "recommend" 写成 "will require",属措辞升级。
第二条 bound 更重要,而且它比该机构自己的论证更强:KV cache 的量级大头,在前代 Kimi K2 采用 MLA 架构时就已经被消灭了。按公开架构参数估算 100 万 token 单序列的 KV cache 量级——传统多头注意力约 4 TB,MLA 约 70 GB,MLA 叠加 KDA 线性注意力后约 17.6 GB。也就是说,KDA 带来的增量节省(约 70 GB 降到 18 GB)相对 1.49 TB 的权重是二阶小量。所以"线性注意力干掉巨额 KV cache 从而利空内存"这个直觉,从量级上就不成立,根本不需要动用 Jevons 论证去反驳它。
⚠️ 一处未解冲突需记明:本轮另一路对抗验证曾把"64 颗以上建议"与"约 1.49 TB 权重"两项判为未通过。但该轮五个检索代理有四个因网络中断失败,而官方原文另有独立抓取与第三方引用截图双重佐证,故判断为验证方检索失败而非事实被推翻。冲突并列记录,不作已解决处理。
三、分段详解
(1)训练侧:数据不是过时,而是根本不存在
这是本轮最硬也最令人不适的发现。Moonshot 官方 Kimi K3 发布页(2026-07-16)对训练侧的披露是零——没有 GPU 小时数、没有 FLOPs、没有预训练集群规模、没有芯片型号、没有训练成本、没有预训练 token 数。官方明文推迟:"Further details on the architecture, training, and evaluations will be released alongside the Kimi K3 technical report."
以营销性质的发布页作为"未披露"的证据在方法上是成立的:若厂商握有有利的高效训练数字,公布动机极强。四条独立渠道的反证检索也全部为负——Hugging Face 的 moonshotai 组织下无 K3 仓库、GitHub 无 K3 仓库、约十九个二手源无一引用任何训练算力数字。
唯一的训练侧量化表述是"相对 K2 约 2.5 倍 scaling efficiency 改进"——一个没有分母的比值,钉不住任何绝对算力。而这恰恰是"效率而非规模"叙事所倚赖的那个数字。
一条间接但有价值的线索藏在官方 benchmark 脚注里:SWE Marathon 跑在"H20 校准分支"上,PostTrain Bench 使用 H20 而非官方设定的 H100。H20 是出口管制下的对华特供型号,这暴露了该实验室评测基础设施上可用的硅,但属评测环境而非训练集群证明,不可过度解读。
目前流传的唯一公开算力估算是一条社媒推文(约 1e25 FLOPs、1500 至 2500 万美元)——E 级,不计分、不进结论链,此处仅作线索记录。
(2)推理侧:部署拓扑是第三种,不是通常说的那两种
市场讨论通常在两个选项间打转:开放权重会带来分散自托管(很多人各买各的卡),还是退化成集中服务(和闭源一样)。平台实测显示都不是。
OpenRouter 的 provider 分布(2026-07-20,三十日滚动)给出的图景是:一份权重落到十三到二十家独立推理云,每家各自把全量副本常驻在自己的 GPU 上。
- Kimi K2.7 Code(约 1 万亿参数开放权重):Moonshot 自家仅占 18.6%,第三方托管商合计 81.4%,分散在十四家
- gpt-oss-120b:十四家以上有实际 token 份额,OpenAI 自己不在其中
- Kimi K3:权重尚未发布,provider 数为 1(仅 Moonshot 自己);但 Together 已挂出 "coming soon"、Baseten 已开 waitlist——开放权重发布的第一落点是托管商,不是企业机房
这个拓扑与闭源的差异是真实的:闭源模型的权重只在原厂一套机队上常驻,开放权重在 N 套机队上常驻,每套都要独立扛峰值、独立留冗余、独立做 KV cache。但它对硬件总需求的符号未定,因为 N 本身是需求的函数——Nemotron 3 Ultra 550B 的付费托管 99.6% 收敛到 DeepInfra 一家,就是"需求不足时 N 迅速塌缩到 1"的现成例证。叠加托管商在开放权重上的薄毛利(约占 OpenRouter 二成用量、仅约 4% 收入),为其备大量冗余产能的意愿受到压制。
支撑这一拓扑的还有部署漏斗数据。Mozilla 与 SlashData 的《State of Open Source AI 2026》(样本 1,494,实地调查 2026 年 5 月下旬)测得:开放模型真正进入生产的比例仅 51%,闭源 63%,且组织规模越大差距越拉开(闭源从 54% 升到 73%,开放仅从 53% 升到 57%)。报告的判词很精准:"Closed deployment is a problem money solves. Open deployment is a problem the ecosystem has to finish."
(3)能力差距:一个被广泛用反了的数字
"开放权重只落后闭源四个月"是当前最流行的论据之一。Epoch AI 的原始数据页确实给出这个数字(2026-01-01 至 2026-05-28 窗口,等价 8 个 ECI 点),但它带三重限定,缺一条都会把结论用反:
- 口径是等能力到达时间差,不是发布日之差。Epoch 逐日计算最强开放模型的能力指数,再回溯最强闭源模型上次达到该水平的时点。因此它不能与 Artificial Analysis 之类的分数差混用。
- Epoch 自陈该估计可能低估真实差距,给出两条机制原文:开放模型在私有 benchmark 上相对更差(可能因为更激进地在公开榜上爬坡),以及领先闭源实验室出于安全、商业或竞争原因并不总是发布其最强模型。若采用更严格判据,差距为六个月。
- 测量截至 2026-05-28,结构上不可能包含 Kimi K3(07-16)与 Qwen3.8(07-19)。
所以这个数字应读作开放权重落后的下限,而不是"开放权重已经追上来了"。独立交叉源(英国 AI 安全研究所的前沿网络靶场测量)给出四到七个月,把 Epoch 的四个月夹在下沿,方向一致。
(4)出口管制:类比 DeepSeek R1 时必须校正的一处时序误述
把 2026 年 7 月的开放权重事件类比 2025 年 1 月的 DeepSeek R1 冲击时,"中国先进芯片可得性"常被描述为"R1 时期全面封锁、2026 年放开"。这个框架是错的。
监管一手文件(美国工业与安全局新闻稿 + 2026-01-15 生效的联邦公报终局规则)显示的真实机制是:H200 与 MI325X 级加速器的对华出口审查,从"拒绝推定"改为逐案审查,并附三项安全条件、对华出货不超过对美终端出货 50% 的总量上限,Blackwell 级 B30A 仍禁。逐案审查确立的是申请资格,不是已批准量、更不是已交付量。
而 R1 发布时(2025-01),H20 对华出口并不需要许可——许可要求 2025 年 4 月才到位。所以正确框架是天花板上移,不是从封锁到开放。
⚠️ 广泛流传的"25% 出口税"与"中国订单超两百万颗 H200"两项,未能溯源到该规则,含此表述的候选证据在三票对抗验证中被否,此处不采用。
(5)历史对照有效,但外推无效
NVIDIA 数据中心分部营收(10-K 分部披露,分部合计与总营收对账通过):FY2024 为 475 亿美元、FY2025 为 1152 亿美元、FY2026 为 1937 亿美元,同比增长 68%,绝对增量 786 亿美元,为该分部历史最大。
由于 DeepSeek R1 发布于 2025-01-20 而 FY2026 截至 2026-01-25,该财年完整覆盖了 R1 冲击之后的十二个月。这构成一次已完成的自然实验:上一轮"模型效率跃升利空硬件"的恐慌,被随后十二个月的一手财报证否了。同期 SK 海力士 2026 年第一季度财报(4 月 23 日)营收同比增长约 198%,业绩解读中的分析师口径是"AI 推理需要的内存比预期多得多"。
但这不能外推到当前这道题,理由有二。其一,该数据截至 2026-01-25,早于 Kimi K3 存在近六个月——它能说明 R1 之后发生了什么,不能说明 K3 之后会发生什么。其二,两次事件在五个维度存在结构性差异:模型规模(6710 亿 / 370 亿激活 对 2.8 万亿 / 约 500 亿激活)、开放与闭源能力差距、中国先进芯片可得性、部署门槛(R1 可单节点部署 对 K3 需超节点)、以及市场预期起点(R1 时 AI 基建叙事尚在早期,现在四大云厂 2026 资本开支已达七千亿美元量级、市场对 AI 需求的关注与预期基线已完全不同)。以"R1 之后没有崩塌"推断"K3 之后也不会",属归纳外推,不构成前瞻证据。
(6)闭源阵营:口径陷阱比结论更重要
四大云厂 2026 年资本开支指引全部上调、无一下调(各家电话会 A 级原话),2026 年第一季度合计约 1298 亿美元。但上调的归因不是加量:Alphabet 明确归因于并表 Intersect 收购,Meta 原话是"反映元件涨价预期,其次才是数据中心成本",微软约 190 亿美元的增量中约 25 亿来自元件涨价。
所以"四家合计约七千亿美元"里有相当比例是价格效应而非算力增量,拿它推 GPU 或服务器出货量会高估。
另一个普遍误引:微软所说"约三分之二资本开支用于短寿命资产(主要是 GPU 和 CPU)"是短寿命与长寿命资产的拆分,不是训练与推理的拆分。流传的"推理已占 AI 算力六到七成"追不到一手来源。
把四家电话会全文扫过 training 与 inference 的每一处后:没有任何一家管理层说过"从训练转向推理",也没有任何一家把策略调整归因于开放权重竞争。
(7)竞争态势:阵营边界在双向流动,不是单向侵蚀
这是本题的第二半,也是最容易被"开放追赶闭源"的单线叙事简化掉的一半。实际观察到的是双向流动:
- 由开转闭:Meta 于 2026-04-08 发布首个专有闭源模型 Muse Spark,前沿研发整体转入闭源。报道给出的动因之一,恰恰是担心竞争对手尤其中国实验室基于 Llama 开放权重构建商业产品——即开放策略的外溢收益被判定为不可接受。⚠️ 该项全部为二手报道,Meta 未发正式声明,且另有报道称其仍将开源下一代的开放版本,两条方向冲突并列保存、不合并。
- 由闭转开:NVIDIA 大规模推 Nemotron 开源家族(31.6B / 120B / 550B,并开放训练数据与后训练配方),OpenAI 曾于 2025 年发布开放权重模型(但至 2026 年中未出继任版本)。
投入侧则明确在加,且加得凶。 SpaceX 招股书首次披露 xAI 的 AI 分部资本开支:2025 年 127.27 亿美元,2026 年第一季度单季即 77.23 亿——单季已达上年全年的 61%,年化约 2.4 倍,且该分部吃掉合并资本开支约 77%。招股书自述扩张的唯一限速是"我们能多快部署电力与算力"。
唯一符合"转向保守"的是 OpenAI(算力承诺口径大幅下修、退出两个海外数据中心项目),但公开报道给出的归因是融资约束与上市前预期管理,不是开放权重竞争。而且它退出的产能被微软立刻接手并扩容。
把这些放在一起,2026 年真正变化的不是"投多少",而是"谁持有资产"——每一次某家收缩,产能都被另一家立刻吸收(xAI 利用率仅约 11% 的闲置集群被整体租给 Anthropic 即是一例)。这是资产负债表洗牌,不是需求毁灭。
闭源阵营面对能力商品化压力的揭示性偏好,是往上跑而非往下守。 前沿档 API 价格在涨不在跌(各家官方定价页 2026-07-20 直取):Anthropic 在原旗舰 Opus 档(每百万 token 输入 5 美元、输出 25 美元)之上新开 Fable 与 Mythos 两个 10/50 档;OpenAI 旗舰从一年前 GPT-5 的 1.25/10 抬到 5/30,专业档达 30/180。实际形态是价格分层——便宜档更便宜、贵档更贵——不是均匀通缩。⚠️ 价格证据按库纪律仅作叙事与现实差距的输入,不作结论。
四、区间判断(会怎样、多少、多久)
| 判断 | 量级 / 时间 | 证据级 |
|---|---|---|
| Kimi K3 权重容量(MXFP4) | 约 1.49 TB;装不进 8×H200(1.13 TB) | A(官方参数)+ 算术 |
| KDA 相对 MLA 的 KV cache 增量节省 | 约 70 GB 降到 18 GB,相对权重为二阶小量 | 架构参数估算(量级非精确值) |
| 开放权重落后闭源前沿 | 四个月(下限;严格判据六个月),窗口截至 2026-05-28 | B |
| 开放权重模型第三方托管占比 | Kimi K2.7 为 81.4%,分散十四家 | B(平台实测,分母不含自托管) |
| 开放模型进入生产比例 | 51%(闭源 63%),规模越大差距越拉开 | B |
| 开放模型占企业 API 美元支出 | 约 11%(自 2024 年 19% 下滑),中国模型约 1% | C(且时点为 2025-12,已旧七个月) |
| NVIDIA 数据中心 FY2026 | 1937 亿美元,同比 68%,绝对增量 786 亿美元 | A |
| Kimi K3 训练算力 | 无任何披露,推迟至 2026-07-27 | A(缺席即证据) |
五、最能推翻结论的 3 个条件(监控触发器)
- 2026-07-27 的 Kimi K3 技术报告披露训练算力为数量级跃升(而非与前代同量级)。若如此,"开放权重靠效率而非规模竞争"被推翻,训练侧军备竞赛叙事转为成立,本文对训练侧的克制判断需整体重估。这是头号触发器,七天后到期,零成本。
- 权重发布后第三方托管商未能在合理窗口内上线 K3 端点。若托管上线明显滞后,说明 2.8 万亿这个尺寸连专业托管商都难以消化——那将是一条比"多托管商各持副本"更强、也更指向需求收缩的结论,第三节第(2)小节的拓扑判断需改写。
- 企业美元支出口径下开放权重份额出现反转上升。当前双口径背离(token 量领先、美元份额下滑)是"开放权重扩张与闭源收入未被侵蚀可并存"的支点;若下一期企业调查显示美元份额反转,则能力商品化开始穿透企业预算,闭源实验室定价权的论证需重估。
六、我不会信的叙事(及为什么)
❌ "线性注意力降低 KV cache,所以利空 NVIDIA、HBM、DRAM" —— 量级上就不成立。KV cache 的大头在前代采用 MLA 时已被消灭,线性注意力的增量节省相对 1.49 TB 权重是二阶小量。
❌ "这条利好硬件的论证 = 利好 NVIDIA" —— 混淆了总需求与厂商份额。开放权重恰恰是硬件脱钩的使能器:闭源模型不可能移植到华为昇腾,开放权重的才能。DeepSeek V4 在昇腾 950PR 上有 Day 0 支持,昇腾、寒武纪、海光三家完成适配。⚠️ 但这条要克制——Epoch AI 对中国模型的调查显示中国实验室"推理常用国产芯片,但很少用于大模型预训练",且 DeepSeek V4 的训练硬件有五个来源、至少三种互不兼容的说法,本文并列保存不合并。
❌ "四大云厂七千亿美元资本开支 = 算力增量" —— 相当部分是元件涨价与并购并表的价格效应。
❌ "微软三分之二短寿命资产 = 推理占比" —— 那是资产寿命拆分,不是训练与推理拆分。这个误引极其普遍。
❌ "大模型 API 价格一年跌八成" —— 前沿档在涨不在跌。实际形态是价格分层(便宜档更便宜、贵档更贵),不是均匀通缩。⚠️ 另有一处几乎无人提及的口径污染:Anthropic 已更换 tokenizer,其官方定价页承认相同文本产生约多三成 token——这会机械性抬高任何 token 消耗时序,也污染跨代的每 token 单价比较。
❌ "DeepSeek 训练只花了约 558 万美元" —— 该数字口径是边际最终训练,DeepSeek-V3 技术报告(arXiv 2412.19437)原文明确排除前期研究与架构、算法、数据的消融实验。第三方(SemiAnalysis 等研究机构与后续分析)给出的五亿、十三亿、十六亿美元是不同 scope(机队资本开支 对 模型项目成本 对 单次训练),四个数不可相减、不可互证。
❌ "Kimi K3 发布 48 小时因 GPU 产能暂停订阅 = 需求爆表" —— Moonshot 官方原文三处限定词全是"我们的"(our GPUs、our current capacity),拆分会员计划的官方理由是"更精确地匹配算力",即配给管理。且当时全球只有 Moonshot 一家能服务 K3。该信号在结构上无法区分"需求太大"与"唯一供给方产能太小",在权重发布前不构成需求侧证据。
❌ 本文作者自己的一条推论,同样不信 —— 我曾推断"NVIDIA 把 Nemotron 开源家族尺寸停在 550B 是为了让模型可被广泛自托管从而拉动 GPU 销售"。查无官方依据:NVIDIA 给出的分档理由是工作负载右尺寸化与 agent 并发数;且 Nemotron 3 Ultra 在该路由平台以免费端点跑量、付费托管 99.6% 集中于一家,即 NVIDIA 推广自家开源模型的落点也是第三方托管加补贴。该推论已隔离,不进结论链。