开放权重模型与 AI 硬件需求:判定输入到期后的重估
研究问题:开放权重大模型(Kimi K3、Qwen3.8)沿当前轨迹继续发展,未来 6 至 18 个月对 AI 硬件需求是加速还是减速?分训练与推理两个市场,并判断开放与闭源实验室的竞争态势演化。 完成日期:2026-07-28 本文 supersede
研究输出_开放权重模型与硬件需求_2026-07-20.md——那一轮的结论是"判定输入被推迟七天,当日无法定夺"。七天到了,输入来了。 边界声明:本文止于产业基本面,不输出估值/买卖/方向/仓位/目标价。价格、定价、成本一律仅作"叙事-现实 gap"的输入证据(evidence ✓ / conclusion ✗)。 证据等级:A=公司一手(可写实)→ E=不可计分仅记录,怎么读证据分级。
行话看不懂?点开名词小注
名词小注(懂投资但不熟 AI 基建的读者先看这段):开放权重(open-weight,模型参数文件可下载、可自行部署,区别于只给 API 的闭源模型);MoE(混合专家架构,模型总参数很大但每次只激活一小部分);激活参数(每个 token 真正参与计算的参数量,决定算力需求);总参数(决定内存容量需求——与激活参数是两回事,混用是最常见的错误);HBM(高带宽内存,贴在 GPU 上的昂贵内存,模型权重必须常驻其中);MXFP4/FP8(把每个参数分别压到约 4.25 比特、8 比特的量化格式,压得越狠越省内存但精度损失越大);KV cache(推理时缓存的上下文中间态);吞吐(tokens per second,模型每秒吐出多少字,决定用起来快不快);托管商(第三方推理云,替你把模型跑起来、你按用量付费);scaling law(模型能力随算力投入变化的经验曲线)。
一、一句话结论
加速——而且判定它的证据不在厂商的披露里,在厂商拒绝披露的那部分与架构算术的交叉处。 Kimi K3 把每个 token 实际参与计算的参数从上代的 326 亿抬到 1042 亿(增加 220%),仅此一项就使训练算力的下界变成上代的 3.2 倍(独立第三方按同侪外推给出的中值是 6.7 倍;上界未定——该第三方自陈的训练数据量区间上沿对应约 12 倍);而 Moonshot 在技术报告开篇明确拒绝了"用效率替代规模"的路线,写明开放阵营若停在 1 万亿级会导致与最强闭源的差距扩大。推理侧的答案更硬也更意外:K3 的单位 token 价格是上代 1.1 万亿模型的三到四倍,吞吐却只有上代的一半左右(8–72 对 21–149 字/秒),能接住它的第三方托管商从 12 家掉到 5 家。开放权重变强,单位 token 的硬件强度是上升的,不是下降的。(⚠️ 推理侧这组数是权重发布 24 小时内的快照对上代成熟期数据,两端生命周期阶段不同——它支持方向,但不足以坐实因果,8 月 10 日重测才能拆开。) 真正的新问题不再是方向,而是:绝对训练算力至今零披露——同一个实验室连续两代都写了训练芯片与 token 数,这一代把两项都收回了。
二、关键物理 bound(决定性论据)
本轮最硬、且不随时点失效的一块,是两组算术。
(1)训练算力的下界
大模型的训练算力有一个业内通用的近似:算力 ≈ 6 × 激活参数 × 训练 token 数。这两个数中,激活参数在这次技术报告里第一次给全了,训练 token 数上代给过。于是:
| Kimi K2(上代,已披露) | Kimi K3(本代) | |
|---|---|---|
| 激活参数 | 326 亿 | 1042 亿(+220%) |
| 总参数 | 1.04 万亿 | 2.78 万亿(+167%) |
| 层数 | 61 | 93 |
| 训练 token | 15.5 万亿 | 未披露 |
| 推算训练算力 | 约 3.0×10²⁴ 次浮点运算 | — |
把 K3 的训练 token 数按最保守的假设——与上代完全持平——代进去,得到的下界是 3.2 倍。这个假设几乎不可能成立,因为三件事都指向 token 只会更多:总参数涨了 167%(按 scaling law,参数越大最优训练数据量越大)、K3 新增了完整的视觉语料而上代是纯文本、报告明说重新调优了"每参数分配多少 token"这个比值。若 token 数跟着涨三成,倍数是 4.2;若随总参数同比例涨(总参是上代的 2.67 倍),是 8.5。
| 训练 token 假设 | K3 训练算力 | 相对上代 |
|---|---|---|
| 与上代持平(最保守) | 9.7×10²⁴ | 3.20× |
| +30% | 1.3×10²⁵ | 4.16× |
| 随总参数同比例增长(×2.67) | 2.6×10²⁵ | 8.54× |
这条推导有一个独立的外部锚可以对表。 Epoch AI 的模型数据库给 K3 的估算是 2.0×10²⁵ 次浮点运算,置信标注为"可能"(likely);其方法是按同侪模型外推训练 token 约 30 万亿(自陈区间 15 万亿到 60 万亿),再用同一个 6ND 公式。按它自己给上代的估算(2.98×10²⁴,标注"确信")算,倍数约 6.7 倍。
两条路径的差异完全来自 token 数假设(15.5 万亿对 30 万亿),激活参数那个乘子是同一个官方披露值。所以三个数要分清:3.2 倍是下界(本文算术,前提是 token 不少于上代)、6.7 倍是第三方中值(Epoch 按 30 万亿 token 外推)、上界未定——Epoch 自陈其 token 假设区间上沿是 60 万亿,代进同一个公式得约 3.75×10²⁵、相当于上代的 12.4 倍。方向由两条独立路径支撑,量级仍不可锚,缺口收敛到"预训练 token 总数"这一个乘子。
⚠️ 别把它读成"3 到 7 倍的区间"——7 不是上界,是中值。
这里必须拆掉一个流传最广的误读。 官方反复强调的"scaling efficiency 提升约 2.5 倍",被普遍读成"所以开放权重不需要更多算力了"。看报告里那张图就知道不是:横轴是算力、纵轴是验证损失,2.5 倍是曲线的横向位移——意思是"要达到同样的模型质量,现在只需要过去 40% 的算力"。但 K3 显然没有停在上代的质量水平上。效率增益被拿去买更大的规模了,不是拿去省钱了。 这两件事同时为真,而市场把前者当成了后者的替代品。
⚠️ 顺带堵一个方法陷阱:那张图的横轴范围是 10²⁰ 到 10²¹,这是用来拟合 scaling law 的代理小模型的实验区间(报告原文说得很清楚:"我们做了专门的 scaling-law 研究来重新调优关键超参数"),与 K3 正式训练那一跑差四到五个数量级。拿这张图去反推 K3 的训练算力在方法上不成立——但已经有二手源在这么做了。
(2)部署门槛:不再是一个数,是一个区间
上一轮算过 K3 权重在最激进量化下约 1.49 TB。这次有了实测——不同托管商用了不同的量化格式,于是同一个模型的内存需求相差近两倍:
| 量化格式 | 权重占用 | 8×B200(1.54TB) | 8×B300(2.30TB) | 16×B300(4.61TB) |
|---|---|---|---|---|
| FP4(Nebius 实用) | 1.39 TB | 余 0.15 | 余 0.91 | 余 3.22 |
| MXFP4(Moonshot 官方) | 1.48 TB | 余 0.06 | 余 0.83 | 余 3.13 |
| FP8(Baseten 实用) | 2.78 TB | 装不下 | 装不下 | 余 1.83 |
也就是说:Baseten 选择用精度更高的 FP8 来托管,代价是权重占 2.78 TB,超过八张 B300 的总显存,它必须上到 16 张卡以上。 上一轮把"最小部署单元"当成一个待测的数字,这轮的实测答案是:它是一条曲线,托管商在"精度"和"硬件成本"之间各自选点。
三、分段详解
(1)训练侧:分叉解开了,但不是靠披露解开的
上一轮的核心分叉是:开放权重阵营到底是在扩大训练算力投入,还是在大致持平的算力基座上靠架构和数据把参数堆上去?当时判定它的唯一一手输入被推迟。
技术报告给出的回答是三段式的,而且第一段令人意外。
第一段:它仍然不回答那个数字,而且比上一代回答得更少。
47 页报告全文扫过之后,六类训练算力指标——GPU 小时数、总浮点运算量、预训练集群规模、训练芯片型号、训练成本、预训练 token 总数——一个都没有。第 5.2 节的标题是"3T 级预训练的基础设施",用了约四千字详述并行方案,全程使用符号(专家数 E、并行度 R、序列长 S、每 token 专家数 K),不给任何一个绝对规模数字。第 6.4 节叫"成本效率",但内容全是推理侧的每任务成本,不是训练成本。
对照前两代,这不是"这类报告本来就不写",而是同一实验室连续披露两代之后主动收回:
| 代际 | 训练芯片披露 | 预训练 token 披露 |
|---|---|---|
| Kimi K2(2025-07) | ✅ 有专章"Compute Cluster":NVIDIA H800,每节点 2TB 内存 + 8 卡、节点内 NVLink/NVSwitch、节点间 8×400Gbps RoCE | ✅ 15.5 万亿 |
| Kimi K2.5(2026-02) | ✅ 附录 C:"在 NVIDIA H800 GPU 集群上训练,节点间 8×400Gbps RoCE" | ✅ 约 15 万亿 |
| Kimi K3(2026-07) | ❌ 无对应章节,全文零训练芯片 | ❌ 零 |
而且这不只是我自己的读法——独立第三方复现了同一现象:Epoch AI 数据库的"训练硬件"字段,K2 填 NVIDIA H800 SXM5、K2.5 填 NVIDIA H800 SXM5、K3 是空的。K2 的算力估算能标"确信"而 K3 只能标"可能",原因正是这些字段的有无。
所以披露在倒退,而且这是可以逐代验证的倒退。这件事本身是本轮最值得记下来的信号。报告没解释为什么,我也不打算替它解释——训练用的硅来源敏感、竞争考量、单纯的编辑取舍,三种解释都说得通,没有一种有官方依据。只把三条线索并列摆着:报告里 SWE-Marathon 评测跑在"H20 校准分支"上、PostTrain Bench 用 H20 而非官方设定的 H100、第 7 节的 kernel 优化案例覆盖"一块 NVIDIA Hopper GPU 和一块其他厂商的 GPGPU"(未具名)。这些都是评测环境,不是训练集群的证明,不可过度解读。
顺便打一个假:网上流传的"K3 用 H800 训练"没有任何官方依据。它的源头是社媒从 K2 和 K2.5 的已披露值外推(原帖用词是"这大概跑在他们训 K2.x 那批 H800 上"),二手检索摘要再把这句推测复述成事实。K3 的训练芯片型号至今是空白。
报告里确实有两个绝对规模数字,但都不是预训练算力,值得单独记下来免得被误用:
- 第 5.3.1 节(强化学习,非预训练):"把每次 100 万上下文的 Kimi K3 强化学习实验控制在几百张 GPU 以内"
- 第 5.3.2 节(沙箱,CPU 侧):"在 Kimi K3 的整个训练与评测过程中,共创建了 51,219,741 个沙箱、1,505,678 个镜像"
第一条值得注意,因为它限制了我原本可能过度解读的那部分:单次强化学习实验只有几百卡的规模,不是万卡级。真正的算力堆叠来自实验次数与九个专家模型的乘积,而不是单次实验的体量。
第二段:它给了推导这个数字所需要的全部输入。 就是第二节那张架构对比表。上一轮无法计算,是因为不知道激活参数;这一轮知道了,算术就能自己走完。
第三段:它直接说了想干什么。 技术报告引言里这段话,是本轮最关键的定性证据(逐字翻译):
"开源模型生态在第二根轴(推理时算力)上进展迅速,但在第一根轴上进展缓慢:许多近期模型仍停留在 1 万亿参数级别或略高。当越来越精巧的推理与智能体强化学习方法被应用到规模相近的预训练基座上时,开源的进步有收敛的风险,而与最强专有系统的差距会扩大。我们用 Kimi K3 同时把两根轴都推到前沿:把预训练基座扩展到前所未有的 3 万亿参数级,同时在 100 万 token 上下文上扩展强化学习、推理投入与长程交互。"
这是厂商自己的揭示性偏好:它判断"只在推理侧卷、预训练停在 1 万亿级"会输,所以选择两边一起加。这与"效率替代规模"的叙事是正面冲突的。
还有一块算力被普遍漏掉了:后训练。 报告写明,强化学习跨三个领域(通用任务、通用智能体、编程智能体),每个领域再分三档推理投入(低/高/最大),"总共产生九个专家模型",最后用多教师在线蒸馏合并成一个统一模型。也就是说,在预训练之外,还有九次 2.8 万亿参数级的强化学习训练加一次蒸馏。而且报告明确把强化学习算力当作一根在推的轴——原文是"通过扩展强化学习算力,工具调用步数持续上升,同时模型整体能力全面提升"。这些算力完全不在"预训练算力"里,也不在上面那组倍数里(那组只算预训练)。
但要按住一句:这块算力的量级不宜夸大。按报告自陈,单次百万上下文的强化学习实验被"控制在几百张 GPU 以内"。所以后训练的算力堆叠来自实验次数乘以九个专家模型,而不是单次实验的体量——它是一笔可观的增量,不是又一个万卡级工程。
(2)推理侧:首日实测给出了第三种答案
上一轮为这个问题设了一个干净的判定条件:权重发布后,第三方托管商如果在 72 小时内上线并拿到实际调用量,就是复刻上代"第三方占八成、分散十四家"的形态;如果上线明显滞后,说明这个尺寸连专业托管商都消化不了。
两个分支都没发生。 实测是第三种:上线极快,但承接方数量少了近六成,而且服务质量剧烈分化。
权重发布不到 24 小时,OpenRouter 上已有 6 家托管商、7 个服务端点:
| 托管商 | 输入 $/百万 | 输出 $/百万 | 吞吐 | 量化 | 上下文 | 可用率 |
|---|---|---|---|---|---|---|
| Baseten | 3.00 | 15.00 | 19 字/秒 | FP8 | 100 万 | 99.6% |
| Fireworks | 3.00 | 15.00 | 32 字/秒 | — | 100 万 | 98.1% |
| Moonshot 自家 | 3.00 | 15.00 | 21 字/秒 | MXFP4 | 100 万 | 99.9% |
| DigitalOcean | 3.00 | 15.00 | 8 字/秒 | — | 100 万 | 83.8% |
| Together | 3.00 | 15.00 | 33 字/秒 | — | 100 万 | 93.3% |
| Fireworks Fast | 4.50 | 22.50 | 72 字/秒 | — | 100 万 | 93.8% |
| Nebius | 3.00 | 15.00 | 17 字/秒 | FP4 | 8 千 | 16.7% |
对照上代 Kimi K2.7-Code(1.1 万亿参数,已成熟):14 个端点、13 家独立托管商,其中 Moonshot 自家占 2 个端点,第三方为 12 家;输入每百万 token 0.71 到 0.95 美元、输出 3.50 到 4.00 美元;吞吐 21 到 149 字/秒;上下文统一 25.6 万,量化以 INT4 为主。
⚠️ 两个口径必须先说清,否则下面的对比会错:一是托管商数要同口径——上代的 13 家含自家、K3 的 5 家不含自家,可比的是第三方 12 家对 5 家;二是两代定价根本不同,不存在"同样价格"这个前提。
把两代放在一起,规模从 1.1 万亿涨到 2.8 万亿(+155%)的代价是这样的:
| 上代 K2.7-Code(成熟期) | K3(首日) | 变化 | |
|---|---|---|---|
| 第三方托管商 | 12 家 | 5 家 | −58% |
| 输入价格 | 0.71–0.95 美元/百万 | 3.00 美元 | 涨 3.2–4.2 倍 |
| 输出价格 | 3.50–4.00 美元/百万 | 15.00 美元 | 涨 3.75–4.3 倍 |
| 吞吐(全量端点) | 21–149 字/秒 | 8–72 字/秒 | 上沿 −52%、下沿 −62% |
| 上下文一致性 | 统一 25.6 万 | 8 千到 100 万,剧烈分化 | — |
信息量最大的一项是 Fireworks 同时挂了两个端点:标准档 3.00/15.00 卖每秒 32 字,"Fast"档 4.50/22.50 卖每秒 72 字。加价 50%,速度翻 2.25 倍——这是托管商拿更多硬件换溢价的直接定价证据。而 Nebius 这一端,是把上下文从 100 万砍到 8 千才勉强跑起来,可用率只有 16.7%。
所以"开放权重让推理更便宜"这个叙事,在 3 万亿级上是反的——而且比"同价格买到更少"更糟:价格和速度两个方向同时恶化。单位 token 的价格是上代的三到四倍,吞吐却只有上代的一半左右;想在 K3 上恢复到快一些的速度,还得在这三到四倍之上再多付一半(Fireworks 的 Fast 档),而这多付的钱对应的就是更多硬件。
⚠️ 这组对比有一处方法论弱点必须讲明:K3 是权重发布 24 小时内的快照,上代是成熟期数据,两端不在同一生命周期阶段。价格与吞吐的差异里有多少来自规模、多少来自"还没优化完",本轮拆不开。把它当作因果结论是不成立的——这个归因已单列为一条推论并挂了证伪条件(详见 §五、§七)。
这个判断有第二条独立路径佐证。 Artificial Analysis 用自己的方法测得 K3 输出速度 33.3 字/秒(在同类 98 个模型里排第 59),每任务成本 0.72 美元;而同为开放权重的 DeepSeek V4 Pro 是 0.04 美元、GLM-5.2 是 0.32 美元——K3 的每任务成本是 DeepSeek V4 Pro 的 18 倍。该平台给 K3 的自动摘要写得很直接:
"Kimi K3 智能水平位居前列,但与同等规模的其他开放权重模型相比特别昂贵,而且明显慢、非常啰嗦。"
注意这句话的比较基准是开放权重阵营内部,排除了"开放对闭源"的口径干扰。两条独立路径(路由平台的托管实测、评测平台的统一方法测量)指向同一结论:K3 贵且慢。而它换来的是 57 对 44 的智能指数——能力与成本同向大幅上移,这正是"扩规模路线"在推理侧的价格表现。
还有一件事值得单独记:K3 在 OpenRouter 上的第二大流量来源是 Claude Code(1030 亿 token),仅次于 Hermes Agent(3470 亿)。开放权重模型已经渗透进闭源厂商的工具链里,模型和工具链的绑定关系正在解耦。
⚠️ 这组数据的口径限制必须一起传下去:这是权重发布不到 24 小时的快照,托管商还在陆续上线,5 家是当前值不是终值,吞吐和可用率都含冷启动效应;上代那组是成熟期数据,两者不在同一生命周期阶段。要严格可比,得等 8 月 10 日窗口结束后重测。另外 OpenRouter 的分母按定义不含自托管,不能用来估自托管与托管之比。
(3)架构层面:为什么"线性注意力干掉内存需求"是错的
上一轮从量级上驳过这个说法,当时用的是按公开参数做的估算。这轮有了官方架构描述,可以直接用原文:
K3 的 93 层里,69 层是 KDA(线性注意力),24 层是 Gated MLA(传统注意力)。报告第 5.4 节原文说,这个混合架构"维护两套根本不同的缓存,必须在百万 token 上下文下联合管理";第 5.4.1 节进一步说明:"MLA 的 KV cache 随序列长度增长、按 token 分页,而 KDA 的循环状态是固定大小、每个请求只有一份。"
也就是说,K3 没有消灭 KV cache,它保留了 24 层会随长度增长的那种。而且报告在强化学习那节明确写了,可复用的空闲前缀会被"写回 CPU 内存里的外部 KV cache 池"——这意味着需求不只落在 GPU 显存上,也落在服务器内存上。
生产侧还有几个一手数字很有说服力:典型的编程请求前缀是 40 万 token(而增量只有 4 千,所以缓存命中与否差"几个数量级");生产流量的单请求成本跨越三个数量级;调度上每个会话被一致性哈希钉到两个集群(主集群加一个预备集群,预备集群不持有缓存、故障切换时要重新计算),而且跨集群链路"远慢于集群内网络"所以缓存无法迁移、每个集群必须自持完整能力。冗余在这里是设计要求,不是浪费。
(4)"开放"的定义在这一代收窄了
这是本轮一个完全没被预期到的发现。K3 的许可证不是 MIT。
| Kimi K2 | Kimi K3 | |
|---|---|---|
| 许可证 | Modified MIT | 自定义 "Kimi K3 License" |
| 署名义务 | 月活超 1 亿或月营收超 2000 万美元 → 界面标注 | 同 |
| 托管服务限制 | 无 | 任意连续 12 个月累计营收超 2000 万美元者,商用前须与 Moonshot 另签商业协议 |
| 豁免 | — | 内部自用;经官方产品或认证伙伴访问 |
上一轮的判断是"开放权重发布的第一落点是托管商,不是企业机房"。K3 的许可证恰好把闸设在这个落点上——Together、Fireworks、Baseten 这些推理云,12 个月累计营收过 2000 万美元几乎没有悬念。
所以"K3 是开源模型"这句话之后需要限定:权重可以下载、可以自己部署(内部自用明确豁免),但商业化托管不再是无条件的。 对企业自建反而没影响,受影响的是转售算力这条路径。
⚠️ 克制一句:条款存在不等于已在执行。五家第三方在 24 小时内就上线了,至少说明条款没构成即时障碍——可能已经谈好了,也可能双方还没处理。这一项留待观察,不作推断。
开放阵营内部还有第二处分化,是关于"承诺能不能兑现"的。 上一轮把 K3 和 Qwen3.8 归为同一种"先开商业化窗口、再放权重"的节奏。九天过去,两家分岔了:
| 承诺 | 兑现情况(截至 7 月 28 日) | |
|---|---|---|
| Kimi K3 | 明确日期 7 月 27 日 | 准时兑现(权重仓库 118 个文件,实测参数量 2,779,931,837,184) |
| Qwen3.8 | "soon",无日期 | 九天未兑现 |
Qwen3.8 我查了四条渠道——Hugging Face 官方组织(按创建时间倒序全量拉取)、ModelScope、Qwen 官方研究博客、阿里官方社交账号——全部为空。官方唯一的表述仍是 7 月 19 日那条"即将发布并开放权重",无日期、无许可证、无仓库。而且它至今不在任何第三方评测榜上,厂商自述的"仅次于 Fable 5"发布九天仍无独立复核。
所以真正的分野不在"是否先变现",而在是否给出可问责的日期。这一条对判断开放权重供给节奏是有信息量的:一个 2.4 万亿参数级模型的权重发布,在承诺之后九天仍然不可预期。
⚠️ 克制:九天不算长,Qwen3.8 随时可能发布。这里记录的是截至今日的状态,不是"阿里不会开源"的判断。
(5)能力差距:权威数据没更新,但有了独立实测
"开放权重只落后闭源四个月"这个被反复引用的数字,本轮去复核了源头:Epoch AI 的数据页至今仍是 2026 年 1 月 1 日至 5 月 28 日的窗口(发布于 5 月 29 日),结构上不含 Kimi K3,也不含 Qwen3.8。所以上一轮给它加的三重限定原封不动继续有效:口径是"等能力到达时间差"而非发布日之差、Epoch 自陈该估计可能低估真实差距(更严格判据下是六个月)、窗口不含最新模型。它是开放权重落后的下限,不是"已经追上"的证据。
补充一个背景:Epoch 同时记录了历史对照——2023 年 1 月至 2025 年 10 月的平均差距是三个月,2026 年以来是四个月。差距是略微扩大的,不是缩小。
不过现在有了 K3 自己的第三方实测。技术报告引用的那组(截至 7 月 23 日)是:
| 榜单 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| Artificial Analysis 智能指数 | 57.1 | 59.9 | 58.9 | 55.7 | 51.1 |
| Vals 指数 | 74.7(第 2) | 75.1 | 73.1 | 70.4 | 65.0 |
| WebDev Arena(Elo) | 1678(第 1) | 1634 | 1630 | 1565 | 1592 |
| Agent Arena | 9.1(第 4) | 12.7 | 10.1 | 9.8 | 6.5 |
这组数字我去 Artificial Analysis 独立复核过,五项全部对得上(取整后 57/60/59/56/51)。但复核同时发现两件事,都需要写进来:
第一,报告自述的名次今天已经过期了。 报告原文说 K3"在 580 个模型中排第四——若把 GPT-5.6 Sol 的不同投入档合并计为一条则排第三"。所以坊间流传的"第三"不是二手源杜撰,是报告自己给的另一种计数口径。但 Claude Opus 5 于 7 月 24 日发布并登顶(61 分),所以今天按"每个模型只取最强变体"计,K3 是第四(Opus 5 → Fable 5 → GPT-5.6 Sol → K3)——数字上巧合还是 4,成因已经换人;按含全部投入档计则是第七。任何名次引用都必须带取数日期,五天就能失效。
第二,报告表里的 GPT-5.5 已不能作当代对照。 今天 AA 上 GPT-5.5 Pro 无当前评分,GPT-5.5 Instant 只有 29 分(第 83)。OpenAI 现役前沿是 GPT-5.6 系列。上面的表已删去该列。
所以正确的读法是:K3 超过了闭源厂商的上一代(Claude Opus 4.8),落后当代最强(Claude Opus 5)四分。 它是榜上最高的开放权重模型,这一点没有争议;但"追平前沿"是不成立的。这与 Epoch"落后数月"的时间口径不矛盾,两者可以并读。WebDev Arena 那个第一来自报告转引、本轮未独立复核(独立复核只覆盖了 Artificial Analysis 一家),而且那是单项。
(6)闭源阵营:真正的表态在明后两天
上一轮设的第三个判定点是四大云厂二季度财报里的 2027 年资本开支口径。本轮盘点发现窗口刚好卡在中间:Alphabet 已于 7 月 22 日发布,微软和 Meta 在 7 月 29 日,亚马逊在 7 月 30 日。
Alphabet 那份(⚠️ 以下数字来自二手财经报道,属待验证级别,本文只用它的日程与归因方向,不用来做任何推算;下一轮应直取该公司投资者关系原文升级为一手):2026 年资本开支指引从 1800–1900 亿美元上调到 1950–2050 亿美元,Google Cloud 营收同比增 82%,积压订单单季增加 500 亿美元至 5140 亿;并明确表示 2027 年还会继续增加,归因是产能交付加速与供应约束延续到 2027 年——不是开源竞争。
但这里有一个时序问题必须讲清楚:Alphabet 的财报日(7 月 22 日)早于 K3 权重发布(7 月 27 日)。它能说明的是"截至 7 月 22 日闭源阵营仍在加码且归因与开源无关",不能说明"闭源阵营看到 K3 之后怎么想"。真正意义上 K3 之后的第一次管理层公开表态,是明天和后天的微软、Meta、亚马逊。这是本题下一个零成本判定点,一到两天后到期。
(7)需要向上一轮认领的三处更正
重写的责任之一是把上一轮写错的地方点出来,而不是悄悄改掉。
- "约 500 亿激活参数"是错的,实际是 1042 亿,低估逾五成。这是在官方未披露时的推算。更正方向对原论证有利:上一轮用它论证"DeepSeek R1 时期与 K3 时期存在结构性差异因而不可外推",实际差异比当时写的更大(370 亿对 1042 亿,而非 370 亿对 500 亿),结论不仅不变而且更强。已在
SRC-2026-0319追加更正注记(不删原文)。 - "一份权重落到十三到二十家推理云"这个泛化,在 3 万亿级上不成立。那是 1.1 万亿级模型的观测,K3 首日只有 5 家第三方。托管商数量不是常数,是模型规模的减函数。
- "64 颗加速器是效率建议而非容量硬约束"需要补一句:这个判断本身没错(8×B300 确实装得下 MXFP4 权重),但技术报告和模型卡都没有重申 64 颗这个建议,而实测显示选择 FP8 的托管商必须上 16 卡以上。"最小部署单元"应当被理解为随量化格式展开的区间,而非单一数字。
四、区间判断(会怎样、多少、多久)
| 判断 | 量级 / 时间 | 证据级 |
|---|---|---|
| K3 激活参数 | 1042 亿(上代 326 亿,+220%) | A(技术报告 Table 1) |
| K3 训练算力相对上代 | 下界 3.2×(算术)/第三方中值 6.7×/上界未定(Epoch token 区间上沿对应约 12.4×) | A 级输入 + 算术;B(Epoch) |
| K3 绝对训练算力 | 仍零披露;外部估算 2.0×10²⁵ 次运算(标注"可能",token 假设区间 15–60 万亿) | A(缺席即证据)+ B(估算) |
| 训练披露倒退 | 连续三代中首次收回芯片型号与 token 数两项(K2/K2.5 均披露 H800 + 约 15 万亿 token) | A(三代报告原文)+ B(Epoch 字段) |
| 后训练规模 | 9 个专家模型(3 域 × 3 档)+ 多教师蒸馏;单次 RL 实验控制在几百卡以内 | A |
| 权重容量 | FP4 1.39 TB/MXFP4 1.48 TB/FP8 2.78 TB(超 8×B300) | A 参数 + 算术 |
| K3 首日第三方托管商 | 5 家(上代成熟期 12 家,同为第三方口径) | B(平台实测,首日快照) |
| K3 吞吐与单价 | 吞吐 8–72 字/秒(上代全量端点 21–149);单价为上代 3.2–4.3 倍;评测平台独立测得 33.3 字/秒 | B(两源独立) |
| K3 每任务成本 | 0.72 美元 = DeepSeek V4 Pro 的 18 倍、GLM-5.2 的 2.3 倍(同为开放权重) | B |
| 许可证 | 由 Modified MIT 变为含托管营收门槛的自定义许可 | A |
| 开放权重落后闭源前沿 | 4 个月(下限;严格判据 6 个月),窗口截至 2026-05-28、不含 K3 | B |
| K3 当代能力位次 | 落后当代最强(Claude Opus 5,61 分)4 分;超闭源上一代(Opus 4.8)1 分;开放权重第一 | B(2026-07-28 实测) |
| Qwen3.8 权重 | 承诺"soon"后 9 天未发布,四渠道皆空;至今无第三方实测 | A(反证检索) |
| Nemotron 尺寸上限 | 550B 总参 / 55B 激活,从未出现 1T 以上 | A |
五、最能推翻结论的 3 个条件(监控触发器)
- 8 月 10 日重测时,K3 的第三方托管商数量没有超过首日的 5 家、吞吐也没有随优化上来。 本文把"第三方托管商 12 → 5 家"读作规模抬高门槛的证据,但首日快照含冷启动效应,这个读法的前提是"5 家是起点"。若一个窗口过去仍是 5 家且吞吐停滞,那说明的就不是"门槛抬高"而是"这个尺寸在商业上跑不通"——那会是一条比本文更强、也更指向需求收缩的结论,第三节第(2)小节需整体改写。
- Epoch 纳入 K3 与 Qwen3.8 重算后,开放与闭源差距显著收窄至两个月以内。 本文沿用"开放权重落后闭源、且差距在略微扩大"的判断,它支撑着"闭源阵营没有理由因开源竞争而收缩投入"这条链。若差距被实测大幅压缩,能力商品化的传导速度需要重估。
- 微软、Meta、亚马逊在 7 月 29 至 30 日的财报中首次把资本开支策略调整归因于开源模型竞争。 迄今四大云厂管理层从未有过这类表述(上一轮已做过全文扫描验证)。这是本文"竞争态势为双向流动而非单向侵蚀"判断的关键否定证据,一旦出现即需重新检视。
六、我不会信的叙事(及为什么)
❌ "scaling efficiency 提升 2.5 倍 = 开放权重不再需要更多算力" —— 范畴错误。2.5 倍是"达到同等质量所需算力降至 40%"的横向位移,而 K3 没有停在同等质量上。效率增益被用来买更大规模了。这是本轮最普遍的误读。
❌ "线性注意力消灭 KV cache,所以利空内存需求" —— 官方架构描述直接否掉:K3 的 93 层里保留了 24 层传统注意力,其 KV cache 随序列长度增长,且官方明说两套缓存"必须联合管理"。此外 KV cache 会被写回 CPU 内存池——需求还外溢到服务器内存。
❌ "开放权重让推理更便宜" —— K3 的单位 token 价格是上代 1.1 万亿模型的三到四倍(输入 3.00 对 0.71–0.95 美元、输出 15.00 对 3.50–4.00),吞吐却只有一半左右(8–72 对 21–149 字/秒)。价格与速度两个方向同时恶化。(⚠️ K3 侧为首日快照、上代为成熟期,两端生命周期阶段不同——本条否定的是"更便宜"这个叙事本身,不是对因果的断言。)
❌ "K3 是开源模型"(不加限定时) —— 许可证已非 MIT,托管方 12 个月累计营收超 2000 万美元需另签商业协议。权重可下载不等于可无条件商业化托管。
❌ "技术报告发布了 = 训练算力已知" —— 47 页报告里六类算力指标一个都没有,而且比前两代披露得更少。方向可以由架构算术推出,但量级只有下界(3.2 倍)可锚,上界未定——第三方估算的训练数据量假设区间上沿对应约 12 倍。
❌ "K3 用 H800 训练" —— 没有任何官方依据。源头是社媒从上两代的已披露值外推(原帖自己写的是"大概"),二手摘要把推测复述成了事实。K3 的训练芯片型号至今空白。
❌ 用技术报告里那张 scaling law 图反推 K3 训练算力 —— 图上横轴 10²⁰ 到 10²¹ 是拟合曲线用的代理小模型实验区间,与正式训练相差四到五个数量级。已经有二手源在这么用了。
❌ "K3 在智能榜排第三/第四"(不带日期时) —— 报告自述的名次截至 7 月 23 日,Claude Opus 5 于 7 月 24 日登顶后已经过期。五天就能失效的数字,引用必须带取数日。
❌ "Alphabet 二季度财报证明闭源阵营不怕开源竞争" —— 时序不对。Alphabet 7 月 22 日发布,早于 K3 权重发布 5 天。它是事件前证据,只能作背景。
❌ "开放权重落后闭源只有四个月"(不加限定时) —— 该数字口径是等能力到达时间差、Epoch 自陈可能低估(严格判据六个月)、且窗口截至 5 月 28 日结构上不含 K3。它是下限。
❌ 上一轮我自己写的"约 500 亿激活参数" —— 错的,实际 1042 亿。见第三节第(7)小节。