工程决策 · 2026-08-22

Kimi K3:自托管还是 API
2.8T 的账本

K3 权重 07-27 开源(2.8T,史上最大)。「自己部署还是调 API」这个问题,答案取决于你的月调用量和合规要求——先把账算清楚。

#kimi k3#自托管#开源权重#成本对比

要点

2.8T

K3 总参数

Stable LatentMoE,896 专家每 token 激活 16 个。权重 07-27 开源。

$3 / $15

官方 API 价

每百万 token 输入/输出,缓存命中 $0.30,1M 窗口一口价。

自托管起步档位

2.8T 全精度不现实;FP8/量化后仍需多台 8×H 级 GPU 节点才能跑得像样。

1M

上下文窗口

API 与权重同规格。自托管时的显存大头正是长上下文的 KV cache。

自托管 2.8T 意味着什么

K3 是史上最大开源权重模型:2.8T 总参的 MoE。权重免费(07-27 开源),但「免费下载」不等于「便宜运行」——FP8 部署也要多节点 GPU 集群,再叠 1M 上下文的 KV cache,自托管的固定成本每月轻松上万美元。它的甜蜜区是超大且稳定的调用量,或有数据不出内网的硬合规要求。

背景

K3 开源后请求暴增,Moonshot 一度暂停 C 端订阅扩容——API 侧的热度说明多数人用脚投票选了 API。同期 DeepSeek 涨价(08-17)让一部分人重新翻出「自托管省钱」的旧账本,但对 2.8T 这个体量,自托管的盈亏平衡点到得很晚。

时间线

2026-07-16

K3 于 WAIC 发布,API 同步可用。

2026-07-27

权重开源,下载与部署请求暴增。

2026-08

社区部署报告陆续出现:多节点 FP8 是主流可行方案。

已确认 vs 注意

已确认

权重已开源、官方 API 价 $3/$15、1M 上下文,均见官方渠道。K3 在 QCode 有真实调用量。

注意

「开源 = 免费」是错觉:2.8T 的推理集群月成本是五位数美元级。网上「单卡跑 K3」的说法指的都是小量化演示,不是生产可用。

自托管 vs API

自托管

适合:月调用量极大且稳定、数据不出内网的硬合规、有现成 GPU 集群。固定成本高,边际成本低。

API(QCode 等)

适合:其余所有人。零固定成本、弹性伸缩、永远用最新权重。$3/$15 级官方价乘服务费率。

怎么做决策

算盈亏平衡点:自托管月固定成本 ÷ API 单价 = 临界月调用量。2.8T 集群的固定成本下,这个临界点非常高。再加两条硬规则:有数据不出内网的合规要求 → 只能自托管;调用量波动大 → 只能 API。

在 QCode 上

kimi-k3 在 QCode 在售(30 天内有真实调用),官方价乘服务费率,无保底无订阅。先用 API 跑真实负载量出月度用量,再评估自托管是否过盈亏平衡点——多数人会发现 API 就是终点。

常见问题

Kimi K3 的权重真的开源了吗?

是,2026-07-27 在 Hugging Face 开源,2.8T Stable LatentMoE,史上最大开源权重模型。

自托管 K3 要什么硬件?

生产级 FP8 部署需要多台 8 卡 H 级 GPU 节点;单卡或单机只能跑重度量化的演示,不具备生产价值。

自托管比 API 便宜吗?

只在月调用量极大且稳定时成立。2.8T 集群的月固定成本是五位数美元级,盈亏平衡点很高。

什么时候必须自托管?

数据不出内网的硬合规场景(金融、政企内网)。这时成本不是主要变量。

API 和权重的能力一致吗?

官方口径是同一份权重。API 侧有强制思考(low/high/max 三档),自托管同理。

QCode 上 K3 怎么计费?

官方价乘服务费率按量计,目录价以 /models 实时列示为准。

信息来源

Moonshot 官方发布与开源公告(07-16/07-27)、Hugging Face moonshotai 组织页、社区部署报告(2026-08)、QCode /models(08-22)。

先 API 跑量,再谈自建

kimi-k3 在 QCode 按量在售——用真实账单回答「要不要自托管」。