Kimi K3:自托管还是 API
2.8T 的账本
K3 权重 07-27 开源(2.8T,史上最大)。「自己部署还是调 API」这个问题,答案取决于你的月调用量和合规要求——先把账算清楚。
要点
K3 总参数
Stable LatentMoE,896 专家每 token 激活 16 个。权重 07-27 开源。
官方 API 价
每百万 token 输入/输出,缓存命中 $0.30,1M 窗口一口价。
自托管起步档位
2.8T 全精度不现实;FP8/量化后仍需多台 8×H 级 GPU 节点才能跑得像样。
上下文窗口
API 与权重同规格。自托管时的显存大头正是长上下文的 KV cache。
自托管 2.8T 意味着什么
K3 是史上最大开源权重模型:2.8T 总参的 MoE。权重免费(07-27 开源),但「免费下载」不等于「便宜运行」——FP8 部署也要多节点 GPU 集群,再叠 1M 上下文的 KV cache,自托管的固定成本每月轻松上万美元。它的甜蜜区是超大且稳定的调用量,或有数据不出内网的硬合规要求。
背景
K3 开源后请求暴增,Moonshot 一度暂停 C 端订阅扩容——API 侧的热度说明多数人用脚投票选了 API。同期 DeepSeek 涨价(08-17)让一部分人重新翻出「自托管省钱」的旧账本,但对 2.8T 这个体量,自托管的盈亏平衡点到得很晚。
时间线
K3 于 WAIC 发布,API 同步可用。
权重开源,下载与部署请求暴增。
社区部署报告陆续出现:多节点 FP8 是主流可行方案。
已确认 vs 注意
已确认
权重已开源、官方 API 价 $3/$15、1M 上下文,均见官方渠道。K3 在 QCode 有真实调用量。
注意
「开源 = 免费」是错觉:2.8T 的推理集群月成本是五位数美元级。网上「单卡跑 K3」的说法指的都是小量化演示,不是生产可用。
自托管 vs API
自托管
适合:月调用量极大且稳定、数据不出内网的硬合规、有现成 GPU 集群。固定成本高,边际成本低。
API(QCode 等)
适合:其余所有人。零固定成本、弹性伸缩、永远用最新权重。$3/$15 级官方价乘服务费率。
怎么做决策
算盈亏平衡点:自托管月固定成本 ÷ API 单价 = 临界月调用量。2.8T 集群的固定成本下,这个临界点非常高。再加两条硬规则:有数据不出内网的合规要求 → 只能自托管;调用量波动大 → 只能 API。
在 QCode 上
kimi-k3 在 QCode 在售(30 天内有真实调用),官方价乘服务费率,无保底无订阅。先用 API 跑真实负载量出月度用量,再评估自托管是否过盈亏平衡点——多数人会发现 API 就是终点。
常见问题
Kimi K3 的权重真的开源了吗?
是,2026-07-27 在 Hugging Face 开源,2.8T Stable LatentMoE,史上最大开源权重模型。
自托管 K3 要什么硬件?
生产级 FP8 部署需要多台 8 卡 H 级 GPU 节点;单卡或单机只能跑重度量化的演示,不具备生产价值。
自托管比 API 便宜吗?
只在月调用量极大且稳定时成立。2.8T 集群的月固定成本是五位数美元级,盈亏平衡点很高。
什么时候必须自托管?
数据不出内网的硬合规场景(金融、政企内网)。这时成本不是主要变量。
API 和权重的能力一致吗?
官方口径是同一份权重。API 侧有强制思考(low/high/max 三档),自托管同理。
QCode 上 K3 怎么计费?
官方价乘服务费率按量计,目录价以 /models 实时列示为准。
信息来源
Moonshot 官方发布与开源公告(07-16/07-27)、Hugging Face moonshotai 组织页、社区部署报告(2026-08)、QCode /models(08-22)。
相关阅读
与 Moonshot AI 无隶属。硬件成本为公开部署报告的估算口径。