Kimi K3:自前ホストか API か
2.8T の収支計算
K3 のウェイトは 07-27 に公開(2.8T、史上最大)。「自分でデプロイするか API を呼ぶか」の答えは、月間呼び出し量とコンプライアンス要件次第——まず計算を済ませよう。
要点
K3 の総パラメータ
Stable LatentMoE、896 エキスパートで 1 トークンあたり 16 を起動。ウェイトは 07-27 に公開。
公式 API 価格
100 万トークンあたり入力/出力、キャッシュヒット $0.30、1M ウィンドウ一律。
自前ホストの下限構成
2.8T をフル精度で動かすのは非現実的。FP8/量子化後でも、まともに動かすには 8×H 級 GPU ノードが複数台必要だ。
コンテキストウィンドウ
API もウェイトも同じ仕様。自前ホストでメモリを食う主犯は、まさに長コンテキストの KV キャッシュだ。
2.8T を自前ホストするとはどういうことか
K3 は史上最大のオープンウェイトモデルで、総パラメータ 2.8T の MoE だ。ウェイトは無料(07-27 公開)だが、「無料でダウンロード」は「安く動かせる」ではない——FP8 デプロイでも複数ノードの GPU クラスタが必要で、そこに 1M コンテキストの KV キャッシュが乗ると、自前ホストの固定費は軽く月 1 万ドル級を超える。適しているのは超大規模で安定した呼び出し量がある場合か、データをイントラネットから出せない硬性コンプライアンス要件がある場合だ。
背景
K3 公開後にリクエストが急増し、Moonshot は一時 C 向けサブスクの増枠を停止した——API 側の熱狂は、大半の人が行動で API を選んだことを示している。一方、DeepSeek の値上げ(08-17)で「自前ホストのほうが安い」という古い計算書を引っ張り出した人もいるが、2.8T という規模では損益分岐点にたどり着くのが非常に遅い。
タイムライン
K3 が WAIC で発表され、API も同日から利用可能。
ウェイトが公開され、ダウンロードとデプロイのリクエストが急増。
コミュニティのデプロイ報告が続々登場。複数ノードの FP8 が主流の実現可能プラン。
確認済み vs 注意点
確認済み
ウェイト公開済み、公式 API 価格 $3/$15、1M コンテキスト——いずれも公式チャネルの情報。K3 は QCode で実呼び出し量がある。
注意点
「オープンソース = 無料」は幻想だ:2.8T の推論クラスタは月 5 桁ドル級のコストがかかる。ネットの「シングルカードで K3」という話は、重量化したデモを指しており、プロダクションでは使えない。
自前ホスト vs API
自前ホスト
向いているのは:月間呼び出し量が極めて大きく安定している、データをイントラから出せない硬性コンプライアンス、既存の GPU クラスタがある場合。固定費は高いが限界費は低い。
API(QCode など)
向いているのは:それ以外の全員。固定費ゼロ、伸縮自在、常に最新のウェイトを使える。公式価格 $3/$15 級 × サービスレート。
判断の進め方
損益分岐点を計算する:自前ホストの月固定費 ÷ API 単価 = 臨界月間呼び出し量。2.8T クラスタの固定費では、この臨界点は非常に高い。さらに 2 つの硬性ルール:データをイントラから出せないコンプライアンス要件 → 自前ホスト一択。呼び出し量の変動が大きい → API 一択。
QCode では
kimi-k3 は QCode で販売中(30 日以内に実呼び出しあり)で、公式価格 × サービスレート。最低利用量もサブスクもない。まず API で実負荷を流して月間使用量を測り、それから自前ホストが損益分岐点を超えるか評価しよう——多くの人は API が終着点だと気づく。
よくある質問
Kimi K3 のウェイトは本当に公開された?
はい。2026-07-27 に Hugging Face で公開。2.8T の Stable LatentMoE で、史上最大のオープンウェイトモデルだ。
K3 の自前ホストに必要なハードウェアは?
プロダクション級の FP8 デプロイには 8 基 H 級 GPU ノードが複数台必要。シングルカードやシングルマシンでは重量化のデモしか動かせず、プロダクションの価値はない。
自前ホストは API より安い?
月間呼び出し量が極めて大きく安定している場合に限る。2.8T クラスタの月固定費は 5 桁ドル級で、損益分岐点は高い。
自前ホストが必須になるのはどんなとき?
データをイントラネットから出せない硬性コンプライアンスの場面(金融、官公庁・大企業のイントラ)。この場合コストは主要な変数ではない。
API とウェイトの能力は同じ?
公式の説明では同じウェイトだ。API 側は強制思考(low/high/max の 3 段階)があり、自前ホストでも同様に動く。
QCode での K3 の課金は?
公式価格 × サービスレートの従量課金。カタログ価格は /models のリアルタイム掲載が優先だ。
情報源
Moonshot 公式の発表とオープンソース告知(07-16/07-27)、Hugging Face の moonshotai 組織ページ、コミュニティのデプロイ報告(2026-08)、QCode /models(08-22)。
関連記事
Moonshot AI とは無関係です。ハードウェアコストは公開されているデプロイ報告の推定口径です。