Technische Entscheidung · 2026-08-22

Kimi K3: Self-Hosting oder API
Die Rechnung für 2.8T

Die Gewichte von K3 wurden am 27.07. veröffentlicht (2.8T, die größten bisher). Ob Sie es selbst betreiben oder die API nutzen sollten, hängt von Ihrem monatlichen Volumen und Ihren Compliance-Anforderungen ab – rechnen Sie zuerst nach.

Aktualisiert 2026-08-22

#kimi k3#Self-Hosting#open weights#Kostenvergleich

Die wichtigsten Punkte

2.8T

Gesamtparameter von K3

Stable LatentMoE mit 896 Experten, davon 16 aktiv pro Token. Gewichte am 27.07. als Open Source veröffentlicht.

$3 / $15

Offizieller API-Preis

Pro Million Input-/Output-Tokens, Cache-Treffer $0.30, ein einheitlicher Preis für das 1M-Fenster.

8×

Einstiegsstufe für Self-Hosting

2.8T in voller Präzision ist unrealistisch; selbst nach FP8/Quantisierung benötigen Sie für einen brauchbaren Betrieb mehrere Knoten mit je 8 GPUs der H-Klasse.

1M

Kontextfenster

Dieselbe Spezifikation für API und Gewichte. Beim Self-Hosting geht der Speicher vor allem für den KV-Cache bei langem Kontext drauf.

Was Self-Hosting von 2.8T bedeutet

K3 ist das größte Open-Weights-Modell aller Zeiten: ein MoE mit 2.8T Gesamtparametern. Die Gewichte sind kostenlos (am 27.07. als Open Source veröffentlicht), aber „kostenlos herunterladbar“ heißt nicht „günstig im Betrieb“ – selbst ein FP8-Deployment erfordert einen GPU-Cluster mit mehreren Knoten, und der KV-Cache für 1M Kontext treibt die Fixkosten des Self-Hostings locker in den fünfstelligen Bereich pro Monat. Sinnvoll ist es bei extrem großem, stabilem Aufrufvolumen oder bei harten Compliance-Vorgaben, dass Daten das Intranet nie verlassen.

Hintergrund

Nach der Öffnung von K3 stiegen die Anfragen sprunghaft, und Moonshot pausierte kurzzeitig den Ausbau der Consumer-Abos – die Auslastung auf der API-Seite zeigt, dass die meisten mit den Füßen für die API abgestimmt haben. Gleichzeitig ließ die DeepSeek-Preiserhöhung (17.08.) manche die alte Rechnung „Self-Hosting spart Geld“ wieder hervorholen, doch bei 2.8T wird der Break-even-Punkt erst sehr spät erreicht.

Zeitachse

2026-07-16

K3 startet auf der WAIC, die API ist am selben Tag verfügbar.

2026-07-27

Die Gewichte werden veröffentlicht; Downloads und Deployment-Anfragen steigen sprunghaft.

2026-08

Erste Deployment-Berichte aus der Community: Multi-Node-FP8 ist der gängige praktikable Ansatz.

Bestätigt vs. Vorsicht

Bestätigt

Die Gewichte sind offen, der offizielle API-Preis beträgt $3/$15, und der Kontext umfasst 1M – alles aus offiziellen Quellen. K3 hat auf QCode ein reales Aufrufvolumen.

Vorsicht

„Open Source = kostenlos“ ist eine Illusion: Ein Inferenz-Cluster für 2.8T kostet fünfstellig pro Monat. Behauptungen, K3 laufe „auf einer einzelnen Karte“, beziehen sich auf stark quantisierte Demos, nicht auf den Produktiveinsatz.

Self-Hosting vs. API

Self-Hosting

Geeignet für: extrem großes und stabiles monatliches Volumen, harte Compliance-Vorgaben, dass Daten im Intranet bleiben, einen vorhandenen GPU-Cluster. Hohe Fixkosten, niedrige Grenzkosten.

API (QCode usw.)

Geeignet für: alle anderen. Keine Fixkosten, elastische Skalierung, stets die neuesten Gewichte. Etwa $3/$15 zum offiziellen Preis mal Servicefaktor.

So entscheiden Sie

Berechnen Sie den Break-even: monatliche Fixkosten des Self-Hostings ÷ API-Stückpreis = kritisches Monatsvolumen. Bei den Fixkosten eines 2.8T-Clusters liegt diese Schwelle sehr hoch. Dazu gelten zwei harte Regeln: Wenn Daten aus Compliance-Gründen im Intranet bleiben müssen → nur Self-Hosting; bei stark schwankendem Volumen → nur API.

Auf QCode

kimi-k3 ist auf QCode verfügbar (mit realen Aufrufen in den letzten 30 Tagen), zum offiziellen Preis mal Servicefaktor, ohne Mindestabnahme und ohne Abo. Messen Sie zuerst Ihr tatsächliches Monatsvolumen über die API und prüfen Sie dann, ob Self-Hosting den Break-even erreicht – die meisten stellen fest, dass die API die Endlösung ist.

FAQ

Sind die Gewichte von Kimi K3 wirklich offen?

Ja – am 2026-07-27 auf Hugging Face als Open Source veröffentlicht: ein 2.8T Stable LatentMoE, das größte Open-Weights-Modell aller Zeiten.

Welche Hardware benötigt das Self-Hosting von K3?

Ein produktionstaugliches FP8-Deployment benötigt mehrere Knoten der H-Klasse mit je 8 GPUs; eine einzelne Karte oder ein einzelner Server führt nur stark quantisierte Demos ohne Produktionswert aus.

Ist Self-Hosting günstiger als die API?

Nur bei extrem großem und stabilem Monatsvolumen. Die Fixkosten eines 2.8T-Clusters liegen bei fünf Stellen pro Monat, daher liegt der Break-even-Punkt sehr hoch.

Wann ist Self-Hosting Pflicht?

Bei harten Compliance-Szenarien, in denen Daten im Intranet bleiben müssen (Finanzwesen, Intranets von Behörden/Unternehmen). Dort sind die Kosten nicht die Hauptvariable.

Haben API und Gewichte dieselben Fähigkeiten?

Offiziell sind es dieselben Gewichte. Auf der API-Seite ist Reasoning verpflichtend (Stufen low/high/max); beim Self-Hosting verhält es sich genauso.

Wie wird K3 auf QCode abgerechnet?

Pay-as-you-go zum offiziellen Preis mal Servicefaktor; die Katalogpreise folgen der aktuellen /models-Liste.

Quellen

Offizielle Launch- und Open-Source-Ankündigungen von Moonshot (16.07./27.07.), die Hugging-Face-Organisationsseite moonshotai, Deployment-Berichte aus der Community (2026-08), QCode /models (22.08.).

Erst Volumen über die API laufen lassen, dann über den Eigenbetrieb sprechen

kimi-k3 ist auf QCode per Pay-as-you-go verfügbar – lassen Sie eine echte Rechnung die Frage „Self-Hosting ja oder nein?“ beantworten.

Weiterlesen

Nicht mit Moonshot AI verbunden. Hardwarekosten sind Schätzungen auf Basis öffentlicher Deployment-Berichte.

Erst testen, dann entscheiden

Unsicher bei der Tarifwahl? Beginnen Sie mit Starter ($8.57/Monat) und wechseln Sie auf einen höheren Tarif, wenn Sie zufrieden sind — der ungenutzte Wert des alten Tarifs geht auf Ihr Guthaben zurück.