GLM-5.3-Flash-Preise
$0.15/$0.50 Listenpreis; 50 % Rabatt endete am 9. Sept.
Der Listenpreis beträgt $0.15 Input / $0.50 Output pro Million Tokens, im Einführungszeitraum bis 2026-09-09 24:00 (UTC+8) halbiert. Die Ersparnis ist real – doch die Cache-Read-Position verdient eine eigene Rechnung.
Aktualisiert 2026-09-21
Vier Preispositionen
Input · Aktion
Pro Million Tokens. Der Listenpreis beträgt $0.15; nach Ende des Aktionszeitraums gilt er wieder.
Output · Aktion
Pro Million Tokens. Der Listenpreis beträgt $0.50. Ein Input-/Output-Verhältnis von 1:3.3 – moderater als bei den meisten Modellen dieser Klasse.
Cache Read · Aktion
Der Listenpreis beträgt $0.03. ⚠️ Diese Position bestimmt bei Coding-Agents mit langem Kontext die tatsächlichen Kosten – siehe den Vergleich unten.
im Vergleich zu Opus 4.8
Beide liegen beim AA Intelligence Index bei 57; zu Aktionspreisen kostet dieses Modell etwa ein Vierzigstel von Claude Opus 4.8.
So funktioniert der offizielle Preis
Z.ai und bigmodel.cn führen GLM-5.3-Flash mit $0.15 pro Million Input-Tokens, $0.50 pro Million Output-Tokens und $0.03 für Cache Reads. Die Einführungsaktion halbiert alle drei Werte – $0.075 / $0.25 / $0.015 – und die Cache-Speicherung ist während dieser Zeit kostenlos. Damit liegt das Modell bei rund einem Zehntel des gleichgenerationellen GLM-5.3 (während der Aktion einem Zwanzigstel) und bei einem Vierzigstel von Claude Opus 4.8. Die Frist steht fest: 9. September 2026, 24:00 Uhr (UTC+8).
Was die Aggregatoren berechnen
OpenRouters z-ai/glm-5.3-flash zeigt derzeit den Aktionspreis von $0.075 / $0.25 mit Cache Reads zu $0.015. Novita führt zai-org/glm-5.3-flash auf der eigenen Serverless-Plattform zu $0.15 / $0.50. AIHubMix startete mit einem zeitlich befristeten Rabatt von 50 %. QuickSilver Pro gibt an, rund 20 % unter der offiziellen Aktion zu liegen ($0.06 / $0.20). Die Spanne resultiert aus der jeweiligen Subventionsstrategie und den Abrechnungskonditionen der Anbieter – prüfen Sie vor einem Wechsel, ob tatsächlich derselbe 1M-Kontext und dieselbe Cache-Abrechnung geboten werden.
Preisverlauf
Start und API-Freigabe, die 50-%-Aktion lief von Anfang an: $0.075 / $0.25, Cache Read $0.015.
OpenRouter stellt den kostenlosen Slug stealth/ox-alpha ein und führt z-ai/glm-5.3-flash zu Aktionspreisen.
24:00 Uhr (UTC+8): Die Aktion endet. Zurück zu $0.15 / $0.50, Cache Reads zu $0.03.
Bestätigt vs. selbst prüfen
Bestätigt
Listenpreis von $0.15/$0.50, Aktionspreis von $0.075/$0.25, Cache Reads zu $0.03 ($0.015 während der Aktion), die Frist 2026-09-09 24:00 (UTC+8) und kostenlose Cache-Speicherung im Aktionszeitraum – jeweils laut Dokumentation und Launch-Ankündigungen von Z.ai und bigmodel.cn.
Selbst prüfen
Die Preise der Aggregatoren ändern sich ständig und enthalten nicht immer dasselbe Kontextlimit oder dieselbe Cache-Richtlinie; wenn eine Plattform die offizielle Aktion unterbietet, prüfen Sie, ob es sich um eine Subvention oder um eine Abstufung handelt. Auch die Kontingentumrechnung beim Coding Plan (Flash zu etwa 3x GLM-5.3) variiert je nach Tarifstufe – lesen Sie die offizielle Seite für Ihre Region.
Auf dem Papier günstig – doch rechnen Sie zuerst den Cache durch
Der Schlagzeilenpreis ist tatsächlich niedrig
$0.075 / $0.25 kommt dem Tiefstpreis für alles auf AA-Index 57 nahe. Bei Einzelaufrufen, kurzen Kontexten und Batch-Jobs schlägt sich die Ersparnis direkt nieder.
Bei Cache Reads sieht es anders aus
Cache Read kostet $0.03 ($0.015 während der Aktion). Ein Entwickler hat das mit etwa dem 4-Fachen des Off-Peak-Preises von DeepSeek V4 Flash gemessen. Agent-Schleifen lesen denselben langen Kontext immer wieder ein, sodass die Cache-Kosten die Ersparnis beim Schlagzeilenpreis übersteigen können. Rechnen Sie zuerst mit Ihrer eigenen Trefferquote und durchschnittlichen Kontextlänge.
Ihre eigene Rechnung
Teilen Sie eine typische Anfrage in drei Teile: frische Input-Tokens, gecachte Input-Tokens und Output-Tokens. Während der Aktion lautet die Formel (frisch × $0.075 + gecacht × $0.015 + Output × $0.25) / 1,000,000. Agent-Workflows landen meist zwischen 60 % und 90 % Cache-Trefferquote, und je höher sie ist, desto stärker dominiert die Cache-Position – genau deshalb führt der Schlagzeilenpreis allein in die Irre. Verdoppeln Sie nach dem 9. September alle drei Werte, um Ihre langfristigen Kosten zu erhalten.
Bei QCode
Die über QCode nutzbaren Z.ai-Modelle sind GLM-5.3-Flash, GLM-5.3 und GLM-5.2; sie werden unabhängig bepreist und folgen nicht Position für Position den Listenpreisen des Herstellers – maßgeblich ist die Seite /models. GLM-5.3-Flash ging am 2026-08-27 live: $0.14/M Input und $0.49/M Output; der Cache Read wurde am 2026-09-08 von $0.14/M auf $0.04/M gesenkt. Um die realen Kosten chinesischer Modelle zu vergleichen, sehen Sie sich auch GLM-5.3 oder die DeepSeek-V4-Familie an, die zusätzlich Off-Peak-Preise zum halben Tarif bietet.
FAQ
Wann genau endet der Rabatt?
Am 9. September 2026 um 24:00 Uhr, UTC+8. Danach steigt Input wieder auf $0.15, Output auf $0.50 und Cache Reads auf $0.03, jeweils pro Million Tokens.
Gibt es einen kostenlosen Tarif?
Es gibt keinen dauerhaft kostenlosen öffentlichen Endpunkt. Kostenlos war die anonyme Stealth-Vorschau stealth/ox-alpha, die am Enthüllungstag aus dem Produktivkatalog von OpenRouter entfernt wurde. Neue Konten auf der Plattform von Z.ai erhalten Testguthaben – das ist ein Test und kein kostenloser Tarif.
Wie wird das Caching abgerechnet?
Cache Reads kosten $0.03 pro Million Tokens ($0.015 während der Aktion), und die Cache-Speicherung ist im Aktionszeitraum kostenlos. Beachten Sie: Obwohl Cache Read ein Fünftel des Input-Preises kostet, macht er bei Arbeiten mit langem Kontext und hoher Trefferquote den weitaus größten Teil der abgerechneten Tokens aus.
Ist es günstiger als DeepSeek V4 Flash?
Das hängt vom Profil Ihres Traffics ab. Bei reinem Input und Output liegt der GLM-Aktionspreis niedriger. Bei Cache Reads hat ein Entwickler GLM mit etwa dem 4-Fachen des Off-Peak-Preises von DeepSeek V4 Flash gemessen – und DeepSeek halbiert die Preise zusätzlich außerhalb der Spitzenzeiten. Bei Coding-Agents mit langem Kontext und hoher Cache-Trefferquote sollten Sie beide separat durchrechnen.
Coding Plan oder Pay-as-you-go?
Der Coding Plan von Z.ai gibt Flash etwa das 3-Fache des Kontingents von GLM-5.3, was sich für gleichmäßige tägliche Nutzung mit hohem Volumen eignet. Wenn Ihre Nutzung schwankt oder Sie zusätzlich Claude, GPT oder Gemini benötigen, ist Pay-as-you-go über ein einziges Gateway flexibler und erspart Ihnen, Ihr Guthaben auf jeder Plattform separat aufzuladen.
Kann ich einem Drittanbieter vertrauen, der den offiziellen Preis unterbietet?
Sie können einen nutzen, sollten aber drei Dinge prüfen: ob die Kontextobergrenze tatsächlich die vollen 1M beträgt, ob die Cache-Abrechnung übereinstimmt und welche Rate Limits gelten. Plattformen, die unter dem offiziellen Aktionspreis liegen (zum Beispiel $0.06 / $0.20), betreiben meist eine befristete Subventionierung, die nicht von Dauer sein muss.
Quellen
Offizielle Preisdokumentation von Z.ai und bigmodel.cn, die Launch-Ankündigung von Z.ai (2026-08-26), die Preise auf den Modellseiten von OpenRouter und Novita, die Launch-Beiträge von AIHubMix und QuickSilver Pro sowie eine auf X veröffentlichte Messung der Cache-Kosten eines Entwicklers (erfasst vom 2026-08-26 bis 27).
Chinesische Modelle, ein Key für alle
GLM-5.3, DeepSeek V4, Kimi K3 und Qwen lassen sich über denselben QCode-Endpunkt nutzen – zu offiziellen Preisen mal einem Servicefaktor, ohne separate Aufladung bei jeder Plattform.
Weiterführende Artikel
GLM-5.3-Flash: der komplette Leitfaden
Architektur, Kontext, der tatsächliche Benchmark und die Anbindung.
GLM-5.3: der komplette Leitfaden
Fähigkeiten und Preise des Flaggschiffs derselben Generation.
AI Model Radar 2026
Preise und Verfügbarkeit im Überblick, für alle Modellfamilien.
Die Preise sind eine Momentaufnahme vom 2026-08-27 und ändern sich, sobald die Anbieter sie anpassen. QCode steht in keiner Verbindung zu Z.ai. GLM-5.3-Flash ist auf QCode verfügbar.