GLM-5.3-Flash
320B-A18B, 1M Kontext, MIT-Gewichte
Z.ai hat es am 26. August veröffentlicht – es ist das Modell, das anonym als Ox Alpha auf OpenRouter lief. Es kostet ein Zehntel von GLM-5.3, ist aber kein „Flash, das Sie auf einem Laptop ausführen können“: 320B Parameter insgesamt, mindestens 181GB für das lokale Hosting.
Aktualisiert 2026-09-09
Vier Zahlen, auf die es ankommt
Parameter
320B insgesamt, 18B aktiv; MoE mit hybrider Sparse- und Linear-Attention. „Flash“ bezieht sich auf die Inferenzkosten, nicht auf die Modellgröße.
Kontextfenster
Die offizielle Dokumentation und die Dokumentation von Z.ai nennen beide 1.048.576 bei maximal 131.072 Completion-Tokens. ⚠️ Artificial Analysis führt 400K auf – die Angaben widersprechen sich.
Einführungspreis (50 % Rabatt)
Der Listenpreis beträgt $0.15 / $0.50 pro Million Tokens; das Halbpreis-Fenster endet am 2026-09-09 um 24:00 Uhr (UTC+8). Cache-Lesen kostet $0.03 ($0.015 während der Aktion).
AA Intelligence Index
Gleiche Klasse wie Claude Opus 4.8. ⚠️ Nicht die Klasse von Fable 5 – der kursierende Wert von 80 % stammte aus einer Stichprobe von 10 Aufgaben.
Was GLM-5.3-Flash ist
Das erste nativ multimodale Modell in der GLM-5-Reihe von Z.ai, veröffentlicht am 26. August 2026 mit offenen Gewichten unter MIT-Lizenz (bereits auf Hugging Face). Es ist ein MoE mit 320B insgesamt und 18B aktiven Parametern, das hybride Sparse- und Linear-Attention nutzt, Text-, Bild- und Videoeingaben akzeptiert, Text ausgibt und Tool Calling sowie visuelles Coding unterstützt. Vor dem Start lief es eine Woche lang unter dem Codenamen Ox Alpha auf OpenRouter; laut Z.ai lief diese Woche vollständig auf inländischen KI-Beschleuniger-Clustern, verarbeitete täglich etwa 100 Billionen Tokens, und die hauseigene, auf SGLang basierende Engine erzielte eine etwa dreifache Ende-zu-Ende-Beschleunigung.
Was in den ersten 24 Stunden geschah
Am Tag der Enthüllung nahm OpenRouter den anonymen Slug stealth/ox-alpha aus seinem Produktivkatalog und ersetzte ihn durch z-ai/glm-5.3-flash, womit die kostenlose Vorschau endete. Novita und AIHubMix führten es noch am selben Tag auf; SiliconFlow, Fireworks und Together waren Stand 27. August nicht gefolgt. Drei Fragen dominieren die Diskussion: Wie lautet der tatsächliche Benchmark-Wert, wie kommt man jetzt an das Modell, da der kostenlose Endpunkt weg ist, und lässt es sich lokal betreiben? Die dritte ist mit Abstand das lauteste Thema auf r/LocalLLaMA – der Name „Flash“ ließ viele ein kleines Modell vermuten.
Zeitachse
GLM-5.3 erscheint (gleiche Basis, nur Post-Training); die API geht am 19. August zum Preis von GLM-5.2 live.
Ein anonymes Modell mit dem Codenamen Ox Alpha erscheint als kostenlose Vorschau auf OpenRouter und OpenCode.
Z.ai enthüllt, dass Ox Alpha GLM-5.3-Flash ist, öffnet die Gewichte, veröffentlicht die API, und der anonyme Slug wird abgeschaltet.
Bestätigt vs. häufig missverstanden
Bestätigt
Veröffentlichungsdatum, die Architektur 320B-A18B, MIT-Lizenz mit Gewichten auf Hugging Face, der Listenpreis von $0.15/$0.50 und die Aktionsfrist bis 2026-09-09, der AA Intelligence Index von 57 sowie die Identität als Ox Alpha – alles anhand offizieller Ankündigungen oder der Herstellerdokumentation überprüfbar.
Häufig missverstanden
Der Wert „DeepSWE 80 %“ stammte aus einer Stichprobe von 10 Aufgaben während der Stealth-Phase. Der offizielle Wert für DeepSWE v1.1 liegt bei 63.4 %; ein einzelner Community-Durchlauf mit 113 Aufgaben ergab etwa 58.4 %. Auch „vergleichbar mit Fable 5“ trifft nicht zu – ein AA-Index von 57 ordnet es in die Klasse von Opus 4.8 ein. Und „es heißt Flash, also muss es lokal laufen“ ist falsch: Dies ist ein Modell mit 320B Parametern.
Die andere Seite der 40-fach günstigeren Preise
Input und Output sind tatsächlich günstig
Zum Aktionspreis von $0.075/$0.25 kostet es etwa ein Zwanzigstel von GLM-5.3 und ein Vierzigstel von Claude Opus 4.8. Für kurze Turns und Batch-Aufgaben ist der Kostenvorteil real.
Cache-Lesen dagegen nicht
Cache-Lesen kostet $0.03 ($0.015 während der Aktion) – ein Entwickler maß das als etwa das Vierfache des Off-Peak-Tarifs von DeepSeek V4 Flash. Bei Agent-Schleifen, die einen langen Kontext wiederholt erneut senden, können die Cache-Gebühren die auffällige Ersparnis übersteigen. Rechnen Sie zuerst mit Ihrer eigenen Cache-Trefferquote nach.
So verwenden Sie es
Der offizielle Modellcode lautet glm-5.3-flash und wird über den OpenAI-kompatiblen Endpunkt von Z.ai oder bigmodel.cn bereitgestellt. Die IDs von Drittanbietern unterscheiden sich: OpenRouter verwendet z-ai/glm-5.3-flash, Novita verwendet zai-org/glm-5.3-flash. Planen Sie für das lokale Hosting zuerst den Speicher ein: FP8-Gewichte umfassen etwa 306 GiB, BF16 etwa 585 GB, und die kleinste NVFP4-Quantisierung liegt derzeit bei etwa 181 GB; das GGUF von Unsloth ist noch als Work-in-Progress gekennzeichnet. Wenn Sie es über einen Client wie Claude Code ansteuern, beachten Sie, dass Suffixe wie [1m] clientseitige Markierungen sind, die Ihr Gateway verarbeiten muss, statt sie unverändert an den Upstream weiterzureichen.
Auf QCode
Die derzeit auf QCode routbaren Z.ai-Modelle sind GLM-5.3-Flash, GLM-5.3 und GLM-5.2; sie werden unabhängig bepreist, statt die Listenpreise des Herstellers Zeile für Zeile zu übernehmen, und sind mit einem Key über einen Endpunkt umschaltbar. GLM-5.3-Flash ging am 2026-08-27 auf QCode live: $0.14/M Input und $0.49/M Output; das Cache-Lesen wurde am 2026-09-08 auf $0.04/M gesenkt, mit 1M Kontext und Bildeingabe.
FAQ
Ist GLM-5.3-Flash kostenlos?
Nein. Kostenlos war der Endpunkt stealth/ox-alpha während der anonymen Vorschau, und dieser Slug wurde am Tag der Enthüllung ohne Alias aus dem Produktivkatalog von OpenRouter entfernt. Auch einen :free-Endpunkt gibt es dafür auf OpenRouter nicht – den mit kostenloser Stufe hat die Vorgängergeneration GLM-5.2. Neue Konten auf der Plattform von Z.ai erhalten Testguthaben, das ist jedoch nicht dasselbe wie dauerhaft kostenlos.
Beträgt der Kontext 1M oder 400K?
Sowohl die offizielle Dokumentation als auch die Dokumentation von Z.ai nennen 1.048.576 Tokens mit maximal 131.072 Tokens pro Completion. Artificial Analysis führt dagegen 400K auf und stuft das Modell als proprietär ein, was der MIT-Veröffentlichung widerspricht. Die beiden Quellen widersprechen sich; die wahrscheinlichste Erklärung ist, dass AA ein serverseitiges Limit erfasst hat. Betrachten Sie die offizielle Dokumentation als maßgeblich, doch wenn Sie auf sehr langen Kontext angewiesen sind, messen Sie ihn bei dem konkreten Anbieter, den Sie einsetzen möchten.
Liegt DeepSWE bei 63,4 % oder bei 80 %?
Der offizielle DeepSWE-v1.1-Wert liegt bei 63,4 %. Die 80 % stammen aus einem einzelnen Durchlauf mit 10 Aufgaben während der Stealth-Phase und ließen sich bei größeren Stichproben nicht reproduzieren; ein Community-Durchlauf mit 113 Aufgaben kam auf etwa 58,4 %. Verwenden Sie 63,4 %, wenn Sie Modelle vergleichen.
Kann ich es lokal betreiben?
Nur mit sehr viel Arbeitsspeicher. FP8-Gewichte umfassen etwa 306 GiB, BF16 etwa 585 GB, und die kleinste NVFP4-Quantisierung aus der Community liegt bei rund 181 GB. Eine einzelne Consumer-GPU kommt nicht infrage; eine Workstation mit 256 GB Unified Memory ist die am häufigsten diskutierte Option, und die GGUF-Quantisierung von Unsloth wird weiterhin als in Arbeit geführt. Für die meisten ist die API der günstigere Weg.
GLM-5.3 oder GLM-5.3-Flash?
GLM-5.3 ist das Flaggschiff derselben Generation (Post-Training) und bei komplexem Coding stärker. Flash ist die kostengünstige Stufe dieser Generation zu etwa einem Zehntel des Preises und bietet zusätzlich native Multimodalität. Nutzen Sie Flash für Batch-Aufgaben, kostensensible Workloads und alles, was Bilder betrifft; bleiben Sie für langfristiges Coding bei GLM-5.3. Im Coding Plan von Z.ai ist das Flash-Kontingent etwa dreimal so groß wie das von GLM-5.3.
Wann endet der Rabatt?
Am 2026-09-09 um 24:00 Uhr (UTC+8). Danach gilt wieder der Listenpreis: $0.15 Input / $0.50 Output pro Million Tokens, wobei der Cache-Read von $0.015 wieder auf $0.03 steigt.
Quellen
Offizielle Dokumentation von Z.ai und bigmodel.cn, der Launch-Blog von Z.ai und offizielle Social-Media-Ankündigungen (2026-08-26), die Modellseiten von OpenRouter und Novita, die Hugging-Face-Model-Card, die Modellseite von Artificial Analysis sowie Community-Threads auf r/LocalLLaMA und V2EX (erfasst vom 2026-08-26 bis 27).
Chinesische Modelle, ein Key für alle
GLM-5.3, DeepSeek V4, Kimi K3 und Qwen lassen sich am selben QCode-Endpunkt umschalten – zu offiziellen Preisen mal einem Service-Multiplikator, ohne separate Aufladung bei jeder Plattform.
Weiterführende Artikel
GLM-5.3 – der komplette Leitfaden
Fähigkeiten, Preise und Zugang beim Flaggschiff derselben Generation.
GLM-5.3 vs. GLM-5.2
Was das Post-Training tatsächlich gebracht hat.
AI Model Radar 2026
Preis- und Verfügbarkeits-Tracking für alle Modellfamilien.
Die Angaben sind ein Stand vom 2026-08-27 und ändern sich, sobald die Anbieter aktualisieren. QCode steht in keiner Verbindung zu Z.ai. GLM-5.3-Flash ist auf QCode verfügbar.