1M-Langkontext 2026 im Preisvergleich: Wer Aufschlag nimmt und ab welcher Schwelle
Stand 2026-10-07 schreibt Anthropic auf seiner Preisseite ausdrücklich, dass der 1M-Kontext zum Standardpreis abgerechnet wird: Bei Claude Opus 5.5 und Sonnet 5.5 kostet eine Anfrage mit 900K Tokens pro Token genauso viel wie eine mit 9K. OpenAI berechnet bei GPT-6 Sol und GPT-6.1 Sol ab mehr als 272K Input-Tokens die gesamte Anfrage mit dem 2-Fachen für Input und Cache und dem 1,5-Fachen für Output; xAI stuft bei Grok 4.7 alle Tokens einer Anfrage in den höheren Tarif ein, sobald der Prompt 200K erreicht; die offizielle Preisliste von DeepSeek führt für V4.1 Flash keine Langkontext-Aufschlagsstufe auf (Stand 2026-10-07), nur Preise für Spitzen- und Nebenzeit. Darunter finden Sie drei Rechenbeispiele, umgerechnet aus den offiziellen Preislisten.
Aktualisiert 2026-10-07
Vier Zahlen, auf die es ankommt
Claude mit 1M Kontext
Laut offizieller Preisseite erhalten Claude 4.6 und neuere Modelle den vollen 1M-Kontext zum Standardpreis; eine Anfrage mit 900K Tokens kostet pro Token so viel wie eine mit 9K. Opus 5.5 kostet $4 Input / $20 Output, Sonnet 5.5 $2 / $10.
Schwelle bei GPT-6 Sol und GPT-6.1 Sol
Ab mehr als 272K Input-Tokens wird die gesamte Anfrage mit dem 2-Fachen für Input und Cache und dem 1,5-Fachen für Output berechnet: Bei GPT-6.1 Sol werden aus $2 / $10 dann $4 / $15.
Schwelle bei Grok 4.7
Sobald der Prompt 200K erreicht, laufen alle Tokens der Anfrage über den höheren Tarif: Aus $2 / $6 werden $4 / $12. Der Kontext von Grok 4.7 beträgt 500K, nicht 1M.
Spitzenzeit-Preis von DeepSeek V4.1 Flash
1M Kontext; Input ohne Cache-Treffer und Output kosten zur Spitzenzeit $0.3 / $1.2 pro Million Tokens, zur Nebenzeit die Hälfte, also $0.15 / $0.6. Eine Langkontext-Aufschlagsstufe führt die offizielle Preisliste nicht auf (Stand 2026-10-07).
Wie die Preislisten der vier Anbieter mit Langkontext umgehen
Stand 2026-10-07 lassen sich die offiziellen Seiten der vier Anbieter beim Langkontext in drei Gruppen einteilen. Ausdrücklich kein Aufschlag: Die Preisseite von Anthropic sagt, dass Claude 4.6 und neuere Modelle das volle 1M-Kontextfenster zum Standardpreis enthalten; die Dokumentation zum Kontextfenster führt Opus 5.5 und Sonnet 5.5 als 1M-Modelle, bei denen 1M der Standard ist, kein Beta-Header nötig ist und Langkontext-Anfragen zum Standardpreis abgerechnet werden. Eine ausdrücklich genannte Schwelle, ab der die ganze Anfrage teurer wird: Bei GPT-6 Sol und GPT-6.1 Sol von OpenAI liegt sie bei mehr als 272K Input-Tokens, bei Grok 4.7 von xAI bei einem Prompt ab 200K; in beiden Fällen wechseln alle Tokens der Anfrage in den höheren Tarif, nicht nur der Teil über der Schwelle. Keine Langkontext-Aufschlagsstufe in der offiziellen Preisliste: DeepSeek V4.1 Flash hat 1M Kontext, die Preisliste nennt nur Preise für Spitzen- und Nebenzeit, und die offizielle Formel lautet Anzahl der Tokens × Preis.
Was sich seit September an den Preislisten geändert hat
Am 2026-09-29 kündigte das OpenAI-Changelog GPT-6.1 Sol an, mit Standardpreisen für Prompts bis 272K Input-Tokens von $2 Input, $0.10 Cached Input, $2.50 Cache-Write und $10 Output; die Regel auf der Modellseite, nach der die gesamte Anfrage ab mehr als 272K teurer wird, ist wortgleich mit der von GPT-6 Sol, erschienen am 2026-09-22. Anthropic veröffentlichte Opus 5.5 am 2026-09-22 und Sonnet 5.5 am 2026-09-28, beide mit 1M Kontext und bis zu 128K Output-Tokens pro Anfrage. Die Release Notes von xAI nennen für Grok 4.7 ein Kontextfenster von 500K, mit $2 / $0.50 / $6 unter 200K Prompt-Tokens und $4 / $1 / $12 darüber. DeepSeek brachte V4.1 Flash am 2026-09-10 heraus und senkte die API-Preise entsprechend; die Spitzen- und Nebenzeittarife gelten seit 16:00 UTC am 2026-08-16.
Chronologie
DeepSeek veröffentlicht V4.1 Flash mit 1M Kontext; die API-Preise sinken, die Aufteilung in Spitzen- und Nebenzeit bleibt.
Claude Opus 5.5 und GPT-6 Sol erscheinen am selben Tag: Das eine Modell rechnet den 1M-Kontext zum Standardpreis ab, das andere verteuert ab mehr als 272K Input-Tokens die ganze Anfrage.
GPT-6.1 Sol erscheint: bis 272K $2 Input / $10 Output, darüber $4 / $15, Cached Input steigt von $0.10 auf $0.20.
Bestätigt vs. nicht eindeutig geregelt
Bestätigt (wörtlich auf den offiziellen Seiten)
Alles Folgende lässt sich wörtlich auf den offiziellen Seiten prüfen: Claude 4.6 und neuere Modelle erhalten den vollen 1M-Kontext zum Standardpreis, eine 900K-Anfrage kostet pro Token so viel wie eine 9K-Anfrage, und Cache- sowie Batch-Rabatte gelten im ganzen Fenster; Opus 5.5 kostet $4 / $20, Sonnet 5.5 $2 / $10, im Batch $2 / $10 bzw. $1 / $5; GPT-6 Sol und GPT-6.1 Sol berechnen ab mehr als 272K Input-Tokens die gesamte Anfrage mit dem 2-Fachen für Input und Cache und dem 1,5-Fachen für Output, und beide haben ein Kontextfenster von 1.050.000 Tokens bei maximal 922.000 Input-Tokens; Grok 4.7 hat 500K Kontext und zwei Preiszeilen um die 200K-Grenze; DeepSeek V4.1 Flash hat 1M Kontext, Spitzen- und Nebenzeitpreise und veröffentlichte Spitzenzeiten. Die Gesamtbeträge in den Beispielen haben wir selbst aus den offiziellen Preislisten umgerechnet; kein Anbieter hat sie so veröffentlicht.
Nicht eindeutig geregelt
Drei Punkte klären die offiziellen Seiten nicht, und diese Seite entscheidet sie nicht stellvertretend für die Anbieter: Erstens sagt OpenAI nicht, ob 272K genau 272.000 Tokens meint und ob Tokens aus dem Cache zur Schwelle zählen; die Beispiele nutzen deshalb 270.000 und 280.000, um der Grenze auszuweichen. Zweitens schreibt xAI in der Tabelle ≥ 200k, in der Fußnote reaches, in den Release Notes above und im Fast-Abschnitt exceeds; bei einer Anfrage mit genau 200K Tokens zählt daher, was tatsächlich abgebucht wird. Drittens führt die offizielle Preisliste von DeepSeek keine Langkontext-Aufschlagsstufe auf (Stand 2026-10-07), die Beispiele rechnen daher mit den gelisteten Preisen; auf derselben Seite hält DeepSeek zudem fest, dass es sich Preisanpassungen vorbehält.
So wählen Sie: Schauen Sie zuerst, wo Ihr Input meist liegt
Input meist zwischen 200K und 272K
In diesem Bereich ist Grok 4.7 schon im höheren Tarif, GPT-6 Sol und GPT-6.1 Sol noch im Standardtarif, Claude bleibt laut Anbieter beim Standardpreis, und die offizielle Preisliste von DeepSeek führt keine Langkontext-Aufschlagsstufe auf. Aus den offiziellen Preislisten umgerechnet kostet eine Anfrage mit 250.000 Input- und 8.000 Output-Tokens bei Sonnet 5.5 und GPT-6.1 Sol je $0.58, bei Opus 5.5 $1.16, bei Grok 4.7 $1.096 und bei DeepSeek V4.1 Flash zur Spitzenzeit $0.0846.
Input oft über 272K
Jenseits von 272K wechselt auch OpenAI in den höheren Tarif; Claude bleibt laut Anbieter beim Standardpreis, und für DeepSeek, dessen offizielle Preisliste keine Langkontext-Aufschlagsstufe aufführt, gelten die gelisteten Preise. Aus den offiziellen Preislisten umgerechnet kostet eine Anfrage mit 400.000 Input- und 8.000 Output-Tokens bei Sonnet 5.5 $0.88, bei Opus 5.5 $1.76, bei GPT-6.1 Sol $1.72, bei Grok 4.7 $1.696 und bei DeepSeek V4.1 Flash $0.1296 zur Spitzenzeit bzw. $0.0648 zur Nebenzeit. Der Input-Preis von GPT-6.1 Sol ($4) liegt damit gleichauf mit Opus 5.5.
Drei Rechenbeispiele zum Nachrechnen
Alle Zahlen sind aus den offiziellen Preislisten umgerechnet. Erstens 400.000 Input- und 8.000 Output-Tokens ohne Cache-Treffer: Sonnet 5.5 = 400.000 × $2/Mio. + 8.000 × $10/Mio. = $0.88; Opus 5.5 = 400.000 × $4/Mio. + 8.000 × $20/Mio. = $1.76; GPT-6.1 Sol und GPT-6 Sol im Langkontext-Tarif = 400.000 × $4/Mio. + 8.000 × $15/Mio. = $1.72; Grok 4.7 im Tarif ab 200K = 400.000 × $4/Mio. + 8.000 × $12/Mio. = $1.696; DeepSeek V4.1 Flash zur Spitzenzeit = 400.000 × $0.3/Mio. + 8.000 × $1.2/Mio. = $0.1296, zur Nebenzeit $0.0648. Zweitens die 272K-Schwelle von GPT-6.1 Sol: 270.000 Input + 8.000 Output = 270.000 × $2/Mio. + 8.000 × $10/Mio. = $0.62, dagegen 280.000 Input + 8.000 Output = 280.000 × $4/Mio. + 8.000 × $15/Mio. = $1.24; 10.000 Input-Tokens mehr verdoppeln also den Betrag, während dieselben zwei Anfragen bei Sonnet 5.5 $0.62 und $0.64 kosten. Drittens die 200K-Schwelle von Grok 4.7: 250.000 Input + 8.000 Output = 250.000 × $4/Mio. + 8.000 × $12/Mio. = $1.096, gegenüber $0.548 zu den Preisen unter 200K. Batch, Caching und regionale Aufschläge sind nicht enthalten.
Auf QCode
QCode rechnet pro Token ab; die Preise der einzelnen Modelle finden Sie unter /models. Von den Modellen auf dieser Seite lassen sich claude-opus-5-5, claude-sonnet-5-5, gpt-6.1-sol, gpt-6-sol und deepseek-v4.1-flash mit demselben Key aufrufen; Grok 4.7 gehört nicht dazu. Die Beispiele hier sind aus den offiziellen Preislisten der Anbieter umgerechnet, also weder ein Angebot von QCode noch eine Beschreibung, wie QCode abrechnet.
Häufig gestellte Fragen
Verlangen Claude Opus 5.5 und Sonnet 5.5 einen Aufschlag für den vollen 1M-Kontext?
Nein. Die offizielle Preisseite sagt über Claude 4.6 und neuere Modelle: include the full 1M token context window at standard pricing, und nennt als Beispiel, dass eine Anfrage mit 900k Tokens zum selben Preis pro Token abgerechnet wird wie eine mit 9k. Die Dokumentation zum Kontextfenster ergänzt: 1M ist der Standard, ein Beta-Header ist nicht nötig, und Langkontext-Anfragen werden zum Standardpreis abgerechnet. Cache- und Batch-Rabatte gelten im gesamten Fenster, und bei jeder Anfragelänge bleibt der Standardpreis für Opus 5.5 bei $4 / $20 und für Sonnet 5.5 bei $2 / $10.
Verteuert GPT-6.1 Sol nur die Tokens oberhalb von 272K?
Nein, die gesamte Anfrage wird neu bepreist. Auf der Modellseite steht: Prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request. Laut offizieller Preisliste kostet GPT-6.1 Sol bis 272K $2 Input, $0.10 Cached Input, $2.50 Cache-Write und $10 Output, darüber $4, $0.20, $5 und $15; bei GPT-6 Sol unterscheidet sich nur der Cached Input ($0.20 und $0.40). Beide haben ein Kontextfenster von 1.050.000 Tokens und maximal 922.000 Input-Tokens.
Hat Grok 4.7 einen 1M-Kontext, und wie wird oberhalb von 200K abgerechnet?
Nein, in der Preistabelle von xAI steht Grok 4.7 mit 500K Kontext. Die Preise stehen in zwei Zeilen: unter 200K Prompt-Tokens $2 Input, $0.50 Cached Input und $6 Output, ab 200K $4, $1 und $12, und laut Fußnote gilt dann der höhere Preis für alle Tokens der Anfrage. Mit 1M Kontext führt xAI grok-4.3 und die grok-4.20-Familie; auch deren Zeilen ab 200K kosten das Doppelte der unteren Zeilen (grok-4.3 von $1.25 / $2.50 auf $2.50 / $5.00).
Wie rechnet DeepSeek V4.1 Flash den 1M-Kontext ab?
Die offizielle Preisliste führt keine Langkontext-Aufschlagsstufe auf (Stand 2026-10-07), nur Preise für Spitzen- und Nebenzeit. V4.1 Flash (Modellname in der API: deepseek-flash) hat 1M Kontext und kostet pro Million Tokens: Input mit Cache-Treffer $0.006 zur Spitzenzeit und $0.003 zur Nebenzeit, Input ohne Cache-Treffer $0.3 bzw. $0.15, Output $1.2 bzw. $0.6. Spitzenzeit ist montags bis freitags von 01:00 bis 04:00 und von 06:00 bis 10:00 UTC, ausgenommen chinesische Feiertage; alle übrigen Stunden, auch Wochenenden und chinesische Feiertage ganztägig, gelten als Nebenzeit.
Kommen Batch und regionale Endpunkte zum Langkontext-Preis hinzu?
Das regelt jeder Anbieter anders. Anthropic schreibt, dass Cache- und Batch-Rabatte im gesamten Kontextfenster gelten; im Batch kostet Opus 5.5 $2 / $10 und Sonnet 5.5 $1 / $5, und reine US-Inferenz über inference_geo bringt einen Faktor 1,1 auf alle Token-Kategorien. In der Batch-Tabelle von OpenAI liegt der Tarif von GPT-6.1 Sol über 272K bei $2 Input und $7.50 Output, und regionale Verarbeitung kostet, wo angeboten, 10 % Aufschlag. Auf der Batch-Rabattliste von xAI fehlt Grok 4.7, und Modelle außerhalb der Liste erhalten keinen Batch-Rabatt; der US-Regionalendpunkt kostet das 1,1-Fache, auch für Langkontext-Tarife, bei Grok 4.7 über 200K also $4.40 / $1.10 / $13.20. Die offizielle Preisliste von DeepSeek nennt keine Batch- oder Regionalpreise (Stand 2026-10-07).
Kann ich diese Modelle über QCode aufrufen?
claude-opus-5-5, claude-sonnet-5-5, gpt-6.1-sol, gpt-6-sol und deepseek-v4.1-flash lassen sich mit demselben Key aufrufen, Grok 4.7 nicht. QCode rechnet pro Token ab, die Preise der einzelnen Modelle stehen unter /models. Alle Zahlen auf dieser Seite sind aus den offiziellen Preislisten der Anbieter umgerechnet und kein Angebot von QCode.
Quellen
Anthropic: die offizielle Preisseite (Modellpreise, Langkontext-Preise, Batch- und Data-Residency-Preise), die Dokumentation zum Kontextfenster, die Modellübersicht sowie die Modellseiten zu Opus 5.5 und Sonnet 5.5 (Erscheinungsdaten). OpenAI: die Preisseite der Entwicklerdokumentation (Standard- und Batch-Tabellen, Definition von kurzem und langem Kontext), die Modellseiten zu GPT-6.1 Sol und GPT-6 Sol (272K-Regel, Kontextfenster und maximaler Input) und das API-Changelog (Erscheinungsdaten und Standardpreise bis 272K). xAI: die Seiten Models und Pricing der Dokumentation (Abschnitte Batch, US-Regionalendpunkt und Fast) sowie die Release Notes. DeepSeek: die Seite Models & Pricing und das Change Log der API-Dokumentation. Alles abgerufen am 2026-10-07.
Ein Key, Modell wechseln, selbst vergleichen
QCode rechnet pro Token ab, die Preise der einzelnen Modelle stehen unter /models; claude-sonnet-5-5, gpt-6.1-sol und deepseek-v4.1-flash laufen mit demselben Key.
Weiterführende Lektüre
Langkontext-KI-Coding-Leitfaden 2026
Die Fenster wurden größer, die Probleme haben sich verändert: praktische Techniken, um in Fenstern ab 1 Mio. Tokens effizient zu programmieren.
GPT-6 Sol / Luna Preis-Tracker
Offizielle Preise, Tarifregeln und nachrechenbare Beispiele für zwei Reasoning-Modelle von OpenAI.
Fehlersuche bei Context Length Exceeded
Die drei Erscheinungsformen des Kontextüberlaufs und wie Sie sie voneinander unterscheiden.
Die Zahlen und Zitate auf dieser Seite wurden am 2026-10-07 geprüft; maßgeblich sind die offiziellen Seiten der Anbieter, und Preise können sich ohne Vorankündigung ändern. Alle Beträge pro Anfrage sind aus den offiziellen Preislisten umgerechnet, kein Angebot und kein Versprechen. Welche Modelle verfügbar sind, zeigt /models.