Preis-Tracker · Stand 2026-10-07

Prompt-Caching-Preise 2026: Was Claude, GPT und DeepSeek berechnen und wie Sie sparen

Stand 2026-10-07 kosten Cache-Lesezugriffe bei Claude Opus 5.5 und Sonnet 5.5 jeweils $0.20 pro Million Tokens; ein 5-Minuten-Cache-Write kostet das 1,25-Fache des Basis-Inputpreises ($5 / $2.50), ein 1-Stunden-Write das Doppelte ($8 / $4). GPT-6.1 Sol berechnet für gecachten Input $0.10, GPT-6 Sol $0.20, Cache-Writes kosten bei beiden $2.50. Cache-Treffer bei DeepSeek-V4-Pro kosten außerhalb der Spitzenzeit $0.022 und in der Spitzenzeit $0.044. Diese Seite stellt die Preisregeln, TTLs und Mindestlängen der drei Anbieter nebeneinander, mit zwei Rechenbeispielen auf Basis der offiziellen Preislisten.

Aktualisiert 2026-10-07

#Cache-Lesen $0.20#1-Stunden-Cache-Write#GPT-6.1 Sol $0.10#DeepSeek-Cache-Treffer

Vier Zahlen, die Sie kennen sollten

$0.20

Cache-Lesen Opus 5.5 / Sonnet 5.5 (pro Million Tokens)

Beide kosten $0.20. Laut Fußnote der offiziellen Preisliste werden Cache-Treffer und -Auffrischungen bei Opus 5.5 mit dem 0,05-Fachen des Basis-Inputpreises berechnet (5 % von $4), bei Sonnet 5.5 mit dem Standardfaktor 0,1 (10 % von $2).

1.25× / 2×

Claude-Cache-Writes: 5 Minuten / 1 Stunde

Laut offizieller Faktortabelle kostet ein 5-Minuten-Cache-Write das 1,25-Fache des Basis-Inputpreises, ein 1-Stunden-Write das 2-Fache. Als Einzelpreise sind das $5 / $8 bei Opus 5.5 und $2.50 / $4 bei Sonnet 5.5.

$0.10 / $0.20

Gecachter Input GPT-6.1 Sol / GPT-6 Sol

Standardpreise für Prompts bis 272K Input-Tokens. Beide haben $2 Input und $2.50 Cache-Writes (1,25-fach); gecachter Input kostet bei GPT-6.1 Sol 5 % und bei GPT-6 Sol 10 % des ungecachten Satzes.

$0.022 / $0.044

Cache-Treffer DeepSeek-V4-Pro: Nebenzeit / Spitzenzeit

Die offizielle Preisliste teilt den Input in Cache-Treffer und Cache-Fehlschlag; ein Fehlschlag kostet $0.66 / $1.32. Bei DeepSeek-V4.1-Flash kosten Treffer $0.003 / $0.006.

So wird Caching bepreist

Stand 2026-10-07 funktioniert Prompt-Caching bei allen drei Anbietern im Kern gleich: Trifft ein wiederholtes Präfix den Cache, werden diese Tokens zu einem ermäßigten Satz berechnet. Unterschiede gibt es darin, ob fürs Schreiben ein Aufschlag anfällt, wie hoch der Rabatt fürs Lesen ist und wie lange der Cache lebt. Anthropic: Standardmäßig lebt der Cache 5 Minuten, und jeder Treffer frischt ihn ohne Aufpreis auf; alternativ wählen Sie 1 Stunde, dann steigt der Write-Preis vom 1,25- auf das 2-Fache des Basis-Inputpreises. Nach der Kalkulation des Anbieters lohnt sich der 5-Minuten-Cache ab einem Lesezugriff, der 1-Stunden-Cache ab zwei. OpenAI: Laut offizieller Dokumentation ist Prompt-Caching für unterstützte Modelle standardmäßig aktiv; ab GPT-5.6 kosten Cache-Writes das 1,25-Fache des ungecachten Inputpreises, Lesezugriffe bei den meisten Modellen das 0,1-Fache und bei GPT-6.1 Sol das 0,05-Fache. Der Write-Preis ist kein Zuschlag obendrauf: Jedes Input-Token kostet genau einen Satz, ungecacht, Cache-Lesen oder Cache-Write. DeepSeek: Laut Anbieter ist der Festplatten-Cache für alle Nutzer standardmäßig aktiv, ohne Codeänderung, und die Preisliste kennt nur einen Treffer- und einen Fehlschlag-Satz.

Die Herstellerangaben: Cache-Lesen bei Opus 5.5 und GPT-6.1 Sol nur 0,05-fach

Derzeit haben sowohl Anthropic als auch OpenAI Modelle mit einem Cache-Lese-Faktor unter dem üblichen 0,1. Die Fußnote in Anthropics Preisliste setzt Cache-Treffer und -Auffrischungen bei Opus 5.5 mit dem 0,05-Fachen des Basis-Inputpreises an, also $4 Input und $0.20 Cache-Lesen; die meisten anderen Modelle nutzen den Standardfaktor 0,1, Fable 5.1 den Faktor 0,025. OpenAIs Caching-Leitfaden nennt für GPT-5.6 und neuer Cache-Writes zum 1,25-Fachen des ungecachten Inputpreises und Lesezugriffe zum 0,1-Fachen bei den meisten Modellen bzw. zum 0,05-Fachen bei GPT-6.1 Sol; für ältere Modelle weist die offizielle Vergleichstabelle keine zusätzliche Cache-Write-Gebühr aus. DeepSeeks Preisliste kennt dagegen nur zwei Inputsätze: Cache-Treffer und Cache-Fehlschlag.

Drei Daten, die für Cache-Preise zählen

2026-09-22

Claude Opus 5.5 erscheint zu $4 / $20 (laut aktueller Preisliste Cache-Lesen $0.20); am selben Tag veröffentlicht OpenAI GPT-6 Sol mit $2 Input, $0.20 gecachtem Input und $10 Output für Prompts bis 272K Input-Tokens.

2026-09-28

Claude Sonnet 5.5 erscheint; seine Zeile in der aktuellen Preisliste: Input $2, 5-Minuten-Cache-Write $2.50, 1-Stunden-Cache-Write $4, Cache-Lesen $0.20, Output $10.

2026-09-29

OpenAI veröffentlicht GPT-6.1 Sol: bis 272K Input-Tokens $2 Input, $0.10 gecachter Input, $2.50 Cache-Write und $10 Output; gecachter Input kostet 5 % des ungecachten Satzes.

Bestätigt vs. nicht verifiziert

Bestätigt (wörtlich auf den offiziellen Seiten)

Alles Folgende lässt sich wörtlich in den offiziellen Dokumentationen und Preislisten prüfen: Cache-Lesen zu $0.20 bei Opus 5.5 und Sonnet 5.5, 5-Minuten-Writes zu $5 und $2.50, 1-Stunden-Writes zu $8 und $4; der Cache-Lese-Faktor 0,05 bei Opus 5.5; Claudes Standard-Lebensdauer von 5 Minuten, gezählt ab Beginn der Anfrage; die Mindestlänge von 512 Tokens bei Opus 5.5 und Sonnet 5.5 und 1.024 Tokens bei Sonnet 5, wobei kürzere Prompts ohne Caching und ohne Fehlermeldung verarbeitet werden; gecachter Input zu $0.10 bei GPT-6.1 Sol und $0.20 bei GPT-6 Sol, Cache-Writes zu $2.50 bei beiden; 1.024 Tokens Mindestlänge und mindestens 30 Minuten Cache-Lebensdauer ab GPT-5.6; über 272K Input-Tokens berechnen GPT-6 Sol und GPT-6.1 Sol für die gesamte Anfrage Input und Cache doppelt und Output 1,5-fach; die Treffer- und Fehlschlagpreise von DeepSeek-V4-Pro und DeepSeek-V4.1-Flash sowie die Spitzenzeiten. Die beiden Rechenbeispiele auf dieser Seite sind aus diesen offiziellen Preisen umgerechnet und keine gemessenen Kosten.

Nicht verifiziert und vom Hersteller nicht veröffentlicht

Drei Dinge sind nicht verifiziert, planen Sie Ihr Budget nicht darauf: Erstens veröffentlicht DeepSeek keine feste Cache-Lebensdauer – der Anbieter schreibt nur, dass der Cache nach dem Best-Effort-Prinzip arbeitet, keine Trefferquote garantiert und nach Nichtnutzung meist innerhalb weniger Stunden bis weniger Tage geleert wird; zweitens nennt OpenAI für gecachten Input bis zu 95 % Rabatt, und die Beispiel-Deployments in der Dokumentation melden Trefferquoten von etwa 70 % und über 90 % – das sind Beispiele des Anbieters, kein Versprechen für Ihre Arbeitslast; drittens haben die im Netz kursierenden Screenshots zu „gemessenen Trefferquoten“ und Vergleichszahlen keine Primärquelle, diese Seite übernimmt sie nicht.

Zwei nachrechenbare Beispiele

Beispiel 1: lange Sitzung eines Coding-Agenten, 100K-Präfix über 20 Runden

Aus den offiziellen Preislisten umgerechnet, mit festen Eingaben: ein unveränderliches Präfix von 100K Tokens (System-Prompt, Tool-Definitionen, Projektkontext), 20 aufeinanderfolgende Runden mit jeweils weniger als 5 Minuten Abstand; gezählt wird nur dieses Präfix, ohne die neuen Inhalte jeder Runde und ohne Output. Sonnet 5.5: ohne Cache 20 × 0.1M × $2 = $4.00; mit Cache ein 5-Minuten-Write für $0.25 plus 19 Lesezugriffe zu 19 × $0.02 = $0.38, zusammen $0.63. Opus 5.5: $8.00 gegenüber $0.88 (Write $0.50 + Lesen $0.38). GPT-6 Sol: $4.00 gegenüber $0.63; GPT-6.1 Sol: $4.00 gegenüber $0.44 (Write $0.25 + Lesen 19 × $0.01). Beim Anbietervergleich beachten: Die Beispiele setzen gleiche Tokenzahlen voraus, derselbe Text kann bei den Modellen verschiedener Anbieter aber unterschiedlich viele Tokens ergeben; laut Anthropics Preisliste etwa erzeugt der neuere Tokenizer ab Claude 4.7 für denselben Text rund 30 % mehr Tokens als der vorherige, wobei der genaue Anstieg vom Inhalt abhängt.

Beispiel 2: 5 Minuten oder 1 Stunde TTL

Aus den offiziellen Preislisten umgerechnet, mit festen Eingaben: Sonnet 5.5, 100K-Präfix, 6 Runden, 10 Minuten Abstand. Ohne Cache 6 × $0.20 = $1.20. Mit 5-Minuten-TTL ist der Cache jedes Mal abgelaufen und wird neu geschrieben, 6 × $0.25 = $1.50, also teurer als ganz ohne Cache. Mit 1-Stunden-TTL ergeben ein Write für $0.40 plus 5 Lesezugriffe für $0.10 zusammen $0.50. Unter denselben Bedingungen kostet Opus 5.5 $2.40, $3.00 und $0.90. Der Rat des Anbieters: Kommen Aufrufe immer im Abstand von weniger als 5 Minuten, bleiben Sie beim 5-Minuten-Cache, weil jeder Treffer ihn ohne Aufpreis verlängert; liegen die Abstände zwischen 5 Minuten und einer Stunde, wechseln Sie zum 1-Stunden-Cache. Zum Vergleich: Bei OpenAI bleibt ein gecachtes Präfix ab GPT-5.6 nach dem letzten Write oder der letzten Wiederverwendung mindestens 30 Minuten wiederverwendbar, ein Abstand von 10 Minuten liegt nach den offiziellen Regeln also noch in diesem Fenster.

So schalten Sie es ein und sparen: fünf Schritte

Erstens: In der Claude API schaltet ein einzelnes cache_control-Feld auf oberster Ebene der Anfrage das automatische Caching ein; das System setzt den Breakpoint auf den letzten cachebaren Block und schiebt ihn mit wachsendem Gespräch nach vorn. Für eine Stunde setzen Sie in cache_control ttl auf 1h; ein Prompt erlaubt bis zu 4 Breakpoints. Zweitens: Achten Sie auf die Reihenfolge. Das gecachte Präfix läuft tools, dann system, dann messages, und eine Änderung auf einer Ebene macht diese und alle folgenden ungültig; stellen Sie stabile Tool-Definitionen, System-Prompts und lange Dokumente an den Anfang, Zeitstempel und anderes Veränderliches ans Ende. Drittens: In Claude Code mit API-Key hat das Hauptgespräch standardmäßig eine TTL von fünf Minuten; laut offizieller Dokumentation setzen Sie promptCacheTtl auf 1h (oder die Umgebungsvariable CLAUDE_CODE_PROMPT_CACHE_TTL), was Claude Code v2.1.242 oder neuer voraussetzt. Nach einem Modellwechsel mit /model liest die erste Anfrage das ganze Gespräch ungecacht neu ein. Viertens: Bei OpenAI ab GPT-5.6 setzt der implizite Modus, der laut Anbieter für die meisten Anwendungsfälle direkt passt, einen Breakpoint ans Ende der letzten geeigneten Nachricht; im expliziten Modus kostet alles nach dem letzten Breakpoint den ungecachten Satz ohne Write-Gebühr, so können Sie vermeiden, dass sich ständig ändernde Inhalte in den Cache geschrieben werden. Fünftens: Prüfen Sie die usage-Felder, bei Claude cache_creation_input_tokens und cache_read_input_tokens (sind beide 0, wurde nichts gecacht), bei OpenAI usage.input_tokens_details.cached_tokens und cache_write_tokens, bei DeepSeek prompt_cache_hit_tokens und prompt_cache_miss_tokens.

Auf QCode

QCode rechnet pro Token ab; die Einzelpreise jedes Modells stehen unter /models. Die Zahlen auf dieser Seite stammen aus den offiziellen Preislisten der Anbieter und sollen erklären, wie Caching bepreist wird und wie Sie sparen; was auf QCode tatsächlich berechnet wird, entnehmen Sie /models und den Aufrufdetails in der Konsole.

Häufig gestellte Fragen

Was kosten Cache-Lesezugriffe bei Claude?

Stand 2026-10-07 kosten Cache-Lesezugriffe bei Claude Opus 5.5 und Sonnet 5.5 jeweils $0.20 pro Million Tokens. Die Faktoren unterscheiden sich: Opus 5.5 liegt beim 0,05-Fachen des Basis-Inputpreises (5 % von $4), Sonnet 5.5 beim Standardfaktor 0,1 (10 % von $2) und Fable 5.1 bei 0,025 ($0.25). In der Preisliste heißt die Spalte Cache hits and refreshes: Ein Präfix wird aus dem Cache gelesen und dabei zugleich seine Lebensdauer erneuert.

Was kostet ein 1-Stunden-Cache-Write bei Claude, und lohnt er sich?

Ein 1-Stunden-Cache-Write kostet das 2-Fache des Basis-Inputpreises: $4 pro Million Tokens bei Sonnet 5.5 und $8 bei Opus 5.5 (die 5-Minuten-Stufe kostet $2.50 bzw. $5). Die Kalkulation des Anbieters beim Lesefaktor 0,1: Der 5-Minuten-Cache lohnt sich nach einem Lesezugriff, der 1-Stunden-Cache nach zwei. Aus der offiziellen Preisliste umgerechnet kostet ein 100K-Präfix auf Sonnet 5.5 über 6 Runden mit 10 Minuten Abstand mit dem 1-Stunden-Cache $0.50 und mit dem 5-Minuten-Cache, der jede Runde abläuft und neu geschrieben wird, $1.50. Kommen Aufrufe immer im Abstand von weniger als 5 Minuten, empfiehlt der Anbieter, beim 5-Minuten-Cache zu bleiben.

Muss ich das Caching bei OpenAI einschalten, und kosten Writes extra?

Einschalten ist nicht nötig: Laut offizieller Dokumentation ist Prompt-Caching für unterstützte Modelle standardmäßig aktiv. Ab GPT-5.6 kosten Writes das 1,25-Fache des ungecachten Inputpreises ($2.50 bei GPT-6 Sol und GPT-6.1 Sol), aber nicht als Zuschlag obendrauf: Jedes Input-Token kostet nur einen Satz, ungecacht, Cache-Lesen oder Cache-Write. Die Lebensdauer steuern Sie über prompt_cache_options.ttl; der einzige unterstützte Wert 30m ist zugleich der Standard, und eine Wiederverwendung verlängert sie ohne erneute Write-Gebühr. Die Mindestlänge beträgt 1.024 Tokens.

Was kosten Cache-Treffer bei DeepSeek?

Stand 2026-10-07 laut offizieller Preisliste pro Million Input-Tokens: DeepSeek-V4-Pro kostet bei Cache-Treffer $0.022 außerhalb und $0.044 in der Spitzenzeit, bei Fehlschlag $0.66 / $1.32; DeepSeek-V4.1-Flash (Modellname in der API: deepseek-flash) kostet bei Treffer $0.003 / $0.006, bei Fehlschlag $0.15 / $0.3. Spitzenzeiten sind montags bis freitags 01:00–04:00 und 06:00–10:00 UTC, ausgenommen chinesische Feiertage; außerhalb davon kosten die Sätze die Hälfte. Aus der offiziellen Preisliste umgerechnet kostet ein 100K-Präfix über 20 Runden bei V4-Pro in der Spitzenzeit $2.64 ohne Treffer oder $0.2156 mit Fehlschlag in der ersten und Treffern in den folgenden 19 Runden.

Zählen Cache-Treffer gegen das Rate Limit?

Das handhaben die beiden Anbieter unterschiedlich. Anthropic schreibt bei den Einsatzfällen des 1-Stunden-Caches ausdrücklich, dass Cache-Treffer nicht von Ihrem Rate Limit abgezogen werden. In OpenAIs FAQ heißt es, dass gecachte Input-Tokens weiterhin auf das Token-pro-Minute-Limit zählen und Prompt-Caching nichts daran ändert, wie Rate Limits ermittelt werden.

Wie wird Caching auf QCode berechnet?

QCode rechnet pro Token ab; die Einzelpreise jedes Modells stehen unter /models. Die Zahlen auf dieser Seite stammen aus den offiziellen Preislisten der Anbieter. Modell, Tokenzahl und Kosten jedes Aufrufs können Sie in den Aufrufdetails auf der Seite mit der Nutzungsstatistik in der Konsole prüfen.

Quellen

Claude-Preise und Caching-Regeln: die offizielle Preisseite von Anthropic und die Dokumentation Prompt caching (abgerufen am 2026-10-07; mit Cache-Lese- und Write-Preisen je Modell, Faktoren und Fußnoten, TTLs, Mindestlängen, Invalidierungsregeln und usage-Feldern); Veröffentlichungsdaten: die offiziellen Release Notes von Anthropic. TTL-Einstellungen in Claude Code: die Seiten zu Prompt Caching und Kostenkontrolle in der offiziellen Claude-Code-Dokumentation. OpenAI: die offizielle Preisseite, die Modellseiten zu GPT-6 Sol und GPT-6.1 Sol, der Leitfaden Prompt caching und das API-Changelog (am selben Tag abgerufen). DeepSeek: die offizielle Seite Models & Pricing und der Leitfaden Context Caching (am selben Tag abgerufen). QCode: die Seiten zu Kosten und Kostenoptimierung auf docs.qcode.cc.

Pro Token bezahlt, Preise unter /models

QCode rechnet pro Token ab; die Einzelpreise jedes Modells stehen unter /models. Wie Caching bepreist wird und wie Sie sparen, zeigen die offiziellen Preise und die beiden Rechenbeispiele auf dieser Seite.

Weiterführende Lektüre

Die Preise und Regeln auf dieser Seite wurden am 2026-10-07 geprüft; maßgeblich sind die offiziellen Seiten von Anthropic, OpenAI und DeepSeek, Änderungen beim Anbieter sind ohne Vorankündigung möglich. Die beiden Rechenbeispiele sind aus den offiziellen Preislisten umgerechnete Illustrationen: Sie zählen nur die Inputkosten des wiederholten Präfixes, ohne neue Inhalte und Output, und sind keine gemessenen Kosten. Rabattprozente und Beispiel-Trefferquoten der Anbieter sind deren eigene Angaben. Maßgeblich für die Modellverfügbarkeit ist /models.

Erst testen, dann entscheiden

Unsicher bei der Tarifwahl? Beginnen Sie mit Starter ($8.57/Monat) und wechseln Sie auf einen höheren Tarif, wenn Sie zufrieden sind — der ungenutzte Wert des alten Tarifs geht auf Ihr Guthaben zurück.