Claude Sonnet 5 vs. GPT-5.6 vs. Gemini 3.1 Pro
Anthropic, OpenAI und Google haben nie einen gemeinsamen Benchmark durchgeführt – einen einzelnen „Gewinner“-Score gibt es also nicht. Hier erfahren Sie, was tatsächlich vergleichbar ist (Preis, Kontext, Verfügbarkeit) und was nicht (Leaderboard-Scores), wobei die Benchmark-Zellen bewusst ehrlich leer gelassen werden.
Das Fazit in einem Satz
Zwischen diesen Anbietern gibt es keinen gemeinsamen Benchmark – vergleichen Sie anhand von Preis, Wert und Verfügbarkeit, nicht anhand eines einzelnen Scores.
Anthropic hat keine exakten Benchmark-Zahlen für Claude Sonnet 5 veröffentlicht; es heißt lediglich qualitativ, die Leistung sei „nah an Opus 4.8“. OpenAI und Google nutzen ihre eigenen Testumgebungen zu ihren eigenen Zeitpunkten. Die sinnvollen Entscheidungsachsen sind daher Kosten, Kontextfenster, Ausgabelimits und die tatsächliche allgemeine Verfügbarkeit jedes Modells. Claude Sonnet 5 ist ein Mid-Tier-Agentic-Coding-Modell, das Opus 4.8 zu einem niedrigeren Preis annähert – Opus 4.8 führt nach wie vor bei den anspruchsvollsten Coding-, Urteils- und Cyber-Aufgaben. Testen Sie alle drei Modelle auf Ihrer eigenen Workload, bevor Sie entscheiden.
Was IST und was NICHT vergleichbar ist
✅ Was Sie vergleichen KÖNNEN
Harte, veröffentlichte Fakten lassen sich anbieterübergreifend gegenüberstellen: Listenpreis pro Million Tokens, Größe des Kontextfensters, maximale Ausgabelänge, Wissensstand sowie – entscheidend – die tatsächliche Verfügbarkeit (welches Modell ist GA auf welcher Plattform, und welche Tarife sind noch Preview). Das sind die Zahlen, die Ihre Rechnung und Ihren Integrationsplan tatsächlich beeinflussen, und sie bilden die ehrliche Grundlage für eine Entscheidung.
🚫 Was Sie NICHT vergleichen können
Einen einzigen „Bestes Modell“-Score gibt es hier nicht. Anthropic hat für Sonnet 5 keine SWE-bench-, Terminal-Bench- oder OSWorld-Zahl veröffentlicht, und keine anbieterübergreifende Bewertung wurde auf identischen Harnesses, Prompts und Snapshots durchgeführt. Jede Tabelle, die Sonnet 5, GPT-5.6 und Gemini nebeneinander mit exakten Prozentwerten zeigt, setzt Schätzwerten von Drittanbietern aus verschiedenen Zeitpunkten zusammen — betrachten Sie diese Zahlen als richtungsweisend, niemals als maßgeblich.
Specs & Verfügbarkeit auf einen Blick
Verifizierte Specs, sofern die Anbieter sie veröffentlicht haben; die Benchmark-Zeile ist bewusst leer gelassen.
| Merkmal | Claude Sonnet 5 | GPT-5.6 | Gemini 3.1 Pro |
|---|---|---|---|
| Anbieter & Positionierung | Anthropic · Mid-Tier, bestes Gleichgewicht aus Geschwindigkeit und Intelligenz | OpenAI · Flaggschiff-Linie | Google · Flaggschiff-Linie |
| Kontextfenster | 1 Mio. Tokens (Standard = Maximum) | Tarifabhängig – siehe OpenAI-Dokumentation | Anbieterseitig angegeben – siehe Google Vertex-Dokumentation |
| Max. Ausgabe | 128K (bis zu 300K über Batches-Beta) | Anbieterseitig angegeben | Anbieterseitig angegeben |
| Preis (Input / Output pro MTok) | $2 / $10 (Standard) | Alle Tarife gelistet; Sol $4/$20 (09-12) | Siehe Google-Preise (Region/Tarif) |
| Wissensstand | Januar 2026 | Anbieterseitig angegeben | Anbieterseitig angegeben |
| Verfügbarkeit / GA-Status | GA – Standard auf Free & Pro; API, Bedrock, Vertex AI, Foundry, Copilot, OpenRouter | GA am 9. Juli 2026 (Sol / Terra / Luna) | Variiert nach Region & Plattform |
| Öffentlicher Benchmark (SWE-bench / Terminal-Bench) | – nicht anbieterveröffentlicht | – keine gemeinsame Testumgebung | – keine gemeinsame Testumgebung |
| Am besten geeignet für | Agentic Coding zu einem Mid-Tier-Preis; Opus-nahe Qualität | Testen Sie auf Ihrer eigenen Aufgabenmix | Testen Sie auf Ihrer eigenen Aufgabenmix |
Claude Sonnet 5 Specs und Preise gemäß anthropic.com/news/claude-sonnet-5 und platform.claude.com-Dokumentation ($2/$10 Input/Output, am 2026-08-10 als Standardtarif bestätigt; der neue Tokenizer verwendet ~30 % mehr Tokens für denselben Text, wodurch er grob kostenneutral gegenüber Sonnet 4.6 mit $3/$15 ist). Die Zellen für GPT-5.6 und Gemini sind tendenzielle Verweise auf die jeweilige Anbieterdokumentation, keine QCode-verifizierten Zahlen. Kein Benchmark-Wert hier stammt von Anthropic.
Zwei Einschränkungen, die die meisten Online-Vergleiche verfälschen
🔮 GPT-5.6 ist jetzt GA – aber prüfen Sie, welchen Modus ein Benchmark verwendet hat
Alle drei GPT-5.6-Tarife sind am 9. Juli 2026 GA geworden. Achten Sie beim Vergleich von Benchmark-Werten darauf, welcher Modus gemessen wurde: Sol Ultra ist der High-Compute-Modus von Sol (91.9 % auf Terminal-Bench 2.1), kein separater Preistarif; das Standard-Sol erreicht 88.8 %. Ultra-Modus-Scores als Standarderlebnis zu betrachten, führt zu falschen Schlussfolgerungen.
📅 Die meisten „Sonnet vs. Gemini“-Tabellen stammen aus der Sonnet-4.6-Ära
Claude Sonnet 5 wurde am 2026-06-30 veröffentlicht, sodass die überwiegende Mehrheit der online kursierenden „Sonnet vs. Gemini“-Vergleichstabellen gegen Claude Sonnet 4.6 erstellt und nie aktualisiert wurde. Sie enthalten alte Preise, alte Kontextlimits und alte Snapshots. Beachten Sie, dass Sonnet 4.6 (claude-sonnet-4-6) weiterhin aktiv ist – nicht eingestellt, vorläufige Abschaltung frühestens am 17. Februar 2027 – mit Sonnet 5 als empfohlenem Nachfolger und neuem Standard. Wenn eine Tabelle nicht „Sonnet 5“ angibt, gehen Sie davon aus, dass sie veraltet ist.
Alle drei Modelle mit einem QCode-Key nutzen
Statt einen Gewinner aus Zahlen zu küren, die es nicht gibt, führen Sie Ihren eigenen Vergleichsdurchlauf durch. Mit einem einzigen QCode-API-Key leiten Sie Anfragen an Claude Sonnet 5 für Agentic Coding und an die OpenAI-kompatible Linie für GPT-5.x – so können Sie dieselbe Aufgabe im A/B-Vergleich testen und anhand von echtem Output, Latenz und Kosten entscheiden.
export ANTHROPIC_BASE_URL="https://api.qcode.cc"
export ANTHROPIC_AUTH_TOKEN="$QCODE_KEY"
export ANTHROPIC_MODEL="claude-sonnet-5"
claude
npm install -g @openai/codex
# add QCode profile in ~/.codex/config.toml
codex --profile qcode
Richten Sie Claude Code auf api.qcode.cc mit dem Modell claude-sonnet-5 ein und fügen Sie der Codex CLI ein QCode-Profil für GPT-5.x hinzu. Führen Sie dann dieselbe Aufgabe über jedes Modell aus und vergleichen Sie auf Ihrem eigenen Repository – der einzige Benchmark, der für Ihre Entscheidung wirklich zählt. Der Zugang zu Gemini hängt von Ihrem Tarif und Ihrer Region ab; prüfen Sie beim Anbieter die aktuelle Verfügbarkeit.
Häufig gestellte Fragen
Welches der drei Modelle ist für Coding am besten geeignet?
Einen gemeinsam von den Anbietern veröffentlichten Benchmark über Anthropic, OpenAI und Google hinweg gibt es nicht – daher kann anhand offizieller Zahlen kein einzelnes Modell als „bestes für Coding“ ausgezeichnet werden. Anthropic positioniert Claude Sonnet 5 als Agentic-Coding-Modell der Mittelklasse, dessen Qualität an Opus 4.8 heranreicht, zu einem niedrigeren Preis; Opus 4.8 führt weiterhin bei den anspruchsvollsten Coding- und Urteilsaufgaben. Der ehrliche Ansatz: alle drei Modelle auf dem eigenen Repository testen und anhand des eigenen Task-Mix, der Latenz und der Kosten bewerten – nicht anhand einer Rangliste.
Ist Claude Sonnet 5 besser als GPT-5.6?
Das kann anhand veröffentlichter Daten niemand sagen. Anthropic hat keine exakten Benchmark-Zahlen für Sonnet 5 veröffentlicht, und es gibt keinen Äpfel-mit-Äpfel-Vergleich, den beide Anbieter gleichermaßen durchgeführt haben. Sonnet 5 ist ein Modell der Mittelklasse mit einem Preis von $2/MTok Input und $10/MTok Output (Standardtarif). Jede Behauptung „Sonnet 5 schlägt GPT-5.6“, die man online findet, ist eine Drittanbieter-Schätzung, kein Anbieterergebnis.
Kann ich SWE-bench-Scores zwischen ihnen vergleichen?
Nicht zuverlässig. Anthropic hat keinen exakten SWE-bench-, Terminal-Bench- oder OSWorld-Wert für Claude Sonnet 5 veröffentlicht – nur die qualitative Aussage, dass die Leistung „nahe an Opus 4.8“ liege. Anbieterübergreifende SWE-bench-Tabellen vermischen üblicherweise unterschiedliche Testumgebungen, Daten und Modellsnapshots und sind daher nicht direkt vergleichbar. Jeden Wert, den man sieht, sollte man als Drittanbieter-Schätzung betrachten, nicht als Anthropic-veröffentlichte Zahl.
Ist GPT-5.6 allgemein verfügbar?
Ja – seit dem 9. Juli 2026 sind alle drei GPT-5.6-Stufen (Sol / Terra / Luna) über die API und Codex allgemein verfügbar. Auch Claude Sonnet 5 ist GA: Es ist das Standardmodell auf den Free- und Pro-Tarifen und über die Claude API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry, GitHub Copilot und OpenRouter verfügbar. Beide Familien laufen über QCode auf einem einzigen API-Key.
Führen Sie Ihren eigenen Vergleichstest auf QCode durch
Ein API-Key, echte Aufgaben, ehrliche Ergebnisse – entscheiden Sie mit Ihren eigenen Zahlen, nicht mit der Rangliste eines anderen.
Weiterführende Artikel
Claude Sonnet 5: vollständiger Überblick
Spezifikationen, Preise, Kontextfenster und Verfügbarkeit für das neue Mid-Tier-Standardmodell von Anthropic.
AI Model Radar 2026
Wo jedes aktuelle Flaggschiff-Modell in puncto Verfügbarkeit und ehrlichem Status-Badge steht.
GPT-5.6-Leitfaden
Stufen, Benchmarks, Preise und Zugriff auf die OpenAI-Produktlinie – jetzt GA.
Claude Sonnet 5 vs Opus 4.8
Wann Sonnet 5 als Modell der Mittelklasse ausreicht und wann die anspruchsvollsten Aufgaben weiterhin Opus 4.8 erfordern.