Drei-Anbieter-Vergleich · maximal abgesichert

Claude Sonnet 5 vs. GPT-5.6 vs. Gemini 3.1 Pro

Anthropic, OpenAI und Google haben nie einen gemeinsamen Benchmark durchgeführt – einen einzelnen „Gewinner“-Score gibt es also nicht. Hier erfahren Sie, was tatsächlich vergleichbar ist (Preis, Kontext, Verfügbarkeit) und was nicht (Leaderboard-Scores), wobei die Benchmark-Zellen bewusst ehrlich leer gelassen werden.

#Claude Sonnet 5 #GPT-5.6 #Gemini 3.1 Pro #Ehrlicher Vergleich

Das Fazit in einem Satz

Zwischen diesen Anbietern gibt es keinen gemeinsamen Benchmark – vergleichen Sie anhand von Preis, Wert und Verfügbarkeit, nicht anhand eines einzelnen Scores.

Anthropic hat keine exakten Benchmark-Zahlen für Claude Sonnet 5 veröffentlicht; es heißt lediglich qualitativ, die Leistung sei „nah an Opus 4.8“. OpenAI und Google nutzen ihre eigenen Testumgebungen zu ihren eigenen Zeitpunkten. Die sinnvollen Entscheidungsachsen sind daher Kosten, Kontextfenster, Ausgabelimits und die tatsächliche allgemeine Verfügbarkeit jedes Modells. Claude Sonnet 5 ist ein Mid-Tier-Agentic-Coding-Modell, das Opus 4.8 zu einem niedrigeren Preis annähert – Opus 4.8 führt nach wie vor bei den anspruchsvollsten Coding-, Urteils- und Cyber-Aufgaben. Testen Sie alle drei Modelle auf Ihrer eigenen Workload, bevor Sie entscheiden.

Was IST und was NICHT vergleichbar ist

✅ Was Sie vergleichen KÖNNEN

Harte, veröffentlichte Fakten lassen sich anbieterübergreifend gegenüberstellen: Listenpreis pro Million Tokens, Größe des Kontextfensters, maximale Ausgabelänge, Wissensstand sowie – entscheidend – die tatsächliche Verfügbarkeit (welches Modell ist GA auf welcher Plattform, und welche Tarife sind noch Preview). Das sind die Zahlen, die Ihre Rechnung und Ihren Integrationsplan tatsächlich beeinflussen, und sie bilden die ehrliche Grundlage für eine Entscheidung.

🚫 Was Sie NICHT vergleichen können

Einen einzigen „Bestes Modell“-Score gibt es hier nicht. Anthropic hat für Sonnet 5 keine SWE-bench-, Terminal-Bench- oder OSWorld-Zahl veröffentlicht, und keine anbieterübergreifende Bewertung wurde auf identischen Harnesses, Prompts und Snapshots durchgeführt. Jede Tabelle, die Sonnet 5, GPT-5.6 und Gemini nebeneinander mit exakten Prozentwerten zeigt, setzt Schätzwerten von Drittanbietern aus verschiedenen Zeitpunkten zusammen — betrachten Sie diese Zahlen als richtungsweisend, niemals als maßgeblich.

Specs & Verfügbarkeit auf einen Blick

Verifizierte Specs, sofern die Anbieter sie veröffentlicht haben; die Benchmark-Zeile ist bewusst leer gelassen.

Merkmal Claude Sonnet 5 GPT-5.6 Gemini 3.1 Pro
Anbieter & PositionierungAnthropic · Mid-Tier, bestes Gleichgewicht aus Geschwindigkeit und IntelligenzOpenAI · Flaggschiff-LinieGoogle · Flaggschiff-Linie
Kontextfenster1 Mio. Tokens (Standard = Maximum)Tarifabhängig – siehe OpenAI-DokumentationAnbieterseitig angegeben – siehe Google Vertex-Dokumentation
Max. Ausgabe128K (bis zu 300K über Batches-Beta)Anbieterseitig angegebenAnbieterseitig angegeben
Preis (Input / Output pro MTok)$2 / $10 (Standard)Alle Tarife gelistet; Sol $4/$20 (09-12)Siehe Google-Preise (Region/Tarif)
WissensstandJanuar 2026Anbieterseitig angegebenAnbieterseitig angegeben
Verfügbarkeit / GA-StatusGA – Standard auf Free & Pro; API, Bedrock, Vertex AI, Foundry, Copilot, OpenRouterGA am 9. Juli 2026 (Sol / Terra / Luna)Variiert nach Region & Plattform
Öffentlicher Benchmark (SWE-bench / Terminal-Bench)– nicht anbieterveröffentlicht– keine gemeinsame Testumgebung– keine gemeinsame Testumgebung
Am besten geeignet fürAgentic Coding zu einem Mid-Tier-Preis; Opus-nahe QualitätTesten Sie auf Ihrer eigenen AufgabenmixTesten Sie auf Ihrer eigenen Aufgabenmix

Claude Sonnet 5 Specs und Preise gemäß anthropic.com/news/claude-sonnet-5 und platform.claude.com-Dokumentation ($2/$10 Input/Output, am 2026-08-10 als Standardtarif bestätigt; der neue Tokenizer verwendet ~30 % mehr Tokens für denselben Text, wodurch er grob kostenneutral gegenüber Sonnet 4.6 mit $3/$15 ist). Die Zellen für GPT-5.6 und Gemini sind tendenzielle Verweise auf die jeweilige Anbieterdokumentation, keine QCode-verifizierten Zahlen. Kein Benchmark-Wert hier stammt von Anthropic.

Zwei Einschränkungen, die die meisten Online-Vergleiche verfälschen

🔮 GPT-5.6 ist jetzt GA – aber prüfen Sie, welchen Modus ein Benchmark verwendet hat

Alle drei GPT-5.6-Tarife sind am 9. Juli 2026 GA geworden. Achten Sie beim Vergleich von Benchmark-Werten darauf, welcher Modus gemessen wurde: Sol Ultra ist der High-Compute-Modus von Sol (91.9 % auf Terminal-Bench 2.1), kein separater Preistarif; das Standard-Sol erreicht 88.8 %. Ultra-Modus-Scores als Standarderlebnis zu betrachten, führt zu falschen Schlussfolgerungen.

📅 Die meisten „Sonnet vs. Gemini“-Tabellen stammen aus der Sonnet-4.6-Ära

Claude Sonnet 5 wurde am 2026-06-30 veröffentlicht, sodass die überwiegende Mehrheit der online kursierenden „Sonnet vs. Gemini“-Vergleichstabellen gegen Claude Sonnet 4.6 erstellt und nie aktualisiert wurde. Sie enthalten alte Preise, alte Kontextlimits und alte Snapshots. Beachten Sie, dass Sonnet 4.6 (claude-sonnet-4-6) weiterhin aktiv ist – nicht eingestellt, vorläufige Abschaltung frühestens am 17. Februar 2027 – mit Sonnet 5 als empfohlenem Nachfolger und neuem Standard. Wenn eine Tabelle nicht „Sonnet 5“ angibt, gehen Sie davon aus, dass sie veraltet ist.

Alle drei Modelle mit einem QCode-Key nutzen

Statt einen Gewinner aus Zahlen zu küren, die es nicht gibt, führen Sie Ihren eigenen Vergleichsdurchlauf durch. Mit einem einzigen QCode-API-Key leiten Sie Anfragen an Claude Sonnet 5 für Agentic Coding und an die OpenAI-kompatible Linie für GPT-5.x – so können Sie dieselbe Aufgabe im A/B-Vergleich testen und anhand von echtem Output, Latenz und Kosten entscheiden.

Claude Code (Claude Sonnet 5)
export ANTHROPIC_BASE_URL="https://api.qcode.cc"
export ANTHROPIC_AUTH_TOKEN="$QCODE_KEY"
export ANTHROPIC_MODEL="claude-sonnet-5"
claude
OpenAI Codex CLI (GPT-5.x)
npm install -g @openai/codex
# add QCode profile in ~/.codex/config.toml
codex --profile qcode

Richten Sie Claude Code auf api.qcode.cc mit dem Modell claude-sonnet-5 ein und fügen Sie der Codex CLI ein QCode-Profil für GPT-5.x hinzu. Führen Sie dann dieselbe Aufgabe über jedes Modell aus und vergleichen Sie auf Ihrem eigenen Repository – der einzige Benchmark, der für Ihre Entscheidung wirklich zählt. Der Zugang zu Gemini hängt von Ihrem Tarif und Ihrer Region ab; prüfen Sie beim Anbieter die aktuelle Verfügbarkeit.

Häufig gestellte Fragen

Welches der drei Modelle ist für Coding am besten geeignet?

Einen gemeinsam von den Anbietern veröffentlichten Benchmark über Anthropic, OpenAI und Google hinweg gibt es nicht – daher kann anhand offizieller Zahlen kein einzelnes Modell als „bestes für Coding“ ausgezeichnet werden. Anthropic positioniert Claude Sonnet 5 als Agentic-Coding-Modell der Mittelklasse, dessen Qualität an Opus 4.8 heranreicht, zu einem niedrigeren Preis; Opus 4.8 führt weiterhin bei den anspruchsvollsten Coding- und Urteilsaufgaben. Der ehrliche Ansatz: alle drei Modelle auf dem eigenen Repository testen und anhand des eigenen Task-Mix, der Latenz und der Kosten bewerten – nicht anhand einer Rangliste.

Ist Claude Sonnet 5 besser als GPT-5.6?

Das kann anhand veröffentlichter Daten niemand sagen. Anthropic hat keine exakten Benchmark-Zahlen für Sonnet 5 veröffentlicht, und es gibt keinen Äpfel-mit-Äpfel-Vergleich, den beide Anbieter gleichermaßen durchgeführt haben. Sonnet 5 ist ein Modell der Mittelklasse mit einem Preis von $2/MTok Input und $10/MTok Output (Standardtarif). Jede Behauptung „Sonnet 5 schlägt GPT-5.6“, die man online findet, ist eine Drittanbieter-Schätzung, kein Anbieterergebnis.

Kann ich SWE-bench-Scores zwischen ihnen vergleichen?

Nicht zuverlässig. Anthropic hat keinen exakten SWE-bench-, Terminal-Bench- oder OSWorld-Wert für Claude Sonnet 5 veröffentlicht – nur die qualitative Aussage, dass die Leistung „nahe an Opus 4.8“ liege. Anbieterübergreifende SWE-bench-Tabellen vermischen üblicherweise unterschiedliche Testumgebungen, Daten und Modellsnapshots und sind daher nicht direkt vergleichbar. Jeden Wert, den man sieht, sollte man als Drittanbieter-Schätzung betrachten, nicht als Anthropic-veröffentlichte Zahl.

Ist GPT-5.6 allgemein verfügbar?

Ja – seit dem 9. Juli 2026 sind alle drei GPT-5.6-Stufen (Sol / Terra / Luna) über die API und Codex allgemein verfügbar. Auch Claude Sonnet 5 ist GA: Es ist das Standardmodell auf den Free- und Pro-Tarifen und über die Claude API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry, GitHub Copilot und OpenRouter verfügbar. Beide Familien laufen über QCode auf einem einzigen API-Key.

Führen Sie Ihren eigenen Vergleichstest auf QCode durch

Ein API-Key, echte Aufgaben, ehrliche Ergebnisse – entscheiden Sie mit Ihren eigenen Zahlen, nicht mit der Rangliste eines anderen.

Erst testen, dann entscheiden

Unsicher bei der Tarifwahl? Beginnen Sie mit Starter ($8.57/Monat) und wechseln Sie auf einen höheren Tarif, wenn Sie zufrieden sind — der ungenutzte Wert des alten Tarifs geht auf Ihr Guthaben zurück.