SWE-Bench Pro 2026 – Der realitätsnahe Benchmark für KI-Coding-Modelle
Die aggregierte Rangliste vom 18.08.: Mythos 5 80.3, Fable 5 80.0 und Opus 5 79.2 führen, während das Open-Weight-Modell Qwen3.8 Max mit 67.7 GPT-5.6 Sol mit 64.6 überholt. Achten Sie auf die Methodik: Dies sind aggregierte Zahlen – Eigenmeldungen der Anbieter und die offizielle Scale-Rangliste verwenden unterschiedliche Methoden. Details finden Sie auf unserer Seite „Drei erste Plätze“.
SWE-Bench Pro vs. Verified – Der Benchmark im Vergleich
SWE-Bench Verified (ab 2024 populär): ca. 500 human-verifizierte GitHub-Issue-Fix-Aufgaben. SWE-Bench Pro (ab 2026 Mainstream): gleicher Ansatz, aber schwieriger – längerer Kontext, mehr Dateien betroffen, näher an echten PR-Workflows. Verified plateaute bei rund 80 % (5.2-Codex), Pro bietet noch ca. 40 Punkte Spielraum und ist nun der kanonische Benchmark. Terminal-Bench 2.0 misst Terminal-Agent-Aufgaben; OSWorld misst GUI-Steuerungs-Aufgaben; GDPval misst professionelles Fachwissen.
Score-Entwicklung Q1–Q2 2026
Frühe Entwicklung: GPT-5.2-Codex (2026-01) Verified 80.0 % / Pro 56.4 %; GPT-5.3-Codex (2026-02) Pro 56.8 % (dieses Modell wurde 2026-08 eingestellt); GPT-5.5 Pro 58.6 %. Die aggregierte Rangliste vom 18.08. (llm-stats / benchlm-Methodik): Mythos 5 80.3, Fable 5 80.0, Opus 5 79.2, Qwen3.8 Max 67.7, GPT-5.6 Sol 64.6, GLM-5.2 62.1. Hinweis: Anthropics System Card meldet Fable 5 eigenständig mit 80.3 (gleichauf mit Mythos), die aggregierte Rangliste verzeichnet 80.0 – beide Zahlen existieren; der Unterschied liegt in der Bewertungsmethodik.
Modellübergreifender Vergleich nach Szenario
Laut aggregierter Rangliste vom 18.08.: Mythos 5 (80.3) > Fable 5 (80.0) > Opus 5 (79.2) führen, und Qwen3.8 Max (67.7) überholt GPT-5.6 Sol (64.6). Modelle nach Szenario auswählen: 1) Langlauf-Agenten-/Terminal-Aufgaben → siehe Terminal-Bench 2.1-Rangliste (andere Seite auf dieser Website); 2) tiefgreifende Python-Refactorings → die Claude-Reihe (Opus 5 / Fable 5); 3) Open Weights + Preis-Leistung → Qwen3.8 Max / GLM-5.2 / DeepSeek V4 Pro; 4) das OpenAI-Ökosystem → GPT-5.6 Sol. Zur Methodik-Lage siehe „Drei erste Plätze bei SWE-Bench Pro“.
Einheitlicher Zugang zu allen großen Modellen über QCode
QCode.cc bietet von China aus ein einheitliches, transparentes API-Gateway zu allen großen Coding-Modellen – Claude (Opus 4.7 / Sonnet), GPT (5.5 / Codex-Familie), Gemini (3) und weitere. Ein Abo, nutzungsbasierte Abrechnung. In Claude Code, Codex CLI, Cursor, Cline oder Continue ist der Modellwechsel nur ein Ändern der Base-URL und Modell-ID – einmal konfigurieren, überall ausführen.
FAQ
Ist 58.6 % auf SWE-Bench Pro viel? Wie sollte ich es einordnen?
Pro ist deutlich schwieriger als Verified: Verified ist gesättigt (80 %+), während die besten Eigenmeldungen auf Pro bei rund 80 liegen und Scale's offizielle Zahlen aus dem einheitlichen Framework niedriger ausfallen. Bevor Sie einen Pro-Score lesen, stellen Sie drei Fragen: welche Rangliste, welches Scaffold, welche Effort-Stufe – Details auf „Drei erste Plätze bei SWE-Bench Pro“.
Warum schlägt das allgemeine GPT-5.5 auf Pro das coding-spezifische 5.3-Codex?
Das ist ein Bild der ersten Jahreshälfte 2026. Die Spitze der aggregierten Rangliste vom 18.08. besteht nun aus drei Claude-Modellen (Mythos 5 / Fable 5 / Opus 5), und GPT-5.3-Codex wurde 2026-08 eingestellt (Migration auf die drei GPT-5.6-Stufen). Seit 2026-09-03 ist das Top-Modell der OpenAI-Reihe GPT-6 Astra – beachten Sie jedoch, dass OpenAI weder auf der Modellseite noch in der System Card einen SWE-bench-Verified-Score dafür veröffentlicht hat, sodass es auf dieser Rangliste keine vergleichbare Position hat. Behandeln Sie anderswo kursierende Zahlen nicht als offiziell.
Opus 4.7's Pro-Score ist nicht veröffentlicht – wie soll ich es bewerten?
Auf dieser aggregierten Rangliste vom 2026-08-18 gibt es für Opus 4.7 keinen anbietergemeldeten Pro-Score, also ordnen Sie es nicht nach Score ein. Sein Rang wurde auf Opus 5 überführt; Stand 2026-09-29 ist das neueste Opus von Anthropic Opus 5.5 (veröffentlicht 2026-09-22, $4 / $20). Siehe den Tracker /claude-opus-5-2-status-tracker und die Spezifikationen unter /claude-opus-5-5-guide.
Weiterführende Anleitungen
Alle großen Coding-Modelle über QCode nutzen
Mythos 5 ist nur eingeschränkt verfügbar; Fable 5 / Opus 5 / die komplette GPT-5.6-Reihe / GLM-5.3 / Kimi K3 / DeepSeek V4 Pro sind alle über den einheitlichen QCode-Kanal aufrufbar, nutzungsbasiert abgerechnet.
QCode-Tarif jetzt startenQCode-Konto erstellen
Pläne ab ¥60 / $8.57. Ein API-Key für Claude, GPT und Gemini.