Terminal-Bench 3.0
Deutlich schwerer als 2.1 – der Spitzenreiter knackt gerade so die 40 %
TB 3.0 startete am 2026-08-19 mit dem Ziel, für Basismodelle Erfolgsquoten unter 30 % beim ersten Versuch zu erreichen. Der Spitzenreiter beim Stand vom 2026-08-27, Claude Opus 5, kam nur auf 42.7%, während die Rangliste von 2.1 bei rund 88 % gesättigt ist.
Aktualisiert 2026-09-21
Vier wichtige Fakten
Score des Spitzenreiters (damals)
Claude Opus 5 führte TB 3.0 mit 42.7% an (Stand 2026-08-27) – damals das einzige Modell über 40 %.
Score des Spitzenreiters von TB 2.1 (gesättigt)
Der Spitzenreiter von TB 2.1, Grok 4.6, erreicht 88.4%; die vier besten Modelle liegen alle im Bereich von 86%–89% – kaum noch Abstand.
Designziel von 3.0
Die Entwickler (Harbor, Laude Institute, Snorkel AI, Turing) haben ausdrücklich Erfolgsquoten unter 30 % beim ersten Versuch für Basismodelle angestrebt.
Abdeckung der Domänen
3.0 umfasst 7 Aufgabendomänen und führt GPU-Sandboxes (bis zu H100), Multi-Container-Topologien, Live-Microservices und strengere Bewertungslogik ein.
Was sich zwischen 3.0 und 2.1 tatsächlich geändert hat
Die Spitzenmodelle von TB 2.1 haben sich im Allgemeinen der 90-%-Marke genähert, sodass zu wenig Abstand bleibt, um echte Unterschiede zwischen Modellen zu erkennen – das klassische Problem der „Benchmark-Sättigung“. TB 3.0 fügt nicht einfach mehr Aufgaben hinzu, sondern legt die Messlatte auf Infrastrukturebene höher: GPU-Sandboxes bis zu H100, Multi-Container-Topologien, Anbindung an laufende Live-Microservices und eine strengere „Genau-dann-wenn“-Bewertungslogik (keine unscharfe, ungefähre Bewertung). Die Entwickler haben öffentlich erklärt, dass der Schwierigkeitsgrad von 3.0 auf Erfolgsquoten unter 30 % beim ersten Versuch für Basismodelle zielt – deshalb erreichte der Spitzenreiter Claude Opus 5 beim Stand vom 2026-08-27 nur 42.7%. Die Modelle sind nicht schlechter geworden; der Maßstab ist strenger geworden.
Aktuelle Entwicklung
TB 3.0 startete am 2026-08-19; die erste Version (v0.1) umfasst 74 Aufgaben in 7 Domänen. Die Top 8 beim Stand vom 2026-08-27 waren: Claude Opus 5 (42.7%), GPT-5.6 Sol (34.6%), Claude Fable 5 (34.0%), GLM-5.3 (32.4%), Grok 4.6 (26.5%), Claude Opus 4.8 (21.1%), GPT-5.6 Terra (20.8%) und Cognitions SWE-1.7 Lightning (18.6%).
Zeitplan
Terminal-Bench 3.0 startet; v0.1 umfasst 74 Aufgaben in 7 Domänen.
Die erste Rangliste wird veröffentlicht, angeführt von Claude Opus 5 mit 42.7% – derzeit das einzige Modell über 40 %.
Als frühe Version werden der Aufgabensatz und die Rangliste voraussichtlich weiter wachsen; die Platzierungen verschieben sich, während sich der Benchmark weiterentwickelt.
Bestätigt vs. weiter zu beobachten
Bestätigt
TB 3.0 startete am 2026-08-19 und wurde gemeinsam von Harbor, Laude Institute, Snorkel AI und Turing entwickelt; der Spitzenreiter beim Stand vom 2026-08-27 war Claude Opus 5 (42.7%). Der Spitzenreiter von TB 2.1, Grok 4.6, liegt bei 88.4%, die vier besten Modelle im Bereich von 86%–89%.
Weiter zu beobachten
Die Platzierungen in TB 3.0 verändern sich: Die 42.7% auf dieser Seite sind eine Momentaufnahme vom 2026-08-27, und die Standard-Rangliste der Website ist 4.0 (Stand der Abfrage vom 2026-09-21; GPT-6 Astra führt mit 58.2%). Betrachten Sie eine einmalige Momentaufnahme nicht als dauerhafte Wahrheit.
TB 3.0 vs. TB 2.1
TB 2.1 (auf dem Weg zur Sättigung)
Die Spitzenmodelle liegen bei 86%–89% dicht beieinander, kaum noch Abstand; weiterhin weit verbreitet, aber echte Unterschiede zwischen Modellen sind schwer zu erkennen.
TB 3.0 (zieht die Scores auseinander)
GPU-Sandboxes + Multi-Container + Live-Microservices + strenge Bewertung; der Spitzenreiter hat die 40 % gerade erst geknackt, was einen besseren Eindruck von der tatsächlichen Leistungsgrenze aktueller Modelle vermittelt.
So lesen Sie diese Rangliste
Prüfen Sie zuerst, ob die abgedeckten Domänen zu Ihrem tatsächlichen Anwendungsfall passen (3.0 umfasst 7 Domänen, und nicht jede Aufgabe ist für Ihre Arbeit relevant). Schauen Sie dann auf die tatsächlichen Score-Abstände statt auf die Rangfolge – bereits bei den ersten Modellen von TB 3.0 zeigt sich ein deutlicher Abstand (42.7% vs. 34.6% vs. 34.0%), was aussagekräftiger ist als das Feld von 2.1, in dem alle nur wenige Punkte auseinanderliegen. Der Benchmark ist noch jung, prüfen Sie ihn daher regelmäßig erneut, statt sich auf eine einzelne Momentaufnahme zu verlassen.
Was Sie bei QCode tun können
Von den aktuellen Top 8 in TB 3.0 gehören Claude Opus 5, GPT-5.6 Sol, Claude Fable 5, GLM-5.3 und Claude Opus 4.8 alle zum verkaufbaren Angebot von QCode – mit einem Key rufen Sie sie zum offiziellen Preis × Servicesatz auf. Grok 4.6 und SWE-1.7 Lightning werden derzeit nicht über QCode angeboten.
FAQ
Warum liegen die Scores in TB 3.0 durchgängig so viel niedriger als in 2.1?
Die Modelle sind nicht schwächer geworden – die Bewertung ist strenger geworden. 3.0 führt GPU-Sandboxes, Multi-Container-Topologien, Live-Microservices und strengere Bewertungslogik ein, und die Entwickler haben ausdrücklich Erfolgsquoten unter 30 % beim ersten Versuch für Basismodelle angestrebt; dass die Scores durchgängig sinken, ist daher zu erwarten.
Lohnt es sich noch, TB 2.1 heranzuziehen?
Ja, aber die Spitzenmodelle sind weitgehend gesättigt (Bereich 86%–89%), sodass kaum Abstand bleibt. Wenn Sie nur einige wenige Spitzenmodelle miteinander vergleichen, ist 3.0 aussagekräftiger.
Wie viele Aufgaben umfasst TB 3.0 derzeit?
Die erste Version (v0.1) umfasst 74 Aufgaben in 7 Domänen; als frühe Version wird der Aufgabensatz voraussichtlich weiter wachsen.
Grok 4.6 führte TB 2.1 an – warum liegt es in 3.0 weiter hinten?
Schwierigkeitsgrad der Aufgaben und Infrastrukturanforderungen unterscheiden sich zwischen den Versionen erheblich; 3.0 legt den Schwerpunkt auf realistische, komplexe Multi-Container-/Microservice-Szenarien, in denen verschiedene Modelle deutlich anders abschneiden als beim Aufgabensatz von 2.1 – eine Verschiebung der Platzierungen ist zu erwarten.
Kann ich über QCode jedes Modell dieser Rangliste aufrufen?
Nein. Von den Top 8 in TB 3.0 werden Grok 4.6 und SWE-1.7 Lightning derzeit nicht über QCode angeboten; die übrigen 5 (Claude Opus 5, GPT-5.6 Sol, Claude Fable 5, GLM-5.3, Claude Opus 4.8) können alle mit einem QCode-Key aufgerufen werden.
Was bedeutet die „Genau-dann-wenn“-Bewertung in TB 3.0?
Gemeint ist eine strengere automatisierte Bewertung – eine Aufgabe gilt nur dann als erledigt, wenn sie die vorgegebenen Bedingungen exakt erfüllt, statt unscharf und ungefähr bewertet zu werden. Das verringert Fehlbewertungen, bei denen etwas „richtig aussieht, aber nicht vollständig korrekt ist“.
Quellen
Startdatum von TB 3.0 (2026-08-19), Entwickler (Harbor, Laude Institute, Snorkel AI, Turing), Anzahl der Domänen, Designziel (Basis-Bestehensquote unter 30 %) und aktuelle Leaderboard-Werte stammen von der offiziellen Leaderboard-Seite von Terminal-Bench 3.0 und aus der zugehörigen Berichterstattung in Tech-Medien; die TB-2.1-Werte stammen aus der Version 2.1 derselben Leaderboard-Reihe. Geprüft am 2026-08-27.
Jenseits des Leaderboards: Ein Key testet die gängigen Modelle
Claude Opus 5, GPT-5.6 Sol, Claude Fable 5, GLM-5.3 und weitere TB-3.0-Spitzenreiter – alle mit einem QCode-Key aufrufbar.
Weiterführende Lektüre
SWE-bench-Pro-Ranking 2026
Der aktuelle Stand eines weiteren führenden Leaderboards für Coding-Fähigkeiten.
So wird der Artificial Analysis Intelligence Index berechnet
Die Methodik eines weiteren Gesamt-Leaderboards – TB 2.1 ist eine seiner Komponenten.
AI Model Radar 2026
Unser eigener Gesamtvergleich von Modellen.
Die Leaderboard-Daten auf dieser Seite stammen von der offiziellen Leaderboard-Seite von Terminal-Bench und stellen keine offizielle Aussage von QCode dar; maßgeblich sind die jeweils aktuellen Werte im Live-Leaderboard, und wir führen kein eigenes unabhängiges Ranking.