Terminal-Bench 2.1
Drei Nummer-eins-Platzierungen – welcher trauen Sie?
Derselbe Benchmark, aber das offizielle Board, Artificial Analysis und vals.ai küren jeweils einen anderen Sieger. Die Abweichung liegt nicht an Score-Tuning, sondern an Harness, Effort-Stufe und Snapshot-Datum.
Aktualisiert 2026-09-21
Die drei Spitzenreiter
Offizielles Board · Claude Code × Fable 5
tbench.ai, Eintrag als Agent-+-Modell-Kombination, xhigh-Stufe, Snapshot vom 2026-06-07, $552.67 pro Durchlauf.
Artificial Analysis · GPT-5.6 Sol
xhigh-Reasoning-Stufe. Opus 5 folgt mit 89.1, Grok 4.6 ist mit 88.4 Dritter (laut The Batch, 08-21).
vals.ai · GPT-5.6 Sol
Einheitliches Terminus-2-Harness, pass@1. Opus 5 mit 84.64, Kimi K3 mit 80.90.
Aufgaben
Terminal-Aufgaben vom Modelltraining bis zur Systemadministration, nach Schwierigkeit abgestuft; zum Start überschritt kein Modell in der schweren Stufe 50 %.
Was Terminal-Bench 2.1 ist
Terminal-Bench ist ein Open-Source-Benchmark der Community für Terminal-Agenten: Modelle müssen Aufgaben tatsächlich in einem Sandbox-Terminal erledigen – zum Beispiel: „Trainiere ein fasttext-Modell auf den Yelp-Daten in data/, halte es unter 150MB und erreiche 0,62 Genauigkeit auf einem privaten Testset.“ Version 2.1 umfasst 89 Aufgaben aus Bereichen wie Modelltraining und Systemadministration und wird mit pass@1 bewertet: Eine Aufgabe zählt nur, wenn alle zugehörigen pytest-Prüfungen bestehen. Terminalarbeit ist das Heimspiel von Agenten wie Claude Code, Codex und Cursor – dadurch ist dieses Board eine belastbare Kennzahl für agentisches Coding.
Warum es im August 2026 hochkochte
Seit dem 08-08 zitieren mehrere Medien die Zahlen von Artificial Analysis: GPT-5.6 Sol 89.5 vs. Claude Opus 5 89.1 – ein Abstand von 0.4 an der Spitze; am 08-21 meldete The Batch, dass Grok 4.6 mit 88.4 in die Top drei vorgerückt ist. Das offizielle tbench.ai wird dagegen von Claude Code × Fable 5 mit 83.8 angeführt – beide Zahlenreihen stimmen, sie messen nur nicht dieselbe Art von „Modell“. Und die Launch-Notizen von GLM-5.3 verweisen bereits auf Terminal-Bench 3.0, wodurch 2.1 zum Board der vorigen Generation wird.
Zeitachse
Aktueller Spitzenreiter im offiziellen Board: Claude Code × Fable 5 (xhigh) mit 83,8.
Die Artificial-Analysis-Werte „Sol 89,5 vs. Opus 5 89,1“ verbreiten sich in der Medienberichterstattung.
The Batch: Grok 4.6 mit 88,4 stößt in die Top drei vor; der vals.ai-Snapshot aus demselben Zeitraum zeigt Sol 85,77 / Opus 5 84,64 / K3 80,90.
Bestätigt vs. leicht misszuverstehen
Bestätigt
Alle drei Leaderboards existieren tatsächlich und liefern überprüfbare Zahlen: das offizielle tbench.ai (Kombinationen aus Agent und Modell, Harbor-Framework), vals.ai (einheitliches Terminus-2-Harness, pass@1) und Artificial Analysis (direkte Modelltests mit gekennzeichneten Effort-Stufen). Die Unterschiede entstehen durch Harness und Stufe, nicht durch erfundene Daten.
Leicht misszuverstehen
Schlagzeilen wie „Modell X führt Terminal-Bench an“ verraten fast nie, welches Board, welcher Agent oder welche Effort-Stufe gemeint ist. Das offizielle Board misst Kombinationen aus „Agent + Modell“ (z. B. Claude Code × Fable 5), keine reinen Modelle; Kombinationswerte als Modellwerte zu lesen ist der häufigste Fehler.
Kosten vergleichen, bevor Sie auf Scores schauen
Die Scores liegen eng beieinander
Die beiden Erstplatzierten im offiziellen Board liegen nur 0.7 auseinander (83.8 vs. 83.1), bei Artificial Analysis 0.4. 2.1 ist für Frontier-Modelle nahezu gesättigt.
Die Kosten unterscheiden sich um ein Mehrfaches
Kosten pro Durchlauf im offiziellen Board: $552.67 für die Fable-5-Kombination, $2,059.19 für die GPT-5.5-Kombination. Gleiches Score-Band, fast das 4-Fache an Budget.
So führen Sie den Benchmark selbst erneut aus
Das offizielle Framework ist Harbor: harbor run -d terminal-bench/terminal-bench-2-1 -a "<agent>" -m "<model>" -k 5. Um Modelle zu vergleichen, fixieren Sie Agent und Effort-Stufe; um einen Agent auszuwählen, fixieren Sie das Modell. Die Snapshots von vals.ai und Artificial Analysis eignen sich als Gegenprobe.
Auf QCode
Die Modelle an der Spitze aller drei Boards – Fable 5, Opus 5, Sonnet 5, GPT-5.5, die gesamte GPT-5.6-Reihe, Kimi K3, GLM-5.2 – lassen sich alle nacheinander mit demselben Key auf QCode erneut ausführen, zum offiziellen Preis mal unserem Servicesatz und deutlich günstiger, als jede Plattform einzeln aufzuladen. Die Grok-Reihe ist auf QCode nicht angebunden; nutzen Sie dafür die offiziellen Kanäle.
FAQ
Wer führt Terminal-Bench 2.1 also tatsächlich an?
Das hängt vom Board ab: Laut dem offiziellen tbench.ai liegt Claude Code × Fable 5 vorn (83.8), laut Artificial Analysis GPT-5.6 Sol (89.5), und auch der vals.ai-Snapshot sieht Sol vorn (85.77). Harnesses und Bewertung unterscheiden sich.
Warum liegen die offiziellen Werte so viel niedriger?
Das offizielle Board testet Kombinationen aus „Agent + Modell“ mit Snapshot-Datum pro Eintrag; vals.ai testet erneut unter einem einheitlichen Terminus-2-Harness, und Artificial Analysis testet Modelle direkt mit gekennzeichneten Effort-Stufen. Stärkeres Harness, höhere Stufe, höherer Score.
Was decken die 89 Aufgaben ab?
Reale Aufgaben in einem Sandbox-Terminal: Modelltraining, Systemadministration, Datenverarbeitung und mehr, nach Schwierigkeit abgestuft. Bewertet wird mit pass@1 – alle mitgelieferten pytest-Prüfungen müssen bestehen.
Ist Terminal-Bench 3.0 schon erschienen?
Anbieter verweisen bereits darauf: Die Launch-Notizen von GLM-5.3 nennen TB 3.0, und Vergleichsseiten Dritter zeigen Opus 5 mit 42.7 / Sol mit 34.6. Der Benchmark ist deutlich schwerer; die Spitzenwerte von 2.1 sind nahezu gesättigt.
Was kostet ein Wiederholungslauf?
Einträge im offiziellen Board haben eine Kostenspalte: $552.67 pro Durchlauf für die Fable-5-Kombination, $2,059.19 für die GPT-5.5-Kombination. Eine einheitliche Pay-as-you-go-API-Plattform ist deutlich günstiger, als jede Plattform einzeln zu abonnieren.
Welches Board sollte die Auswahl bestimmen?
Wählen Sie Agents über das offizielle Board (Kombinationswerte), reine Modelle über vals.ai (einheitliches Harness) und nutzen Sie Artificial Analysis für schnelle Vergleiche zwischen Modellen. Keine einzelne Zahl sollte die alleinige Grundlage sein.
Quellen
Offizielles tbench.ai-Board (abgerufen am 2026-08-22), Methodik und Snapshots von vals.ai zu Terminal-Bench 2.1, Artificial Analysis (über felloai und The Batch, 2026-08-21), BuildApps (2026-08-08).
Ein Key – zu Ihrem eigenen Ergebnis
Die führenden Modelle sind über denselben QCode-Endpunkt aufrufbar – zum offiziellen Preis mal unserem Servicesatz; das Budget für Wiederholungsläufe bestimmen Sie selbst.
Weiterführende Artikel
SWE-bench-Pro-Ranking 2026
Aktuelle Platzierungen im repo-weiten Long-Horizon-Benchmark.
SWE-bench in der Produktionsrealität
Die Lücke zwischen Leaderboard-Scores und echter Softwareentwicklung.
KI-Modell-Radar 2026
Preis- und Verfügbarkeitstracking über die Flaggschiff-Familien hinweg.
Die Leaderboard-Zahlen sind ein Snapshot vom 2026-08-22 und ändern sich, sobald die Boards aktualisiert werden. Keine Verbindung zu einer Benchmark-Organisation.