Deep Dive · Umstrittener Benchmark-Wert

Claude Fable 5 bei SWE-Bench Pro: Woher die 80,3 % stammen und ob man ihnen trauen kann

Claude Fable 5 erzielte bei SWE-Bench Pro 80,3 % – eine der höchsten veröffentlichten Zahlen überhaupt. Aber wie wurde sie tatsächlich gemessen, und warum berichten unabhängige Evaluatoren abweichende Ergebnisse? Hier beide Seiten.

#80,3 % Score#SWE-Bench Pro#Methodikstreit#Claude Fable 5
Bitte zuerst lesen: Der Wert ist umstritten

80,3 % ist das Ergebnis nach der offiziellen Methodik von Anthropic, erzeugt mit dem eigenen Evaluierungs-Scaffolding. Die aggregierten Boards (llm-stats / benchlm, Snapshots 2026-08-18/21) verzeichnen Fable 5 mit 80,0 %, wobei Mythos 5 mit 80,3 % vorne liegt – beide Zahlen existieren tatsächlich; der Unterschied liegt in der Methodik. Beachten Sie außerdem, dass das offizielle Board von Scale mit einheitlichem Framework durchgängig niedrigere Werte ausweist. Den vollständigen Vergleich der drei Methodiken finden Sie unter „SWE-bench Pros drei erste Plätze“ auf dieser Website.

Zuletzt erneut geprüft: 2026-08-22 (beide Methodiken nebeneinander dargestellt: offizielle Selbstangabe 80,3 / aggregiertes Board 80,0).

SWE-Bench-Pro-Leaderboard im Vergleich

Die SWE-Bench-Pro-Werte, die Anthropic beim Launch von Fable 5 veröffentlicht hat, im Vergleich zu anderen Flaggschiff-Modellen derselben Zeit. Alle Angaben stammen aus offiziellen bzw. von den Evaluatoren veröffentlichten Materialien – achten Sie auf die Spalte „Evaluator / Methodik“, denn sie stammen nicht alle aus demselben neutralen Testlauf.

Modell SWE-Bench-Pro-Score Evaluator / Methodik — Hinweis
Claude Fable 5 80.3% Eigenes Evaluierungs-Scaffolding von Anthropic — Gleichauf mit Mythos 5
Claude Opus 4.8 69.2% Eigenes Evaluierungs-Scaffolding von Anthropic — Claude-Flaggschiff der Vorgängergeneration, als Baseline aufgeführt
GPT-5.5 58.6% Von Anthropic veröffentlichte Vergleichsdaten — Flaggschiff-Modell von OpenAI; nicht unabhängig von OpenAI verifiziert
Gemini 3.1 Pro 54.2% Von Anthropic veröffentlichte Vergleichsdaten — Flaggschiff-Modell von Google; nicht unabhängig von Google verifiziert

Der Wert im Detail

Wie die 80,3 % gemessen wurden

SWE-Bench Pro ist eine Evaluierungssuite auf Basis realer Software-Engineering-Aufgaben: Modelle müssen Fehlerbehebungen, Refactorings und ähnliche Arbeiten in Codebasen erledigen, die realen Entwicklungsszenarien ähneln – und damit näher an der Komplexität der Produktion liegen als frühere SWE-Bench-Versionen. Claude Fable 5 erzielte in den offiziellen Materialien von Anthropic 80.3 % (gleichauf mit Mythos 5), während die aggregierten Ranglisten (llm-stats / benchlm) für Fable 5 80.0 % und für Mythos 5 80.3 % ausweisen. Beide Zahlen existieren tatsächlich; die Frage ist nicht, welche erfunden ist, sondern mit welcher Methodik die jeweilige Zahl gemessen wurde.

Wichtige Klarstellung: offizielle Evaluierungsmethodik, keine neutrale Reproduktion

Der Wert von 80.3 % wurde mit Anthropics eigenem Evaluierungs-Scaffolding ermittelt – es handelt sich also um ein Ergebnis nach offizieller Methodik und nicht um eines, das von einem neutralen Test-Harness eines Dritten unabhängig reproduziert wurde. Dieser Unterschied ist wichtig: Das Scaffolding bestimmt, wie das Modell jede Aufgabe liest, wie es Tools aufruft, ob es nach einem Fehlschlag erneut versuchen darf und wie viel Kontextbudget es erhält – Details, die die endgültige Erfolgsquote wesentlich beeinflussen. Und wenn der getestete Anbieter dieses Scaffolding selbst baut und abstimmt, besteht naturgemäß Spielraum, es zugunsten des eigenen Modells auszulegen. techjacksolutions.com hat einen skeptischen Bericht veröffentlicht und darin ausdrücklich festgehalten, dass die Ergebnisse abwichen, als unabhängige Prüfer SWE-Bench Pro mit ihrer eigenen Methodik reproduzierten, und zwar von Anthropics offizieller Zahl. Das bedeutet nicht, dass 80.3 % gefälscht oder bedeutungslos wären – es ist ein Wert nach offizieller Evaluierungsmethodik, und das ist etwas anderes als eine unabhängige Reproduktion. Leserinnen und Leser sollten beide Seiten kennen und nicht nur die Zahl aus der Launch-Ankündigung.

Wofür sich ein solcher Wert eignet – und wofür nicht

Benchmark-Werte sind ein nützlicher Datenpunkt, aber nicht das ganze Bild bei der Modellauswahl. SWE-Bench Pro spiegelt die Leistung bei einer bestimmten Verteilung von Aufgaben wider – Fehlerbehebungen in realen Codebasen –, während Ihr eigener Anwendungsfall ganz anders aussehen kann: Neuentwicklungen auf der grünen Wiese, komplexes Systemdesign, groß angelegte Refactorings bei langen Kontextfenstern. Der Wert lässt sich nicht zwangsläufig übertragen. Hinzu kommt: Eine uneinheitliche Methodik (offizielles Scaffolding vs. unabhängige Reproduktion) bedeutet, dass Zahlen in derselben Rangliste nicht zwingend unter identischen, fairen Bedingungen entstanden sind. Schauen Sie bei der Modellauswahl über den Benchmark-Wert hinaus auf Ihren konkreten Aufgabentyp, Ihren Bedarf an Kontextlänge und die Kostenunterschiede zwischen den Modellen – und führen Sie idealerweise vor der Entscheidung einen kleinen Test mit Ihren eigenen realen Aufgaben durch.

Wie sich diese Seite zu den beiden anderen verhält

Diese drei Seiten ergänzen sich und sind nicht redundant – jede beantwortet eine andere Frage.

Sie möchten die vollständige Rangliste sehen?

Die vollständige SWE-Bench-Pro-Rangliste aller wichtigen Modelle finden Sie auf der Seite „SWE-Bench Pro 2026 Leaderboard“. Diese Seite geht ausführlich auf ein einzelnes Modell ein, Fable 5, und auf die Geschichte hinter seinem Wert – die vollständige Rangliste wird hier nicht noch einmal aufgeführt.

Sie möchten die allgemeinere Methodikkritik lesen?

Die allgemeinen methodischen Grenzen von Benchmarks wie SWE-Bench – Verzerrung bei der Aufgabenauswahl, Abhängigkeit vom Scaffolding, Repräsentativität für die Arbeit in der Produktion – werden ausführlich in „SWE-Bench and the Reality Gap in Production“ behandelt. Diese Seite stützt sich auf die Schlussfolgerungen jener Seite, statt sie hier erneut zu diskutieren.

Fable 5 mit QCode nutzen

QCode bietet Claude Fable 5 bereits an, nutzbar mit einem einzigen Key. Details zu den Preisen und Vergleiche mit anderen Modellen finden Sie im Preisleitfaden – sie werden hier nicht behandelt.

Zeitleiste

Das derzeit dokumentierte Schlüsseldatum.

2026-06-09

Claude Fable 5 erscheint, Wert von 80.3 % veröffentlicht

Anthropic bringt Claude Fable 5 auf den Markt; die offiziellen Evaluierungsmaterialien zeigen auf SWE-Bench Pro einen Wert von 80.3 %, gleichauf mit Mythos 5, das am selben Tag erschien.

Primärquellen

die Berichterstattung von the-decoder.com über den Launch von Claude Fable 5 und die veröffentlichten Benchmark-Zahlen; der skeptische Bericht von techjacksolutions.com über die Lücke zwischen dem offiziellen SWE-Bench-Pro-Wert und unabhängig reproduzierten Ergebnissen; die Aufschlüsselung des SWE-Bench-Pro-Benchmarks von vellum.ai; die offizielle Release-Seite von Anthropic.

FAQ

Ist der Wert von 80.3 % für Claude Fable 5 auf SWE-Bench Pro der höchste überhaupt?

Das hängt von der Methodik ab: In den offiziellen Materialien von Anthropic liegen Fable 5 und Mythos 5 mit 80.3 % gleichauf; in den aggregierten Ranglisten (llm-stats / benchlm, Stand 18.08.) führt Mythos 5 mit 80.3 %, Fable 5 folgt mit 80.0 % auf Platz zwei und Opus 5 mit 79.2 % auf Platz drei. Bitte nennen Sie beim Zitieren die Methodik.

Ist dieser Wert vertrauenswürdig? Warum ist er umstritten?

Der Wert selbst ist eine tatsächlich veröffentlichte Zahl und keine Erfindung; 80.3 % ist jedoch das Ergebnis nach offizieller Methodik mit Anthropics eigenem Evaluierungs-Scaffolding, während die aggregierten Ranglisten (llm-stats / benchlm) 80.0 % ausweisen. Die offizielle Rangliste von Scale auf dem einheitlichen SEAL-Framework liegt durchgehend noch niedriger. Im Kern geht es beim Streit darum, „wer die Testbedingungen aufgebaut hat und welcher Datensplit verwendet wurde“, nicht darum, ob der Wert existiert. Den Vergleich der drei Methodiken finden Sie unter „SWE-bench Pro's Three First Places“.

Worin besteht der eigentliche Unterschied zwischen offizieller Methodik und unabhängiger Reproduktion?

Das Evaluierungs-Scaffolding bestimmt, wie ein Modell Aufgabenbeschreibungen liest, Tools aufruft, nach Fehlschlägen erneut versucht und wie viel Kontext- bzw. Schrittbudget es erhält – Implementierungsdetails, die die endgültige Erfolgsquote wesentlich beeinflussen. Wenn der Anbieter des getesteten Modells dieses Scaffolding selbst baut und abstimmt, können die Ergebnisse von dem abweichen, was ein neutraler Dritter erhielte, der alle Modelle nach einem einheitlichen Standard prüft. Das ist ein allgemeines Problem von Benchmark-Zahlen, die Anbieter selbst veröffentlichen, und keine Besonderheit von Fable 5.

Wie stark sollte dieser Wert meine Modellwahl tatsächlich beeinflussen?

Betrachten Sie ihn als ein aussagekräftiges Signal, nicht als das einzige. Er zeigt ungefähr, wie leistungsfähig das Modell bei Bugfix-artigen Aufgaben in realen Codebasen ist – das kann zu Ihrem eigenen Anwendungsfall (Aufgabentyp, Kontextlänge, Kostenbudget) passen oder auch nicht. Wir empfehlen, für den breiteren Vergleich das vollständige „SWE-Bench Pro 2026 Leaderboard“ zu prüfen und anschließend in kleinem Umfang an Ihren eigenen realen Aufgaben zu validieren.

QCode-Konto erstellen

Pläne ab ¥60 / $8.57. Ein API-Key für Claude, GPT und Gemini.

Weiterführende Artikel

Diese Website steht in keiner Verbindung zu Anthropic. Die SWE-Bench-Pro-Werte folgen den offiziellen Veröffentlichungsunterlagen und der Berichterstattung Dritter; die Angaben auf dieser Seite gelten Stand 2026-08-08 und können sich ändern. Aufgrund unterschiedlicher Evaluierungsmethoden sind Werte aus verschiedenen Quellen möglicherweise nicht direkt vergleichbar.

Erst testen, dann entscheiden

Unsicher bei der Tarifwahl? Beginnen Sie mit Starter ($8.57/Monat) und wechseln Sie auf einen höheren Tarif, wenn Sie zufrieden sind — der ungenutzte Wert des alten Tarifs geht auf Ihr Guthaben zurück.