Ranglisten-Analyse · 22.08.2026

Dreimal Platz 1 auf SWE-bench Pro
Niemand hat gelogen, niemand hat die ganze Geschichte erzählt

Laut der System Card von Anthropic erreicht Fable 5 einen Wert von 80.3; Aggregatoren führen Fable 5 mit 80.0 und Mythos 5 mit 80.3; das offizielle Board von Scale liegt etwas darunter. Der Unterschied ergibt sich aus Datensplits und Scaffolds – nicht aus Score-Gaming.

Aktualisiert 2026-08-22

#swe-bench pro#Bewertungsbedingungen der Rangliste#öffentlicher vs. privater Split#Scaffold

Die drei kursierenden „ersten Plätze“

80.3

Herstellerangabe · Fable 5

Bedingungen der Anthropic System Card: eigenes Harness, eigene Läufe. Mythos 5 erreicht denselben Wert.

80.0

Aggregatoren · Fable 5

Aggregator-Seiten wie llm-stats führen Fable 5 mit 80.0 und Mythos 5 mit 80.3 – 0.3 Abstand zur System Card.

59.1

Scale offiziell · GPT-5.4 xHigh

Der offizielle öffentliche Split von Scale (das standardisierte SEAL-Framework), 2026-04. Niedrigere Werte, aber die strengsten Bedingungen.

731 / 276

Anzahl öffentlicher / privater Aufgaben

SWE-bench Pro umfasst insgesamt 1865 Aufgaben: 731 öffentliche, 276 private kommerzielle und 858 zurückgehaltene. Nicht alle Hersteller führen denselben Satz aus.

Was SWE-bench Pro ist

Ein Coding-Benchmark auf Enterprise-Niveau mit langem Planungshorizont, den Scale AI im September 2025 (2025-09) veröffentlicht hat: 1865 Aufgaben aus 41 professionellen Repositories. Der öffentliche Split verwendet ausschließlich Repositories mit starken Copyleft-Lizenzen im GPL-Stil, um Trainingskontamination zu unterbinden; der private Split besteht aus Closed-Source-Code von vertraglich gebundenen Startups. Die Bewertung ist streng: Ein Patch muss die neuen Fail-to-pass-Tests bestehen lassen, ohne einen bestehenden Test zu brechen. Der Benchmark ist um eine Größenordnung schwerer als Verified – Modelle, die auf Verified 70 % und mehr erreichen, starteten auf Pro bei etwa 23 %.

Warum die Zahlen nicht übereinstimmen

Die drei Quellen messen gar nicht dieselbe Art von „Score“: System Cards der Hersteller sind Selbstangaben auf deren eigenen Harnesses; Aggregatoren mischen Herstellerangaben mit Wiederholungsläufen Dritter; das offizielle Board von Scale wiederholt alles unter dem einheitlichen SEAL-Framework und führt öffentliche und private Splits getrennt auf. Kommen noch Reasoning-Effort-Stufen (high/xhigh) und Stichtage der Snapshots hinzu, kann dasselbe Modell legitim drei oder vier verschiedene Werte haben.

Zeitachse

2025-09-21

Scale veröffentlicht SWE-bench Pro; erste Baselines: GPT-5 mit 23.3 % / Opus 4.1 mit 23.1 % (öffentlicher Split).

2026-06-08/09

Fable 5 / Mythos 5 erscheinen, die System Cards geben 80.3 an; Aggregatoren erfassen sie nach und nach mit 80.0 / 80.3.

2026-08

Die aggregierten Boards pendeln sich ein: Mythos 5 mit 80.3, Fable 5 mit 80.0 und Opus 5 mit 79.2 führen; das offizielle Board von Scale liegt unter seinen Bedingungen deutlich niedriger.

Gesichert vs. leicht misszuverstehen

Gesichert

Alle drei Zahlensätze existieren tatsächlich, jeder mit eigener Herkunft; die Unterschiede erklären sich vollständig durch den Datensplit (öffentlich/privat), das Scaffold (Hersteller-Harness vs. einheitliches SEAL-Framework) und die Effort-Stufe.

Leicht misszuverstehen

„X führt SWE-bench Pro mit 80+ an“ und „SWE-bench Pro erreicht höchstens Werte in den 50ern“ können beide stimmen – Ersteres folgt den Bedingungen der Herstellerangaben bzw. Aggregatoren, Letzteres den offiziellen Bedingungen von Scale mit einheitlichem Framework. Nennen Sie beim Zitieren einer Zahl immer die zugrunde liegenden Bedingungen.

Welche Bedingungen Sie lesen sollten

Modellübergreifende Auswahl

Lesen Sie das offizielle Board von Scale oder Wiederholungsläufe mit einheitlichem Framework wie vals.ai: niedrigere Werte, aber vergleichbar – ein Maßstab für alle Modelle.

Die Spitze verfolgen

Lesen Sie System Cards der Hersteller und aggregierte Boards: aktuellere und höhere Werte, die aber nur vertikal mit historischen Werten unter denselben Bedingungen vergleichbar sind.

Wie Sie sich von Ranglisten nicht täuschen lassen

Drei Schritte: ① Fragen Sie nach dem Datensplit – die 731 öffentlichen oder die 276 privaten Aufgaben; ② fragen Sie nach dem Scaffold – Harness des Herstellers oder einheitliches SEAL-Framework; ③ fragen Sie nach Effort-Stufe und Datum. Vergleichen Sie Zahlen nicht horizontal, wenn nicht alle drei Antworten übereinstimmen.

Auf QCode

Die Modelle an der Spitze der Boards – Fable 5, Opus 5, die gesamte GPT-5.6-Reihe, GLM-5.3, Kimi K3, DeepSeek V4 Pro – lassen sich alle mit einem QCode-Key aufrufen. Statt über Bedingungen zu streiten, lassen Sie einmal Ihr eigenes Repository laufen: ein Endpunkt, ein Scaffold, Zahlen, die Sie selbst erzeugen.

FAQ

Wer ist bei SWE-bench Pro nun tatsächlich Erster?

Nach Aggregator-Bedingungen: Mythos 5 (80.3); nach Herstellerangaben: Fable 5 und Mythos 5 gleichauf bei 80.3; die offiziellen Werte von Scale mit einheitlichem Framework liegen insgesamt etwas niedriger. Jeder der drei „ersten Plätze“ hat seine eigenen Bedingungen.

Warum liegt das offizielle Board so deutlich unter den Herstellerangaben?

Das offizielle Board von Scale wiederholt jedes Modell unter dem einheitlichen SEAL-Framework und weist öffentliche und private Splits getrennt aus; Herstellerangaben nutzen ihre eigenen, optimierten Harnesses. Allein der Framework-Unterschied kann bei den schweren Aufgaben 20 Punkte kosten.

Was ist der Unterschied zwischen öffentlichem und privatem Split?

Die 731 öffentlichen Aufgaben stammen aus Repositories mit starkem Copyleft im GPL-Stil; die 276 privaten Aufgaben sind kommerzieller Closed-Source-Code von vertraglich gebundenen Startups – mit dem geringsten Kontaminationsrisiko und im Allgemeinen niedrigeren Werten. Weitere 858 zurückgehaltene Aufgaben sind nicht öffentlich.

In welchem Verhältnis steht SWE-bench Pro zu Verified?

Pro ist der im September 2025 (2025-09) veröffentlichte Nachfolger-Benchmark: längerer Planungshorizont, näher an Enterprise-Aufgaben, von Grund auf kontaminationsresistent. Modelle, die auf Verified 70 % und mehr erreichen, starteten auf Pro bei etwa 23 %.

Beeinflusst die Effort-Stufe die Ergebnisse?

Ja. Die Stufen high und xhigh unterscheiden sich bei schweren Aufgaben sichtbar, und Herstellerangaben verwenden meist die höchste Stufe. Stellen Sie vor einem Vergleich sicher, dass die Stufen beider Seiten übereinstimmen.

Wie wiederholen Sie Läufe für die Modellauswahl am zuverlässigsten?

Legen Sie ein Scaffold fest (z. B. das offizielle SWE-Agent oder SEAL), nutzen Sie einen einheitlichen API-Endpunkt und lassen Sie echte Issues aus Ihren eigenen Repositories laufen – das liegt näher an Ihrer Arbeitslast als jedes Board von Drittanbietern.

Quellen

Offizielle SWE-bench-Pro-Seite von Scale (labs.scale.com, abgerufen am 2026-08-22), System Card von Anthropic zu Fable 5 (über vellum), llm-stats, das aggregierte Board von benchlm (21.08.), Berichterstattung von techjacksolutions zum Streit um die Bedingungen.

Statt Ranglisten zu vertrauen: Führen Sie Ihre eigenen Läufe durch

Die führenden Modelle sind über denselben QCode-Endpunkt aufrufbar – führen Sie Ihre eigenen Repos unter einem einheitlichen Scaffold erneut aus.

Erst testen, dann entscheiden

Unsicher bei der Tarifwahl? Beginnen Sie mit Starter ($8.57/Monat) und wechseln Sie auf einen höheren Tarif, wenn Sie zufrieden sind — der ungenutzte Wert des alten Tarifs geht auf Ihr Guthaben zurück.