Ein neues Modell ist erschienen – woran erkennen Sie, ob sich der Wechsel lohnt?
Öffentliche Benchmarks beantworten die Frage „Wie schneidet es bei Standardaufgaben ab?“. Sie möchten aber wissen: „Wie schneidet es in meinem Codebestand ab?“ Diese beiden Antworten unterscheiden sich häufig.
Aktualisiert 2026-09-19
Vier Prinzipien
Eigene Aufgaben verwenden
Zwanzig reale Aufgaben, die Sie kürzlich bearbeitet haben, sagen den Wert eines Modells für Sie besser voraus als jede öffentliche Rangliste.
Ein Aufgabensatz für alle Kandidaten
Ein Vergleich von Modellen anhand unterschiedlicher Aufgaben führt zu einem bedeutungslosen Ergebnis. Der Aufgabensatz muss feststehen.
Namen bei der Bewertung verbergen
Wenn Sie wissen, welche Ausgabe von welchem Modell stammt, verschiebt das Ihr Urteil messbar. Decken Sie die Namen zuerst ab.
Ein Durchlauf beweist nichts
Führen Sie jede Aufgabe dreimal aus. Weichen die drei Ergebnisse stark voneinander ab, ist auch die Aussage „Es ist besser“ selbst instabil.
Warum öffentliche Benchmarks hier nicht weiterhelfen
Öffentliche Benchmarks lösen ein Vergleichbarkeitsproblem: Mit einem festen Aufgabensatz und einer festen Bewertungsmethode lassen sich verschiedene Modelle in einem gemeinsamen Koordinatensystem verorten. Das hat Forschungswert, aber nur begrenzten Auswahlwert, und zwar aus drei Gründen. Die Aufgaben haben meist nichts mit Ihrem Codebestand oder Ihrem Fachgebiet zu tun; die Bewertung entspricht möglicherweise nicht den Qualitätsdimensionen, auf die es Ihnen ankommt; und sobald ein Modell weit verbreitet ist, steigt mit der Zeit die Wahrscheinlichkeit, dass Benchmark-Aufgaben in die Trainingsdaten gelangen. Ein hoher Wert bedeutet nicht „besser für Sie“.
Zu neu veröffentlichten Modellen
In den ersten Tagen nach einer Veröffentlichung schwankt die öffentliche Meinung stark: Frühe Anwender haben kleine Stichproben und einseitige Aufgabenverteilungen, und Überlastung in der Startphase führt dazu, dass Latenzprobleme für Qualitätsprobleme gehalten werden. Wenn Sie es nicht eilig haben, liefert eine Evaluation ein bis zwei Wochen später deutlich stabilere Erkenntnisse.
Die Schritte
Wählen Sie zwanzig reale Aufgaben aus und frieren Sie sie ein. Die Qualität dieses Schritts bestimmt den Wert der gesamten Evaluation.
Jeder Kandidat bearbeitet denselben Satz, dreimal pro Aufgabe; Kosten und Latenz werden festgehalten.
Bewerten Sie blind anhand der Dimensionen, die Ihnen wichtig sind, und beziehen Sie danach die Kosten wieder ein.
Ranglisten grenzen das Feld ein; Ihre eigenen Durchläufe entscheiden
Was diese Seite aussagen kann
Die Methodik einer selbst aufgebauten Evaluation ist allgemeingültig und unabhängig vom jeweiligen Modell: den Aufgabensatz festlegen, anhand derselben Aufgaben vergleichen, blind bewerten, wiederholt messen und die Kosten parallel festhalten. Das gilt für jede Modellauswahl.
Was diese Seite nicht aussagt
Wir haben Ornith-1.5 nicht systematisch evaluiert. Daher nennt diese Seite keine Benchmark-Werte, keine Ranglistenplätze und keine Aussagen der Art „schlägt Modell X“. Solche Zahlen verfälschen sich beim Weitererzählen leicht, und die Modellauswahl kostet Geld und Zeit – sie sollte nicht auf ungeprüften Zahlen beruhen.
Zwei Entscheidungsgrundlagen
Ranglisten lesen
Kostenlos und schnell, um das Feld einzugrenzen. Die Frage „Taugt es für meine Arbeit?“ beantwortet es jedoch nicht, und in der Startphase ist es verrauscht.
Eine kleine Evaluation aufbauen
Etwa zwei Stunden; das Ergebnis lässt sich direkt auf Ihre Situation übertragen, und der Aufgabensatz ist beim nächsten Mal wiederverwendbar. Der Preis dafür: Sie müssen den Satz zuerst zusammenstellen.
Eine Selbstevaluation, die Sie in zwei Stunden abschließen können
Schritt eins: Nehmen Sie zwanzig Aufgaben, die Sie in den letzten zwei Wochen tatsächlich bearbeitet haben, und decken Sie Ihre übliche Verteilung ab – wählen Sie nicht nur schwierige heraus, denn Routinearbeit macht den größeren Anteil aus. Schritt zwei: Frieren Sie diesen Satz ein und lassen Sie jeden Kandidaten dieselben zwanzig Aufgaben bearbeiten. Schritt drei: Entfernen Sie vor der Bewertung die Modellnamen und bewerten Sie anhand der Dimensionen, die Ihnen wirklich wichtig sind – war Nacharbeit nötig, wurde an anderer Stelle etwas beschädigt, wurde der Kontext verstanden. Schritt vier: Führen Sie jede Aufgabe dreimal aus und prüfen Sie die Stabilität. Schritt fünf: Halten Sie die Kosten parallel fest. Liegt die Qualität nah beieinander, entscheiden Kosten und Geschwindigkeit.
Bietet QCode Ornith-1.5 an?
Ganz klar: QCode bietet Ornith-1.5 derzeit nicht an. Wir stellen sieben Familien bereit – Claude, GPT/Codex, Gemini, GLM, Kimi, DeepSeek und Qwen – unter einem Key. Wenn Sie gezielt Ornith-1.5 evaluieren möchten, benötigen Sie dafür den eigenen offiziellen Kanal; die Methode auf dieser Seite gilt dort genauso. Wenn Ihre Evaluation dazu führt, dass Sie bei den genannten Familien bleiben, bieten wir Ihnen Zugang mit Abrechnung über ein festes Tageskontingent und planbaren Kosten.
FAQ
Kann ich Ornith-1.5 bei QCode nutzen?
Derzeit nicht. QCode stellt die Familien Claude, GPT/Codex, Gemini, GLM, Kimi, DeepSeek und Qwen bereit; Ornith-1.5 gehört nicht dazu.
Warum nennt diese Seite keine Benchmark-Zahlen?
Weil wir sie nicht selbst erhoben haben. Unbelegte Zahlen zu veröffentlichen schadet denjenigen, die eine Auswahlentscheidung treffen – und diese Entscheidung kostet Geld und Zeit.
Reichen zwanzig Aufgaben aus?
Für eine individuelle Entscheidung meist ja, sofern die zwanzig Aufgaben Ihre übliche Verteilung tatsächlich abbilden. Liegen die Kandidaten sehr nah beieinander, erweitern Sie auf fünfzig und prüfen Sie erneut.
Warum die Modellnamen verbergen?
Weil die Kenntnis der Quelle die Bewertung messbar verschiebt. Besonders ausgeprägt ist das bei neu veröffentlichten Modellen, bei denen allein die Vorfreude die vergebenen Bewertungen anhebt.
Ist es Verschwendung, jede Aufgabe dreimal auszuführen?
Dieser Schritt spart am meisten. Weichen drei Durchläufe stark voneinander ab, ist „es ist besser“ eine instabile Schlussfolgerung – und eine darauf gestützte Migrationsentscheidung kostet weit mehr.
Was, wenn die Evaluation zeigt, dass mein aktuelles Modell völlig ausreicht?
Das ist ein wertvolles Ergebnis. Das übliche Resultat einer Auswahl-Evaluation lautet nicht „wechseln“, sondern „kein Wechsel nötig“ – das erspart Ihnen die Migrationskosten.
Quellen
Leistungsfähigkeit und Verfügbarkeit der Modelle richten sich nach den offiziellen Angaben des Herausgebers. Diese Seite bietet nur eine Evaluationsmethode und gibt keine Benchmark-Zahlen Dritter wieder.
Evaluation abgeschlossen – jetzt wünschen Sie sich planbaren Zugang
Ein Key für sieben Modellfamilien, abgerechnet über ein festes Tagesbudget.
Weiterführende Artikel
Leitfaden zu Claude Opus 4.8
Spezifikationen und Nutzung der Flaggschiff-Coding-Stufe dieser Generation.
SWE-Bench-Pro-Ranking 2026
Wo diese Modelle bei realen Repository-Aufgaben landen.
KI-Modellradar 2026
In welcher Veröffentlichungsphase sich die einzelnen Frontier-Modelle befinden.
Fähigkeiten und Verfügbarkeit von Modellen Dritter richten sich nach den offiziellen Angaben der jeweiligen Anbieter. Diese Seite enthält keine Benchmark-Zahlen, sondern nur eine Methode, die Sie selbst durchführen können. Die Familien, die QCode derzeit anbietet, finden Sie auf unserer Modellseite.