Benchmark-Erklärung · Artificial Analysis Intelligence Index

So wird der Artificial Analysis Intelligence Index berechnet
Ein gewichteter Durchschnitt aus 9 Evaluierungen mit veröffentlichten Gewichtungen

Der AA Intelligence Index ist ein gewichteter Durchschnitt aus 9 Teilevaluierungen: Agents mit 34 %, Coding und Scientific Reasoning mit je 24 %, General mit 18 %. Weicht der Wert eines Modells zwischen Leaderboards oder im Zeitverlauf ab, liegt das meist an der Index-Version oder am Zeitpunkt der Datenabfrage, nicht daran, dass sich das Modell verändert hat.

Aktualisiert 2026-08-27

#AA Intelligence Index#v4.1#9 gewichtete Evaluierungen#pass@1

Vier wichtige Fakten

34 %

Agents hat die höchste Gewichtung

Unter den 9 Teilevaluierungen hat Agents den größten Anteil, aufgeteilt in GDPval-AA v2 (20 %) und τ³-Banking (14 %).

24 % + 24 %

Coding und Scientific Reasoning teilen sich Platz zwei

Coding macht 24 % aus (Terminal-Bench v2.1 mit 16 %, SciCode mit 8 %); Scientific Reasoning ebenfalls 24 % (Humanity's Last Exam 12 %, GPQA Diamond und CritPt mit je 6 %).

18 %

General hat die geringste Gewichtung

General macht 18 % aus (AA-LCR mit 6 %, AA-Omniscience mit 8 % Genauigkeit plus 4 % Halluzinationsfreiheit).

pass@1

Bewertungsmethode

Die meisten Teilevaluierungen verwenden pass@1 (beim ersten Versuch korrekt), aggregiert über wiederholte Durchläufe.

Die vollständige Tabelle der 9 Teilevaluierungen und ihrer Gewichtungen

Der AA Intelligence Index v4.1 ist ein gewichteter Durchschnitt aus neun Evaluierungen: Agents mit 34 % (GDPval-AA v2 mit 20 %, τ³-Banking mit 14 %); Coding mit 24 % (Terminal-Bench v2.1 mit 16 %, SciCode mit 8 %); Scientific Reasoning mit 24 % (Humanity's Last Exam mit 12 %, GPQA Diamond mit 6 %, CritPt mit 6 %) und General mit 18 % (AA-LCR mit 6 %, AA-Omniscience mit 8 % Genauigkeit und 4 % Halluzinationsfreiheit). Bewertet wird hauptsächlich mit pass@1 – das Modell muss es gleich beim ersten Versuch richtig lösen, aggregiert über mehrere wiederholte Durchläufe.

Warum der Wert desselben Modells an verschiedenen Stellen unterschiedlich aussieht

Zwei Modelle mit demselben Gesamtwert haben nicht zwangsläufig dasselbe Fähigkeitsprofil – es können völlig unterschiedliche Stärkenkombinationen sein, die zufällig dieselbe gewichtete Summe ergeben. Hinzu kommt: Artificial Analysis überarbeitet laufend die Index-Version (aktuell v4.1, eingeführt im Juni 2026) und die konkrete Zusammensetzung der Teilevaluierungen, und verschiedene Versionen haben unterschiedliche Gewichtungen; selbst bei derselben Version erfassen unterschiedliche Abfragezeitpunkte Modell-Updates und veränderte Evaluierungsumgebungen, sodass der Wert desselben Modells schwanken kann.

Zeitachse

Frühe Versionen

Artificial Analysis führt den Intelligence Index als gewichteten Gesamtwert ein, um die Fähigkeiten von Modellen umfassend zu vergleichen.

2026-06

Index v4.1 wird eingeführt und legt die neun Teilevaluierungen samt Gewichtungen öffentlich fest (Agents 34 %, Coding 24 %, Scientific Reasoning 24 %, General 18 %).

Laufend

Zusammensetzung und Gewichtungen der Teilevaluierungen werden von Version zu Version angepasst, sodass Werte zu verschiedenen Abfragezeitpunkten nicht exakt übereinstimmen müssen.

Gesichert vs. verbreitete Fehlinterpretation

Gesichert

Die neun Teilevaluierungen des AA Intelligence Index v4.1 und ihre Gewichtungen (Agents 34 %, Coding 24 %, Scientific Reasoning 24 %, General 18 % sowie die jeweiligen Untergewichtungen) sind auf der offiziellen Methodik-Seite von Artificial Analysis öffentlich dokumentiert; bewertet wird vorwiegend mit pass@1.

Verbreitete Fehlinterpretation

Viele betrachten den Gesamtwert als Ranking einer einzelnen Fähigkeitsdimension und leiten daraus direkt ab, „dieses Modell schlägt jenes“ – tatsächlich ist der Gesamtwert aber eine gewichtete Summe aus neun heterogenen Evaluierungen. Zwei Modelle mit ähnlicher Gesamtsumme können bei Agents, Coding und Scientific Reasoning sehr unterschiedliche Stärkenprofile haben; wer nur auf die Gesamtsumme schaut, interpretiert leicht falsch.

Gesamtwert vs. Teilwerte

Nur der Gesamtwert

Geeignet für eine schnelle, grobe Einordnung der Fähigkeiten, sagt aber nicht konkret, wo ein Modell stark oder schwach ist.

Aufschlüsselung nach Teilevaluierung

Wenn Ihr Anwendungsfall stark auf Agents oder Coding ausgerichtet ist, ist der direkte Blick auf die jeweilige Teilevaluierung (etwa die Komponente Terminal-Bench v2.1) gezielter als der Gesamtwert.

So nutzen Sie diesen Index in der Praxis

Schritt 1: Finden Sie heraus, welche der neun Kategorien (Agents, Coding, Scientific Reasoning oder General) Ihrem tatsächlichen Anwendungsfall am nächsten kommt, und gewichten Sie den passenden Teilwert höher als den Gesamtwert. Schritt 2: Stellen Sie beim Vergleich von Modellen sicher, dass beide Werte aus derselben Index-Version und demselben Datenabruf stammen – Vergleiche über Versionen oder Abrufdaten hinweg lassen sich leicht falsch deuten. Schritt 3: Betrachten Sie den Gesamtwert als grobe Vorauswahl, nicht als endgültige Antwort – ergänzen Sie ihn vor Ihrer Entscheidung durch einen kleinen Test mit Ihrer tatsächlichen Aufgabe.

Was Sie mit QCode tun können

Welche Dimension des Index für Ihren Anwendungsfall auch am wichtigsten ist: Mit einem QCode-Key erhalten Sie Zugang zu mehreren Modellfamilien mit Spitzenwerten zugleich. So können Sie einen kleinen Vergleich mit Ihrer tatsächlichen Aufgabe durchführen, statt sich allein auf eine einzelne Gesamtzahl zu verlassen.

FAQ

Wie wird der AA Intelligence Index genau berechnet?

Er ist ein gewichteter Durchschnitt aus neun Teilbewertungen: Agents 34 % (GDPval-AA v2 20 % + τ³-Banking 14 %), Coding 24 % (Terminal-Bench v2.1 16 % + SciCode 8 %), Scientific Reasoning 24 % (HLE 12 % + GPQA Diamond 6 % + CritPt 6 %), General 18 % (AA-LCR 6 % + AA-Omniscience-Genauigkeit 8 % + Nicht-Halluzination 4 %).

Warum weicht der Wert desselben Modells von dem ab, was ich zuvor gesehen habe?

Die häufigsten Gründe sind ein Upgrade der Index-Version (Gewichtungen oder Zusammensetzung der Teilbewertungen haben sich geändert) oder ein anderes Abrufdatum der Daten (das Modell selbst wurde möglicherweise aktualisiert oder die Testumgebung angepasst).

Haben zwei Modelle mit demselben Gesamtwert wirklich die gleiche Leistungsfähigkeit?

Nicht unbedingt. Der Gesamtwert ist eine gewichtete Summe. Zwei Modelle können daher in verschiedenen Teilbereichen jeweils stark oder schwach sein und zufällig bei einer ähnlichen Gesamtsumme landen – ihre tatsächlichen Leistungsprofile können sich stark unterscheiden.

Was bedeutet pass@1?

Es bedeutet, dass das Modell nur einen Versuch hat – es zählt nur dann als bestanden, wenn es beim ersten Versuch richtig liegt. Die meisten Teilbewertungen laufen mehrfach und fassen die pass@1-Ergebnisse zu einem Wert zusammen.

Terminal-Bench v2.1 ist nur ein Teil des Coding-Teilwerts – warum behandeln andere Seiten dieser Website es als eigenständiges Leaderboard?

Terminal-Bench ist sowohl ein eigenständiges öffentliches Leaderboard als auch eine Komponente der Coding-Kategorie des AA Index (16 der 24 Punkte von Coding). Die beiden Darstellungen widersprechen sich nicht – sie unterscheiden sich nur im Detailgrad.

Worauf sollte ich bei der Modellauswahl anhand dieses Index noch achten?

Betrachten Sie den Index als allgemeine Orientierung, nicht als einzige Entscheidungsgrundlage. Wenn Ihre Aufgabe speziell ist, gehen Sie direkt zum Wert der passenden Teilbewertung und ergänzen Sie ihn vor der endgültigen Entscheidung durch einen kleinen Test.

Quellen

Die neun Teilbewertungen des AA Intelligence Index v4.1, ihre Gewichtungen, die Bewertungsmethode (pass@1) und das Einführungsdatum der Version (Juni 2026) stammen von der offiziellen Methodikseite von Artificial Analysis. Geprüft am 2026-08-27.

Entscheiden Sie nicht anhand einer einzelnen Gesamtzahl

Mit einem QCode-Key erhalten Sie Zugang zu mehreren Modellfamilien mit Spitzenwerten und können einen kleinen Test mit Ihrer tatsächlichen Aufgabe durchführen.

Weiterführende Artikel

Die Erläuterung der Methodik des Artificial Analysis Intelligence Index auf dieser Seite beruht auf dessen offizieller öffentlicher Dokumentation und ist keine offizielle Aussage von QCode; maßgeblich für konkrete Gewichtungen und die Zusammensetzung der Teilbewertungen ist die aktuelle offizielle Seite von Artificial Analysis.

Erst testen, dann entscheiden

Unsicher bei der Tarifwahl? Beginnen Sie mit Starter ($8.57/Monat) und wechseln Sie auf einen höheren Tarif, wenn Sie zufrieden sind — der ungenutzte Wert des alten Tarifs geht auf Ihr Guthaben zurück.