So wird der Artificial Analysis Intelligence Index berechnet
Ein gewichteter Durchschnitt aus 9 Evaluierungen mit veröffentlichten Gewichtungen
Der AA Intelligence Index ist ein gewichteter Durchschnitt aus 9 Teilevaluierungen: Agents mit 34 %, Coding und Scientific Reasoning mit je 24 %, General mit 18 %. Weicht der Wert eines Modells zwischen Leaderboards oder im Zeitverlauf ab, liegt das meist an der Index-Version oder am Zeitpunkt der Datenabfrage, nicht daran, dass sich das Modell verändert hat.
Aktualisiert 2026-08-27
Vier wichtige Fakten
Agents hat die höchste Gewichtung
Unter den 9 Teilevaluierungen hat Agents den größten Anteil, aufgeteilt in GDPval-AA v2 (20 %) und τ³-Banking (14 %).
Coding und Scientific Reasoning teilen sich Platz zwei
Coding macht 24 % aus (Terminal-Bench v2.1 mit 16 %, SciCode mit 8 %); Scientific Reasoning ebenfalls 24 % (Humanity's Last Exam 12 %, GPQA Diamond und CritPt mit je 6 %).
General hat die geringste Gewichtung
General macht 18 % aus (AA-LCR mit 6 %, AA-Omniscience mit 8 % Genauigkeit plus 4 % Halluzinationsfreiheit).
Bewertungsmethode
Die meisten Teilevaluierungen verwenden pass@1 (beim ersten Versuch korrekt), aggregiert über wiederholte Durchläufe.
Die vollständige Tabelle der 9 Teilevaluierungen und ihrer Gewichtungen
Der AA Intelligence Index v4.1 ist ein gewichteter Durchschnitt aus neun Evaluierungen: Agents mit 34 % (GDPval-AA v2 mit 20 %, τ³-Banking mit 14 %); Coding mit 24 % (Terminal-Bench v2.1 mit 16 %, SciCode mit 8 %); Scientific Reasoning mit 24 % (Humanity's Last Exam mit 12 %, GPQA Diamond mit 6 %, CritPt mit 6 %) und General mit 18 % (AA-LCR mit 6 %, AA-Omniscience mit 8 % Genauigkeit und 4 % Halluzinationsfreiheit). Bewertet wird hauptsächlich mit pass@1 – das Modell muss es gleich beim ersten Versuch richtig lösen, aggregiert über mehrere wiederholte Durchläufe.
Warum der Wert desselben Modells an verschiedenen Stellen unterschiedlich aussieht
Zwei Modelle mit demselben Gesamtwert haben nicht zwangsläufig dasselbe Fähigkeitsprofil – es können völlig unterschiedliche Stärkenkombinationen sein, die zufällig dieselbe gewichtete Summe ergeben. Hinzu kommt: Artificial Analysis überarbeitet laufend die Index-Version (aktuell v4.1, eingeführt im Juni 2026) und die konkrete Zusammensetzung der Teilevaluierungen, und verschiedene Versionen haben unterschiedliche Gewichtungen; selbst bei derselben Version erfassen unterschiedliche Abfragezeitpunkte Modell-Updates und veränderte Evaluierungsumgebungen, sodass der Wert desselben Modells schwanken kann.
Zeitachse
Artificial Analysis führt den Intelligence Index als gewichteten Gesamtwert ein, um die Fähigkeiten von Modellen umfassend zu vergleichen.
Index v4.1 wird eingeführt und legt die neun Teilevaluierungen samt Gewichtungen öffentlich fest (Agents 34 %, Coding 24 %, Scientific Reasoning 24 %, General 18 %).
Zusammensetzung und Gewichtungen der Teilevaluierungen werden von Version zu Version angepasst, sodass Werte zu verschiedenen Abfragezeitpunkten nicht exakt übereinstimmen müssen.
Gesichert vs. verbreitete Fehlinterpretation
Gesichert
Die neun Teilevaluierungen des AA Intelligence Index v4.1 und ihre Gewichtungen (Agents 34 %, Coding 24 %, Scientific Reasoning 24 %, General 18 % sowie die jeweiligen Untergewichtungen) sind auf der offiziellen Methodik-Seite von Artificial Analysis öffentlich dokumentiert; bewertet wird vorwiegend mit pass@1.
Verbreitete Fehlinterpretation
Viele betrachten den Gesamtwert als Ranking einer einzelnen Fähigkeitsdimension und leiten daraus direkt ab, „dieses Modell schlägt jenes“ – tatsächlich ist der Gesamtwert aber eine gewichtete Summe aus neun heterogenen Evaluierungen. Zwei Modelle mit ähnlicher Gesamtsumme können bei Agents, Coding und Scientific Reasoning sehr unterschiedliche Stärkenprofile haben; wer nur auf die Gesamtsumme schaut, interpretiert leicht falsch.
Gesamtwert vs. Teilwerte
Nur der Gesamtwert
Geeignet für eine schnelle, grobe Einordnung der Fähigkeiten, sagt aber nicht konkret, wo ein Modell stark oder schwach ist.
Aufschlüsselung nach Teilevaluierung
Wenn Ihr Anwendungsfall stark auf Agents oder Coding ausgerichtet ist, ist der direkte Blick auf die jeweilige Teilevaluierung (etwa die Komponente Terminal-Bench v2.1) gezielter als der Gesamtwert.
So nutzen Sie diesen Index in der Praxis
Schritt 1: Finden Sie heraus, welche der neun Kategorien (Agents, Coding, Scientific Reasoning oder General) Ihrem tatsächlichen Anwendungsfall am nächsten kommt, und gewichten Sie den passenden Teilwert höher als den Gesamtwert. Schritt 2: Stellen Sie beim Vergleich von Modellen sicher, dass beide Werte aus derselben Index-Version und demselben Datenabruf stammen – Vergleiche über Versionen oder Abrufdaten hinweg lassen sich leicht falsch deuten. Schritt 3: Betrachten Sie den Gesamtwert als grobe Vorauswahl, nicht als endgültige Antwort – ergänzen Sie ihn vor Ihrer Entscheidung durch einen kleinen Test mit Ihrer tatsächlichen Aufgabe.
Was Sie mit QCode tun können
Welche Dimension des Index für Ihren Anwendungsfall auch am wichtigsten ist: Mit einem QCode-Key erhalten Sie Zugang zu mehreren Modellfamilien mit Spitzenwerten zugleich. So können Sie einen kleinen Vergleich mit Ihrer tatsächlichen Aufgabe durchführen, statt sich allein auf eine einzelne Gesamtzahl zu verlassen.
FAQ
Wie wird der AA Intelligence Index genau berechnet?
Er ist ein gewichteter Durchschnitt aus neun Teilbewertungen: Agents 34 % (GDPval-AA v2 20 % + τ³-Banking 14 %), Coding 24 % (Terminal-Bench v2.1 16 % + SciCode 8 %), Scientific Reasoning 24 % (HLE 12 % + GPQA Diamond 6 % + CritPt 6 %), General 18 % (AA-LCR 6 % + AA-Omniscience-Genauigkeit 8 % + Nicht-Halluzination 4 %).
Warum weicht der Wert desselben Modells von dem ab, was ich zuvor gesehen habe?
Die häufigsten Gründe sind ein Upgrade der Index-Version (Gewichtungen oder Zusammensetzung der Teilbewertungen haben sich geändert) oder ein anderes Abrufdatum der Daten (das Modell selbst wurde möglicherweise aktualisiert oder die Testumgebung angepasst).
Haben zwei Modelle mit demselben Gesamtwert wirklich die gleiche Leistungsfähigkeit?
Nicht unbedingt. Der Gesamtwert ist eine gewichtete Summe. Zwei Modelle können daher in verschiedenen Teilbereichen jeweils stark oder schwach sein und zufällig bei einer ähnlichen Gesamtsumme landen – ihre tatsächlichen Leistungsprofile können sich stark unterscheiden.
Was bedeutet pass@1?
Es bedeutet, dass das Modell nur einen Versuch hat – es zählt nur dann als bestanden, wenn es beim ersten Versuch richtig liegt. Die meisten Teilbewertungen laufen mehrfach und fassen die pass@1-Ergebnisse zu einem Wert zusammen.
Terminal-Bench v2.1 ist nur ein Teil des Coding-Teilwerts – warum behandeln andere Seiten dieser Website es als eigenständiges Leaderboard?
Terminal-Bench ist sowohl ein eigenständiges öffentliches Leaderboard als auch eine Komponente der Coding-Kategorie des AA Index (16 der 24 Punkte von Coding). Die beiden Darstellungen widersprechen sich nicht – sie unterscheiden sich nur im Detailgrad.
Worauf sollte ich bei der Modellauswahl anhand dieses Index noch achten?
Betrachten Sie den Index als allgemeine Orientierung, nicht als einzige Entscheidungsgrundlage. Wenn Ihre Aufgabe speziell ist, gehen Sie direkt zum Wert der passenden Teilbewertung und ergänzen Sie ihn vor der endgültigen Entscheidung durch einen kleinen Test.
Quellen
Die neun Teilbewertungen des AA Intelligence Index v4.1, ihre Gewichtungen, die Bewertungsmethode (pass@1) und das Einführungsdatum der Version (Juni 2026) stammen von der offiziellen Methodikseite von Artificial Analysis. Geprüft am 2026-08-27.
Entscheiden Sie nicht anhand einer einzelnen Gesamtzahl
Mit einem QCode-Key erhalten Sie Zugang zu mehreren Modellfamilien mit Spitzenwerten und können einen kleinen Test mit Ihrer tatsächlichen Aufgabe durchführen.
Weiterführende Artikel
Terminal-Bench 3.0 erklärt
Die neueste Version der Terminal-Bench-Reihe, auf die sich die Coding-Komponente des AA Index bezieht.
AI Model Radar 2026
Unser eigener Gesamtvergleich von Modellen, nützlich zum Abgleich mit dem AA Index.
SWE-bench Pro Ranking 2026
Ein weiteres führendes Leaderboard mit Coding-Fokus.
Die Erläuterung der Methodik des Artificial Analysis Intelligence Index auf dieser Seite beruht auf dessen offizieller öffentlicher Dokumentation und ist keine offizielle Aussage von QCode; maßgeblich für konkrete Gewichtungen und die Zusammensetzung der Teilbewertungen ist die aktuelle offizielle Seite von Artificial Analysis.