So wird der Artificial Analysis Intelligence Index berechnet
v4.3.2: ein gewichteter Durchschnitt aus 10 Evaluierungen mit veröffentlichten Gewichtungen
Stand 2026-10-07 ist der AA Index (Artificial Analysis Intelligence Index) bei v4.3.2: ein gewichteter Durchschnitt aus 10 Evaluierungen mit Agents 30 %, Coding 20 %, Scientific Reasoning 20 % und General 30 %. Die oft zitierte Aufteilung 34 % / 24 % / 24 % / 18 % ist die ältere v4.1-Gewichtung vom Juni 2026. Weicht der Wert eines Modells zwischen Seiten ab, liegt das meist an der Indexversion oder am Erhebungszeitpunkt.
Aktualisiert 2026-10-07
Mehr als Ranglisten — ein Key, um Claude, GPT und chinesische Modelle selbst zu messen.
- Bezahlung pro Token — aktuelle Preise unter /models
- Zahlung per Karte (Visa / Mastercard / AMEX), Apple Pay, Google Pay oder Krypto
- Selbstbedienung: aufladen und sofort aktivieren
Vier wichtige Fakten
Kategorie Agents
AA-Briefcase v1.1 mit 15 %, GDPval-AA v2.1 mit 10 %, AutomationBench-AA mit 5 %; laut Artificial Analysis betont die Gewichtung agentische Aufgaben.
Coding und Scientific Reasoning
Coding 20 % (Terminal-Bench 4.0 10 %, SciCode 10 %); Scientific Reasoning 20 % (Humanity's Last Exam 10 %, CritPt 10 %). GPQA Diamond ist seit v4.2 nicht mehr im Index.
Kategorie General
AA-Omniscience 15 % (Genauigkeit 10 % plus Nicht-Halluzination 5 %), GDP.pdf 10 %, AA-LCR v1.1 5 %. In v4.1 lag General bei nur 18 %.
Bewertungsmethode
Terminal-Bench 4.0, SciCode, AA-LCR, HLE und CritPt werden mit pass@1 bewertet; die Agents-Evaluierungen nutzen vor allem Elo aus paarweisen Vergleichen eines Jury-Panels.
Die 10 Evaluierungen von v4.3.2 und ihre Gewichte
Stand 2026-10-07 ist der aktuelle AA Intelligence Index v4.3.2 ein gewichteter Durchschnitt aus 10 Evaluierungen in vier Kategorien: Agents 30 % (AA-Briefcase v1.1 15 %, GDPval-AA v2.1 10 %, AutomationBench-AA 5 %); Coding 20 % (Terminal-Bench 4.0 10 %, SciCode 10 %); General 30 % (AA-Omniscience 15 %, davon 10 % Genauigkeit und 5 % Nicht-Halluzination; GDP.pdf 10 %; AA-LCR v1.1 5 %); Scientific Reasoning 20 % (Humanity's Last Exam 10 %, CritPt 10 %). Laut Artificial Analysis betont die Gewichtung agentische Aufgaben. Die Bewertung ist nicht einheitlich: Terminal-Bench 4.0, SciCode, AA-LCR, HLE und CritPt nutzen pass@1; AA-Briefcase und GDPval-AA Elo aus paarweisen Vergleichen; AutomationBench-AA bewertet die Zielerreichung.
Warum der Wert desselben Modells an verschiedenen Stellen unterschiedlich aussieht
Zwei Modelle mit gleichem Gesamtwert haben nicht unbedingt dasselbe Fähigkeitsprofil – unterschiedliche Stärken können dieselbe gewichtete Summe ergeben. Außerdem überarbeitet Artificial Analysis den Index laufend: v4.1 (Juni 2026) gewichtete Agents mit 34 %, Coding mit 24 %, Scientific Reasoning mit 24 % und General mit 18 %; im September 2026 folgten v4.2, v4.3, v4.3.1 und v4.3.2, und Stand 2026-10-07 ist v4.3.2 mit 10 Evaluierungen aktuell. Versionen unterscheiden sich in Evaluierungen und Gewichten; selbst innerhalb einer Version kann ein anderer Erhebungszeitpunkt Modell-Updates erfassen, sodass der Wert schwankt.
Zeitachse
Artificial Analysis führt den Intelligence Index als gewichteten Gesamtwert ein, um die Fähigkeiten von Modellen umfassend zu vergleichen.
Index v4.1 wird eingeführt und legt die neun Teilevaluierungen samt Gewichtungen öffentlich fest (Agents 34 %, Coding 24 %, Scientific Reasoning 24 %, General 18 %).
September 2026: v4.2, v4.3, v4.3.1 und v4.3.2 erscheinen. v4.2 nimmt AA-Briefcase (15 %) und GDP.pdf (10 %) auf und entfernt GPQA Diamond; v4.3 ersetzt τ³-Banking durch AutomationBench-AA und Terminal-Bench 2.1 durch Terminal-Bench 4.0. Aktuelle Kategoriegewichte: Agents 30 %, Coding 20 %, Scientific Reasoning 20 %, General 30 %.
Gesichert vs. verbreitete Fehlinterpretation
Gesichert
Stand 2026-10-07 nennt die offizielle Methodikseite von Artificial Analysis: v4.3.2 umfasst 10 Evaluierungen; Kategoriegewichte Agents 30 %, Coding 20 %, Scientific Reasoning 20 %, General 30 %; Einzelgewichte AA-Briefcase 15 %, GDPval-AA 10 %, AutomationBench-AA 5 %, Terminal-Bench 4.0 10 %, SciCode 10 %, AA-LCR 5 %, AA-Omniscience Genauigkeit 10 % und Nicht-Halluzination 5 %, HLE 10 %, GDP.pdf 10 %, CritPt 10 %. In der Versionshistorie steht v4.1 (Juni bis August 2026) mit 34 % / 24 % / 24 % / 18 %. Artificial Analysis schätzt das 95-%-Konfidenzintervall des Index auf weniger als ±1 %.
Verbreitete Fehlinterpretation
Viele lesen den Gesamtwert als eindimensionales Ranking und leiten daraus direkt ab, wer besser ist – dabei ist er eine gewichtete Summe aus zehn sehr unterschiedlichen Evaluierungen. Zwei Modelle mit ähnlicher Summe können sich in Agents, Coding, Scientific Reasoning und General deutlich unterscheiden. Ein weiterer häufiger Fehler: einen v4.3.2-Wert mit den v4.1-Gewichten (34 % / 24 % / 24 % / 18 %) zu erklären – die beiden Gewichtungen sind nicht gleich.
Gesamtwert vs. Teilwerte
Nur der Gesamtwert
Geeignet für eine schnelle, grobe Einordnung der Fähigkeiten, sagt aber nicht konkret, wo ein Modell stark oder schwach ist.
Aufschlüsselung nach Teilevaluierung
Wenn Ihr Anwendungsfall klar Richtung Agents oder Coding geht, schauen Sie direkt auf die passende Evaluierung (etwa Terminal-Bench 4.0 in der Coding-Kategorie von v4.3.2) – das ist gezielter als der Gesamtwert.
So nutzen Sie diesen Index in der Praxis
Schritt 1: Klären Sie, welche der vier Kategorien (Agents, Coding, Scientific Reasoning oder General) Ihrem Anwendungsfall am nächsten kommt, und gewichten Sie den passenden Teilwert höher als den Gesamtwert. Schritt 2: Prüfen Sie beim Modellvergleich, ob beide Werte aus derselben Indexversion (Stand 2026-10-07: v4.3.2) und derselben Datenerhebung stammen – Vergleiche über Versionen oder Zeitpunkte hinweg führen leicht in die Irre. Schritt 3: Nutzen Sie den Gesamtwert als groben Filter und testen Sie vor der Entscheidung im kleinen Rahmen mit Ihrer echten Aufgabe.
Was Sie mit QCode tun können
Stand 2026-10-07 ruft ein QCode-Key claude-opus-5-5, claude-sonnet-5-5, gpt-6.1-sol, deepseek-v4-pro, glm-5.3, qwen3.8-max, kimi-k3 und weitere Modelle auf – so vergleichen Sie mit Ihrer eigenen Aufgabe statt nach einer einzigen Gesamtzahl. Abgerechnet wird pro Token; die Preise je Modell und das aktuelle Modellangebot stehen unter /models.
FAQ
Wie wird der AA Intelligence Index genau berechnet?
Stand 2026-10-07 ist v4.3.2 ein gewichteter Durchschnitt aus 10 Evaluierungen: Agents 30 % (AA-Briefcase 15 % + GDPval-AA 10 % + AutomationBench-AA 5 %), Coding 20 % (Terminal-Bench 4.0 10 % + SciCode 10 %), General 30 % (AA-Omniscience Genauigkeit 10 % + Nicht-Halluzination 5 % + GDP.pdf 10 % + AA-LCR 5 %), Scientific Reasoning 20 % (HLE 10 % + CritPt 10 %).
Warum weicht der Wert desselben Modells von dem ab, was ich zuvor gesehen habe?
Die häufigsten Gründe sind ein Upgrade der Index-Version (Gewichtungen oder Zusammensetzung der Teilbewertungen haben sich geändert) oder ein anderes Abrufdatum der Daten (das Modell selbst wurde möglicherweise aktualisiert oder die Testumgebung angepasst).
Haben zwei Modelle mit demselben Gesamtwert wirklich die gleiche Leistungsfähigkeit?
Nicht unbedingt. Der Gesamtwert ist eine gewichtete Summe. Zwei Modelle können daher in verschiedenen Teilbereichen jeweils stark oder schwach sein und zufällig bei einer ähnlichen Gesamtsumme landen – ihre tatsächlichen Leistungsprofile können sich stark unterscheiden.
Was bedeutet pass@1?
Das Modell hat genau einen Versuch und besteht nur, wenn die erste Antwort richtig ist. In v4.3.2 werden Terminal-Bench 4.0, SciCode, AA-LCR, HLE und CritPt mit pass@1 bewertet; AA-Briefcase und GDPval-AA in der Agents-Kategorie nutzen stattdessen Elo aus paarweisen Vergleichen.
Terminal-Bench ist nur ein Teil der Coding-Kategorie – warum behandeln andere Seiten dieser Website es als eigenständiges Leaderboard?
Terminal-Bench ist sowohl ein eigenständiges öffentliches Leaderboard als auch Bestandteil der Coding-Kategorie des AA Index: v4.3 hat Terminal-Bench 2.1 durch Terminal-Bench 4.0 ersetzt, das in v4.3.2 10 % des Gesamtwerts ausmacht (Coding insgesamt 20 %). Laut Artificial Analysis bleibt Terminal-Bench 2.1 Teil ihres Coding Index. Beide Sichtweisen widersprechen sich nicht – sie arbeiten nur mit unterschiedlicher Granularität.
Worauf sollte ich bei der Modellauswahl anhand dieses Index noch achten?
Betrachten Sie den Index als allgemeine Orientierung, nicht als einzige Entscheidungsgrundlage. Wenn Ihre Aufgabe speziell ist, gehen Sie direkt zum Wert der passenden Teilbewertung und ergänzen Sie ihn vor der endgültigen Entscheidung durch einen kleinen Test.
Quellen
Die zehn Evaluierungen von v4.3.2, Kategorie- und Einzelgewichte, Bewertungsmethoden sowie die Versionshistorie von v4.1 bis v4.3.2 stammen von der offiziellen Methodikseite von Artificial Analysis (Intelligence Benchmarking, inklusive Version History) und den Indexhinweisen auf der Startseite. Abgerufen am 2026-10-07. Die historischen v4.1-Gewichte stammen aus derselben Versionshistorie.
Entscheiden Sie nicht anhand einer einzelnen Gesamtzahl
Ein QCode-Key ruft Modelle von Claude, GPT, DeepSeek, GLM, Qwen und Kimi auf – testen Sie sie mit Ihrer echten Aufgabe.
Weiterführende Artikel
Terminal-Bench 3.0 erklärt
Ausführliche Erklärung zu Terminal-Bench 3.0; seit AA Index v4.3 nutzt die Coding-Kategorie Terminal-Bench 4.0.
AI Model Radar 2026
Unser eigener Gesamtvergleich von Modellen, nützlich zum Abgleich mit dem AA Index.
SWE-bench Pro Ranking 2026
Ein weiteres führendes Leaderboard mit Coding-Fokus.
Diese Erklärung der Methodik des Artificial Analysis Intelligence Index beruht auf der offiziellen öffentlichen Dokumentation (geprüft am 2026-10-07) und ist keine offizielle Aussage von QCode. Maßgeblich für Gewichte und Zusammensetzung ist die offizielle Seite von Artificial Analysis; welche Modelle angeboten werden, steht unter /models.