Statt einer Rangliste führen wir ein Rekordbuch: fünf Disziplinen, je ein benannter Test. Hier siehst du, wer den Bestwert hält, seit wann er steht, wer ihn davor hielt und wie schnell die Rekorde fallen. Jeder Wert stammt von einem unabhängigen Prüfer, und was nie gemessen wurde, bleibt eine Lücke.
5Disziplinen
22Rekordwechsel in 12 Monaten
31Tage seit dem letzten Rekord
167Modelle in den Quellen
Stand: 15. August 2026
Die aktuellen Rekorde
Ein Rekord ist der beste veröffentlichte Lauf auf dem einen Test der Disziplin, eingetragen an dem Tag, an dem das Modell erschien. Kein Mittelwert über verschieden schwere Prüfungen, keine Auswahl des besten Werts aus mehreren Tests.
Am häufigsten wechselte der Rekord zuletzt in Mathematik. Am längsten hält er in Faktentreue.
Eigens geschriebene, unveröffentlichte Aufgaben auf Forschungsniveau. Der einzige Mathematiktest in den Quellen, an dem sich Spitzenmodelle noch unterscheiden.
Claude Fable 587,8 %
Rekord seit 9. Juni 2026 · hält seit 67 Tagen
davor GPT-5.5 Pro mit 78,0 %
Verfolger heuteGPT-5.6 Sol · 82,9 %GPT-5.5 Pro · 78,0 %
Neuartige visuelle Muster, die so nicht im Training vorkamen. Menschen lösen sie zuverlässig, Modelle bisher kaum.
Inkling36,5 %
Rekord seit 15. Juli 2026 · hält seit 31 Tagen
davor Gemini 3 Pro mit 31,1 %
Verfolger heuteGemini 3 Pro · 31,1 %GLM-5.2 · 22,8 %
Jeder Punkt ein Modell, die Treppe der Rekord
Waagerecht das Erscheinungsdatum, senkrecht der Wert auf dem Test der gewählten Disziplin. Die Linie steigt genau dann, wenn ein neues Modell den Bestwert überbietet. Fahr über einen Punkt, um Modell und Wert zu sehen.
gemessenes ModellRekord bei ErscheinenRekordverlauf
Der leichte Test und der schwere Test
Beides ist Mathematik, beides vom selben Modell, beides von Epoch AI ausgewertet. Links Wettbewerbsaufgaben, wie sie in Schülerolympiaden vorkommen. Rechts eigens geschriebene, unveröffentlichte Aufgaben auf Forschungsniveau. Wenn du irgendwo liest, eine KI löse Mathematik nahezu vollständig, ist fast immer der linke Test gemeint.
Deshalb rechnet das Rekordbuch in Mathematik mit dem schweren Test. Der leichte trennt die Spitzenmodelle nicht mehr: 36 von 139 dort gemessenen Modellen liegen bei 90 Prozent oder darüber. Auf dem schweren Test hat das noch kein Modell geschafft.
Zwei Modelle im direkten Vergleich
Wähl zwei Modelle und sieh sie Disziplin für Disziplin nebeneinander. Gezählt wird nur, was bei beiden gemessen ist. Eine Schraffur heißt: dort fehlt der Lauf.
GPT-5.6 SolClaude Fable 5
82,9 %Mathematik87,8 %
93,5 %Wissenschaft85,9 %
nicht gemessenSoftwarenicht gemessen
71,6 %Faktentreue68,3 %
nicht gemessenAbstraktionnicht gemessen
GPT-5.6 Sol führt in 2 von 3 gemeinsam gemessenen Disziplinen, Claude Fable 5 in 1.
Alle aktuellen Modelle
Sortiert nach dem Epoch AI Capabilities Index, dem einen Gesamtindex, den wir übernehmen und zuschreiben; Modelle ohne Index stehen am Ende, neueste zuerst. Der Balkenstreifen zeigt die fünf Disziplinen in fester Reihenfolge. Ein schraffiertes Feld heißt, dass dieses Modell auf diesem Test nie gelaufen ist.
Zeile anklicken für Test, Prüfer und Zahl der Läufe
112 weitere Modelle, zu dünn gemessen für ein Profil
Diese Modelle stehen in den Quellen, aber auf weniger als 3 der fünf Tests. Ein Profil aus ein oder zwei Werten sagt nichts über die Form eines Modells, deshalb steht hier nur, worauf sie überhaupt gemessen wurden.
Für Mathematik gibt es in den Quellen vier Tests von sehr unterschiedlicher Schwere. Sie zu mitteln oder den besten Wert daraus zu nehmen, macht aus einer gelösten Forschungsaufgabe und einer gelösten Wettbewerbsaufgabe dieselbe Zahl. Wir binden jede Disziplin an genau einen Test und zeigen die anderen getrennt als das, was sie sind.
Was ein Rekord hier ist
Der beste veröffentlichte Lauf eines Modells auf dem Test der Disziplin, eingetragen am Erscheinungstag des Modells. Nur Modelle mit Datum kommen in die Reihe; die übrigen werden gezählt. Wird ein älteres Modell später besser nachgemessen, kann sich die Reihe rückwirkend ändern. Deshalb steht oben der Beobachtungszeitpunkt.
Kein eigener Score
Der gezeigte Index ist der Epoch AI Capabilities Index samt Konfidenzintervall. Wir reichen ihn weiter und schreiben ihn zu, statt eine konkurrierende Zahl zu erfinden. Einen Gesamtsieger über alle Disziplinen küren wir nicht.
Keine ergänzten Werte
Eine Disziplin ohne erfolgreichen öffentlichen Lauf bleibt leer und senkt die ausgewiesene Abdeckung. Nichts wird geschätzt, um eine Zeile zu füllen.
Wer gemessen hat, steht dabei
Jeder Test nennt seinen Prüfer. Epoch AI unterscheidet zwischen eigener Auswertung, Auswertung durch das Benchmark-Team und Selbstauskunft des Modellanbieters. Werte der letzten Art sind gekennzeichnet; auf dieser Seite gibt es derzeit keine.
Namen werden nie zusammengeführt
Ein Ergebnis aus einer zweiten Quelle wird nur bei exakter Namensgleichheit übernommen. Was keine exakte Entsprechung hat, bleibt draußen und wird gezählt, statt passend geraten zu werden. Deshalb ist die Disziplin Abstraktion dünn besetzt.
Ein Benchmark-Wert ist eine Momentaufnahme unter einem Testaufbau. Er belegt nicht, dass ein Modell intelligent, sicher oder für eine bestimmte Aufgabe geeignet ist.
Häufige Fragen
+Ist das ein IQ-Test?
Nein. Ein Sprachmodell hat keinen IQ im menschlichen Sinn, und wir berechnen auch keinen. Geführt wird ein Rekordbuch über fünf benannte Tests. Wo Epoch AI seinen Capabilities Index veröffentlicht, reichen wir ihn mit Konfidenzintervall weiter und schreiben ihn zu.
+Was zählt hier als Rekord?
Der beste veröffentlichte Lauf eines Modells auf dem einen Test der Disziplin, eingetragen am Erscheinungstag des Modells. Nur ein strikt besserer Wert bricht einen Rekord, Gleichstand nicht. Wird ein älteres Modell später besser nachgemessen, kann sich die Reihe rückwirkend ändern; die Seite nennt deshalb ihren Beobachtungszeitpunkt.
+Warum sind eure Mathematik-Werte niedriger als anderswo?
Weil wir den schweren Test zeigen. Für Mathematik stehen in den Quellen vier Tests von sehr unterschiedlicher Schwere. Auf den Wettbewerbsaufgaben erreichen mehrere Modelle 100 Prozent, auf den Forschungsaufgaben hat noch nie ein Modell 90 Prozent erreicht. Der leichte Test trennt die Spitze nicht mehr, deshalb rechnet das Rekordbuch mit dem schweren. Den leichten Wert findest du bei jedem Modell in den Details und im direkten Vergleich.
+Warum sind manche Felder schraffiert?
Weil es dort keinen erfolgreichen öffentlichen Lauf gibt. Die Lücke wird als Lücke gezeigt und senkt die ausgewiesene Abdeckung. Früher standen an solchen Stellen von uns ergänzte Werte, das haben wir entfernt.
+Warum kürt ihr keinen Gesamtsieger?
Weil jede Disziplin ihren eigenen Rekordhalter hat und die fünf Tests Verschiedenes messen. Jede Gesamtzahl müsste die Disziplinen gewichten, und diese Gewichtung wäre unsere Erfindung. Innerhalb einer Disziplin ist ein Rang dagegen belastbar, weil dort alle Modelle auf demselben Test gemessen wurden.
+Warum fehlen Modelle, von denen ich gehört habe?
Ein Modell braucht Werte auf mindestens drei der fünf Tests, um in der Modellliste zu stehen. Alle übrigen sind darunter namentlich aufgeführt, zusammen mit dem, worauf sie gemessen wurden. Modelle, die in keiner der beiden Quellen auftauchen, erscheinen gar nicht.
+Woher kommen die Werte?
Aus dem Benchmarking-Hub von Epoch AI und den Datendateien des ARC Prize. Beide sind offiziell, maschinenlesbar und erlauben den Abruf. Jede Zelle nennt ihren Test und wer ihn ausgewertet hat.
+Wie aktuell ist das?
Oben steht der Zeitpunkt der letzten Sammlung. Die Daten werden bei jeder Veröffentlichung der Seite neu erhoben; wir behaupten keinen festen Takt, den die Pipeline nicht einhält.
Quellen & Stand
Stand: 15. August 2026
Benchmark-Werte sind Momentaufnahmen unter einem Testaufbau. Sie belegen nicht, dass ein Modell intelligent, sicher oder für eine bestimmte Aufgabe geeignet ist.
Welches Modell passt zu deinem Anwendungsfall?
Ein Rekord entscheidet das nicht. Wir bringen das passende Modell in deinen Prozess und sagen dir, woran wir das festmachen.