KI-IQ

Das Rekordbuch der KI

Statt einer Rangliste führen wir ein Rekordbuch: fünf Disziplinen, je ein benannter Test. Hier siehst du, wer den Bestwert hält, seit wann er steht, wer ihn davor hielt und wie schnell die Rekorde fallen. Jeder Wert stammt von einem unabhängigen Prüfer, und was nie gemessen wurde, bleibt eine Lücke.

5Disziplinen
22Rekordwechsel in 12 Monaten
31Tage seit dem letzten Rekord
167Modelle in den Quellen

Stand: 15. August 2026

Die aktuellen Rekorde

Ein Rekord ist der beste veröffentlichte Lauf auf dem einen Test der Disziplin, eingetragen an dem Tag, an dem das Modell erschien. Kein Mittelwert über verschieden schwere Prüfungen, keine Auswahl des besten Werts aus mehreren Tests.

Am häufigsten wechselte der Rekord zuletzt in Mathematik. Am längsten hält er in Faktentreue.

Mathematik

FrontierMath Tier 4 (v2) ↗

Eigens geschriebene, unveröffentlichte Aufgaben auf Forschungsniveau. Der einzige Mathematiktest in den Quellen, an dem sich Spitzenmodelle noch unterscheiden.

Claude Fable 587,8 %

Rekord seit 9. Juni 2026 · hält seit 67 Tagen

davor GPT-5.5 Pro mit 78,0 %

Verfolger heuteGPT-5.6 Sol · 82,9 %GPT-5.5 Pro · 78,0 %
46 Modelle gemessenvon Epoch AI ausgewertet1 ohne Veröffentlichungsdatum außen vor

Wissenschaft

GPQA Diamond ↗

Fragen aus Biologie, Physik und Chemie, die Fachleute mit Suchmaschine mehrheitlich nicht lösen.

GPT-5.4 Pro94,6 %

Rekord seit 5. März 2026 · hält seit 163 Tagen

davor Gemini 3.1 Pro mit 94,4 %

Verfolger heuteGemini 3.1 Pro · 94,4 %Gemini 3.6 Flash · 94,1 %
162 Modelle gemessenvon Epoch AI ausgewertet2 ohne Veröffentlichungsdatum außen vor

Software

SWE-bench Verified ↗

Echte, dokumentierte Fehler in echten Open-Source-Projekten. Bestanden gilt nur, wenn die Testsuite danach durchläuft.

Claude Opus 4.783,5 %

Rekord seit 16. April 2026 · hält seit 121 Tagen

davor Claude Opus 4.6 mit 78,7 %

Verfolger heuteGPT-5.5 · 80,6 %Gemini 3.5 Flash · 79,3 %
32 Modelle gemessenvon Epoch AI ausgewertet1 ohne Veröffentlichungsdatum außen vor

Faktentreue

SimpleQA Verified ↗

Kurze Faktenfragen mit genau einer richtigen Antwort. Ein erfundener Wert zählt schlechter als ein Eingeständnis von Unwissen.

Gemini 3.1 Pro77,3 %

Rekord seit 19. Februar 2026 · hält seit 177 Tagen

davor Gemini 3 Pro mit 72,9 %

Verfolger heuteGemini 3 Pro · 72,9 %GPT-5.6 Sol · 71,6 %
66 Modelle gemessenvon Epoch AI ausgewertet1 ohne Veröffentlichungsdatum außen vor

Abstraktion

ARC-AGI-2 ↗

Neuartige visuelle Muster, die so nicht im Training vorkamen. Menschen lösen sie zuverlässig, Modelle bisher kaum.

Inkling36,5 %

Rekord seit 15. Juli 2026 · hält seit 31 Tagen

davor Gemini 3 Pro mit 31,1 %

Verfolger heuteGemini 3 Pro · 31,1 %GLM-5.2 · 22,8 %
20 Modelle gemessenvom Benchmark-Team ausgewertet

Jeder Punkt ein Modell, die Treppe der Rekord

Waagerecht das Erscheinungsdatum, senkrecht der Wert auf dem Test der gewählten Disziplin. Die Linie steigt genau dann, wenn ein neues Modell den Bestwert überbietet. Fahr über einen Punkt, um Modell und Wert zu sehen.

0255075100202420252026o3-mini · 0,0 % · 31. Januar 2025o4-mini · 4,9 % · 16. April 2025Gemini 2.5 Pro (Jun 2025) · 0,0 % · 17. Juni 2025Claude Opus 4.1 · 2,4 % · 5. August 2025GPT-5 mini · 12,2 % · 7. August 2025GPT-5 nano · 2,4 % · 7. August 2025Claude Sonnet 4.5 · 2,4 % · 29. September 2025GPT-5 Pro · 19,5 % · 7. Oktober 2025Claude Opus 4.5 · 4,9 % · 24. November 2025GPT-5.2 · 31,7 % · 11. Dezember 2025GPT-5.2 Pro · 46,0 % · 11. Dezember 2025Gemini 3 Flash · 17,1 % · 17. Dezember 2025Claude Opus 4.6 · 26,8 % · 5. Februar 2026Grok 4.20 · 17,1 % · 17. Februar 2026Gemini 3.1 Pro · 26,8 % · 19. Februar 2026GPT-5.4 · 49,0 % · 5. März 2026GPT-5.4 Pro · 58,5 % · 5. März 2026GPT-5.4 Mini · 9,8 % · 17. März 2026GPT-5.4 Nano · 12,2 % · 17. März 2026Claude Opus 4.7 · 31,7 % · 16. April 2026Grok 4.3 Beta · 14,6 % · 17. April 2026Kimi K2.6 · 25,6 % · 20. April 2026GPT-5.5 · 72,5 % · 23. April 2026GPT-5.5 Pro · 78,0 % · 23. April 2026DeepSeek-V4-Pro · 2,4 % · 24. April 2026GPT-5.5 Instant · 2,4 % · 5. Mai 2026AI Co-Mathematician · 75,6 % · 8. Mai 2026Gemini 3.5 Flash · 26,8 % · 19. Mai 2026Qwen3.7-Max · 34,1 % · 19. Mai 2026Claude Opus 4.8 · 56,1 % · 28. Mai 2026Claude Fable 5 · 87,8 % · 9. Juni 2026Kimi K2.7 Code · 12,2 % · 12. Juni 2026GLM-5.2 · 29,3 % · 16. Juni 2026Claude Sonnet 5 · 29,3 % · 30. Juni 2026Grok 4.5 · 24,4 % · 8. Juli 2026GPT-5.6 Luna · 61,0 % · 9. Juli 2026GPT-5.6 Sol · 82,9 % · 9. Juli 2026GPT-5.6 Terra · 70,7 % · 9. Juli 2026Inkling · 4,9 % · 15. Juli 2026Kimi K3 · 39,0 % · 16. Juli 2026Gemini 3.5 Flash-Lite · 0,0 % · 21. Juli 2026Gemini 3.6 Flash · 22,0 % · 21. Juli 2026Claude Opus 5 · 73,2 % · 24. Juli 2026DeepSeek V4 Flash 0731 · 24,4 % · 31. Juli 2026Qwen 3.8 Max · 46,3 % · 2. August 2026Claude Fable 5 · 87,8 %

gemessenes ModellRekord bei ErscheinenRekordverlauf

Der leichte Test und der schwere Test

Beides ist Mathematik, beides vom selben Modell, beides von Epoch AI ausgewertet. Links Wettbewerbsaufgaben, wie sie in Schülerolympiaden vorkommen. Rechts eigens geschriebene, unveröffentlichte Aufgaben auf Forschungsniveau. Wenn du irgendwo liest, eine KI löse Mathematik nahezu vollständig, ist fast immer der linke Test gemeint.

Wettbewerbsaufgaben OTIS Mock AIME 2024-2025 ↗Forschungsaufgaben FrontierMath Tier 4 (v2) ↗
  • Qwen 3.8 MaxAlibaba99,4 %46,3 %53,1Abstand
  • DeepSeek V4 Flash 0731DeepSeek94,4 %24,4 %70,0Abstand
  • Claude Opus 5Anthropic98,9 %73,2 %25,7Abstand
  • Gemini 3.5 Flash-LiteGoogle DeepMind71,1 %0,0 %71,1Abstand
  • Gemini 3.6 FlashGoogle DeepMind94,2 %22,0 %72,2Abstand
  • Kimi K3Moonshot97,2 %39,0 %58,2Abstand
  • InklingThinking Machines88,9 %4,9 %84,0Abstand
  • GPT-5.6 LunaOpenAI98,3 %61,0 %37,3Abstand

Deshalb rechnet das Rekordbuch in Mathematik mit dem schweren Test. Der leichte trennt die Spitzenmodelle nicht mehr: 36 von 139 dort gemessenen Modellen liegen bei 90 Prozent oder darüber. Auf dem schweren Test hat das noch kein Modell geschafft.

Zwei Modelle im direkten Vergleich

Wähl zwei Modelle und sieh sie Disziplin für Disziplin nebeneinander. Gezählt wird nur, was bei beiden gemessen ist. Eine Schraffur heißt: dort fehlt der Lauf.

GPT-5.6 SolClaude Fable 5
82,9 %Mathematik87,8 %
93,5 %Wissenschaft85,9 %
nicht gemessenSoftwarenicht gemessen
71,6 %Faktentreue68,3 %
nicht gemessenAbstraktionnicht gemessen

GPT-5.6 Sol führt in 2 von 3 gemeinsam gemessenen Disziplinen, Claude Fable 5 in 1.

Alle aktuellen Modelle

Sortiert nach dem Epoch AI Capabilities Index, dem einen Gesamtindex, den wir übernehmen und zuschreiben; Modelle ohne Index stehen am Ende, neueste zuerst. Der Balkenstreifen zeigt die fünf Disziplinen in fester Reihenfolge. Ein schraffiertes Feld heißt, dass dieses Modell auf diesem Test nie gelaufen ist.

Anbieter

1Mathematik2Wissenschaft3Software4Faktentreue5Abstraktion

Zeile anklicken für Test, Prüfer und Zahl der Läufe

112 weitere Modelle, zu dünn gemessen für ein Profil

Diese Modelle stehen in den Quellen, aber auf weniger als 3 der fünf Tests. Ein Profil aus ein oder zwei Werten sagt nichts über die Form eines Modells, deshalb steht hier nur, worauf sie überhaupt gemessen wurden.

  • Grok 4.6Wissenschaft, Faktentreue
  • Qwen3.7 FlashWissenschaft
  • Gemini 3.5 Flash-LiteMathematik, Wissenschaft
  • Qwen3.7-PlusWissenschaft
  • MiniMax-M3Wissenschaft
  • AI Co-MathematicianMathematik
  • Qwen 3.6 FlashWissenschaft, Faktentreue
  • Qwen3.6 27BWissenschaft
  • Qwen 3.6 35B-A3BWissenschaft
  • Muse SparkWissenschaft, Faktentreue
  • Gemma 4 31B ITWissenschaft, Faktentreue
  • Gemini 3.1 Flash-LiteWissenschaft
  • Qwen 3.5 Flash (hosted 35B-A3B)Wissenschaft, Faktentreue
  • Qwen 3.5 Plus (hosted 397B-A17B)Wissenschaft, Faktentreue
  • Qwen3.5 397B-A17BWissenschaft
  • GPT-5.3 CodexSoftware
  • GLM-4.7Wissenschaft, Faktentreue
  • GPT-5.2 ProMathematik
  • DeepSeek-V3.2Wissenschaft, Faktentreue
  • Kimi K2 ThinkingWissenschaft, Faktentreue
  • GPT-5 ProMathematik, Abstraktion
  • Qwen3-MaxWissenschaft, Faktentreue
  • Qwen3-235B-A22B (Jul 2025)Wissenschaft, Faktentreue
  • gpt-oss-120bWissenschaft, Faktentreue
  • gpt-oss-20bWissenschaft
  • Grok 4Wissenschaft, Faktentreue
  • Magistral Small 1.0Wissenschaft
  • DeepSeek-R1 (May 2025)Wissenschaft, Faktentreue
  • Claude Sonnet 4Wissenschaft, Abstraktion
  • Mistral Medium 3Wissenschaft
  • Gemini 2.5 Pro (May 2025)Wissenschaft
  • Qwen3-235B-A22BWissenschaft
  • GPT-4.1 miniWissenschaft
  • GPT-4.1 nanoWissenschaft
  • Grok 3Wissenschaft, Abstraktion
  • Grok-3 miniWissenschaft, Faktentreue
  • QWQ-PlusWissenschaft
  • Llama 4 MaverickWissenschaft, Abstraktion
  • Llama 4 ScoutWissenschaft, Abstraktion
  • Gemini 2.5 Pro (Mar 2025)Wissenschaft
  • DeepSeek-V3 (Mar 2025)Wissenschaft
  • Mistral Small 3.1Wissenschaft
  • Gemma 3 27BWissenschaft
  • GPT-4.5Wissenschaft, Abstraktion
  • Claude 3.7 SonnetWissenschaft, Software
  • Gemini 2.0 FlashWissenschaft, Abstraktion
  • Gemini 2.0 ProWissenschaft
  • o3-miniMathematik, Wissenschaft
  • Qwen2.5-MaxWissenschaft
  • Mistral Small 3Wissenschaft
  • Qwen PlusWissenschaft
  • Gemini 2.0 Flash ThinkingWissenschaft
  • DeepSeek-R1Wissenschaft
  • DeepSeek-R1-Distill-Llama-70BWissenschaft
  • DeepSeek-R1-Distill-Qwen-14BWissenschaft
  • Eurus-2-7B-PRIMEWissenschaft
  • DeepSeek-V3Wissenschaft
  • o1Wissenschaft
  • Grok-2Wissenschaft
  • Phi-4Wissenschaft
  • Llama 3.3 70BWissenschaft
  • Tulu 3 (Tülu 3) 70BWissenschaft
  • Qwen-TurboWissenschaft
  • Claude 3.5 HaikuWissenschaft, Faktentreue
  • Claude 3.5 Sonnet (October 2024)Wissenschaft
  • Ministral 3BWissenschaft
  • Ministral 8BWissenschaft
  • Gemini 1.5 Flash 8BWissenschaft
  • Llama 3.2 90BWissenschaft
  • Qwen2.5-72BWissenschaft
  • Qwen2.5-32BWissenschaft
  • o1-miniWissenschaft, Abstraktion
  • o1-previewWissenschaft
  • Mistral Large 2Wissenschaft
  • Llama 3.1-405BWissenschaft
  • Llama 3.1-70BWissenschaft
  • Llama 3.1-8BWissenschaft
  • GPT-4o miniWissenschaft
  • Mistral NeMoWissenschaft
  • Gemma 2 27BWissenschaft
  • Claude 3.5 SonnetWissenschaft
  • Hermes 2 Theta Llama-3 70BWissenschaft
  • Qwen2-72BWissenschaft
  • Gemini 1.5 FlashWissenschaft
  • Yi-1.5-34BWissenschaft
  • phi-3-medium 14BWissenschaft
  • Llama 3-70BWissenschaft
  • Llama 3-8BWissenschaft
  • Mixtral 8x22BWissenschaft
  • WizardLM-2 8x22BWissenschaft
  • GPT-4 Turbo (Apr 2024)Wissenschaft
  • DBRXWissenschaft
  • Claude 3 HaikuWissenschaft
  • Claude 3 OpusWissenschaft
  • Claude 3 SonnetWissenschaft
  • Mistral LargeWissenschaft
  • Gemini 1.5 ProWissenschaft, Abstraktion
  • Qwen1.5-32BWissenschaft
  • Qwen1.5-72BWissenschaft
  • Gemini 1.0 ProWissenschaft
  • Mixtral 8x7BWissenschaft
  • DeepSeek LLM 67BWissenschaft
  • Claude 2.1Wissenschaft
  • GPT-4 Turbo (Nov 2023)Wissenschaft
  • Yi-34BWissenschaft
  • Mistral 7BWissenschaft
  • Llama 2-70BWissenschaft
  • Claude 2Wissenschaft
  • GPT-3.5 TurboWissenschaft
  • GPT-4 (Jun 2023)Wissenschaft
  • GPT-4 (Mar 2023)Wissenschaft
  • Gemma 2 9BWissenschaft

Wie das entsteht und was es nicht behauptet

  • Eine Disziplin, ein Test

    Für Mathematik gibt es in den Quellen vier Tests von sehr unterschiedlicher Schwere. Sie zu mitteln oder den besten Wert daraus zu nehmen, macht aus einer gelösten Forschungsaufgabe und einer gelösten Wettbewerbsaufgabe dieselbe Zahl. Wir binden jede Disziplin an genau einen Test und zeigen die anderen getrennt als das, was sie sind.

  • Was ein Rekord hier ist

    Der beste veröffentlichte Lauf eines Modells auf dem Test der Disziplin, eingetragen am Erscheinungstag des Modells. Nur Modelle mit Datum kommen in die Reihe; die übrigen werden gezählt. Wird ein älteres Modell später besser nachgemessen, kann sich die Reihe rückwirkend ändern. Deshalb steht oben der Beobachtungszeitpunkt.

  • Kein eigener Score

    Der gezeigte Index ist der Epoch AI Capabilities Index samt Konfidenzintervall. Wir reichen ihn weiter und schreiben ihn zu, statt eine konkurrierende Zahl zu erfinden. Einen Gesamtsieger über alle Disziplinen küren wir nicht.

  • Keine ergänzten Werte

    Eine Disziplin ohne erfolgreichen öffentlichen Lauf bleibt leer und senkt die ausgewiesene Abdeckung. Nichts wird geschätzt, um eine Zeile zu füllen.

  • Wer gemessen hat, steht dabei

    Jeder Test nennt seinen Prüfer. Epoch AI unterscheidet zwischen eigener Auswertung, Auswertung durch das Benchmark-Team und Selbstauskunft des Modellanbieters. Werte der letzten Art sind gekennzeichnet; auf dieser Seite gibt es derzeit keine.

  • Namen werden nie zusammengeführt

    Ein Ergebnis aus einer zweiten Quelle wird nur bei exakter Namensgleichheit übernommen. Was keine exakte Entsprechung hat, bleibt draußen und wird gezählt, statt passend geraten zu werden. Deshalb ist die Disziplin Abstraktion dünn besetzt.

Ein Benchmark-Wert ist eine Momentaufnahme unter einem Testaufbau. Er belegt nicht, dass ein Modell intelligent, sicher oder für eine bestimmte Aufgabe geeignet ist.

Häufige Fragen

Ist das ein IQ-Test?
Nein. Ein Sprachmodell hat keinen IQ im menschlichen Sinn, und wir berechnen auch keinen. Geführt wird ein Rekordbuch über fünf benannte Tests. Wo Epoch AI seinen Capabilities Index veröffentlicht, reichen wir ihn mit Konfidenzintervall weiter und schreiben ihn zu.
Was zählt hier als Rekord?
Der beste veröffentlichte Lauf eines Modells auf dem einen Test der Disziplin, eingetragen am Erscheinungstag des Modells. Nur ein strikt besserer Wert bricht einen Rekord, Gleichstand nicht. Wird ein älteres Modell später besser nachgemessen, kann sich die Reihe rückwirkend ändern; die Seite nennt deshalb ihren Beobachtungszeitpunkt.
Warum sind eure Mathematik-Werte niedriger als anderswo?
Weil wir den schweren Test zeigen. Für Mathematik stehen in den Quellen vier Tests von sehr unterschiedlicher Schwere. Auf den Wettbewerbsaufgaben erreichen mehrere Modelle 100 Prozent, auf den Forschungsaufgaben hat noch nie ein Modell 90 Prozent erreicht. Der leichte Test trennt die Spitze nicht mehr, deshalb rechnet das Rekordbuch mit dem schweren. Den leichten Wert findest du bei jedem Modell in den Details und im direkten Vergleich.
Warum sind manche Felder schraffiert?
Weil es dort keinen erfolgreichen öffentlichen Lauf gibt. Die Lücke wird als Lücke gezeigt und senkt die ausgewiesene Abdeckung. Früher standen an solchen Stellen von uns ergänzte Werte, das haben wir entfernt.
Warum kürt ihr keinen Gesamtsieger?
Weil jede Disziplin ihren eigenen Rekordhalter hat und die fünf Tests Verschiedenes messen. Jede Gesamtzahl müsste die Disziplinen gewichten, und diese Gewichtung wäre unsere Erfindung. Innerhalb einer Disziplin ist ein Rang dagegen belastbar, weil dort alle Modelle auf demselben Test gemessen wurden.
Warum fehlen Modelle, von denen ich gehört habe?
Ein Modell braucht Werte auf mindestens drei der fünf Tests, um in der Modellliste zu stehen. Alle übrigen sind darunter namentlich aufgeführt, zusammen mit dem, worauf sie gemessen wurden. Modelle, die in keiner der beiden Quellen auftauchen, erscheinen gar nicht.
Woher kommen die Werte?
Aus dem Benchmarking-Hub von Epoch AI und den Datendateien des ARC Prize. Beide sind offiziell, maschinenlesbar und erlauben den Abruf. Jede Zelle nennt ihren Test und wer ihn ausgewertet hat.
Wie aktuell ist das?
Oben steht der Zeitpunkt der letzten Sammlung. Die Daten werden bei jeder Veröffentlichung der Seite neu erhoben; wir behaupten keinen festen Takt, den die Pipeline nicht einhält.

Quellen & Stand

Stand: 15. August 2026

Benchmark-Werte sind Momentaufnahmen unter einem Testaufbau. Sie belegen nicht, dass ein Modell intelligent, sicher oder für eine bestimmte Aufgabe geeignet ist.

Welches Modell passt zu deinem Anwendungsfall?

Ein Rekord entscheidet das nicht. Wir bringen das passende Modell in deinen Prozess und sagen dir, woran wir das festmachen.