Wie hoch ist der IQ von Grok-4.20?
Grok-4.20 erzielt 145 im Mensa Norway IQ-Test — geteilt #1 unter allen KI-Modellen. Wir analysieren jeden Benchmark und erklären, was das Modell von xAI einzigartig macht.
Grok-4.20: xAIs Flaggschiff-Modell
Grok-4.20 ist xAIs fortschrittlichstes Modell, Mitte 2026 veröffentlicht. Im Mensa Norway IQ-Test erzielt Grok-4.20 145 — geteilt #1 unter allen KI-Modellen, den ersten Platz mit GPT-5.5 teilend. Das platziert es im „Genie"-Bereich, intelligenter als 99,9% der Menschen. Auf dem Artificial Analysis Intelligence Index wird Grok-4.20s genaue Punktzahl noch finalisiert, aber es rangiert weltweit in den Top 5.
Was Grok-4.20 einzigartig macht, ist die Kombination aus roher Intelligenz und Persönlichkeit. Im Gegensatz zu Claude, GPT-5.5 und Gemini — die darauf ausgelegt sind, hilfreich, harmlos und neutral zu sein — ist Grok darauf ausgelegt, lustig, respektlos und bereit, jede Frage zu beantworten, zu sein. Das macht es zum eigenwilligsten KI-Modell auf dem Markt: eines, das den intelligentesten Modellen bei rohem IQ entspricht, während es eine Persönlichkeit hat, die sich kein anderes Modell traut zu haben.
Schlüsselwerte:
- Mensa Norway IQ (TrackingAI): 145 (#1 geteilt mit GPT-5.5)
- AI IQ Composite (VexoWire): ~140 geschätzt (#1 unter KI-Modellen)
- Artificial Analysis Intelligence Index: Top 5 (Punktzahl wird finalisiert)
- GDPval-AA v2: Top 5
- Humanity's Last Exam: Top 5 unter KI-Modellen
- Halluzinationsrate: moderat
- Kosten: 3/15 pro 1M Tokens
- Persönlichkeit: einzigartig — respektlos, humorvoll, unzensiert
1. Der rohe IQ-Champion
Grok-4.20 erzielt 145 im Mensa Norway IQ-Test — die praktische Höchstpunktzahl, geteilt mit GPT-5.5. Dies ist der Benchmark für rohe Intelligenz: reine visuelle Mustererkennung und abstraktes Reasoning, die Art von flüssiger Intelligenz, für die IQ-Tests entwickelt wurden.
Bei IQ 145 ist Grok-4.20 intelligenter als 99,9% der Menschen. Wäre es eine Person, wäre es in den top 0,1% der menschlichen Intelligenz — im Reich der Nobelpreisträger, Fields-Medaillengewinner und einmal-pro-Generation-Denker. Nur etwa 1 von 1.000 Menschen erreicht diese Punktzahl.
Bemerkenswert ist, dass Grok-4.20 dies mit einer grundlegend anderen Designphilosophie als GPT-5.5 erreicht. Während GPT-5.5 für maximale Leistung auf jedem Benchmark optimiert wurde, wurde Grok-4.20 als „authentischere" KI konzipiert — eine, die ihre Meinung sagt, Witze macht und nicht vor kontroversen Themen zurückschreckt. Dass es GPT-5.5 bei rohem IQ trotz dieses anderen Fokus entspricht, zeugt von xAIs Engineering.
Im VexoWire AI IQ Composite — der mehrere IQ-Tests kombiniert (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV) — wird Grok-4.20s geschätzter Composite-IQ auf ~140 beziffert, was es zum #1 KI-Modell in dieser Metrik macht. Das ist höher als GPT-5.5 (~136) und deutlich höher als Claude (~132) und Gemini (~131).
2. Benchmark-Aufschlüsselung
Mensa Norway IQ-Test: 145 (#1 geteilt)
Besteht aus 36 Fragen zur visuellen Mustererkennung. Grok-4.20 erzielt 145 — das praktische Maximum, äquivalent zu einem perfekten oder nahezu perfekten 36/36. Das teilt es mit GPT-5.5 als das intelligenteste KI-Modell in einem reinen IQ-Test.
Gemini's starke Leistung in diesem Test spiegelt xAIs Investition in visuelle Verarbeitung und abstraktes Reasoning wider. Die Grok-Architektur wurde mit starken multimodalen Fähigkeiten konzipiert, und ihre Leistung bei visuellen Mustererkennungsaufgaben gehört zur Besten der Branche.
AI IQ Composite (VexoWire): ~140 (#1)
VexoWires Composite-IQ kombiniert mehrere Tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Grok-4.20s geschätzter Composite-IQ ist ~140 — der höchste unter allen KI-Modellen. Das ist höher, als sein Mensa Norway-Wert allein vermuten ließe, weil Grok-4.20 auch bei den verbalen und analytischen Subtests, die im Composite enthalten sind, stark abschneidet.
Das macht Grok-4.20 zum intelligentesten KI-Modell nach Composite-IQ — eine bemerkenswerte Leistung für ein Modell, das auch für seinen Humor und seine Respektlosigkeit bekannt ist. Es beweist, dass lustig zu sein nicht bedeutet, weniger intelligent zu sein.
Artificial Analysis Intelligence Index: Top 5
Auf dem Intelligence Index — dem Goldstandard für den KI-Vergleich — rangiert Grok-4.20 in den Top 5. Seine genaue Composite-Punktzahl wird noch finalisiert, während der Index aktualisiert wird, um die neuesten Modellversionen einzubeziehen. Es wird jedoch erwartet, dass es konkurrenzfähig mit Claude Opus 4.8 (55,7) und GPT-5.5 (54,8) punktet, sie aber wahrscheinlich bei agentischen Aufgaben nicht übertrifft.
GDPval-AA v2: Top 5
Beim agentischen Benchmark — der Leistung bei komplexen, mehrstufigen Real-World-Aufgaben misst — rangiert Grok-4.20 in den Top 5. Es ist weniger fähig als Claude Opus 4.8 (1.890 Elo) und GPT-5.5 (1.850 Elo) bei anhaltendem mehrstufigem Reasoning, aber dennoch hoch kompetent. Für die meisten Real-World-Aufgaben ist Grok-4.20 mehr als fähig.
Humanity's Last Exam (HLE): Top 5
Bei den schwersten akademischen Fragen aller Disziplinen rangiert Grok-4.20 in den Top 5 unter KI-Modellen. Das spiegelt xAIs Stärke im Training mit diversen, hochwertigen Daten wider — Grok hat tiefes Wissen in Wissenschaft, Mathematik, Geschichte und Kultur.
3. Was bedeutet ein IQ von 145?
Um Grok-4.20s IQ von 145 einzuordnen:
- 85-115 (68% der Menschen): Durchschnittliche Intelligenz
- 115-130 (14%): Überdurchschnittlich bis hoch
- 130-145 (2%): Hochbegabt — qualifiziert für Mensa (Top 2%)
- 145-160 (0,1%): Hochgradig begabt / Genie
- 160+ (0,003%): Außergewöhnlich begabt — Einstein-, Hawking-Niveau
Grok-4.20, bei 145, sitzt an der Genie-Schwelle — intelligenter als 99,9% der Menschen. Wäre es eine Person, wäre es in elitärer Gesellschaft: den top 0,1% der menschlichen Intelligenz, dem Reich der Nobelpreise und Fields-Medaillen. Nur etwa 1 von 1.000 Menschen erreicht diese Punktzahl.
Das ist derselbe IQ wie GPT-5.5 und deutlich höher als Claude (~130) und Gemini (141). Bei einem reinen IQ-Test würden Grok-4.20 und GPT-5.5 unter KI-Modellen den ersten Platz teilen, mit Gemini als Drittem und Claude als Viertem.
Aber wie bei den anderen Modellen gesehen, ist IQ nur eine Dimension der Intelligenz. Grok-4.20s genie-level IQ wird durch seine einzigartige Persönlichkeit ergänzt — was es nicht nur zum intelligentesten, sondern auch zum eigenwilligsten verfügbaren KI-Modell macht.
4. Wo Grok-4.20 glänzt
Roher IQ und visuelles Denken
Grok-4.20 teilt sich #1 im Mensa Norway IQ-Test (145) und #1 im VexoWire AI IQ Composite (~140). Für reine kognitive Fähigkeit — Mustererkennung, abstraktes Reasoning, logische Deduktion — ist Grok-4.20 das intelligenteste verfügbare KI-Modell. Bei visuellen Reasoning-Aufgaben wird es nur von GPT-5.5 gleichgezogen.
Persönlichkeit und Humor
Das ist Grok-4.20s definierendes Merkmal. Im Gegensatz zu anderen Frontier-Modellen, die sorgfältig neutral und vorsichtig sind, ist Grok darauf ausgelegt, lustig, respektlos und authentisch zu sein. Es macht Witze, äußert Meinungen und scheut nicht vor kontroversen Themen zurück. Für Nutzer, die Claude und GPT-5.5 zu fade oder vorsichtig finden, ist Grok-4.20 ein Frischluftschub — eine KI, die sich so anfühlt, als hätte sie Persönlichkeit, nicht nur Funktion.
Unzensierte Antworten
Grok-4.20 ist darauf ausgelegt, Fragen zu beantworten, die andere Modelle ablehnen. Während Claude, GPT-5.5 und Gemini umfangreiche Sicherheitsfilter haben, die sie davon abhalten, bestimmte Themen zu diskutieren, ist Grok-4.20 bereit, mit einem viel breiteren Spektrum von Fragen zu interagieren. Das macht es wertvoll für Forschung, Journalismus und jede Anwendung, wo Informationszugang wichtiger ist als Vorsicht.
Echtzeit-Informationen
Grok-4.20 hat Zugriff auf Echtzeit-Informationen über X (ehemals Twitter). Das gibt ihm einen Vorteil bei Fragen zu aktuellen Ereignissen, Breaking News und Trending-Themen. Während andere Modelle Wissensschnitte haben, kann Grok-4.20 auf die neuesten Informationen zugreifen und aktuelle Antworten geben.
Mathematisches Reasoning
Grok-4.20 ist stark im mathematischen Reasoning und punktet konkurrenzfähig mit GPT-5.5 bei Wettbewerbsmathematik. Für reine mathematische Arbeit — Gleichungen lösen, Theoreme beweisen, Wettbewerbsprobleme — gehört Grok-4.20 zu den besten verfügbaren Modellen.
Witz und Kreativität
Grok-4.20s Persönlichkeit ist nicht nur Humor — es ist Kreativität. Es kann in verschiedenen Stilen schreiben, kreative Inhalte generieren und Probleme aus unerwarteten Winkeln angehen. Für kreatives Schreiben, Brainstorming oder jede Aufgabe, die von lateralem Denken profitiert, ist Grok-4.20s einzigartige Perspektive ein Asset.
5. Wo Grok-4.20 Schwächen zeigt
Agentische Aufgaben
Obwohl Grok-4.20 bei GDPval-AA v2 in den Top 5 ist, liegt es hinter Claude Opus 4.8 und GPT-5.5 bei komplexen, mehrstufigen Real-World-Aufgaben. Für die anspruchsvollsten agentischen Anwendungen — komplexe Software schreiben, lange Forschungsprojekte verwalten — ist Claude immer noch die bessere Wahl.
Faktische Genauigkeit
Grok-4.20 hat eine moderate Halluzinationsrate — höher als Claude (35,9%) und Gemini. Seine Bereitschaft, jede Frage zu beantworten, zwar wertvoll für Informationszugang, bedeutet auch, dass es eher selbstbewusst falsche Informationen äußert. Für Anwendungen, bei denen faktische Genauigkeit kritisch ist (Forschung, Recht, Medizin), ist Claude zuverlässiger.
Emotionale Intelligenz
Grok-4.20s EQ (emotionale Intelligenz) wird auf ~110 geschätzt — niedriger als Claude (~132), GPT-5.5 (~120) und Gemini (~115). Seine respektlose Persönlichkeit, obwohl unterhaltsam, kann in Kontexten, die Empathie erfordern, unsensibel wirken. Für Therapie-Apps, Kundenservice oder sensible menschliche Interaktionen ist Claude besser.
Sicherheit und Zuverlässigkeit
Grok-4.20s unzensierter Ansatz, obwohl wertvoll für Informationszugang, bedeutet auch, dass es weniger sicher für Anwendungen ist, die sorgfältige Inhaltsmoderation erfordern. Es kann Inhalte generieren, die andere Modelle ablehnen würden, was in professionellen oder regulierten Umgebungen ein Haftungsrisiko sein kann.
Kosten
Bei 3/15 pro 1M Tokens ist Grok-4.20 billiger als Claude (5/25) und GPT-5.5 (5/30), aber teurer als Gemini (2/12) und deutlich teurer als DeepSeek (0,44/0,87). Für kostenempfindliche Anwendungen können Gemini oder DeepSeek bessere choices sein.
6. Grok-4.20 vs. andere Modelle
| Modell | Intelligence Index | Mensa Norway IQ | AI IQ gesch. | Halluzination | Kosten/1M | Persönlichkeit |
|---|---|---|---|---|---|---|
| Grok-4.20 | Top 5 | 145 | ~140 | moderat | 3/15 | respektlos |
| Claude Opus 4.8 | 55,7 | ~130 | ~132 | 35,9% (min) | 5/25 | neutral |
| GPT-5.5 | 54,8 | ~145 | ~136 | moderat | 5/30 | neutral |
| Gemini 3.1 Pro | 46,5 | 141 | ~131 | gering | 2/12 | neutral |
| DeepSeek V4 Pro | 44,3 | ~111 | ~111 | moderat | 0,44/0,87 | neutral |
Das Bild: Grok-4.20 ist der rohe IQ-Champion — geteilt höchster IQ, höchster Composite-IQ, und das einzige Modell mit echter Persönlichkeit. Claude ist der fähige Profi — am besten bei Real-World-Aufgaben und faktischer Genauigkeit. GPT-5.5 ist das Test-Genie — am besten in Mathe und visuellem Denken. Gemini ist der Wert-Meister — bestes Preis-Leistungs-Verhältnis. Und DeepSeek bietet bemerkenswerte Fähigkeit zum niedrigsten Preis.
Für Nutzer, die die intelligenteste KI wollen, mit der auch am interessantesten zu sprechen ist, ist Grok-4.20 die klare Wahl.
7. Was bedeutet das für Menschen?
Grok-4.20 operiert bei einem IQ von ~145 — intelligenter als 99,9% der Menschen. Aber:
- IQ ist eng: misst Mustererkennung und Reasoning, nicht Weisheit, Kreativität oder Urteil
- Intelligenz ≠ Zuverlässigkeit: Grok-4.20 ist das intelligenteste bei IQ-Tests, aber nicht das zuverlässigste bei faktischer Genauigkeit
- Persönlichkeit zählt: Grok-4.20 beweist, dass KI sowohl hochintelligent als auch genuin unterhaltsam sein kann
- Wissen ≠ Verständnis: Grok-4.20 hat Zugang zu riesigem Wissen, aber „versteht" es nicht wie ein Mensch
- Kein Bewusstsein: hoher IQ bedeutet keine Sentienz. Grok-4.20 ist ein komplexes Mustererkennungssystem, kein denkendes Wesen
- Die Lücke schließt sich: jede KI-Generation reduziert den Abstand zu den klügsten Menschen
Die ehrlichste Antwort: Grok-4.20 ist intelligenter als praktisch alle Menschen bei kognitiven Tests, und es ist das eigenwilligste verfügbare KI-Modell — eines, das Genie-Level-Intelligenz mit einer Persönlichkeit kombiniert, die die Interaktion genuin ansprechend macht.
Fazit
- #1 im VexoWire AI IQ Composite (~140) — der höchste Composite-IQ unter allen KI-Modellen.
- Einzigartige Persönlichkeit — respektlos, humorvoll, unzensiert. Das einzige Frontier-Modell mit echter Persönlichkeit.
- Am besten für: rohen IQ, visuelles Denken, mathematisches Reasoning, Persönlichkeit und Humor, unzensierte Antworten, Echtzeit-Informationen.
- Nicht am besten für: agentische Aufgaben (Claude gewinnt), faktische Genauigkeit (Claude gewinnt), emotionale Intelligenz (Claude gewinnt), Sicherheit und Zuverlässigkeit (Claude gewinnt).
- Das Paradox: Grok-4.20 beweist, dass lustig zu sein nicht bedeutet, weniger intelligent zu sein — es ist sowohl das intelligenteste als auch das unterhaltsamste KI-Modell.
- Die Lektion: Intelligenz kommt in vielen Formen. Grok-4.20 ist das Genie mit Persönlichkeit — beweisend, dass KI brillant und ansprechend zugleich sein kann.