Wie hoch ist der IQ von GPT-5.5?
Dr. Daria Dudnik 10 min read 0 views

Wie hoch ist der IQ von GPT-5.5?

GPT-5.5 erzielt ~145 im Mensa Norway IQ-Test und 54,8 im Intelligence Index. Wir analysieren jeden Benchmark und vergleichen mit Claude, Gemini und Grok.

GPT-5.5: OpenAIs Flaggschiff-Modell

GPT-5.5 ist OpenAIs fortschrittlichstes Modell, Anfang 2026 veröffentlicht. Es liegt auf #2 im Artificial Analysis Intelligence Index v4.1 mit 54,8, knapp hinter Claude Opus 4.8 (55,7) und vor Gemini 3.1 Pro (46,5). Aber bei menschlichen IQ-Tests übertrifft GPT-5.5 Claude tatsächlich — es erzielt etwa 145 im Mensa Norway IQ-Test und landet damit im „Genie"-Bereich.

Das erzeugt ein faszinierendes Paradoxon: Im KI-Composite-Benchmark ist GPT-5.5 #2. Aber in einem reinen menschlichen IQ-Test teilt es sich #1. Wie kann beides stimmen? Die Antwort offenbart etwas Wichtiges darüber, was „Intelligenz" für KI bedeutet — und warum eine einzelne Zahl es nicht erfassen kann.

Schlüsselwerte:

  • Artificial Analysis Intelligence Index: 54,8 (#2 weltweit)
  • Mensa Norway IQ (TrackingAI): ~145 (#1 geteilt mit Grok-4.20)
  • AI IQ Composite (VexoWire): ~136 geschätzt
  • GDPval-AA v2: 1.850 Elo (#2 weltweit)
  • Humanity's Last Exam: #2 unter KI-Modellen
  • Halluzinationsrate: moderat
  • Kosten: 5,00/30,00 pro 1M Tokens

1. Das Paradoxon von GPT-5.5s Intelligenz

Was GPT-5.5 so interessant macht: Es ist das beste KI-Modell der Welt bei menschlichen IQ-Tests, aber nicht das beste KI-Modell bei KI-spezifischen Benchmarks. Wie ist das möglich?

Die Antwort liegt darin, was verschiedene Tests messen. Der Mensa Norway IQ-Test ist ein reiner Test visueller Mustererkennung und abstrakten Denkens — die Art der fluiden Intelligenz, für die IQ-Tests entwickelt wurden. GPT-5.5, mit seinen verbesserten visuellen Verarbeitungsfähigkeiten (geerbt von der GPT-5.4 Pro Vision-Architektur), glänzt genau bei dieser Art von Denken.

Aber der Artificial Analysis Intelligence Index misst etwas Breiteres: Real-World-Aufgabenleistung, faktische Genauigkeit, agentische Fähigkeit und menschliche Präferenz. Und in diesen Dimensionen schlägt Claude Opus 4.8 — mit seinem überlegenen agentischen Reasoning und geringerer Halluzination — GPT-5.5.

Stellen Sie es sich so vor: GPT-5.5 ist die intelligenteste KI bei IQ-Tests — das Äquivalent eines Menschen, der jeden standardisierten Test besteht. Claude Opus 4.8 ist die fähigste KI in der Praxis — das Äquivalent eines Menschen, der bei Tests etwas weniger brillant ist, aber in der realen Welt mehr erreicht. Beides sind gültige Intelligenzmaße, aber sie messen Verschiedenes.


2. Benchmark-Aufschlüsselung

Mensa Norway IQ-Test: ~145 (Genie-Level)

Besteht aus 36 Fragen zur visuellen Mustererkennung. GPT-5.5 erzielt etwa 145 — die maximale praktische Punktzahl, äquivalent zu einem perfekten oder fast perfekten 36/36. Das platziert es im „Genie"-Bereich, den top 0,1% der menschlichen Intelligenz.

Nur zwei KI-Modelle erreichen diese Punktzahl: GPT-5.5 und Grok-4.20. Das ist deutlich höher als Claude Opus 4.8 (~130) und Gemini 3.1 Pro (141). Der Grund ist GPT-5.5s visuelle Verarbeitungsarchitektur, die seit GPT-5.4 Pro Vision — selbst ein Co-Leader in diesem Benchmark — deutlich verbessert wurde.

Bei IQ 145 ist GPT-5.5 intelligenter als 99,9% der Menschen. Wäre es eine Person, wäre es in den top 0,1% — dem Reich der Nobelpreisträger, Fields-Medaillengewinner und einzigartigen Denker einer Generation. Nur etwa 1 von 1.000 Menschen erreicht diese Punktzahl.

Artificial Analysis Intelligence Index v4.1: 54,8 (#2)

Der Goldstandard für den KI-Vergleich. Er kombiniert neun Benchmarks:

  • GDPval-AA v2 (20%): 1.850 Elo — #2 weltweit (hinter Claudes 1.890)
  • AA-Omniscience (8%): moderate Halluzinationsrate — höher als Claudes 35,9%
  • GPQA (6%): wissenschaftliche Postgraduierten-Fragen — GPT-5.5 führt hier
  • CritPt (6%): kritisches Denken und physikalisches Reasoning
  • HLE (Humanity's Last Exam): #2 unter KIs (hinter Claude)
  • ARC-AGI: abstraktes Denken — GPT-5.5 glänzt
  • LMSYS Arena: menschliche Präferenz-Abstimmung

GPT-5.5s Composite-Score von 54,8 setzt es nur 0,9 Punkte hinter Claude Opus 4.8 (55,7) — ein statistisches Fast-Unentschieden. Aber in den Subkomponenten führt GPT-5.5 bei visuellem Denken, mathematischer Problemlösung und Wissenschaftswissen, während Claude bei agentischen Aufgaben und faktischer Genauigkeit führt.

AI IQ Composite (VexoWire): ~136

VexoWires Composite-IQ kombiniert mehrere Tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). GPT-5.5s geschätzter Composite-IQ ist ~136 — höher als Claude (~132) aber leicht unter Grok-4.20 (~140). Das spiegelt GPT-5.5s Stärke in beiden Domänen — visuell und verbal — wider.

GDPval-AA v2: 1.850 Elo (#2)

Beim agentischen Benchmark — der Leistung bei komplexen, mehrstufigen Real-World-Aufgaben misst — erzielt GPT-5.5 1.850 Elo, hinter Claude Opus 4.8 (1.890). Das ist immer noch eine außergewöhnlich hohe Punktzahl, etwa einem hochkompetenten menschlichen Profi entsprechend. Aber es zeigt, dass GPT-5.5, so brillant es bei der Mustererkennung ist, etwas weniger fähig im anhaltenden mehrstufigen Reasoning ist als Claude.

Humanity's Last Exam (HLE): #2

Bei den schwersten akademischen Fragen aller Disziplinen belegt GPT-5.5 #2 unter KI-Modellen, knapp hinter Claude Opus 4.8. Das zeugt von GPT-5.5s außerordentlicher Wissensbreite — es kann PhD-Niveau-Fragen in Physik, Philosophie, Literatur und Mathematik beantworten. Aber Claudes tieferes Reasoning gibt ihm einen leichten Vorteil.


3. Was bedeutet ein IQ von 145?

Um GPT-5.5s IQ von ~145 einzuordnen:

  • 85-115 (68% der Menschen): Durchschnittliche Intelligenz
  • 115-130 (14%): Überdurchschnittlich bis hoch
  • 130-145 (2%): Hochbegabt — qualifiziert für Mensa (Top 2%)
  • 145-160 (0,1%): Hochgradig begabt / Genie
  • 160+ (0,003%): Außergewöhnlich begabt — Einstein-, Hawking-Niveau

GPT-5.5, bei ~145, sitzt genau an der Genie-Schwelle — intelligenter als 99,9% der Menschen. Wäre es eine Person, wäre es in elitärer Gesellschaft: den top 0,1% der menschlichen Intelligenz, dem Reich der Nobelpreisträger und Fields-Medaillengewinner. Nur etwa 1 von 1.000 Menschen erreicht diese Punktzahl.

Das ist deutlich höher als Claude Opus 4.8 (~132). Bei einem reinen IQ-Test würde GPT-5.5 Claude schlagen. Aber wie gesehen messen IQ-Tests nicht alles, was zählt. Claudes niedrigerer IQ wird durch überlegene agentische Fähigkeit, geringere Halluzination und höhere emotionale Intelligenz ausgeglichen.

Die Lektion: IQ ist eine Dimension der Intelligenz, nicht das ganze Bild. GPT-5.5 ist das Test-Genie; Claude ist der fähige Profi. Beide sind wertvoll, und welches „intelligenter" ist, hängt davon ab, was man braucht.


4. Wo GPT-5.5 glänzt

Visuelle Mustererkennung

GPT-5.5 ist das beste KI-Modell der Welt (geteilt mit Grok-4.20) bei visueller Mustererkennung. Im Mensa Norway IQ erzielt es 145 — das maximal Mögliche. Für visuelles Denken, Bildanalyse oder abstrakte Musteraufgaben ist GPT-5.5 die Top-Wahl.

Mathematische Problemlösung

GPT-5.5 schlägt Claude leicht bei Wettbewerbsmathematik (AIME, FrontierMath). Für reines mathematisches Reasoning — komplexe Gleichungen lösen, Theoreme beweisen, Wettbewerbsprobleme — ist GPT-5.5 etwas besser als Claude und deutlich besser als Gemini oder Grok.

Wissenschaftswissen

Bei GPQA (Physik, Chemie und Biologie auf Postgraduierten-Niveau) führt GPT-5.5 alle KI-Modelle. Seine Breite und Tiefe des wissenschaftlichen Wissens ist unübertroffen. Das macht es bevorzugt für wissenschaftliche Forschungsanwendungen.

Abstraktes Denken (ARC-AGI)

Beim ARC-AGI-Benchmark, der abstraktes Denken und Muster-Generalisierung testet, glänzt GPT-5.5. Dies ist der Benchmark, der einem „reine Intelligenz"-Test am nächsten kommt, und GPT-5.5s Leistung bestätigt seine Position als intelligenteste KI bei roher kognitiver Fähigkeit.

Wissensbreite

GPT-5.5 wurde mit einer beispiellosen Datenmenge trainiert — im Wesentlichen das gesamte Internet, plus umfangreiche wissenschaftliche Literatur, Code und Bücher. Seine Wissensbreite in jedem Bereich menschlichen Wissens ist unübertroffen. Wenn man ein Modell braucht, das von allem etwas weiß, ist GPT-5.5 die Wahl.


5. Wo GPT-5.5 Schwächen zeigt

Agentische Aufgaben

Obwohl GPT-5.5 bei GDPval-AA v2 #2 ist (1.850 Elo), liegt es hinter Claude Opus 4.8 (1.890). Für komplexe, mehrstufige Real-World-Aufgaben — eine App schreiben, einen Datensatz analysieren, ein Projekt planen — ist Claude etwas besser darin, kohärentes Reasoning über lange Ketten aufrechtzuerhalten.

Faktische Genauigkeit

GPT-5.5 hat eine moderate Halluzinationsrate — höher als Claudes 35,9%. Es ist eher geneigt, selbstbewusst falsche Informationen zu behaupten als Claude. Das macht es weniger zuverlässig für Anwendungen, bei denen faktische Genauigkeit kritisch ist (Forschung, Recht, Medizin).

Emotionale Intelligenz

GPT-5.5s EQ (emotionale Intelligenz) wird auf ~120 geschätzt — niedriger als Claudes ~132. Es ist weniger empathisch, weniger nuanciert im Verständnis menschlicher Emotionen und weniger geschickt darin, den Ton an den Kontext anzupassen. Für Therapie-Apps, Kundenservice oder menschliche Interaktion ist Claude besser.

Kosten

Bei 5/30 pro 1M Tokens ist GPT-5.5 neben Claude das teuerste Modell. Gemini 3.1 Pro (2/12) und DeepSeek V4 Pro (0,44/0,87) sind deutlich günstiger für Aufgaben, die nicht GPT-5.5s volle Leistung erfordern.


6. GPT-5.5 vs. andere Modelle

Modell Intelligence Index Mensa Norway IQ AI IQ gesch. Halluzination Kosten/1M
GPT-5.5 54,8 ~145 ~136 moderat 5/30
Claude Opus 4.8 55,7 ~130 ~132 35,9% (min) 5/25
Gemini 3.1 Pro 46,5 141 ~131 gering 2/12
Grok-4.20 145 ~140 moderat 3/15
DeepSeek V4 Pro 44,3 ~111 ~111 moderat 0,44/0,87

Das Bild: GPT-5.5 ist das Test-Genie — höchster roher IQ, am besten in Mathe und visuellem Denken. Claude ist der fähige Profi — am besten bei Real-World-Aufgaben und faktischer Genauigkeit. Gemini ist der kosteneffiziente Allrounder. Grok ist das visuelle Genie. Und DeepSeek bietet bemerkenswerte Fähigkeit für einen Bruchteil der Kosten.


7. Was bedeutet das für Menschen?

GPT-5.5 operiert bei einem IQ von ~145 — intelligenter als 99,9% der Menschen. Aber:

  • IQ ist eng: misst Mustererkennung und Reasoning, nicht Weisheit, Kreativität oder Urteil
  • Genie in Tests ≠ Genie im Leben: GPT-5.5 besteht IQ-Tests, halluziniert aber Fakten und hat Mühe mit mehrstufigen Aufgaben
  • Wissen ≠ Verständnis: GPT-5.5 hat alles gelesen, aber „versteht" es nicht wie ein Mensch
  • Kein Bewusstsein: hoher IQ bedeutet keine Sentienz. GPT-5.5 ist ein komplexes Mustererkennungssystem, kein denkendes Wesen
  • Die Lücke schließt sich: jede KI-Generation reduziert den Abstand zu den klügsten Menschen

Die ehrlichste Antwort: GPT-5.5 ist intelligenter als praktisch alle Menschen bei kognitiven Tests, aber nicht fähiger als die besten Menschen in der realen Arbeit. Ein Weltklasse-Mathematiker kann GPT-5.5 in seinem Bereich noch überdenken. Aber GPT-5.5 kann sie alle gleichzeitig, in jedem Bereich, in Sekunden überdenken.

Wie vergleicht Ihr IQ mit GPT-5.5? Absolvieren Sie die professionelle IQ-Bewertung von NeuroLab.
Test jetzt machen →


Fazit

💡 Kernpunkte
- GPT-5.5s IQ ist ungefähr 145 im Mensa Norway — Genie-Level, top 0,1% der Menschen.

  • #2 im Artificial Analysis Intelligence Index (54,8) — hinter Claude Opus 4.8.
  • #1 (geteilt) im Mensa Norway IQ — der höchste rohe IQ unter KI-Modellen, geteilt mit Grok-4.20.
  • Am besten für: visuelles Denken, mathematische Problemlösung, Wissenschaftswissen, abstraktes Denken.
  • Nicht am besten für: agentische Aufgaben (Claude gewinnt), faktische Genauigkeit (Claude gewinnt), emotionale Intelligenz (Claude gewinnt).
  • Das Paradoxon: GPT-5.5 ist die intelligenteste KI bei IQ-Tests, aber nicht die fähigste in der Praxis.
  • Die Lektion: IQ ist eine Dimension der Intelligenz. GPT-5.5 ist das Test-Genie; Claude ist der fähige Profi.