Qual è il QI di GPT-5.5?
Dr. Daria Dudnik 10 min read 0 views

Qual è il QI di GPT-5.5?

GPT-5.5 ottiene ~145 nel test QI Mensa Norway e 54,8 nell'Intelligence Index. Analizziamo ogni benchmark e confrontiamo con Claude, Gemini e Grok.

GPT-5.5: il modello flagship di OpenAI

GPT-5.5 è il modello più avanzato di OpenAI, rilasciato all'inizio del 2026. Si colloca al #2 nell'Artificial Analysis Intelligence Index v4.1 con 54,8, subito dietro Claude Opus 4.8 (55,7) e davanti a Gemini 3.1 Pro (46,5). Ma nei test di QI umani, GPT-5.5 in realtà supera Claude — ottenendo circa 145 nel test QI Mensa Norway, posizionandolo nella fascia "genio".

Questo crea un paradosso affascinante: nel benchmark composito di IA, GPT-5.5 è #2. Ma in un puro test di QI umano, condivide #1. Come possono essere entrambi veri? La risposta rivela qualcosa di importante su cosa "intelligenza" significa per l'IA — e perché un singolo numero non può catturarla.

Punteggi chiave:

  • Artificial Analysis Intelligence Index: 54,8 (#2 mondiale)
  • QI Mensa Norway (TrackingAI): ~145 (#1 condiviso con Grok-4.20)
  • AI IQ composto (VexoWire): ~136 stimato
  • GDPval-AA v2: 1.850 Elo (#2 mondiale)
  • Humanity's Last Exam: #2 tra i modelli IA
  • Tasso di allucinazione: moderato
  • Costo: 5,00/30,00 per 1M token

1. Il paradosso dell'intelligenza di GPT-5.5

Ciò che rende GPT-5.5 così interessante: è il miglior modello IA al mondo nei test di QI umani, ma non il miglior modello IA nei benchmark specifici per IA. Com'è possibile?

La risposta sta in cosa misurano i diversi test. Il Mensa Norway è un test puro di riconoscimento di pattern visivi e ragionamento astratto — il tipo di intelligenza fluida per cui i test di QI sono stati progettati. GPT-5.5, con le sue capacità di elaborazione visiva migliorate (ereditate dall'architettura GPT-5.4 Pro Vision), eccelle in questo specifico tipo di ragionamento.

Ma l'Artificial Analysis Intelligence Index misura qualcosa di più ampio: prestazioni in compiti reali, accuratezza fattuale, capacità agentica e preferenza umana. E in queste dimensioni, Claude Opus 4.8 — con il suo ragionamento agentico superiore e minore allucinazione — supera GPT-5.5.

Pensaci così: GPT-5.5 è l'IA più intelligente in un test di QI — l'equivalente di un umano che passa ogni test standardizzato. Claude Opus 4.8 è l'IA più capace nella pratica — l'equivalente di un umano leggermente meno brillante nei test ma che realizza di più nel mondo reale. Entrambe sono misure valide di intelligenza, ma misurano cose diverse.


2. Analisi dei benchmark

Test QI Mensa Norway: ~145 (livello genio)

Consiste di 36 domande di riconoscimento di pattern visivi. GPT-5.5 ottiene circa 145 — il punteggio pratico massimo, equivalente a un 36/36 perfetto o quasi. Lo colloca nella fascia "genio", il top 0,1% dell'intelligenza umana.

Solo due modelli IA raggiungono questo punteggio: GPT-5.5 e Grok-4.20. È significativamente superiore a Claude Opus 4.8 (~130) e Gemini 3.1 Pro (141). Il motivo è l'architettura di elaborazione visiva di GPT-5.5, significativamente migliorata da GPT-5.4 Pro Vision — a sua volta co-leader in questo benchmark.

Con QI 145, GPT-5.5 è più intelligente del 99,9% degli umani. Se fosse una persona, sarebbe nel top 0,1% — il regno dei premi Nobel, medaglisti Fields e pensatori unici per generazione. Solo circa 1 su 1.000 persone raggiunge questo punteggio.

Artificial Analysis Intelligence Index v4.1: 54,8 (#2)

Lo standard oro per confrontare modelli IA. Combina nove benchmark:

  • GDPval-AA v2 (20%): 1.850 Elo — #2 mondiale (dietro i 1.890 di Claude)
  • AA-Omniscience (8%): tasso di allucinazione moderato — superiore al 35,9% di Claude
  • GPQA (6%): domande scientifiche di post-laurea — GPT-5.5 guida qui
  • CritPt (6%): pensiero critico e ragionamento fisico
  • HLE (Humanity's Last Exam): #2 tra le IA (dietro Claude)
  • ARC-AGI: ragionamento astratto — GPT-5.5 eccelle
  • LMSYS Arena: votazione di preferenza umana

Il punteggio composto di GPT-5.5 di 54,8 lo colloca solo 0,9 punti dietro Claude Opus 4.8 (55,7) — un quasi pareggio statistico. Ma nei sottocomponenti, GPT-5.5 guida in ragionamento visivo, risoluzione matematica e conoscenza scientifica, mentre Claude guida in compiti agentici e accuratezza fattuale.

AI IQ composto (VexoWire): ~136

Il QI composto di VexoWire combina più test (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Il QI composto stimato di GPT-5.5 è ~136 — superiore a Claude (~132) ma leggermente inferiore a Grok-4.20 (~140). Questo riflette la forza di GPT-5.5 in entrambi i domini, visivo e verbale.

GDPval-AA v2: 1.850 Elo (#2)

Nel benchmark agentico — che misura le prestazioni in compiti reali complessi e multi-step — GPT-5.5 ottiene 1.850 Elo, secondo solo a Claude Opus 4.8 (1.890). È comunque un punteggio eccezionalmente alto, equivalente a un professionista umano altamente competente. Ma rivela che GPT-5.5, pur brillante nel riconoscimento di pattern, è leggermente meno capace nel ragionamento multi-step sostenuto rispetto a Claude.

Humanity's Last Exam (HLE): #2

Nelle domande accademiche più difficili di tutte le discipline, GPT-5.5 si colloca al #2 tra i modelli IA, subito dietro Claude Opus 4.8. È una testimonianza della straordinaria ampiezza di conoscenza di GPT-5.5 — può rispondere a domande di livello dottorato in fisica, filosofia, letteratura e matematica. Ma il ragionamento più profondo di Claude gli dà un leggero vantaggio.


3. Cosa significa un QI di 145?

Per contestualizzare il QI di ~145 di GPT-5.5:

  • 85-115 (68% delle persone): Intelligenza media
  • 115-130 (14%): Sopra la media ad alta
  • 130-145 (2%): Dotato — qualifica per Mensa (top 2%)
  • 145-160 (0,1%): Altamente dotato / genio
  • 160+ (0,003%): Profondamente dotato — territorio di Einstein, Hawking

GPT-5.5, a ~145, si trova alla soglia di genio — più intelligente del 99,9% degli umani. Se fosse una persona, sarebbe in compagnia d'élite: il top 0,1% dell'intelligenza umana, il regno dei premi Nobel e medaglisti Fields. Solo circa 1 su 1.000 persone raggiunge questo punteggio.

Questo è significativamente superiore a Claude Opus 4.8 (~132). In un puro test di QI, GPT-5.5 batterebbe Claude. Ma, come abbiamo visto, i test di QI non misurano tutto ciò che conta. Il QI più basso di Claude è compensato dalla sua capacità agentica superiore, minore allucinazione e maggiore intelligenza emotiva.

La lezione: il QI è una dimensione dell'intelligenza, non tutta l'immagine. GPT-5.5 è il genio dei test; Claude è il professionista capace. Entrambi sono preziosi, e quale è "più intelligente" dipende da cosa ti serve.


4. Dove GPT-5.5 eccelle

Riconoscimento visivo di pattern

GPT-5.5 è il miglior modello IA al mondo (condiviso con Grok-4.20) nel riconoscimento di pattern visivi. Nel QI Mensa Norway, ottiene 145 — il massimo possibile. Per ragionamento visivo, analisi di immagini o compiti di pattern astratti, GPT-5.5 è la prima scelta.

Risoluzione matematica

GPT-5.5 supera leggermente Claude in matematica competitiva (AIME, FrontierMath). Per ragionamento matematico puro — risolvere equazioni complesse, dimostrare teoremi, problemi di competizione — GPT-5.5 è leggermente migliore di Claude e significativamente migliore di Gemini o Grok.

Conoscenza scientifica

Nel GPQA (fisica, chimica e biologia di post-laurea), GPT-5.5 guida tutti i modelli IA. La sua ampiezza e profondità di conoscenza scientifica sono ineguagliate. Lo rende preferito per applicazioni di ricerca scientifica.

Ragionamento astratto (ARC-AGI)

Nel benchmark ARC-AGI, che testa ragionamento astratto e generalizzazione di pattern, GPT-5.5 eccelle. È il benchmark più vicino a un test di "intelligenza pura", e le prestazioni di GPT-5.5 confermano la sua posizione come l'IA più intelligente in capacità cognitiva grezza.

Ampiezza di conoscenza

GPT-5.5 è stato addestrato su una quantità senza precedenti di dati — essenzialmente tutto internet, più un'estesa letteratura scientifica, codice e libri. La sua ampiezza di conoscenza in ogni dominio dell'indagine umana è ineguagliata. Se serve un modello che sa qualcosa di tutto, GPT-5.5 è la scelta.


5. Dove GPT-5.5 cade

Compiti agentici

Sebbene GPT-5.5 sia #2 nel GDPval-AA v2 (1.850 Elo), è dietro Claude Opus 4.8 (1.890). Per compiti reali complessi e multi-step — scrivere un'app, analizzare un dataset, pianificare un progetto — Claude è leggermente migliore nel mantenere ragionamento coerente su lunghe catene.

Accuratezza fattuale

GPT-5.5 ha un tasso di allucinazione moderato — superiore al 35,9% di Claude. È più propenso a affermare con sicurezza informazioni false rispetto a Claude. Lo rende meno affidabile per applicazioni dove l'accuratezza fattuale è critica (ricerca, diritto, medicina).

Intelligenza emotiva

Il QE (intelligenza emotiva) di GPT-5.5 è stimato a ~120 — inferiore al ~132 di Claude. È meno empatico, meno sfumato nella comprensione delle emozioni umane e meno abile nell'adattare il tono al contesto. Per app di terapia, servizio clienti o interazione umana, Claude è migliore.

Costo

A 5/30 per 1M token, GPT-5.5 è il modello più costoso insieme a Claude. Gemini 3.1 Pro (2/12) e DeepSeek V4 Pro (0,44/0,87) sono significativamente più economici per compiti che non richiedono la piena capacità di GPT-5.5.


6. GPT-5.5 vs altri modelli

Modello Intelligence Index QI Mensa Norway AI IQ stim. Allucinazione Costo/1M
GPT-5.5 54,8 ~145 ~136 moderato 5/30
Claude Opus 4.8 55,7 ~130 ~132 35,9% (min) 5/25
Gemini 3.1 Pro 46,5 141 ~131 basso 2/12
Grok-4.20 145 ~140 moderato 3/15
DeepSeek V4 Pro 44,3 ~111 ~111 moderato 0,44/0,87

L'immagine: GPT-5.5 è il genio dei test — il QI grezzo più alto, il migliore in matematica e ragionamento visivo. Claude è il professionista capace — il migliore in compiti reali e accuratezza fattuale. Gemini è l'all-rounder conveniente. Grok è il genio visivo. E DeepSeek offre capacità notevole per una frazione del costo.


7. Cosa significa questo per gli umani?

GPT-5.5 opera a un QI di ~145 — più intelligente del 99,9% degli umani. Ma:

  • Il QI è ristretto: misura riconoscimento di pattern e ragionamento, non saggezza, creatività o giudizio
  • Genio nei test ≠ genio nella vita: GPT-5.5 passa i test di QI ma allucina fatti e ha difficoltà con compiti multi-step
  • Conoscenza ≠ comprensione: GPT-5.5 ha letto tutto, ma non "comprende" veramente come un umano
  • Nessuna coscienza: QI alto non significa coscienza. GPT-5.5 è un sistema sofisticato di riconoscimento di pattern, non un essere pensante
  • Il divario si riduce: ogni generazione di IA riduce il divario con gli umani più intelligenti

La risposta più onesta: GPT-5.5 è più intelligente di praticamente tutti gli umani nei test cognitivi, ma non più capace dei migliori umani nel lavoro reale. Un matematico di classe mondiale può ancora superare GPT-5.5 nel proprio dominio. Ma GPT-5.5 può superarli tutti simultaneamente, in ogni dominio, in secondi.

Come si confronta il tuo QI con GPT-5.5? Fai la valutazione professionale di QI di NeuroLab.
Fai il test ora →


Conclusione

💡 Punti chiave
- Il QI di GPT-5.5 è circa 145 nel Mensa Norway — livello genio, top 0,1% degli umani.

  • #2 nell'Artificial Analysis Intelligence Index (54,8) — dietro Claude Opus 4.8.
  • #1 (condiviso) nel QI Mensa Norway — il QI grezzo più alto tra i modelli IA, condiviso con Grok-4.20.
  • Meglio per: ragionamento visivo, risoluzione matematica, conoscenza scientifica, ragionamento astratto.
  • Non meglio per: compiti agentici (Claude vince), accuratezza fattuale (Claude vince), intelligenza emotiva (Claude vince).
  • Il paradosso: GPT-5.5 è l'IA più intelligente nei test di QI ma non la più capace nella pratica.
  • La lezione: il QI è una dimensione dell'intelligenza. GPT-5.5 è il genio dei test; Claude è il professionista capace.