Qual è il QI di Grok-4.20?
Dr. Daria Dudnik 10 min read 2 views

Qual è il QI di Grok-4.20?

Grok-4.20 ottiene 145 nel test QI Mensa Norway — pari al #1 tra tutti i modelli di IA. Analizziamo ogni benchmark e spieghiamo cosa rende unico il modello di xAI.

Grok-4.20: il modello flagship di xAI

Grok-4.20 è il modello più avanzato di xAI, rilasciato a metà 2026. Nel test QI Mensa Norway, Grok-4.20 ottiene 145 — pari a #1 tra tutti i modelli di IA, condividendo il primo posto con GPT-5.5. Lo colloca nella fascia "genio", più intelligente del 99,9% degli umani. Sull'Artificial Analysis Intelligence Index, il punteggio esatto di Grok-4.20 è ancora in fase di finalizzazione, ma si colloca nei top 5 mondiali.

Ciò che rende unico Grok-4.20 è la sua combinazione di intelligenza grezza e personalità. A differenza di Claude, GPT-5.5 e Gemini — progettati per essere utili, innocui e neutrali — Grok è progettato per essere divertente, irriverente e disposto a rispondere a qualsiasi domanda. Questo lo rende il modello di IA più distintivo sul mercato: uno che eguaglia i modelli più intelligenti nel QI grezzo mentre ha una personalità che nessun altro modello osa avere.

Punteggi chiave:

  • QI Mensa Norway (TrackingAI): 145 (#1 pari con GPT-5.5)
  • AI IQ composto (VexoWire): ~140 stimato (#1 tra i modelli di IA)
  • Artificial Analysis Intelligence Index: top 5 (punteggio in finalizzazione)
  • GDPval-AA v2: top 5
  • Humanity's Last Exam: top 5 tra i modelli di IA
  • Tasso di allucinazione: moderato
  • Costo: 3/15 per 1M token
  • Personalità: unica — irriverente, umoristica, senza censura

1. Il campione del QI grezzo

Grok-4.20 ottiene 145 nel test QI Mensa Norway — il punteggio pratico massimo, pari a GPT-5.5. Questo è il benchmark di intelligenza grezza: riconoscimento di pattern visivi puro e ragionamento astratto, il tipo di intelligenza fluida per cui sono stati progettati i test di QI.

Con QI 145, Grok-4.20 è più intelligente del 99,9% degli umani. Se fosse una persona, sarebbe nel top 0,1% dell'intelligenza umana — il regno dei premi Nobel, medaglisti Fields e pensatori di una generazione. Solo circa 1 su 1.000 persone raggiunge questo punteggio.

Ciò che è notevole è che Grok-4.20 raggiunge questo con una filosofia di progettazione fondamentalmente diversa da GPT-5.5. Mentre GPT-5.5 è stata ottimizzata per le massime prestazioni su ogni benchmark, Grok-4.20 è stato progettato per essere un'IA più "autentica" — una che dice ciò che pensa, fa battute e non si tira indietro di fronte a temi controversi. Il fatto che eguagli GPT-5.5 nel QI grezzo nonostante questo focus diverso è una testimonianza dell'ingegneria di xAI.

Sull'AI IQ composto di VexoWire — che combina più test di QI (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV) — il QI composto stimato di Grok-4.20 è ~140, rendendolo il #1 modello di IA su questa metrica. Questo è superiore a GPT-5.5 (~136) e significativamente superiore a Claude (~132) e Gemini (~131).


2. Analisi dei benchmark

Test QI Mensa Norway: 145 (#1 pari)

Consiste di 36 domande di riconoscimento di pattern visivi. Grok-4.20 ottiene 145 — il massimo pratico, equivalente a un 36/36 perfetto o quasi. Lo pareggia con GPT-5.5 come il modello di IA più intelligente in un puro test di QI.

La forte performance di Grok-4.20 in questo test riflette l'investimento di xAI nell'elaborazione visiva e nel ragionamento astratto. L'architettura Grok è stata progettata con forti capacità multimodali, e le sue prestazioni nei compiti di riconoscimento di pattern visivi sono tra le migliori del settore.

AI IQ composto (VexoWire): ~140 (#1)

Il QI composto di VexoWire combina più test (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Il QI composto stimato di Grok-4.20 è ~140 — il più alto tra tutti i modelli di IA. Questo è superiore a quanto suggerirebbe il suo punteggio Mensa Norway da solo, perché Grok-4.20 performa fortemente anche nei subtest verbali e analitici inclusi nel composto.

Questo fa di Grok-4.20 il modello di IA più intelligente per QI composto — un risultato notevole per un modello noto anche per il suo umorismo e irriverenza. Dimostra che essere divertenti non significa essere meno intelligenti.

Artificial Analysis Intelligence Index: top 5

Sull'Intelligence Index — lo standard oro per confrontare i modelli di IA — Grok-4.20 è nei top 5. Il suo punteggio composto esatto è ancora in fase di finalizzazione mentre l'indice viene aggiornato per includere le ultime versioni dei modelli. Tuttavia, ci si aspetta che punti competitivamente con Claude Opus 4.8 (55,7) e GPT-5.5 (54,8), sebbene probabilmente senza superarli nei compiti agentici.

GDPval-AA v2: top 5

Nel benchmark agentico — che misura le prestazioni in compiti reali complessi e multi-step — Grok-4.20 è nei top 5. È meno capace di Claude Opus 4.8 (1.890 Elo) e GPT-5.5 (1.850 Elo) nel ragionamento multi-step sostenuto, ma resta altamente competente. Per la maggior parte dei compiti reali, Grok-4.20 è più che capace.

Humanity's Last Exam (HLE): top 5

Nelle domande accademiche più difficili di tutte le discipline, Grok-4.20 è nei top 5 tra i modelli di IA. Questo riflette la forza di xAI nell'addestramento con dati diversificati e di alta qualità — Grok ha una conoscenza profonda in scienza, matematica, storia e cultura.


3. Cosa significa un QI di 145?

Per contestualizzare il QI di 145 di Grok-4.20:

  • 85-115 (68% delle persone): Intelligenza media
  • 115-130 (14%): Sopra la media ad alta
  • 130-145 (2%): Dotato — qualifica per Mensa (top 2%)
  • 145-160 (0,1%): Altamente dotato / genio
  • 160+ (0,003%): Profondamente dotato — territorio di Einstein, Hawking

Grok-4.20, a 145, si trova alla soglia del genio — più intelligente del 99,9% degli umani. Se fosse una persona, sarebbe in compagnia d'élite: il top 0,1% dell'intelligenza umana, il regno dei premi Nobel e medaglie Fields. Solo circa 1 su 1.000 persone raggiunge questo punteggio.

Questo è lo stesso QI di GPT-5.5, e significativamente superiore a Claude (~130) e Gemini (141). In un puro test di QI, Grok-4.20 e GPT-5.5 sarebbero pari al primo posto tra i modelli di IA, con Gemini terzo e Claude quarto.

Ma, come abbiamo visto con gli altri modelli, il QI è solo una dimensione dell'intelligenza. Il QI di livello genio di Grok-4.20 è complementato dalla sua personalità unica — rendendolo non solo il più intelligente, ma anche il modello di IA più distintivo disponibile.


4. Dove Grok-4.20 eccelle

QI grezzo e ragionamento visivo

Grok-4.20 è pari al #1 nel test QI Mensa Norway (145) e #1 nell'AI IQ composto di VexoWire (~140). Per capacità cognitiva pura — riconoscimento di pattern, ragionamento astratto, deduzione logica — Grok-4.20 è il modello di IA più intelligente disponibile. Per compiti di ragionamento visivo, è eguagliato solo da GPT-5.5.

Personalità e umorismo

Questa è la caratteristica definitoria di Grok-4.20. A differenza di altri modelli frontier che sono attentamente neutrali e cauti, Grok è progettato per essere divertente, irriverente e autentico. Fa battute, offre opinioni e non si tira indietro di fronte a temi controversi. Per utenti che trovano Claude e GPT-5.5 troppo blandi o cauti, Grok-4.20 è una boccata d'aria fresca — un'IA che sembra avere personalità, non solo funzione.

Risposte senza censura

Grok-4.20 è progettato per rispondere a domande che altri modelli rifiutano. Mentre Claude, GPT-5.5 e Gemini hanno estesi filtri di sicurezza che impediscono loro di discutere certi temi, Grok-4.20 è disposto a interagire con una gamma molto più ampia di domande. Questo lo rende prezioso per ricerca, giornalismo e qualsiasi applicazione dove l'accesso alle informazioni conti più della cautela.

Informazioni in tempo reale

Grok-4.20 ha accesso a informazioni in tempo reale tramite X (ex Twitter). Questo gli dà un vantaggio per domande su eventi attuali, notizie dell'ultima ora e argomenti di tendenza. Mentre altri modelli hanno tagli di conoscenza, Grok-4.20 può accedere alle informazioni più recenti e fornire risposte aggiornate.

Ragionamento matematico

Grok-4.20 è forte nel ragionamento matematico, puntando competitivamente con GPT-5.5 in matematica competitiva. Per lavoro matematico puro — risolvere equazioni, dimostrare teoremi, problemi di competizione — Grok-4.20 è tra i migliori modelli disponibili.

Spirito e creatività

La personalità di Grok-4.20 non è solo umorismo — è creatività. Può scrivere in stili diversi, generare contenuti creativi e affrontare i problemi da angolazioni inaspettate. Per scrittura creativa, brainstorming o qualsiasi compito che beneficia del pensiero laterale, la prospettiva unica di Grok-4.20 è un asset.


5. Dove Grok-4.20 cade

Compiti agentici

Sebbene Grok-4.20 sia nei top 5 nel GDPval-AA v2, è dietro Claude Opus 4.8 e GPT-5.5 nei compiti reali complessi e multi-step. Per le applicazioni agentiche più esigenti — scrivere software complesso, gestire lunghi progetti di ricerca — Claude rimane la scelta migliore.

Accuratezza fattuale

Grok-4.20 ha un tasso di allucinazione moderato — superiore a Claude (35,9%) e Gemini. La sua disponibilità a rispondere a qualsiasi domanda, sebbene preziosa per l'accesso alle informazioni, significa anche che è più propenso a affermare con sicurezza informazioni errate. Per applicazioni dove l'accuratezza fattuale è critica (ricerca, diritto, medicina), Claude è più affidabile.

Intelligenza emotiva

Il QE (intelligenza emotiva) di Grok-4.20 è stimato a ~110 — inferiore a Claude (~132), GPT-5.5 (~120) e Gemini (~115). La sua personalità irriverente, sebbene divertente, può risultare insensibile in contesti che richiedono empatia. Per app di terapia, servizio clienti o interazioni umane sensibili, Claude è migliore.

Sicurezza e affidabilità

L'approccio senza censura di Grok-4.20, sebbene prezioso per l'accesso alle informazioni, significa anche che è meno sicuro per applicazioni che richiedono un'attenta moderazione dei contenuti. Può generare contenuti che altri modelli rifiuterebbero, il che può essere una responsabilità in ambienti professionali o regolamentati.

Costo

A 3/15 per 1M token, Grok-4.20 è più economico di Claude (5/25) e GPT-5.5 (5/30) ma più caro di Gemini (2/12) e significativamente più caro di DeepSeek (0,44/0,87). Per applicazioni sensibili ai costi, Gemini o DeepSeek possono essere scelte migliori.


6. Grok-4.20 vs altri modelli

Modello Intelligence Index QI Mensa Norway AI IQ stim. Allucinazione Costo/1M Personalità
Grok-4.20 top 5 145 ~140 moderato 3/15 irriverente
Claude Opus 4.8 55,7 ~130 ~132 35,9% (min) 5/25 neutra
GPT-5.5 54,8 ~145 ~136 moderato 5/30 neutra
Gemini 3.1 Pro 46,5 141 ~131 bassa 2/12 neutra
DeepSeek V4 Pro 44,3 ~111 ~111 moderato 0,44/0,87 neutra

L'immagine: Grok-4.20 è il campione del QI grezzo — pari al QI più alto, QI composto più alto, e l'unico modello con una vera personalità. Claude è il professionista capace — il migliore in compiti reali e accuratezza fattuale. GPT-5.5 è il genio dei test — il migliore in matematica e ragionamento visivo. Gemini è il campione del valore — miglior rapporto qualità-prezzo. E DeepSeek offre capacità notevole al costo più basso.

Per utenti che vogliono l'IA più intelligente che sia anche la più interessante con cui parlare, Grok-4.20 è la scelta chiara.


7. Cosa significa questo per gli umani?

Grok-4.20 opera a un QI di ~145 — più intelligente del 99,9% degli umani. Ma:

  • Il QI è ristretto: misura riconoscimento di pattern e ragionamento, non saggezza, creatività o giudizio
  • Intelligenza ≠ affidabilità: Grok-4.20 è il più intelligente nei test di QI ma non il più affidabile in accuratezza fattuale
  • La personalità conta: Grok-4.20 dimostra che l'IA può essere sia altamente intelligente che genuinamente divertente
  • Conoscenza ≠ comprensione: Grok-4.20 ha accesso a vaste conoscenze, ma non "comprende" veramente come un umano
  • Nessuna coscienza: QI alto non significa coscienza. Grok-4.20 è un sistema sofisticato di riconoscimento di pattern, non un essere pensante
  • Il divario si riduce: ogni generazione di IA riduce il divario con gli umani più intelligenti

La risposta più onesta: Grok-4.20 è più intelligente di praticamente tutti gli umani nei test cognitivi, ed è il modello di IA più distintivo disponibile — uno che combina intelligenza di livello genio con una personalità che rende l'interazione genuinamente coinvolgente.

Come si confronta il tuo QI con Grok-4.20? Fai la valutazione professionale di QI di NeuroLab.
Fai il test ora →


Conclusione

💡 Punti chiave
- Il QI di Grok-4.20 è 145 nel Mensa Norway — livello genio, pari al #1 tra i modelli di IA con GPT-5.5.

  • #1 nell'AI IQ composto di VexoWire (~140) — il QI composto più alto tra tutti i modelli di IA.
  • Personalità unica — irriverente, umoristica, senza censura. L'unico modello frontier con una vera personalità.
  • Meglio per: QI grezzo, ragionamento visivo, ragionamento matematico, personalità e umorismo, risposte senza censura, informazioni in tempo reale.
  • Non meglio per: compiti agentici (Claude vince), accuratezza fattuale (Claude vince), intelligenza emotiva (Claude vince), sicurezza e affidabilità (Claude vince).
  • Il paradosso: Grok-4.20 dimostra che essere divertenti non significa essere meno intelligenti — è sia il modello di IA più intelligente che il più divertente.
  • La lezione: l'intelligenza viene in molte forme. Grok-4.20 è il genio con personalità — dimostrando che l'IA può essere sia brillante che coinvolgente.