
L'IA può eguagliare Elon Musk? Stima del QI degli LLM vs umani
Come performano GPT-4, Claude e Gemini nei veri test del QI rispetto a umani come Elon Musk? Analizziamo le capacità cognitive dell'IA, il ragionamento fluido e ciò che gli LLM possono e non possono fare.
La domanda che non va via
Ogni pochi mesi, un titolo diventa virale: "L'IA supera un test del QI con punteggio 155." L'implicazione è chiara: l'intelligenza artificiale ha superato il genio umano, gli Elon Musk del mondo sono obsoleti. Ma c'è qualcosa di vero?
La risposta breve: no. La risposta più lunga richiede di capire cosa misurano i test del QI, come i grandi modelli di linguaggio (LLM) elaborano le informazioni e perché confrontare l'intelligenza umana e artificiale è come confrontare un sottomarino con un nuotatore.
Questo articolo esamina le prove reali — studi peer-reviewed delle prestazioni cognitive degli LLM, la struttura dei test del QI e ciò che sappiamo del profilo cognitivo di Elon Musk — per darti una risposta onesta.
Cosa misurano realmente i test del QI
I test del QI non sono misure singole di "intelligenza." Valutano una gerarchia di capacità cognitive, tipicamente organizzata nel modello Cattell-Horn-Carroll (CHC):
- Ragionamento fluido (Gf): Risoluzione di problemi nuovi senza conoscenze pregresse
- Intelligenza cristallizzata (Gc): Conoscenze acquisite e vocabolario
- Ragionamento quantitativo (Gq): Riconoscimento di pattern numerici
- Elaborazione visiva (Gv): Ragionamento spaziale e geometrico
- Memoria di lavoro (Gwm): Mantenere e manipolare informazioni nella mente
- Velocità di elaborazione (Gs): Velocità cognitiva rapida
Un punteggio QI a scala intera aggrega questi, ma il profilo conta più del numero. Due persone con QI 130 possono avere profili di capacità radicalmente diversi — uno può eccellere nel ragionamento verbale ma avere difficoltà con compiti spaziali, mentre l'altro mostra il contrario.
Come sono stati testati gli LLM
Diversi studi hanno somministrato test del QI umani a grandi modelli di linguaggio. I più rigorosi:
Bubeck et al. (2023) hanno testato GPT-4 sulla WAIS-IV (scala Wechsler), scoprendo che performava al o sopra il 99° percentile nei subtest verbali — Vocabolario, Somiglianze, Informazione — ma aveva difficoltà con compiti di ragionamento spaziale che richiedono elaborazione visiva. Lo studio ha stimato il "QI verbale" di GPT-4 a circa 155.
Zhu et al. (2023) hanno somministrato le Matrici Progressive di Raven (ragionamento fluido non verbale) a più LLM. GPT-4 ha punteggiato nel range del 75°-90° percentile — rispettabile, ma lungi dal livello geniale. Gli autori hanno notato che gli LLM spesso risolvono i problemi di matrici attraverso la corrispondenza di pattern nei dati di addestramento piuttosto che un vero ragionamento fluido.
Le stesse valutazioni di OpenAI (2023-2024) mostrano GPT-4 che punteggia 163 nella sezione verbale del SAT (99° percentile) ma solo 710/800 in matematica — forte, ma non eccezionale secondo gli standard delle università d'élite.
L'illusione verbale: perché i punteggi dell'IA sembrano gonfiati
Ecco il problema centrale: i test del QI sono fortemente verbali, e gli LLM sono addestrati su testo.
La WAIS-IV ha 10 subtest principali. Cinque sono principalmente verbali: Vocabolario, Somiglianze, Informazione, Comprensione, Aritmetica. Per questi, un LLM ha un vantaggio massiccio — ha ingerito essenzialmente tutto il testo pubblicato nei suoi dati di addestramento. Quando gli si chiede "Qual è la somiglianza tra un orologio e un calendario?" il modello non ragiona — recupera la risposta dal suo modello statistico del linguaggio.
Questa è intelligenza cristallizzata (Gc), non ragionamento fluido. Ed è dove gli LLM sembrano più impressionanti. Ma l'intelligenza cristallizzata è la meno predittiva della risoluzione di problemi nel mondo reale e dell'innovazione. Misura ciò che sai, non come pensi.
Dove gli LLM falliscono: il divario Musk
Il profilo cognitivo di Elon Musk — basato sui suoi punteggi SAT e pattern di carriera — è asimmetrico: ragionamento fluido molto alto, capacità spaziale eccezionale, abilità verbali forti ma non d'élite. Questo è esattamente il profilo in cui gli LLM performano peggio.
Ragionamento spaziale (Gv): Gli LLM non possono elaborare nativamente informazioni visuo-spaziali. Quando viene chiesto loro di ruotare mentalmente oggetti 3D o visualizzare traiettorie di razzi, falliscono o si affidano a soluzioni alternative basate sul testo. La capacità di Musk di visualizzare componenti di razzi e le loro interazioni nella testa — un fattore chiave in SpaceX — non ha equivalente negli LLM.
Manipolazione della memoria di lavoro (Gwm): Sebbene gli LLM abbiano grandi finestre di contesto, non manipolano le informazioni nella memoria di lavoro come gli umani. Corrispondono pattern, non mantengono un modello mentale e lo trasformano. La capacità di Musk di mantenere simultaneamente multiple compensazioni ingegneristiche e aggiornarle in tempo reale è una funzione di memoria di lavoro che l'IA attuale non può replicare.
Ragionamento dai primi principi: La strategia cognitiva caratteristica di Musk — scomporre i problemi alla fisica fondamentale e costruire da lì — richiede un vero ragionamento fluido, non recupero. Quando gli LLM tentano il ragionamento dai primi principi, spesso producono catene plausibili ma logicamente errate perché interpolano tra esempi di addestramento invece di ragionare da assiomi.
Apprendimento per trasferimento tra domini: Musk applica lo stesso set di strumenti cognitivi a razzi, auto, interfacce neurali e social media. Gli LLM possono generare testo su tutti questi domini, ma non possono trasferire una strategia di soluzione da un dominio all'altro come fa un esperto umano.
- LLM: Vasta intelligenza cristallizzata (Gc)
- LLM: Generazione e recupero rapido del testo
- LLM: Coerenti, instancabili, scalabili
- LLM: Forti nei test verbali standardizzati
- LLM: Ragionamento spaziale debole (Gv)
- LLM: Nessuna manipolazione genuina della memoria di lavoro
- LLM: Il ragionamento dai primi principi spesso collassa
- LLM: Scarsa transfer di strategie tra domini
Il problema dei benchmark
C'è un problema metodologico più profondo: i test del QI sono stati progettati per umani, non per macchine.
Quando un umano fa le Matrici Progressive di Raven, usa una combinazione di memoria di lavoro, elaborazione visiva e ragionamento fluido. Quando un LLM fa lo stesso test (convertito in testo), usa la corrispondenza di pattern statistica contro i dati di addestramento. Questi sono processi cognitivi fondamentalmente diversi che per caso producono risultati simili su uno specifico test.
Questo è il problema della Legge di Goodhart: quando una misura diventa un obiettivo, cessa di essere una buona misura. Se ottimizziamo l'IA per punteggiare bene nei test del QI, non stiamo rendendo l'IA più intelligente — la stiamo rendendo migliore nei test del QI.
Un confronto più onesto userebbe test progettati per distinguere la cognizione umana dalla corrispondenza di pattern statistica:
- Nuovi problemi di fisica che non possono essere nei dati di addestramento
- Ragionamento spaziale multilivello che richiede simulazione mentale
- Domande avversariali progettate per esporre scorciatoie di corrispondenza di pattern
- Processo decisionale in tempo reale sotto vincoli nuovi
Su queste misure, gli LLM attuali performano ben al di sotto del livello esperto umano.
Cosa dicono realmente i numeri
Siamo concreti. Se confrontiamo il profilo cognitivo stimato di Musk (dalla conversione SAT) con le prestazioni misurate di GPT-4:
| Capacità | Musk (stim.) | GPT-4 (misurato) |
|---|---|---|
| Verbale/Cristallizzata (Gc) | ~130-135 | ~155+ |
| Ragionamento fluido (Gf) | ~140-145 | ~115-125 |
| Spaziale (Gv) | ~145+ | ~80-90 |
| Memoria di lavoro (Gwm) | ~135-140 | N/A (non applicabile) |
| Velocità di elaborazione (Gs) | ~120-130 | Molto veloce, ma meccanismo diverso |
Il quadro è chiaro: gli LLM dominano l'intelligenza cristallizzata ma rimangono significativamente indietro nel ragionamento fluido, capacità spaziale e manipolazione della memoria di lavoro — esattamente le capacità che guidano l'innovazione ingegneristica e la risoluzione imprenditoriale dei problemi.
L'IA può sostituire la funzione Elon Musk?
La "funzione Elon Musk" — come ruolo cognitivo, non come persona — implica:
- Identificare nuovi problemi che non hanno ancora soluzioni
- Ragionare dai primi principi in più domini tecnici
- Prendere decisioni ad alto rischio con informazioni incomplete
- Integrare ragionamento spaziale, quantitativo e verbale in tempo reale
- Sostenere sforzo e concentrazione su progetti pluriennali
L'IA attuale può assistere in ciascuno di questi ma non può eseguire l'integrazione. GPT-4 può aiutare a scrivere codice per una simulazione di razzo, ma non può decidere se costruire un razzo riutilizzabile. Può analizzare dati di chimica delle batterie, ma non può visualizzare il comportamento termico di un nuovo design di cella.
Il divario non riguarda solo i punteggi del QI — riguarda il tipo di intelligenza. Il valore di Musk deriva dal ragionamento fluido applicato a problemi nuovi, non dal conoscere fatti. Gli LLM sono l'opposto: vasta conoscenza fattuale con capacità limitata di risoluzione di problemi nuovi.
Il futuro: convergenza o divergenza?
L'IA sta migliorando rapidamente, ma i miglioramenti sono disuguali. Gli LLM stanno migliorando nei compiti verbali (dove sono già sovrumani) ma i progressi nel ragionamento spaziale e nel vero ragionamento fluido sono più lenti. Gli approcci più promettenti — modelli multimodali, architetture neuro-simboliche e IA embodied — tentano di colmare i divari spaziale e di ragionamento, ma rimangono lontani dal livello esperto umano.
La previsione onesta: l'IA aumenterà sempre più la cognizione umana nei prossimi 5-10 anni, ma la "funzione Musk" — l'integrazione creativa di più tipi di ragionamento applicata a nuove sfide ingegneristiche — rimarrà una capacità umana nel futuro prevedibile. Non perché gli umani sono intrinsecamente superiori, ma perché il tipo di intelligenza richiesto è esattamente il tipo con cui le architetture di IA attuali hanno difficoltà.
Verdetto
- I punteggi dei test del QI sovrastimano l'intelligenza dell'IA perché i test del QI sono fortemente verbali e gli LLM sono addestrati su testo
- Gli LLM eccellono nell'intelligenza cristallizzata (sapere cose) ma rimangono indietro nel ragionamento fluido (risolvere problemi nuovi)
- Il profilo cognitivo di Musk — alto ragionamento fluido, capacità spaziale eccezionale — è esattamente dove l'IA è più debole
- Il titolo "IA QI 155" è fuorviante: misura un tipo di intelligenza diverso da quello che guida l'innovazione reale
- L'IA aumenta ma non può sostituire l'integrazione creativa dei tipi di ragionamento che definisce la cognizione ingegneristica esperta
La domanda non è se l'IA raggiungerà QI 155. Probabilmente lo ha già fatto — nei subtest che non contano per l'innovazione. La vera domanda è se l'IA svilupperà il ragionamento fluido, spaziale e integrativo che permette a qualcuno di guardare un problema che nessuno ha risolto e risolverlo. Questo è il test di Musk. E finora, l'IA lo fallisce.