Qual è il QI di DeepSeek V4?
Dr. Daria Dudnik 10 min read 0 views

Qual è il QI di DeepSeek V4?

DeepSeek V4 Pro ottiene 111 nel test QI Mensa Norway e 44.3 nell'Intelligence Index. Analizziamo ogni benchmark e spieghiamo perché è il miglior modello di IA economico.

DeepSeek V4 Pro: il campione open-source della Cina

DeepSeek V4 Pro è il modello flagship di DeepSeek, il laboratorio cinese di IA che ha stupito il mondo con la sua combinazione di basso costo e alte prestazioni. Rilasciato all'inizio del 2026, DeepSeek V4 Pro ottiene 111 nel test QI Mensa Norway e 44.3 sull'Artificial Analysis Intelligence Index v4.1 — collocandosi nei top 10 globali, ma ben dietro ai modelli di frontiera (Claude a 55,7, GPT-5.5 a 54,8).

Ciò che rende remarkable DeepSeek V4 Pro non è la sua intelligenza grezza — è il suo prezzo. A 0,44/0,87 per 1M token, costa circa 10 volte meno di Claude (5/25) e GPT-5.5 (5/30), e 5 volte meno di Gemini (2/12). Per il prezzo di una singola interrogazione a Claude, potresti fare dieci interrogazioni a DeepSeek V4 Pro. Eppure, ottiene 111 in un test di QI — superiore a circa il 25% degli umani.

DeepSeek V4 Pro è l'IA del popolo: un modello che non compete alla frontiera dell'intelligenza, ma che porta IA capace a tutti a un prezzo praticamente gratuito. Per studenti, hobbisti, piccole imprese e sviluppatori in mercati sensibili ai costi, DeepSeek V4 Pro è spesso l'unica opzione praticabile.

Punteggi chiave:

  • Artificial Analysis Intelligence Index: 44,3 (top 10 globale)
  • QI Mensa Norway (TrackingAI): 111 (sopra la media umana)
  • AI IQ composto (VexoWire): ~111 stimato
  • GDPval-AA v2: top 10
  • Humanity's Last Exam: top 10
  • Tasso di allucinazione: moderato
  • Costo: 0,44/0,87 per 1M token (il più basso tra tutti i modelli principali)
  • Open-source: pesi disponibili per deployment locale

1. La rivoluzione economica

DeepSeek V4 Pro rappresenta un cambiamento fondamentale nel panorama dell'IA: la democratizzazione dell'intelligenza. Mentre i laboratori americani (OpenAI, Anthropic, Google, xAI) competono alla frontiera — spingendo i punteggi di QI da 130 a 140 a 145 — DeepSeek si è concentrato su un obiettivo diverso: rendere l'IA capace accessibile a tutti.

A 0,44 per 1M token di input e0,87 per 1M di output, DeepSeek V4 Pro è sorprendentemente economico. Per mettere in prospettiva: elaborare un documento tipico delle dimensioni di un libro (circa 100.000 token) costa approssimativamente 0,04 di input e0,09 di output. La stessa attività costerebbe 0,50-1,00 con Gemini, 1,00-3,00 con Claude o GPT-5.5.

Questo non è solo uno sconto — è una categoria diversa di prodotto. DeepSeek V4 Pro rende l'IA accessibile a:

  • Studenti che non possono permettersi abbonamenti di $20/mese
  • Piccole imprese in mercati in via di sviluppo
  • Hobbisti e sperimentatori
  • Sviluppatori che creano applicazioni ad alto volume
  • Ricercatori che elaborano enormi set di dati con budget limitati

E la cosa remarkable è: DeepSeek V4 Pro è genuinamente capace. Ottiene 111 nel test QI Mensa Norway — sopra la media umana di 100, e superiore a circa il 25% delle persone. Non è un genio, ma è abbastanza intelligente per la maggior parte delle attività quotidiane: scrittura, programmazione, analisi, traduzione, riassunto.


2. Analisi dei benchmark

Test QI Mensa Norway: 111 (sopra la media)

Consiste di 36 domande di riconoscimento di pattern visivi. DeepSeek V4 Pro ottiene 111 — sopra la media umana di 100, collocandolo nella fascia "sopra la media". Questo è superiore a circa il 25% degli umani, ma ben al di sotto dei modelli di frontiera (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).

Un QI di 111 significa che DeepSeek V4 Pro può riconoscere pattern visivi e ragionare astrattamente a un livello paragonabile a uno studente universitario brillante. Non risolverà i puzzle più difficili, ma gestisce la maggior parte delle attività di ragionamento quotidiano competentemente.

Il divario tra DeepSeek V4 Pro (111) e i modelli di frontiera (130-145) è significativo — circa 20-35 punti di QI, o circa 1-2 deviazioni standard. Questo significa che i modelli di frontiera sono sostanzialmente più intelligenti nei test cognitivi puri. Ma per attività che non richiedono ragionamento di livello genio — che è la maggior parte — DeepSeek V4 Pro è più che adeguato.

Artificial Analysis Intelligence Index v4.1: 44,3 (top 10)

Sull'Intelligence Index, DeepSeek V4 Pro ottiene 44,3 — collocandosi nei top 10 globali, ma circa 10-11 punti dietro i leader di frontiera (Claude 55,7, GPT-5.5 54,8). Questo divario è significativo ma atteso data la differenza di prezzo.

Decomposizione dei componenti dell'Index:

  • GDPval-AA v2: DeepSeek punteggia ragionevolmente ma resta indietro rispetto a Claude e GPT-5.5 in attività complesse multi-step
  • AA-Omniscience: DeepSeek ha un tasso di allucinazione moderato — non basso come Claude, ma accettabile per la maggior parte degli usi
  • GPQA: DeepSeek performa adeguatamente in domande scientifiche di livello post-laurea
  • HLE: DeepSeek si colloca nei top 10 in Humanity's Last Exam
  • ARC-AGI: DeepSeek ha difficoltà con il ragionamento astratto rispetto ai modelli di frontiera
  • LMSYS Arena: DeepSeek ottiene punteggi decenti di preferenza umana, particolarmente in attività di programmazione

AI IQ composto (VexoWire): ~111

Il QI composto di VexoWire combina più test (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Il QI composto stimato di DeepSeek V4 Pro è ~111 — coerente con il suo punteggio Mensa Norway. Lo colloca fermamente nella fascia "sopra la media", paragonabile a un umano brillante ma ben al di sotto del livello genio.

GDPval-AA v2: top 10

Nel benchmark agentico, DeepSeek V4 Pro si colloca nei top 10. È significativamente meno capace di Claude (1.890 Elo) e GPT-5.5 (1.850 Elo) in attività complesse multi-step, ma può gestire carichi di lavoro agentici moderati. Per automazione semplice, attività di programmazione di base e istruzioni multi-step dirette, DeepSeek V4 Pro è competente.

Humanity's Last Exam (HLE): top 10

Nelle domande accademiche più difficili, DeepSeek V4 Pro si colloca nei top 10 tra i modelli di IA. Questo riflette il forte addestramento di DeepSeek su dati accademici e scientifici — il modello ha un'ampia conoscenza trasversale alle discipline, anche se non può eguagliare la profondità di ragionamento dei modelli di frontiera.


3. Cosa significa un QI di 111?

Per contestualizzare il QI di 111 di DeepSeek V4 Pro:

  • 85-115 (68% delle persone): Intelligenza media
  • 115-130 (14%): Sopra la media ad alta
  • 130-145 (2%): Dotato — qualifica per Mensa (top 2%)
  • 145-160 (0,1%): Altamente dotato / genio

DeepSeek V4 Pro, a 111, si situa nella parte alta della fascia media — più intelligente di circa il 25% degli umani, ma senza raggiungere del tutto la soglia "sopra la media" di 115. Se fosse una persona, sarebbe paragonabile a uno studente universitario brillante o un professionista capace — non un genio, ma certamente competente.

Questo è notevolmente inferiore ai modelli di frontiera:

  • Claude Opus 4.8: ~130 (dotato)
  • Gemini 3.1 Pro: 141 (altamente dotato)
  • GPT-5.5: ~145 (genio)
  • Grok-4.20: 145 (genio)

Il divario è significativo — circa 20-35 punti di QI. Ma la domanda chiave è: il divario conta per il tuo caso d'uso? Per la maggior parte delle attività quotidiane — scrivere email, riassumere documenti, programmazione di base, traduzione — un QI di 111 è più che sufficiente. Il vantaggio dei modelli di frontiera si manifesta nei problemi più difficili: dimostrazioni matematiche complesse, ragionamento multi-step intricato, domande di ricerca all'avanguardia.


4. Dove DeepSeek V4 Pro eccelle

Rapporto qualità-prezzo

Questa è la caratteristica definitoria di DeepSeek V4 Pro. A 0,44/0,87 per 1M token, è di gran lunga il modello di IA principale più economico. Per applicazioni ad alto volume — chatbot che servono migliaia di utenti, elaborazione massiva di documenti, analisi di dati su larga scala — il risparmio è enorme. Potresti eseguire 10-30 interrogazioni DeepSeek per il prezzo di una singola interrogazione Claude o GPT-5.5.

Programmazione e attività tecniche

DeepSeek V4 Pro è particolarmente forte nelle attività di programmazione. DeepSeek ha investito pesantemente nei dati di addestramento del codice, e il modello performa bene in benchmark come HumanEval e MBPP. Per sviluppatori che hanno bisogno di un assistente di codifica ma non possono permettersi prezzi di frontiera, DeepSeek V4 Pro è un'eccellente scelta.

Disponibilità open-source

I pesi di DeepSeek V4 Pro sono disponibili per deployment locale. Questo significa che le organizzazioni possono eseguire il modello sul proprio hardware, evitando interamente i costi API e mantenendo i dati privati. Per organizzazioni attente alla sicurezza, ricercatori in ambienti ristretti e sviluppatori che necessitano di controllo totale, questo è un grande vantaggio.

Supporto multilingue

DeepSeek V4 Pro è addestrato estensivamente in cinese e inglese, con forte supporto per altre lingue principali. Per applicazioni in cinese, DeepSeek è tra i migliori modelli disponibili — a volte superando i modelli occidentali in attività in lingua cinese.

Ragionamento matematico

Sebbene non al livello di GPT-5.5, DeepSeek V4 Pro è competente nel ragionamento matematico. Può risolvere la maggior parte dei problemi matematici di livello scuola superiore e università, e gestisce aritmetica e algebra in modo affidabile. Per attività matematiche quotidiane, è più che adeguato.

Velocità

DeepSeek V4 Pro è veloce — le sue dimensioni ridotte e l'architettura ottimizzata significano che genera risposte rapidamente. Per applicazioni dove la latenza conta — chat in tempo reale, strumenti interattivi, servizio clienti — DeepSeek V4 Pro offre prestazioni reattive.


5. Dove DeepSeek V4 Pro cade

QI grezzo e ragionamento complesso

Con un QI di 111, DeepSeek V4 Pro è significativamente al di sotto dei modelli di frontiera nelle attività di ragionamento complesso. Per i problemi più difficili — matematica competitiva, puzzle logici avanzati, ragionamento astratto multi-step — i modelli di frontiera sono sostanzialmente migliori. Se la tua attività richiede ragionamento di livello genio, DeepSeek V4 Pro avrà difficoltà dove Claude o GPT-5.5 avrebbero successo.

Compiti agentici

Nel GDPval-AA v2, DeepSeek V4 Pro è nei top 10 ma ben dietro a Claude e GPT-5.5. Per compiti reali complessi e multi-step — scrivere grandi progetti software, gestire flussi di ricerca, eseguire piani intricati — DeepSeek V4 Pro è meno affidabile. Può gestire compiti agentici semplici ma ha difficoltà con quelli complessi.

Tasso di allucinazione

DeepSeek V4 Pro ha un tasso di allucinazione moderato — superiore a Claude (35,9%) e Gemini. È più propenso a affermare con sicurezza informazioni errate, particolarmente su argomenti di nicchia o specializzati. Per applicazioni dove l'accuratezza fattuale è critica (ricerca, diritto, medicina), Claude è più affidabile.

Intelligenza emotiva

Il QE (intelligenza emotiva) di DeepSeek V4 Pro è stimato a ~105 — inferiore a tutti i modelli di frontiera (Claude ~132, GPT-5.5 ~120, Gemini ~115, Grok ~110). Le sue risposte tendono ad essere più meccaniche e meno sfumate nella comprensione delle emozioni umane. Per app di terapia, servizio clienti o interazioni umane sensibili, questa è una limitazione.

Sicurezza e allineamento

DeepSeek V4 Pro è soggetto a requisiti normativi cinesi, il che significa che potrebbe rifiutarsi di rispondere a certe domande politicamente sensibili. Questo è diverso dai filtri di sicurezza dei modelli occidentali (che si concentrano su contenuti dannosi) e può influire sulla sua utilità per certi argomenti.


6. DeepSeek V4 Pro vs altri modelli

Modello Intelligence Index QI Mensa Norway AI IQ stim. Allucinazione Costo/1M Open-source
DeepSeek V4 Pro 44,3 ~111 ~111 moderato 0,44/0,87
Claude Opus 4.8 55,7 ~130 ~132 35,9% (min) 5/25 no
GPT-5.5 54,8 ~145 ~136 moderato 5/30 no
Gemini 3.1 Pro 46,5 141 ~131 bassa 2/12 no
Grok-4.20 top 5 145 ~140 moderato 3/15 no

L'immagine: DeepSeek V4 Pro è il campione economico — non il più intelligente, ma di gran lunga il più accessibile. Claude è il professionista capace — il migliore in compiti reali e accuratezza fattuale. GPT-5.5 è il genio dei test — il migliore in matematica e ragionamento visivo. Gemini è il campione del valore — miglior rapporto qualità-prezzo tra i modelli di frontiera. Grok-4.20 è il campione del QI grezzo — QI più alto con personalità unica.

Per utenti che hanno bisogno di IA capace al prezzo più basso possibile, DeepSeek V4 Pro è la scelta chiara. Non eguaglierà i modelli di frontiera nei problemi più difficili, ma per il 90% delle attività quotidiane, è più che sufficiente — per una frazione del costo.


7. Cosa significa questo per gli umani?

DeepSeek V4 Pro opera a un QI di ~111 — più intelligente di circa il 25% degli umani. Ma:

  • Il QI non è tutto: un QI di 111 è sopra la media e sufficiente per la maggior parte delle attività pratiche
  • Il costo conta più del QI per la maggior parte degli usi: per applicazioni quotidiane, il risparmio di 10x di DeepSeek spesso conta più del divario di 20-35 punti di QI con i modelli di frontiera
  • L'open-source permette l'innovazione: i pesi aperti di DeepSeek permettono a ricercatori e sviluppatori di costruire soluzioni personalizzate, fine-tunare per domini specifici ed eseguire localmente
  • Conoscenza ≠ comprensione: come tutti i modelli di IA, DeepSeek ha accesso a vaste conoscenze ma non "comprende" veramente come un umano
  • Nessuna coscienza: QI alto non significa coscienza. DeepSeek è un sistema sofisticato di riconoscimento di pattern, non un essere pensante
  • Democratizzazione dell'IA: DeepSeek V4 Pro dimostra che l'IA capace non deve essere costosa — può essere accessibile a tutti

La risposta più onesta: DeepSeek V4 Pro è più intelligente di un quarto degli umani nei test cognitivi, e per la maggior parte degli scopi pratici, è la scelta più intelligente — non perché è il più intelligente, ma perché offre il maggior valore per dollaro.

Come si confronta il tuo QI con DeepSeek V4 Pro? Fai la valutazione professionale di QI di NeuroLab.
Fai il test ora →


Conclusione

💡 Punti chiave
- Il QI di DeepSeek V4 Pro è 111 nel Mensa Norway — sopra la media umana, più intelligente di ~25% delle persone.

  • 44,3 sull'Intelligence Index — top 10 globale, ma ~10 punti dietro i modelli di frontiera.
  • Il costo più basso di qualsiasi modello principale — 0,44/0,87 per 1M token, circa 10x più economico di Claude o GPT-5.5.
  • Open-source — pesi disponibili per deployment locale, permettendo privacy e personalizzazione.
  • Meglio per: applicazioni sensibili ai costi, programmazione, attività ad alto volume, applicazioni in cinese, deployment locale.
  • Non meglio per: ragionamento complesso (modelli di frontiera vincono), compiti agentici (Claude vince), accuratezza fattuale (Claude vince), intelligenza emotiva (Claude vince).
  • La lezione: l'intelligenza non è solo essere il più intelligente — è essere accessibile. DeepSeek V4 Pro democratizza l'IA, portando intelligenza capace a tutti.