Quel est le QI de DeepSeek V4 ?
DeepSeek V4 Pro obtient 111 au test de QI Mensa Norway et 44,3 sur l'Intelligence Index. Nous analysons chaque benchmark et expliquons pourquoi c'est le meilleur modèle d'IA économique.
DeepSeek V4 Pro : le champion open-source de Chine
DeepSeek V4 Pro est le modèle flagship de DeepSeek, le laboratoire chinois d'IA qui a stupéfié le monde par sa combinaison de faible coût et de haute performance. Lancé début 2026, DeepSeek V4 Pro obtient 111 au test de QI Mensa Norway et 44,3 sur l'Artificial Analysis Intelligence Index v4.1 — se classant dans le top 10 mondial, mais loin derrière les modèles de frontière (Claude à 55,7, GPT-5.5 à 54,8).
Ce qui rend DeepSeek V4 Pro remarquable, ce n'est pas son intelligence brute — c'est son prix. À 0,44/0,87 par 1M tokens, il coûte environ 10 fois moins que Claude (5/25) et GPT-5.5 (5/30), et 5 fois moins que Gemini (2/12). Pour le prix d'une seule requête à Claude, vous pourriez faire dix requêtes à DeepSeek V4 Pro. Et pourtant, il obtient 111 à un test de QI — supérieur à environ 25% des humains.
DeepSeek V4 Pro est l'IA du peuple : un modèle qui ne concourt pas à la frontière de l'intelligence, mais qui apporte une IA capable à tout le monde à un prix pratiquement gratuit. Pour les étudiants, les amateurs, les petites entreprises et les développeurs dans des marchés sensibles aux coûts, DeepSeek V4 Pro est souvent la seule option viable.
Scores clés :
- Artificial Analysis Intelligence Index : 44,3 (top 10 mondial)
- QI Mensa Norway (TrackingAI) : 111 (supérieur à la moyenne humaine)
- AI IQ composite (VexoWire) : ~111 estimé
- GDPval-AA v2 : top 10
- Humanity's Last Exam : top 10
- Taux d'hallucination : modéré
- Coût : 0,44/0,87 par 1M tokens (le plus bas parmi tous les modèles majeurs)
- Open-source : poids disponibles pour déploiement local
1. La révolution budgétaire
DeepSeek V4 Pro représente un changement fondamental dans le paysage de l'IA : la démocratisation de l'intelligence. Tandis que les laboratoires américains (OpenAI, Anthropic, Google, xAI) concourent à la frontière — poussant les scores de QI de 130 à 140 à 145 — DeepSeek s'est concentré sur un objectif différent : rendre l'IA capable abordable pour tous.
À 0,44par 1M tokens d'entrée et 0,87 par 1M de sortie, DeepSeek V4 Pro est stupéfiant de bon marché. Pour mettre les choses en perspective : traiter un document typique de la taille d'un livre (environ 100 000 tokens) coûte approximativement 0,04en entrée et 0,09 en sortie. La même tâche coûterait 0,50-1,00 avec Gemini, 1,00-3,00 avec Claude ou GPT-5.5.
Ce n'est pas qu'une remise — c'est une catégorie de produit différente. DeepSeek V4 Pro rend l'IA accessible à :
- Étudiants qui ne peuvent pas se permettre des abonnements à 20$/mois
- Petites entreprises sur des marchés en développement
- Amateurs et bricoleurs menant des expériences
- Développeurs construisant des applications à haut volume
- Chercheurs traitant des ensembles de données massifs avec des budgets limités
Et le fait remarquable est : DeepSeek V4 Pro est genuinely capable. Il obtient 111 au test de QI Mensa Norway — au-dessus de la moyenne humaine de 100, et supérieur à environ 25% des personnes. Ce n'est pas un génie, mais il est suffisamment intelligent pour la plupart des tâches quotidiennes : écriture, programmation, analyse, traduction, résumé.
2. Analyse des benchmarks
Test QI Mensa Norway : 111 (supérieur à la moyenne)
Consiste en 36 questions de reconnaissance de motifs visuels. DeepSeek V4 Pro obtient 111 — au-dessus de la moyenne humaine de 100, le plaçant dans la gamme « supérieur à la moyenne ». C'est plus élevé qu'environ 25% des humains, mais bien en dessous des modèles de frontière (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Un QI de 111 signifie que DeepSeek V4 Pro peut reconnaître des motifs visuels et raisonner abstraitement à un niveau comparable à un étudiant universitaire brillant. Il ne résoudra pas les puzzles les plus difficiles, mais gère la plupart des tâches de raisonnement quotidiennes avec compétence.
L'écart entre DeepSeek V4 Pro (111) et les modèles de frontière (130-145) est significatif — environ 20-35 points de QI, soit environ 1-2 écarts-types. Cela signifie que les modèles de frontière sont substantiellement plus intelligents sur des tests cognitifs purs. Mais pour les tâches qui ne nécessitent pas un raisonnement de niveau génie — ce qui est la plupart — DeepSeek V4 Pro est plus qu'adéquat.
Artificial Analysis Intelligence Index v4.1 : 44,3 (top 10)
Sur l'Intelligence Index, DeepSeek V4 Pro obtient 44,3 — se classant dans le top 10 mondial, mais environ 10-11 points derrière les leaders de frontière (Claude 55,7, GPT-5.5 54,8). Cet écart est significatif mais attendu compte tenu de la différence de prix.
Décomposition des composants de l'Index :
- GDPval-AA v2 : DeepSeek marque raisonnablement mais reste derrière Claude et GPT-5.5 sur les tâches complexes multi-étapes
- AA-Omniscience : DeepSeek a un taux d'hallucination modéré — pas aussi bas que Claude, mais acceptable pour la plupart des usages
- GPQA : DeepSeek performe adéquatement sur les questions scientifiques de niveau troisième cycle
- HLE : DeepSeek se classe dans le top 10 au Humanity's Last Exam
- ARC-AGI : DeepSeek a des difficultés avec le raisonnement abstrait comparé aux modèles de frontière
- LMSYS Arena : DeepSeek obtient des scores décents de préférence humaine, particulièrement pour les tâches de programmation
AI IQ composite (VexoWire) : ~111
Le QI composite de VexoWire combine plusieurs tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Le QI composite estimé de DeepSeek V4 Pro est ~111 — cohérent avec son score Mensa Norway. Cela le place fermement dans la gamme « supérieur à la moyenne », comparable à un humain brillant mais bien en dessous du niveau génie.
GDPval-AA v2 : top 10
Sur le benchmark agentique, DeepSeek V4 Pro se classe dans le top 10. Il est significativement moins capable que Claude (1 890 Elo) et GPT-5.5 (1 850 Elo) sur les tâches complexes multi-étapes, mais peut gérer des charges de travail agentiques modérées. Pour l'automatisation simple, les tâches de programmation basiques et les instructions multi-étapes directes, DeepSeek V4 Pro est compétent.
Humanity's Last Exam (HLE) : top 10
Sur les questions académiques les plus difficiles, DeepSeek V4 Pro se classe dans le top 10 parmi les modèles d'IA. Cela reflète le fort entraînement de DeepSeek sur des données académiques et scientifiques — le modèle a une large connaissance à travers les disciplines, même s'il ne peut pas égaler la profondeur de raisonnement des modèles de frontière.
3. Que signifie un QI de 111 ?
Pour mettre le QI de 111 de DeepSeek V4 Pro en contexte :
- 85-115 (68% des gens) : Intelligence moyenne
- 115-130 (14%) : Au-dessus de la moyenne à élevée
- 130-145 (2%) : Surdoué — qualifie pour Mensa (top 2%)
- 145-160 (0,1%) : Hautement surdoué / génie
DeepSeek V4 Pro, à 111, se situe au haut de la gamme moyenne — plus intelligent qu'environ 25% des humains, mais n'atteignant pas tout à fait le seuil « supérieur à la moyenne » de 115. Si c'était une personne, elle serait comparable à un étudiant universitaire brillant ou un professionnel capable — pas un génie, mais certainement compétent.
C'est notablement inférieur aux modèles de frontière :
- Claude Opus 4.8 : ~130 (surdoué)
- Gemini 3.1 Pro : 141 (hautement surdoué)
- GPT-5.5 : ~145 (génie)
- Grok-4.20 : 145 (génie)
L'écart est significatif — environ 20-35 points de QI. Mais voici la question clé : l'écart compte-t-il pour votre cas d'usage ? Pour la plupart des tâches quotidiennes — écrire des emails, résumer des documents, programmation basique, traduction — un QI de 111 est plus que suffisant. L'avantage des modèles de frontière se manifeste sur les problèmes les plus difficiles : démonstrations mathématiques complexes, raisonnement multi-étapes intriqué, questions de recherche de pointe.
4. Où DeepSeek V4 Pro excelle
Rapport qualité-prix
C'est la caractéristique définissante de DeepSeek V4 Pro. À 0,44/0,87 par 1M tokens, c'est de loin le modèle d'IA majeur le moins cher. Pour les applications à haut volume — chatbots servant des milliers d'utilisateurs, traitement massif de documents, analyse de données à grande échelle — les économies sont énormes. Vous pourriez exécuter 10-30 requêtes DeepSeek pour le prix d'une seule requête Claude ou GPT-5.5.
Programmation et tâches techniques
DeepSeek V4 Pro est particulièrement fort en programmation. DeepSeek a fortement investi dans les données d'entraînement de code, et le modèle performe bien sur des benchmarks comme HumanEval et MBPP. Pour les développeurs qui ont besoin d'un assistant de codage mais ne peuvent pas se permettre les prix de frontière, DeepSeek V4 Pro est un excellent choix.
Disponibilité open-source
Les poids de DeepSeek V4 Pro sont disponibles pour déploiement local. Cela signifie que les organisations peuvent exécuter le modèle sur leur propre matériel, évitant entièrement les coûts d'API et gardant les données privées. Pour les organisations soucieuses de sécurité, les chercheurs en environnements restreints et les développeurs nécessitant un contrôle total, c'est un avantage majeur.
Support multilingue
DeepSeek V4 Pro est entraîné extensivement en chinois et anglais, avec un fort support pour d'autres langues majeures. Pour les applications en chinois, DeepSeek est parmi les meilleurs modèles disponibles — surpassant parfois les modèles occidentaux sur les tâches en langue chinoise.
Raisonnement mathématique
Bien que pas au niveau de GPT-5.5, DeepSeek V4 Pro est compétent en raisonnement mathématique. Il peut résoudre la plupart des problèmes de mathématiques de niveau lycée et université, et gère l'arithmétique et l'algèbre de façon fiable. Pour les tâches mathématiques quotidiennes, c'est plus que suffisant.
Vitesse
DeepSeek V4 Pro est rapide — sa taille réduite et son architecture optimisée signifient qu'il génère des réponses rapidement. Pour les applications où la latence compte — chat en temps réel, outils interactifs, service client — DeepSeek V4 Pro offre des performances réactives.
5. Où DeepSeek V4 Pro pèche
QI brut et raisonnement complexe
Avec un QI de 111, DeepSeek V4 Pro est significativement en dessous des modèles de frontière sur les tâches de raisonnement complexe. Pour les problèmes les plus difficiles — mathématiques compétitives, puzzles logiques avancés, raisonnement abstrait multi-étapes — les modèles de frontière sont substantiellement meilleurs. Si votre tâche nécessite un raisonnement de niveau génie, DeepSeek V4 Pro aura des difficultés là où Claude ou GPT-5.5 réussiraient.
Tâches agentiques
Sur GDPval-AA v2, DeepSeek V4 Pro est dans le top 10 mais bien derrière Claude et GPT-5.5. Pour les tâches réelles complexes et multi-étapes — écrire de grands projets logiciels, gérer des flux de recherche, exécuter des plans intriqués — DeepSeek V4 Pro est moins fiable. Il peut gérer des tâches agentiques simples mais a des difficultés avec les complexes.
Taux d'hallucination
DeepSeek V4 Pro a un taux d'hallucination modéré — supérieur à Claude (35,9%) et Gemini. Il est plus susceptible d'affirmer avec assurance des informations incorrectes, particulièrement sur des sujets de niche ou spécialisés. Pour les applications où la précision factuelle est critique (recherche, droit, médecine), Claude est plus fiable.
Intelligence émotionnelle
Le QE (intelligence émotionnelle) de DeepSeek V4 Pro est estimé à ~105 — inférieur à tous les modèles de frontière (Claude ~132, GPT-5.5 ~120, Gemini ~115, Grok ~110). Ses réponses tendent à être plus mécaniques et moins nuancées dans la compréhension des émotions humaines. Pour les apps de thérapie, le service client ou les interactions humaines sensibles, c'est une limitation.
Sécurité et alignement
DeepSeek V4 Pro est soumis aux exigences réglementaires chinoises, ce qui signifie qu'il peut refuser de répondre à certaines questions politiquement sensibles. Cela diffère des filtres de sécurité des modèles occidentaux (qui se concentrent sur les contenus nuisibles) et peut affecter son utilité pour certains sujets.
6. DeepSeek V4 Pro vs autres modèles
| Modèle | Intelligence Index | QI Mensa Norway | AI IQ est. | Hallucination | Coût/1M | Open-source |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 44,3 | ~111 | ~111 | modéré | 0,44/0,87 | oui |
| Claude Opus 4.8 | 55,7 | ~130 | ~132 | 35,9% (min) | 5/25 | non |
| GPT-5.5 | 54,8 | ~145 | ~136 | modéré | 5/30 | non |
| Gemini 3.1 Pro | 46,5 | 141 | ~131 | faible | 2/12 | non |
| Grok-4.20 | top 5 | 145 | ~140 | modéré | 3/15 | non |
L'image : DeepSeek V4 Pro est le champion budgétaire — pas le plus intelligent, mais de loin le plus abordable. Claude est le professionnel capable — le meilleur en tâches réelles et précision factuelle. GPT-5.5 est le génie des tests — le meilleur en maths et raisonnement visuel. Gemini est le champion du rapport qualité-prix — meilleur coût-efficacité parmi les modèles de frontière. Grok-4.20 est le champion du QI brut — QI le plus élevé avec une personnalité unique.
Pour les utilisateurs qui veulent une IA capable au prix le plus bas possible, DeepSeek V4 Pro est le choix évident. Il n'égalera pas les modèles de frontière sur les problèmes les plus difficiles, mais pour 90% des tâches quotidiennes, c'est plus que suffisant — pour une fraction du coût.
7. Qu'est-ce que cela signifie pour les humains ?
DeepSeek V4 Pro opère à un QI de ~111 — plus intelligent qu'environ 25% des humains. Mais :
- Le QI n'est pas tout : un QI de 111 est au-dessus de la moyenne et suffisant pour la plupart des tâches pratiques
- Le coût compte plus que le QI pour la plupart des usages : pour les applications quotidiennes, l'économie de 10x de DeepSeek compte souvent plus que l'écart de QI de 20-35 points avec les modèles de frontière
- L'open-source permet l'innovation : les poids ouverts de DeepSeek permettent aux chercheurs et développeurs de construire des solutions personnalisées, de fine-tuner pour des domaines spécifiques et d'exécuter localement
- Connaissance ≠ compréhension : comme tous les modèles d'IA, DeepSeek a accès à de vastes connaissances mais ne « comprend » pas véritablement comme un humain
- Pas de conscience : un QI élevé ne signifie pas la sentience. DeepSeek est un système sophistiqué de reconnaissance de motifs, pas un être pensant
- Démocratisation de l'IA : DeepSeek V4 Pro prouve que l'IA capable n'a pas besoin d'être chère — elle peut être accessible à tous
La réponse la plus honnête : DeepSeek V4 Pro est plus intelligent qu'un quart des humains aux tests cognitifs, et pour la plupart des usages pratiques, c'est le choix le plus intelligent — non pas parce qu'il est le plus intelligent, mais parce qu'il offre le plus de valeur par dollar.
Conclusion
- 44,3 sur l'Intelligence Index — top 10 mondial, mais ~10 points derrière les modèles de frontière.
- Le coût le plus bas de tous les modèles majeurs — 0,44/0,87 par 1M tokens, environ 10x moins cher que Claude ou GPT-5.5.
- Open-source — poids disponibles pour déploiement local, permettant confidentialité et personnalisation.
- Idéal pour : applications sensibles aux coûts, programmation, tâches à haut volume, applications en chinois, déploiement local.
- Pas idéal pour : raisonnement complexe (modèles de frontière gagnent), tâches agentiques (Claude gagne), précision factuelle (Claude gagne), intelligence émotionnelle (Claude gagne).
- La leçon : l'intelligence ne consiste pas seulement à être le plus intelligent — mais à être accessible. DeepSeek V4 Pro démocratise l'IA, apportant une intelligence capable à tous.