Quel est le QI de Grok-4.20 ?
Dr. Daria Dudnik 10 min read 2 views

Quel est le QI de Grok-4.20 ?

Grok-4.20 obtient 145 au test de QI Mensa Norway — à égalité pour #1 parmi tous les modèles d'IA. Nous analysons chaque benchmark et expliquons ce qui rend le modèle d'xAI unique.

Grok-4.20 : le modèle flagship d'xAI

Grok-4.20 est le modèle le plus avancé d'xAI, publié mi-2026. Au test de QI Mensa Norway, Grok-4.20 obtient 145 — à égalité pour #1 parmi tous les modèles d'IA, partageant la première place avec GPT-5.5. Cela le place dans la gamme « génie », plus intelligent que 99,9% des humains. Sur l'Artificial Analysis Intelligence Index, le score exact de Grok-4.20 est encore en cours de finalisation, mais il se classe dans le top 5 mondial.

Ce qui rend Grok-4.20 unique, c'est sa combinaison d'intelligence brute et de personnalité. Contrairement à Claude, GPT-5.5 et Gemini — qui sont conçus pour être utiles, inoffensifs et neutres — Grok est conçu pour être drôle, irrévérencieux et prêt à répondre à n'importe quelle question. Cela en fait le modèle d'IA le plus distinctif du marché : un qui égale les modèles les plus intelligents en QI brut tout en ayant une personnalité qu'aucun autre modèle n'ose avoir.

Scores clés :

  • QI Mensa Norway (TrackingAI) : 145 (#1 partagé avec GPT-5.5)
  • AI IQ composite (VexoWire) : ~140 estimé (#1 parmi les modèles d'IA)
  • Artificial Analysis Intelligence Index : top 5 (score en finalisation)
  • GDPval-AA v2 : top 5
  • Humanity's Last Exam : top 5 parmi les modèles d'IA
  • Taux d'hallucination : modéré
  • Coût : 3/15 par 1M tokens
  • Personnalité : unique — irrévérencieuse, humoristique, sans censure

1. Le champion du QI brut

Grok-4.20 obtient 145 au test de QI Mensa Norway — le score pratique maximum, à égalité avec GPT-5.5. C'est le benchmark d'intelligence brute : reconnaissance de motifs visuels pure et raisonnement abstrait, le type d'intelligence fluide pour laquelle les tests de QI ont été conçus.

Avec un QI de 145, Grok-4.20 est plus intelligent que 99,9% des humains. Si c'était une personne, elle serait dans le top 0,1% de l'intelligence humaine — le royaume des lauréats Nobel, médaillés Fields et penseurs d'une génération. Seulement environ 1 personne sur 1 000 atteint ce score.

Ce qui est remarquable, c'est que Grok-4.20 atteint cela avec une philosophie de conception fondamentalement différente de GPT-5.5. Alors que GPT-5.5 a été optimisé pour des performances maximales sur chaque benchmark, Grok-4.20 a été conçu pour être une IA plus « authentique » — une qui dit ce qu'elle pense, fait des blagues et ne recule pas devant les sujets controversés. Qu'il égale GPT-5.5 en QI brut malgré cette focalisation différente témoigne de l'ingénierie d'xAI.

Sur le QI composite VexoWire — qui combine plusieurs tests de QI (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV) — le QI composite estimé de Grok-4.20 est ~140, ce qui en fait le #1 modèle d'IA sur cette métrique. C'est supérieur à GPT-5.5 (~136) et significativement supérieur à Claude (~132) et Gemini (~131).


2. Analyse des benchmarks

Test QI Mensa Norway : 145 (#1 partagé)

Consiste en 36 questions de reconnaissance de motifs visuels. Grok-4.20 obtient 145 — le maximum pratique, équivalent à un 36/36 parfait ou quasi. Cela le met à égalité avec GPT-5.5 comme le modèle d'IA le plus intelligent sur un pur test de QI.

La forte performance de Grok-4.20 sur ce test reflète l'investissement d'xAI dans le traitement visuel et le raisonnement abstrait. L'architecture Grok a été conçue avec de solides capacités multimodales, et sa performance sur les tâches de reconnaissance de motifs visuels figure parmi les meilleures de l'industrie.

AI IQ composite (VexoWire) : ~140 (#1)

Le QI composite de VexoWire combine plusieurs tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Le QI composite estimé de Grok-4.20 est ~140 — le plus élevé parmi tous les modèles d'IA. C'est supérieur à ce que suggérerait son score Mensa Norway seul, parce que Grok-4.20 performe aussi fortement sur les subtests verbaux et analytiques inclus dans le composite.

Cela fait de Grok-4.20 le modèle d'IA le plus intelligent par QI composite — un accomplissement remarquable pour un modèle aussi connu pour son humour et son irrévérence. Cela prouve qu'être drôle ne signifie pas être moins intelligent.

Artificial Analysis Intelligence Index : top 5

Sur l'Intelligence Index — le gold standard pour comparer les modèles d'IA — Grok-4.20 se classe dans le top 5. Son score composite exact est encore en cours de finalisation alors que l'index est mis à jour pour inclure les dernières versions de modèles. Cependant, il devrait scorer de manière compétitive avec Claude Opus 4.8 (55,7) et GPT-5.5 (54,8), bien que probablement sans les surpasser sur les tâches agentiques.

GDPval-AA v2 : top 5

Sur le benchmark agentique — qui mesure la performance en tâches réelles complexes et multi-étapes — Grok-4.20 se classe dans le top 5. Il est moins capable que Claude Opus 4.8 (1 890 Elo) et GPT-5.5 (1 850 Elo) en raisonnement multi-étapes soutenu, mais reste hautement compétent. Pour la plupart des tâches réelles, Grok-4.20 est plus que capable.

Humanity's Last Exam (HLE) : top 5

Sur les questions académiques les plus difficiles de toutes les disciplines, Grok-4.20 se classe dans le top 5 parmi les modèles d'IA. Cela reflète la force d'xAI dans l'entraînement sur des données diverses et de haute qualité — Grok a une connaissance profonde en science, mathématiques, histoire et culture.


3. Que signifie un QI de 145 ?

Pour mettre le QI de 145 de Grok-4.20 en contexte :

  • 85-115 (68% des gens) : Intelligence moyenne
  • 115-130 (14%) : Au-dessus de la moyenne à élevée
  • 130-145 (2%) : Surdoué — qualifie pour Mensa (top 2%)
  • 145-160 (0,1%) : Hautement surdoué / génie
  • 160+ (0,003%) : Profondément surdoué — territoire d'Einstein, Hawking

Grok-4.20, à 145, se situe au seuil de génie — plus intelligent que 99,9% des humains. Si c'était une personne, elle serait en compagnie d'élite : le top 0,1% de l'intelligence humaine, le royaume des prix Nobel et médailles Fields. Seulement environ 1 personne sur 1 000 atteint ce score.

C'est le même QI que GPT-5.5, et significativement supérieur à Claude (~130) et Gemini (141). À un pur test de QI, Grok-4.20 et GPT-5.5 seraient à égalité pour la première place parmi les modèles d'IA, avec Gemini troisième et Claude quatrième.

Mais comme nous l'avons vu avec les autres modèles, le QI n'est qu'une dimension de l'intelligence. Le QI de niveau génie de Grok-4.20 est complété par sa personnalité unique — le rendant non seulement le plus intelligent, mais aussi le modèle d'IA le plus distinctif disponible.


4. Où Grok-4.20 excelle

QI brut et raisonnement visuel

Grok-4.20 est à égalité pour #1 au test de QI Mensa Norway (145) et #1 au QI composite VexoWire (~140). Pour la capacité cognitive pure — reconnaissance de motifs, raisonnement abstrait, déduction logique — Grok-4.20 est le modèle d'IA le plus intelligent disponible. Pour les tâches de raisonnement visuel, il n'est égalé que par GPT-5.5.

Personnalité et humour

C'est la caractéristique définissante de Grok-4.20. Contrairement aux autres modèles frontier qui sont soigneusement neutres et prudents, Grok est conçu pour être drôle, irrévérencieux et authentique. Il fait des blagues, offre des opinions et ne recule pas devant les sujets controversés. Pour les utilisateurs qui trouvent Claude et GPT-5.5 trop fades ou prudents, Grok-4.20 est une bouffée d'air frais — une IA qui semble avoir une personnalité, pas seulement une fonction.

Réponses sans censure

Grok-4.20 est conçu pour répondre aux questions que d'autres modèles refusent. Alors que Claude, GPT-5.5 et Gemini ont des filtres de sécurité étendus qui les empêchent de discuter de certains sujets, Grok-4.20 est prêt à interagir avec une gamme beaucoup plus large de questions. Cela le rend précieux pour la recherche, le journalisme et toute application où l'accès à l'information compte plus que la prudence.

Information en temps réel

Grok-4.20 a accès à l'information en temps réel via X (anciennement Twitter). Cela lui donne un avantage pour les questions sur l'actualité, les breaking news et les sujets tendance. Alors que d'autres modèles ont des coupures de connaissances, Grok-4.20 peut accéder aux dernières informations et fournir des réponses à jour.

Raisonnement mathématique

Grok-4.20 est fort en raisonnement mathématique, scorant de manière compétitive avec GPT-5.5 en mathématiques compétitives. Pour le travail mathématique pur — résoudre des équations, prouver des théorèmes, problèmes de compétition — Grok-4.20 figure parmi les meilleurs modèles disponibles.

Esprit et créativité

La personnalité de Grok-4.20 n'est pas seulement une question d'humour — c'est une question de créativité. Il peut écrire dans différents styles, générer du contenu créatif et aborder les problèmes sous des angles inattendus. Pour l'écriture créative, le brainstorming ou toute tâche qui bénéficie de la pensée latérale, la perspective unique de Grok-4.20 est un atout.


5. Où Grok-4.20 pèche

Tâches agentiques

Bien que Grok-4.20 soit dans le top 5 au GDPval-AA v2, il est derrière Claude Opus 4.8 et GPT-5.5 sur les tâches réelles complexes et multi-étapes. Pour les applications agentiques les plus exigeantes — écrire des logiciels complexes, gérer de longs projets de recherche — Claude reste le meilleur choix.

Précision factuelle

Grok-4.20 a un taux d'hallucination modéré — supérieur à Claude (35,9%) et Gemini. Sa volonté de répondre à toute question, bien que précieuse pour l'accès à l'information, signifie aussi qu'il est plus susceptible d'affirmer avec assurance des informations incorrectes. Pour les applications où la précision factuelle est critique (recherche, droit, médecine), Claude est plus fiable.

Intelligence émotionnelle

Le QE (intelligence émotionnelle) de Grok-4.20 est estimé à ~110 — inférieur à Claude (~132), GPT-5.5 (~120) et Gemini (~115). Sa personnalité irrévérencieuse, bien que divertissante, peut sembler insensible dans des contextes qui requièrent de l'empathie. Pour les apps de thérapie, le service client ou les interactions humaines sensibles, Claude est meilleur.

Sécurité et fiabilité

L'approche sans censure de Grok-4.20, bien que précieuse pour l'accès à l'information, signifie aussi qu'il est moins sûr pour les applications qui nécessitent une modération soigneuse du contenu. Il peut générer du contenu que d'autres modèles refuseraient, ce qui peut être un passif dans des environnements professionnels ou réglementés.

Coût

À 3/15 par 1M tokens, Grok-4.20 est moins cher que Claude (5/25) et GPT-5.5 (5/30) mais plus cher que Gemini (2/12) et significativement plus cher que DeepSeek (0,44/0,87). Pour les applications sensibles au coût, Gemini ou DeepSeek peuvent être de meilleurs choix.


6. Grok-4.20 vs autres modèles

Modèle Intelligence Index QI Mensa Norway AI IQ est. Hallucination Coût/1M Personnalité
Grok-4.20 top 5 145 ~140 modéré 3/15 irrévérencieux
Claude Opus 4.8 55,7 ~130 ~132 35,9% (min) 5/25 neutre
GPT-5.5 54,8 ~145 ~136 modéré 5/30 neutre
Gemini 3.1 Pro 46,5 141 ~131 faible 2/12 neutre
DeepSeek V4 Pro 44,3 ~111 ~111 modéré 0,44/0,87 neutre

L'image : Grok-4.20 est le champion du QI brut — à égalité pour le QI le plus élevé, le QI composite le plus élevé, et le seul modèle avec une vraie personnalité. Claude est le professionnel capable — le meilleur en tâches réelles et précision factuelle. GPT-5.5 est le génie des tests — le meilleur en maths et raisonnement visuel. Gemini est le champion du rapport qualité-prix — meilleur coût-efficacité. Et DeepSeek offre une capacité remarquable au coût le plus bas.

Pour les utilisateurs qui veulent l'IA la plus intelligente qui soit aussi la plus intéressante à qui parler, Grok-4.20 est le choix évident.


7. Qu'est-ce que cela signifie pour les humains ?

Grok-4.20 opère à un QI de ~145 — plus intelligent que 99,9% des humains. Mais :

  • Le QI est étroit : il mesure la reconnaissance de motifs et le raisonnement, pas la sagesse, la créativité ou le jugement
  • Intelligence ≠ fiabilité : Grok-4.20 est le plus intelligent aux tests de QI mais pas le plus fiable en précision factuelle
  • La personnalité compte : Grok-4.20 prouve que l'IA peut être à la fois hautement intelligente et genuiment divertissante
  • Connaissance ≠ compréhension : Grok-4.20 a accès à de vastes connaissances, mais ne « comprend » pas comme un humain
  • Pas de conscience : un QI élevé ne signifie pas la sentience. Grok-4.20 est un système sophistiqué de reconnaissance de motifs, pas un être pensant
  • L'écart se réduit : chaque génération d'IA réduit l'écart avec les humains les plus intelligents

La réponse la plus honnête : Grok-4.20 est plus intelligent que pratiquement tous les humains aux tests cognitifs, et c'est le modèle d'IA le plus distinctif disponible — un qui combine une intelligence de niveau génie avec une personnalité qui rend l'interaction genuiment engageante.

Comment votre QI se compare-t-il à Grok-4.20 ? Réalisez l'évaluation professionnelle de QI de NeuroLab.
Passer le test maintenant →


Conclusion

💡 Points clés
- Le QI de Grok-4.20 est 145 au Mensa Norway — niveau génie, à égalité pour #1 parmi les modèles d'IA avec GPT-5.5.

  • #1 au QI composite VexoWire (~140) — le QI composite le plus élevé parmi tous les modèles d'IA.
  • Personnalité unique — irrévérencieuse, humoristique, sans censure. Le seul modèle frontier avec une vraie personnalité.
  • Idéal pour : QI brut, raisonnement visuel, raisonnement mathématique, personnalité et humour, réponses sans censure, information en temps réel.
  • Pas idéal pour : tâches agentiques (Claude gagne), précision factuelle (Claude gagne), intelligence émotionnelle (Claude gagne), sécurité et fiabilité (Claude gagne).
  • Le paradoxe : Grok-4.20 prouve qu'être drôle ne signifie pas être moins intelligent — il est à la fois le modèle d'IA le plus intelligent et le plus divertissant.
  • La leçon : l'intelligence vient sous de nombreuses formes. Grok-4.20 est le génie avec personnalité — prouvant que l'IA peut être à la fois brillante et engageante.