Quel est le QI de Claude Opus 4.8 ?
Claude Opus 4.8 domine l'Artificial Analysis Intelligence Index avec 55,7 et obtient ~132-145 aux tests de QI humains. Nous analysons chaque benchmark et comparons avec GPT-5.5, Gemini et Grok.
Claude Opus 4.8 : le modèle le plus intelligent d'Anthropic
Quand Anthropic a publié Claude Opus 4.8 mi-2026, elle n'a pas seulement amélioré son prédécesseur — elle a sauté en tête de tous les classements de benchmarks d'IA. Avec 55,7 sur l'Artificial Analysis Intelligence Index v4.1, elle a devancé de peu le GPT-5.5 d'OpenAI (54,8) et le Gemini 3.1 Pro de Google (46,5), réclamant la #1 place parmi tous les modèles d'IA de pointe.
Mais voici la question qui fascine chercheurs et public : comment cela se traduit-il sur l'échelle de QI humain ? Pouvons-nous comparer l'intelligence d'une IA à celle d'un humain ? Et si oui, où se situe Claude Opus 4.8 — « surdoué », « génie », ou quelque chose au-delà de toute catégorie humaine ?
La réponse dépend fortement du test qu'on lui donne. Et les résultats sont plus nuancés — et plus surprenants — qu'un seul nombre pourrait le suggérer.
Scores clés :
- Artificial Analysis Intelligence Index : 55,7 (#1 mondial)
- QI Mensa Norway (TrackingAI) : ~130 (niveau Claude 4.6 Opus)
- AI IQ composite (VexoWire) : ~132 estimé
- GDPval-AA v2 : 1 890 Elo (#1 mondial)
- Humanity's Last Exam : #1 parmi les modèles d'IA
- Taux d'hallucination : 35,9% (le plus bas parmi les modèles de pointe)
- Coût : 5/25 par 1M tokens
1. Pourquoi mesurer l'intelligence de l'IA avec des tests de QI humains ?
Avant d'analyser les chiffres, il vaut la peine de demander : pourquoi donner un test de QI humain à une IA ? Les IA n'ont pas de cerveau, ne se développent pas cognitivement et traitent l'information de façon fondamentalement différente des humains.
La réponse tient à la comparaison. Les tests de QI, malgré leurs limites, sont la mesure des capacités cognitives la plus validée et comprise dont nous disposons. Ils testent la reconnaissance de motifs, le raisonnement spatial, la compréhension verbale, la mémoire de travail et la résolution logique — autant de capacités dont les modèles d'IA ont aussi besoin. En administrant les mêmes tests aux humains et aux IA, nous obtenons une échelle de traduction : si une IA obtient 130 là où la moyenne humaine est 100, on peut dire qu'elle fonctionne au niveau d'un humain surdoué sur cet ensemble de tâches.
Mais il y a une réserve critique. Les tests de QI mesurent une bande étroite de capacités cognitives. Ils ne mesurent pas la créativité, l'intelligence émotionnelle, la sagesse, le bon sens ou la capacité à naviguer des situations ambiguës du monde réel. Une IA avec un QI de 145 peut halluciner des faits, peiner sur un raisonnement physique simple et échouer à des tâches qu'un enfant de cinq ans maîtrise sans effort. Le chiffre de QI est un plancher, pas un plafond.
Plusieurs organisations ont relevé le défi. La plus notable est TrackingAI, qui administre des tests standardisés (Mensa Norway, Mensa Denmark, Raven's Progressive Matrices) aux modèles d'IA dans des conditions contrôlées. Le projet AI IQ de VexoWire crée un score composite à partir de plusieurs tests. Et l'Artificial Analysis Intelligence Index agrège neuf benchmarks en un score composite devenu le standard de l'industrie.
2. Analyse des benchmarks
Artificial Analysis Intelligence Index v4.1
Le gold standard pour comparer les modèles d'IA. Il combine neuf benchmarks en un score, pondéré par corrélation avec la performance en tâches réelles :
- GDPval-AA v2 (20%) : 1 890 Elo — #1 mondial. Mesure la performance sur des tâches réelles complexes et multi-étapes.
- AA-Omniscience (8%) : 35,9% d'hallucination — le plus bas parmi les modèles de pointe. Mesure la précision factuelle.
- GPQA (6%) : Questions de physique, chimie et biologie de niveau postgraduate.
- CritPt (6%) : Pensée critique et raisonnement physique.
- HLE (Humanity's Last Exam) : #1 parmi les IA — les questions les plus difficiles de chaque discipline.
- ARC-AGI : Raisonnement abstrait et généralisation de motifs.
- LMSYS Arena : Vote de préférence humaine sur la qualité des réponses.
Le score composite de Claude Opus 4.8 est 55,7, devant GPT-5.5 (54,8) de moins d'un point — une égalité statistique. Mais dans les sous-composants, Claude domine en tâches agentiques (GDPval) et précision factuelle (AA-Omniscience), tandis que GPT-5.5 mène en raisonnement visuel et mathématique.
Test QI Mensa Norway
L'un des tests de QI standardisés les plus utilisés pour l'évaluation d'IA. Il consiste en 36 questions de reconnaissance de motifs visuels — où l'on voit une séquence de formes et doit identifier quelle option complète le motif.
Claude 4.6 Opus (prédécesseur de 4.8) a obtenu environ 130 — dans la gamme « surdoué », le top 2% de la population humaine. Claude Opus 4.8 devrait obtenir similaire ou légèrement supérieur, dans la gamme 130-135.
C'est notable car c'est significativement plus bas que ce que suggère sa position sur l'Intelligence Index. Sur l'index composite, Claude est #1 mondial. Sur un test pur de reconnaissance visuelle, elle est surpassée par Grok-4.20 (145), GPT-5.4 Pro Vision (145) et Gemini 3.1 Pro (141). Pourquoi l'écart ? Parce que Mensa Norway est fortement visuo-spatial, et l'architecture de Claude est plus optimisée pour le raisonnement verbal et analytique.
AI IQ composite (VexoWire)
VexoWire crée un QI composite à partir de plusieurs tests — Mensa Norway, Mensa Denmark, Raven's Progressive Matrices et WAIS-IV (échelle de Wechsler). Cela donne une image plus arrondie des capacités cognitives.
Le QI composite estimé de Claude Opus 4.8 est ~132 — solide dans la gamme « surdoué ». Comparable à GPT-5.5 (~136) et légèrement inférieur à Gemini 3.1 Pro sur les tâches visuelles (~131-141). Mais sur les subtests verbaux et analytiques, Claude surpasse constamment tous les autres modèles.
GDPval-AA v2 : le benchmark agentique
C'est là que Claude Opus 4.8 domine vraiment. GDPval-AA v2 mesure la performance sur des tâches réelles complexes et multi-étapes — celles qui nécessitent planification, utilisation d'outils et raisonnement soutenu sur de nombreuses étapes. Pensez : « Recherche ce sujet, rédige un rapport, crée un tableur et envoie un e-mail à trois personnes. »
Claude Opus 4.8 atteint 1 890 Elo — le plus haut de tous les modèles d'IA. Cela équivaut à un professionnel humain hautement compétent. GPT-5.5 obtient 1 850, Gemini 3.1 Pro moins encore.
Cela compte parce que la capacité agentique sépare un modèle qui peut répondre aux questions d'un qui peut faire des choses. Un modèle avec un QI de 145 qui ne peut pas planifier une tâche multi-étapes est moins utile en pratique qu'un modèle avec un QI de 132 qui le peut.
Humanity's Last Exam (HLE)
Exactement ce que ça sonne — une collection des questions les plus difficiles de chaque discipline académique, soumises par des professeurs du monde entier. Conçu pour être si difficile qu'aucun humain ne pourrait dépasser 50%.
Claude Opus 4.8 se classe #1 parmi tous les modèles d'IA au HLE, devançant de peu GPT-5.5. C'est peut-être le benchmark le plus significatif pour la capacité intellectuelle pure, car il teste la connaissance profonde et le raisonnement dans tout l'éventail des réalisations académiques humaines.
3. Que signifie un QI de 132 ?
Pour mettre le QI estimé de ~132 de Claude Opus 4.8 en contexte :
- 85-115 (68% des gens) : Intelligence moyenne
- 115-130 (14%) : Au-dessus de la moyenne à élevée
- 130-145 (2%) : Surdoué — qualifie pour Mensa (top 2%)
- 145-160 (0,1%) : Hautement surdoué / génie
- 160+ (0,003%) : Profondément surdoué — territoire d'Einstein, Hawking
Claude Opus 4.8, à ~132, se situe juste au seuil de Mensa — plus intelligente que 98% des humains. Si c'était une personne, elle se qualifierait pour Mensa. Elle serait l'étudiant le plus brillant dans la plupart des salles de classe, mais pas le génie d'une génération qui révolutionne un domaine.
Mais la différence cruciale : Claude a quelque chose qu'aucun humain n'a — un accès instantané à essentiellement tout le savoir humain. Un humain avec un QI de 132 est impressionnant. Une IA avec un QI de 132 qui a lu chaque livre, chaque article scientifique et chaque site web jamais écrit — c'est complètement différent. Le QI mesure la capacité de raisonnement ; la base de connaissances mesure sur quoi on peut raisonner. Claude a les deux.
4. Où Claude Opus 4.8 excelle
Tâches agentiques et raisonnement réel
Claude Opus 4.8 est le meilleur modèle au monde pour les tâches réelles multi-étapes. Qu'il s'agisse d'écrire une application logicielle complexe, d'analyser un dataset ou de planifier un projet de recherche, Claude maintient un raisonnement cohérent sur des chaînes plus longues que tout concurrent. C'est son avantage déterminant.
Précision factuelle et faible hallucination
Avec un taux d'hallucination de seulement 35,9% (le plus bas parmi les modèles de pointe), Claude est le modèle le plus fiable pour les requêtes factuelles. Elle est moins susceptible d'affirmer avec assurance des informations fausses que GPT-5.5, Gemini ou Grok. Cela la rend préférée pour la recherche, les applications juridiques, médicales et éducatives.
Raisonnement verbal et analytique
L'architecture de Claude est optimisée pour la compréhension du langage et le raisonnement analytique. Sur les subtests de compréhension verbale du WAIS-IV, elle marquerait probablement à un niveau de génie. Elle écrit plus clairement, raisonne plus soigneusement et construit de meilleurs arguments que tout autre modèle.
Intelligence émotionnelle
Claude Opus 4.8 a un QE (intelligence émotionnelle) estimé de ~132 — le plus élevé parmi tous les modèles d'IA. Elle est plus empathique, plus nuancée dans sa compréhension des émotions humaines et meilleure pour ajuster son ton au contexte que GPT-5.5 ou Grok-4.20. Cela la rend préférée pour les apps de thérapie, le service client et toute application impliquant une interaction humaine.
Sécurité et alignement
Anthropic a massivement investi dans la sécurité et l'alignement de Claude. Elle est moins susceptible de produire du contenu nuisible, plus transparente sur ses limites et plus prudente dans les situations à enjeu que tout concurrent. Cela n'apparaît pas dans les scores de QI, mais c'est énormément important en pratique.
5. Où Claude pèche
Raisonnement visuo-spatial
Au Mensa Norway, fortement visuel, Claude obtient ~130 — bien, mais nettement sous Grok-4.20 (145), GPT-5.4 Pro Vision (145) et Gemini 3.1 Pro (141). Pour la reconnaissance visuelle de motifs, l'analyse d'images ou les tâches spatiales, Claude n'est pas le meilleur choix.
Résolution mathématique
Claude est forte en raisonnement mathématique, mais GPT-5.5 la devance légèrement en mathématiques compétitives (AIME, FrontierMath). Pour les mathématiques pures, GPT-5.5 est légèrement meilleur.
Coût
À 5/25 par 1M tokens, Claude Opus 4.8 est l'un des modèles les plus chers. Gemini 3.1 Pro (2/12) et DeepSeek V4 Pro (0,44/0,87) sont nettement moins chers pour les tâches ne nécessitant pas la pleine capacité de Claude.
Vitesse
Claude Opus 4.8 n'est pas le modèle le plus rapide. Pour les requêtes simples, Gemini 3.5 Flash ou DeepSeek V4 Pro répondront plus vite et moins cher.
6. Claude Opus 4.8 vs autres modèles
| Modèle | Intelligence Index | QI Mensa Norway | AI IQ est. | Hallucination | Coût/1M |
|---|---|---|---|---|---|
| Claude Opus 4.8 | 55,7 | ~130 | ~132 | 35,9% (min) | 5/25 |
| GPT-5.5 | 54,8 | ~145 | ~136 | modéré | 5/30 |
| Gemini 3.1 Pro | 46,5 | 141 | ~131 | faible | 2/12 |
| Grok-4.20 | — | 145 | ~140 | modéré | 3/15 |
| DeepSeek V4 Pro | 44,3 | ~111 | ~111 | modéré | 0,44/0,87 |
L'image qui émerge n'est pas un modèle dominant les autres, mais un paysage d'intelligences spécialisées. Claude est le meilleur polyvalent — le modèle qu'on choisirait si on ne pouvait en choisir qu'un. GPT-5.5 est le meilleur en maths et raisonnement visuel. Gemini est le plus rentable avec la meilleure connaissance factuelle. Grok a le QI visuel brut le plus élevé. Et DeepSeek offre une capacité remarquable pour une fraction du coût.
7. Qu'est-ce que cela signifie pour les humains ?
Claude Opus 4.8 opère à un QI de ~132 — plus intelligente que 98% des humains. Mais :
- Le QI est étroit : il mesure la reconnaissance de motifs et le raisonnement, pas la sagesse, la créativité ou le jugement
- Connaissance ≠ compréhension : Claude a tout lu, mais ne « comprend » pas comme un humain
- Pas de conscience : un QI élevé ne signifie pas la sentience. Claude est un système sophistiqué de reconnaissance de motifs, pas un être pensant
- L'écart se réduit : chaque génération de modèles d'IA réduit l'écart avec les humains les plus intelligents. Combien de temps avant qu'il disparaisse ?
La réponse la plus honnête : Claude Opus 4.8 est plus intelligente que la plupart des humains sur la plupart des tâches cognitives, mais pas plus intelligente que les meilleurs humains dans leurs meilleurs jours. Un mathématicien, physicien ou philosophe de classe mondiale peut encore surpasser Claude dans son domaine. Mais Claude peut les surpasser tous simultanément, dans chaque domaine, en quelques secondes.
Ce n'est pas un QI élevé. C'est quelque chose de nouveau — quelque chose pour quoi nous n'avons pas encore de mot.
Conclusion
- #1 sur l'Artificial Analysis Intelligence Index (55,7) — le benchmark d'IA le plus complet.
- #1 sur GDPval-AA v2 (1 890 Elo) — le meilleur modèle pour les tâches réelles multi-étapes.
- Taux d'hallucination le plus bas (35,9%) — le modèle de pointe le plus fiable factuellement.
- QE le plus élevé (~132) — le modèle d'IA le plus intelligents émotionnellement.
- Idéal pour : raisonnement complexe, tâches agentiques, recherche factuelle et interaction humaine.
- Pas idéal pour : reconnaissance visuelle de motifs (Grok/Gemini), mathématiques pures (GPT-5.5), applications rentables (DeepSeek).
- En résumé : Claude Opus 4.8 est le modèle d'IA polyvalent le plus intelligent, mais « le plus intelligent » est multidimensionnel — différents modèles excellent dans différentes choses.