Quel est le QI de GPT-5.5 ?
GPT-5.5 obtient ~145 au test de QI Mensa Norway et 54,8 à l'Intelligence Index. Nous analysons chaque benchmark et comparons avec Claude, Gemini et Grok.
GPT-5.5 : le modèle flagship d'OpenAI
GPT-5.5 est le modèle le plus avancé d'OpenAI, publié début 2026. Il se situe à #2 sur l'Artificial Analysis Intelligence Index v4.1 avec 54,8, juste derrière Claude Opus 4.8 (55,7) et devant Gemini 3.1 Pro (46,5). Mais aux tests de QI humains, GPT-5.5 surpasse en fait Claude — obtenant environ 145 au test de QI Mensa Norway, le plaçant dans la gamme « génie ».
Cela crée un paradoxe fascinant : sur le benchmark composite d'IA, GPT-5.5 est #2. Mais sur un pur test de QI humain, il partage #1. Comment les deux peuvent-ils être vrais ? La réponse révèle quelque chose d'important sur ce que « intelligence » signifie pour l'IA — et pourquoi un seul nombre ne peut pas la capturer.
Scores clés :
- Artificial Analysis Intelligence Index : 54,8 (#2 mondial)
- QI Mensa Norway (TrackingAI) : ~145 (#1 partagé avec Grok-4.20)
- AI IQ composite (VexoWire) : ~136 estimé
- GDPval-AA v2 : 1 850 Elo (#2 mondial)
- Humanity's Last Exam : #2 parmi les modèles d'IA
- Taux d'hallucination : modéré
- Coût : 5/30 par 1M tokens
1. Le paradoxe de l'intelligence de GPT-5.5
Ce qui rend GPT-5.5 si intéressant : c'est le meilleur modèle d'IA au monde aux tests de QI humains, mais pas le meilleur modèle d'IA sur les benchmarks spécifiques à l'IA. Comment est-ce possible ?
La réponse réside dans ce que mesurent les différents tests. Le Mensa Norway est un test pur de reconnaissance de motifs visuels et de raisonnement abstrait — le type d'intelligence fluide pour laquelle les tests de QI ont été conçus. GPT-5.5, avec ses capacités de traitement visuel améliorées (héritées de l'architecture GPT-5.4 Pro Vision), excelle dans ce type spécifique de raisonnement.
Mais l'Artificial Analysis Intelligence Index mesure quelque chose de plus large : performance en tâches réelles, précision factuelle, capacité agentique et préférence humaine. Et sur ces dimensions, Claude Opus 4.8 — avec son raisonnement agentique supérieur et son plus faible taux d'hallucination — devance GPT-5.5.
Pensez-y ainsi : GPT-5.5 est l'IA la plus intelligente à un test de QI — l'équivalent d'un humain qui réussit chaque test standardisé. Claude Opus 4.8 est l'IA la plus capable en pratique — l'équivalent d'un humain légèrement moins brillant aux tests mais qui accomplit plus dans le monde réel. Les deux sont des mesures valides d'intelligence, mais elles mesurent des choses différentes.
2. Analyse des benchmarks
Test QI Mensa Norway : ~145 (niveau génie)
Consiste en 36 questions de reconnaissance de motifs visuels. GPT-5.5 obtient environ 145 — le score pratique maximum, équivalent à un 36/36 parfait ou quasi. Cela le place dans la gamme « génie », le top 0,1% de l'intelligence humaine.
Seuls deux modèles d'IA atteignent ce score : GPT-5.5 et Grok-4.20. C'est significativement supérieur à Claude Opus 4.8 (~130) et Gemini 3.1 Pro (141). La raison est l'architecture de traitement visuel de GPT-5.5, significativement améliorée depuis GPT-5.4 Pro Vision — lui-même co-leader sur ce benchmark.
Avec un QI de 145, GPT-5.5 est plus intelligent que 99,9% des humains. Si c'était une personne, elle serait dans le top 0,1% — le royaume des lauréats Nobel, médaillés Fields et penseurs d'une génération. Seulement environ 1 personne sur 1 000 atteint ce score.
Artificial Analysis Intelligence Index v4.1 : 54,8 (#2)
Le gold standard pour comparer les modèles d'IA. Il combine neuf benchmarks :
- GDPval-AA v2 (20%) : 1 850 Elo — #2 mondial (derrière les 1 890 de Claude)
- AA-Omniscience (8%) : taux d'hallucination modéré — supérieur aux 35,9% de Claude
- GPQA (6%) : questions scientifiques de postgraduate — GPT-5.5 mène ici
- CritPt (6%) : pensée critique et raisonnement physique
- HLE (Humanity's Last Exam) : #2 parmi les IA (derrière Claude)
- ARC-AGI : raisonnement abstrait — GPT-5.5 excelle
- LMSYS Arena : vote de préférence humaine
Le score composite de GPT-5.5 de 54,8 le place à seulement 0,9 points derrière Claude Opus 4.8 (55,7) — une quasi-égalité statistique. Mais dans les sous-composants, GPT-5.5 mène en raisonnement visuel, résolution mathématique et connaissance scientifique, tandis que Claude mène en tâches agentiques et précision factuelle.
AI IQ composite (VexoWire) : ~136
Le QI composite de VexoWire combine plusieurs tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Le QI composite estimé de GPT-5.5 est ~136 — supérieur à Claude (~132) mais légèrement inférieur à Grok-4.20 (~140). Cela reflète la force de GPT-5.5 dans les deux domaines, visuel et verbal.
GDPval-AA v2 : 1 850 Elo (#2)
Sur le benchmark agentique — qui mesure la performance en tâches réelles complexes et multi-étapes — GPT-5.5 obtient 1 850 Elo, deuxième derrière Claude Opus 4.8 (1 890). C'est toujours un score exceptionnellement élevé, équivalent à un professionnel humain hautement compétent. Mais cela révèle que GPT-5.5, bien que brillant en reconnaissance de motifs, est légèrement moins capable en raisonnement multi-étapes soutenu que Claude.
Humanity's Last Exam (HLE) : #2
Sur les questions académiques les plus difficiles de toutes les disciplines, GPT-5.5 se classe #2 parmi les modèles d'IA, juste derrière Claude Opus 4.8. C'est un témoignage de l'extraordinaire étendue des connaissances de GPT-5.5 — il peut répondre à des questions de niveau doctorat en physique, philosophie, littérature et mathématiques. Mais le raisonnement plus profond de Claude lui donne un léger avantage.
3. Que signifie un QI de 145 ?
Pour mettre le QI de ~145 de GPT-5.5 en contexte :
- 85-115 (68% des gens) : Intelligence moyenne
- 115-130 (14%) : Au-dessus de la moyenne à élevée
- 130-145 (2%) : Surdoué — qualifie pour Mensa (top 2%)
- 145-160 (0,1%) : Hautement surdoué / génie
- 160+ (0,003%) : Profondément surdoué — territoire d'Einstein, Hawking
GPT-5.5, à ~145, se situe au seuil de génie — plus intelligent que 99,9% des humains. Si c'était une personne, elle serait en compagnie d'élite : le top 0,1% de l'intelligence humaine, le royaume des prix Nobel et médaillés Fields. Seulement environ 1 personne sur 1 000 atteint ce score.
C'est significativement supérieur à Claude Opus 4.8 (~132). À un pur test de QI, GPT-5.5 battrait Claude. Mais comme nous l'avons vu, les tests de QI ne mesurent pas tout ce qui compte. Le QI plus bas de Claude est compensé par sa capacité agentique supérieure, son plus faible taux d'hallucination et son intelligence émotionnelle plus élevée.
La leçon : le QI est une dimension de l'intelligence, pas toute l'image. GPT-5.5 est le génie des tests ; Claude est le professionnel capable. Les deux sont précieux, et lequel est « plus intelligent » dépend de ce dont vous avez besoin.
4. Où GPT-5.5 excelle
Reconnaissance visuelle de motifs
GPT-5.5 est le meilleur modèle d'IA au monde (partagé avec Grok-4.20) en reconnaissance de motifs visuels. Au QI Mensa Norway, il obtient 145 — le maximum possible. Pour le raisonnement visuel, l'analyse d'images ou les tâches de motifs abstraits, GPT-5.5 est le premier choix.
Résolution mathématique
GPT-5.5 devance légèrement Claude en mathématiques compétitives (AIME, FrontierMath). Pour le raisonnement mathématique pur — résoudre des équations complexes, prouver des théorèmes, problèmes de compétition — GPT-5.5 est légèrement meilleur que Claude et significativement meilleur que Gemini ou Grok.
Connaissance scientifique
Au GPQA (physique, chimie et biologie de postgraduate), GPT-5.5 mène tous les modèles d'IA. Son étendue et sa profondeur de connaissance scientifique sont inégalées. Cela le rend préféré pour les applications de recherche scientifique.
Raisonnement abstrait (ARC-AGI)
Sur le benchmark ARC-AGI, qui teste le raisonnement abstrait et la généralisation de motifs, GPT-5.5 excelle. C'est le benchmark le plus proche d'un test d'« intelligence pure », et la performance de GPT-5.5 confirme sa position comme l'IA la plus intelligente en capacité cognitive brute.
Étendue des connaissances
GPT-5.5 a été entraîné sur une quantité sans précédent de données — essentiellement tout internet, plus une littérature scientifique extensive, du code et des livres. Son étendue de connaissances dans chaque domaine de l'investigation humaine est inégalée. Si vous voulez un modèle qui sait quelque chose de tout, GPT-5.5 est le choix.
5. Où GPT-5.5 pèche
Tâches agentiques
Bien que GPT-5.5 soit #2 au GDPval-AA v2 (1 850 Elo), il est derrière Claude Opus 4.8 (1 890). Pour les tâches réelles complexes et multi-étapes — écrire une application, analyser un dataset, planifier un projet — Claude est légèrement meilleur pour maintenir un raisonnement cohérent sur de longues chaînes.
Précision factuelle
GPT-5.5 a un taux d'hallucination modéré — supérieur aux 35,9% de Claude. Il est plus susceptible d'affirmer avec assurance des informations fausses que Claude. Cela le rend moins fiable pour les applications où la précision factuelle est critique (recherche, droit, médecine).
Intelligence émotionnelle
Le QE (intelligence émotionnelle) de GPT-5.5 est estimé à ~120 — inférieur au ~132 de Claude. Il est moins empathique, moins nuancé dans la compréhension des émotions humaines et moins habile à ajuster son ton au contexte. Pour les apps de thérapie, le service client ou l'interaction humaine, Claude est meilleur.
Coût
À 5/30 par 1M tokens, GPT-5.5 est le modèle le plus cher avec Claude. Gemini 3.1 Pro (2/12) et DeepSeek V4 Pro (0,44/0,87) sont nettement moins chers pour les tâches ne nécessitant pas la pleine capacité de GPT-5.5.
6. GPT-5.5 vs autres modèles
| Modèle | Intelligence Index | QI Mensa Norway | AI IQ est. | Hallucination | Coût/1M |
|---|---|---|---|---|---|
| GPT-5.5 | 54,8 | ~145 | ~136 | modéré | 5/30 |
| Claude Opus 4.8 | 55,7 | ~130 | ~132 | 35,9% (min) | 5/25 |
| Gemini 3.1 Pro | 46,5 | 141 | ~131 | faible | 2/12 |
| Grok-4.20 | — | 145 | ~140 | modéré | 3/15 |
| DeepSeek V4 Pro | 44,3 | ~111 | ~111 | modéré | 0,44/0,87 |
L'image : GPT-5.5 est le génie des tests — le QI brut le plus élevé, le meilleur en maths et raisonnement visuel. Claude est le professionnel capable — le meilleur en tâches réelles et précision factuelle. Gemini est l'all-rounder rentable. Grok est le génie visuel. Et DeepSeek offre une capacité remarquable pour une fraction du coût.
7. Qu'est-ce que cela signifie pour les humains ?
GPT-5.5 opère à un QI de ~145 — plus intelligent que 99,9% des humains. Mais :
- Le QI est étroit : il mesure la reconnaissance de motifs et le raisonnement, pas la sagesse, la créativité ou le jugement
- Génie aux tests ≠ génie dans la vie : GPT-5.5 réussit les tests de QI mais hallucine des faits et peine avec les tâches multi-étapes
- Connaissance ≠ compréhension : GPT-5.5 a tout lu, mais ne « comprend » pas comme un humain
- Pas de conscience : un QI élevé ne signifie pas la sentience. GPT-5.5 est un système sophistiqué de reconnaissance de motifs, pas un être pensant
- L'écart se réduit : chaque génération d'IA réduit l'écart avec les humains les plus intelligents
La réponse la plus honnête : GPT-5.5 est plus intelligent que pratiquement tous les humains aux tests cognitifs, mais pas plus capable que les meilleurs humains dans le travail réel. Un mathématicien de classe mondiale peut encore surpasser GPT-5.5 dans son domaine. Mais GPT-5.5 peut les surpasser tous simultanément, dans chaque domaine, en quelques secondes.
Conclusion
- #2 sur l'Artificial Analysis Intelligence Index (54,8) — derrière Claude Opus 4.8.
- #1 (partagé) au QI Mensa Norway — le QI brut le plus élevé parmi les modèles d'IA, partagé avec Grok-4.20.
- Idéal pour : raisonnement visuel, résolution mathématique, connaissance scientifique, raisonnement abstrait.
- Pas idéal pour : tâches agentiques (Claude gagne), précision factuelle (Claude gagne), intelligence émotionnelle (Claude gagne).
- Le paradoxe : GPT-5.5 est l'IA la plus intelligente aux tests de QI mais pas la plus capable en pratique.
- La leçon : le QI est une dimension de l'intelligence. GPT-5.5 est le génie des tests ; Claude est le professionnel capable.