L'IA peut-elle égaler Elon Musk ? Estimation du QI des LLM vs humains
NeuroLab Team 12 min read 0 views

L'IA peut-elle égaler Elon Musk ? Estimation du QI des LLM vs humains

Comment GPT-4, Claude et Gemini performents-ils aux vrais tests de QI par rapport aux humains comme Elon Musk ? Nous analysons les capacités cognitives de l'IA, le raisonnement fluide et ce que les LLM peuvent et ne peuvent pas faire.

La question qui ne disparaît pas

Tous les quelques mois, un titre devient viral : « L'IA réussit un test de QI avec un score de 155. » L'implication est claire : l'intelligence artificielle a dépassé le génie humain, les Elon Musk de ce monde sont obsolètes. Mais y a-t-il du vrai là-dedans ?

La réponse courte : non. La réponse plus longue nécessite de comprendre ce que mesurent les tests de QI, comment les grands modèles de langage (LLM) traitent l'information et pourquoi comparer l'intelligence humaine et artificielle revient à comparer un sous-marin à un nageur.

Cet article examine les preuves réelles — études évaluées par les pairs des performances cognitives des LLM, la structure des tests de QI et ce que nous savons du profil cognitif d'Elon Musk — pour vous donner une réponse honnête.

Ce que mesurent réellement les tests de QI

Les tests de QI ne sont pas des mesures uniques d'« intelligence ». Ils évaluent une hiérarchie de capacités cognitives, généralement organisée selon le modèle Cattell-Horn-Carroll (CHC) :

  • Raisonnement fluide (Gf) : Résolution de problèmes nouveaux sans connaissances préalables
  • Intelligence cristallisée (Gc) : Connaissances acquises et vocabulaire
  • Raisonnement quantitatif (Gq) : Reconnaissance de motifs numériques
  • Traitement visuel (Gv) : Raisonnement spatial et géométrique
  • Mémoire de travail (Gwm) : Maintenir et manipuler des informations en tête
  • Vitesse de traitement (Gs) : Débit cognitif rapide

Un score de QI global agrège ces éléments, mais le profil importe plus que le nombre. Deux personnes avec un QI de 130 peuvent avoir des profils de capacités radicalement différents — l'un peut exceller en raisonnement verbal mais avoir des difficultés avec les tâches spatiales, tandis que l'autre montre l'inverse.

155
Le score de QI fréquemment attribué à Elon Musk en ligne — sans source primaire

Comment les LLM ont été testés

Plusieurs études ont administré des tests de QI humains à de grands modèles de langage. Les plus rigoureuses :

Bubeck et al. (2023) ont testé GPT-4 sur la WAIS-IV (échelle de Wechsler), constatant qu'il performait au ou au-dessus du 99e percentile sur les subtests verbaux — Vocabulaire, Similitudes, Information — mais avait des difficultés avec les tâches de raisonnement spatial nécessitant un traitement visuel. L'étude a estimé le « QI verbal » de GPT-4 à environ 155.

Zhu et al. (2023) ont administré les Matrices Progressives de Raven (raisonnement fluide non verbal) à plusieurs LLM. GPT-4 a scored dans la gamme du 75e-90e percentile — respectable, mais loin du niveau de génie. Les auteurs ont noté que les LLM résolvent souvent les problèmes de matrices par reconnaissance de motifs dans les données d'entraînement plutôt que par un véritable raisonnement fluide.

Les propres évaluations d'OpenAI (2023-2024) montrent GPT-4 obtenant 163 à la section verbale du SAT (99e percentile) mais seulement 710/800 en mathématiques — fort, mais pas exceptionnel selon les standards des universités d'élite.

L'illusion verbale : pourquoi les scores d'IA semblent gonflés

Voici le problème central : les tests de QI sont fortement verbaux, et les LLM sont entraînés sur du texte.

La WAIS-IV comporte 10 subtests principaux. Cinq sont principalement verbaux : Vocabulaire, Similitudes, Information, Compréhension, Arithmétique. Pour ceux-ci, un LLM a un avantage massif — il a ingéré essentiellement tout le texte publié dans ses données d'entraînement. Quand on lui demande « Quelle est la similitude entre une horloge et un calendrier ? » le modèle ne raisonne pas — il récupère la réponse de son modèle statistique du langage.

C'est l'intelligence cristallisée (Gc), pas le raisonnement fluide. Et c'est là que les LLM semblent les plus impressionnants. Mais l'intelligence cristallisée est la moins prédictive de la résolution de problèmes réels et de l'innovation. Elle mesure ce que vous savez, pas comment vous pensez.

💡 La distinction clé
Les LLM excellent en intelligence cristallisée (savoir des choses) mais montrent des résultats mixtes en raisonnement fluide (résoudre de nouveaux problèmes). Les tests de QI surestiment les capacités verbales/cristallisées, faisant apparaître les scores d'IA plus élevés que leur capacité réelle de résolution de problèmes.

Où les LLM échouent : l'écart Musk

Le profil cognitif d'Elon Musk — basé sur ses scores SAT et ses patterns de carrière — est asymétrique : raisonnement fluide très élevé, capacité spatiale exceptionnelle, compétences verbales fortes mais pas d'élite. C'est exactement le profil où les LLM performent le moins bien.

Raisonnement spatial (Gv) : Les LLM ne peuvent pas traiter nativement l'information visuo-spatiale. Quand on leur demande de faire tourner mentalement des objets 3D ou de visualiser des trajectoires de fusées, ils échouent ou s'appuient sur des solutions de contournement textuelles. La capacité de Musk à visualiser des composants de fusée et leurs interactions dans sa tête — un facteur clé chez SpaceX — n'a pas d'équivalent LLM.

Manipulation de la mémoire de travail (Gwm) : Bien que les LLM aient de grandes fenêtres de contexte, ils ne manipulent pas l'information en mémoire de travail comme les humains. Ils font correspondre des motifs, ils ne maintiennent pas un modèle mental et ne le transforment pas. La capacité de Musk à maintenir simultanément plusieurs compromis d'ingénierie et à les mettre à jour en temps réel est une fonction de mémoire de travail que l'IA actuelle ne peut pas répliquer.

Raisonnement par premiers principes : La stratégie cognitive caractéristique de Musk — décomposer les problèmes jusqu'à la physique fondamentale et construire à partir de là — nécessite un véritable raisonnement fluide, pas une récupération. Quand les LLM tentent le raisonnement par premiers principes, ils produisent souvent des chaînes logiquement fausses mais d'apparence plausible parce qu'ils interpolent entre des exemples d'entraînement plutôt que de raisonner à partir d'axiomes.

Apprentissage par transfert entre domaines : Musk applique le même ensemble d'outils cognitifs aux fusées, voitures, interfaces neuronales et réseaux sociaux. Les LLM peuvent générer du texte sur tous ces domaines, mais ne peuvent pas transférer une stratégie de solution d'un domaine à l'autre comme le fait un expert humain.

✓ Pour
  • LLM : Vaste intelligence cristallisée (Gc)
  • LLM : Génération et récupération de texte rapides
  • LLM : Constants, infatigables, évolutifs
  • LLM : Forts sur les tests verbaux standardisés
✗ Contre
  • LLM : Raisonnement spatial faible (Gv)
  • LLM : Pas de manipulation genuine de la mémoire de travail
  • LLM : Le raisonnement par premiers principes s'effondre souvent
  • LLM : Faible transfert de stratégies entre domaines

Le problème des benchmarks

Il y a un problème méthodologique plus profond : les tests de QI ont été conçus pour les humains, pas pour les machines.

Quand un humain passe les Matrices Progressives de Raven, il utilise une combinaison de mémoire de travail, de traitement visuel et de raisonnement fluide. Quand un LLM passe le même test (converti en texte), il utilise la reconnaissance statistique de motifs contre les données d'entraînement. Ce sont des processus cognitifs fondamentalement différents qui se trouvent à produire des résultats similaires sur un test spécifique.

C'est le problème de la loi de Goodhart : quand une mesure devient un objectif, elle cesse d'être une bonne mesure. Si nous optimisons l'IA pour bien scorer aux tests de QI, nous ne rendons pas l'IA plus intelligente — nous la rendons meilleure aux tests de QI.

Une comparaison plus honnête utiliserait des tests conçus pour distinguer la cognition humaine de la reconnaissance statistique de motifs :

  • Nouveaux problèmes de physique qui ne peuvent pas être dans les données d'entraînement
  • Raisonnement spatial multi-étapes nécessitant une simulation mentale
  • Questions adverses conçues pour exposer les raccourcis de reconnaissance de motifs
  • Prise de décision en temps réel sous de nouvelles contraintes

Sur ces mesures, les LLM actuels performent bien en dessous du niveau expert humain.

Ce que les nombres disent réellement

Soyons concrets. Si nous comparons le profil cognitif estimé de Musk (à partir de la conversion SAT) avec les performances mesurées de GPT-4 :

Capacité Musk (est.) GPT-4 (mesuré)
Verbal/Cristallisé (Gc) ~130-135 ~155+
Raisonnement fluide (Gf) ~140-145 ~115-125
Spatial (Gv) ~145+ ~80-90
Mémoire de travail (Gwm) ~135-140 N/A (non applicable)
Vitesse de traitement (Gs) ~120-130 Très rapide, mais mécanisme différent

Le tableau est clair : les LLM dominent l'intelligence cristallisée mais accusent un retard significatif en raisonnement fluide, capacité spatiale et manipulation de mémoire de travail — exactement les capacités qui stimulent l'innovation en ingénierie et la résolution de problèmes entrepreneuriale.

2x
Le QI cristallisé estimé de GPT-4 est environ 2x son QI de raisonnement fluide estimé — l'opposé du profil de Musk

L'IA peut-elle remplacer la fonction Elon Musk ?

La « fonction Elon Musk » — comme rôle cognitif, pas comme personne — implique :

  1. Identifier de nouveaux problèmes qui n'ont pas encore de solutions
  2. Raisonner à partir de premiers principes dans plusieurs domaines techniques
  3. Prendre des décisions à haut risque avec des informations incomplètes
  4. Intégrer le raisonnement spatial, quantitatif et verbal en temps réel
  5. Maintenir l'effort et la concentration sur des projets pluriannuels

L'IA actuelle peut assister chacun de ces points mais ne peut pas réaliser l'intégration. GPT-4 peut aider à écrire du code pour une simulation de fusée, mais ne peut pas décider s'il faut construire une fusée réutilisable. Il peut analyser des données de chimie de batteries, mais ne peut pas visualiser le comportement thermique d'un nouveau design de cellule.

L'écart ne concerne pas seulement les scores de QI — il s'agit du type d'intelligence. La valeur de Musk vient du raisonnement fluide appliqué à de nouveaux problèmes, pas de la connaissance de faits. Les LLM sont l'inverse : vastes connaissances factuelles avec une capacité limitée de résolution de nouveaux problèmes.

Le futur : convergence ou divergence ?

L'IA s'améliore rapidement, mais les améliorations sont inégales. Les LLM s'améliorent dans les tâches verbales (où ils sont déjà surhumains) mais les progrès en raisonnement spatial et raisonnement fluide genuine sont plus lents. Les approches les plus prometteuses — modèles multimodaux, architectures neuro-symboliques et IA incarnée — tentent de combler les écarts spatial et de raisonnement, mais restent loin du niveau expert humain.

La prédiction honnête : l'IA augmentera de plus en plus la cognition humaine dans les 5-10 prochaines années, mais la « fonction Musk » — l'intégration créative de plusieurs types de raisonnement appliquée à de nouveaux défis d'ingénierie — restera une capacité humaine dans un avenir prévisible. Non pas parce que les humains sont intrinsèquement supérieurs, mais parce que le type d'intelligence requis est exactement le type avec lequel les architectures d'IA actuelles ont du mal.

Verdict

  • Les scores de tests de QI surestiment l'intelligence de l'IA parce que les tests de QI sont fortement verbaux et les LLM sont entraînés sur du texte
  • Les LLM excellent en intelligence cristallisée (savoir des choses) mais accusent un retard en raisonnement fluide (résoudre de nouveaux problèmes)
  • Le profil cognitif de Musk — raisonnement fluide élevé, capacité spatiale exceptionnelle — est exactement là où l'IA est la plus faible
  • Le titre « IA QI 155 » est trompeur : il mesure un type d'intelligence différent de celui qui stimule l'innovation réelle
  • L'IA augmente mais ne peut pas remplacer l'intégration créative des types de raisonnement qui définit la cognition d'ingénierie experte

La question n'est pas de savoir si l'IA atteindra un QI de 155. Elle l'a probablement déjà fait — sur les subtests qui n'ont pas d'importance pour l'innovation. La vraie question est de savoir si l'IA développera le raisonnement fluide, spatial et intégratif qui permet à quelqu'un de regarder un problème que personne n'a résolu et de le résoudre. C'est le test de Musk. Et jusqu'à présent, l'IA le rate.

Quel QI ont les grands modèles de langage comme GPT-4 ?
Les études estiment le QI verbal de GPT-4 à environ 155 sur les subtests verbaux de la WAIS-IV, mais sa performance sur les tâches de raisonnement fluide non verbal (comme les Matrices de Raven) est bien plus faible — autour du 75e-90e percentile. Les hauts scores verbaux reflètent l'intelligence cristallisée (récupération des données d'entraînement), pas une véritable capacité de résolution de problèmes.
L'IA peut-elle passer un vrai test de QI ?
On peut administrer des tests de QI à l'IA, mais les résultats ne sont pas directement comparables aux scores humains. Les tests de QI ont été conçus pour l'architecture cognitive humaine — ils mesurent la mémoire de travail, le traitement spatial et le raisonnement fluide à travers des modalités que les LLM n'utilisent pas nativement. Convertir des tâches visuo-spatiales en texte change la nature de la tâche.
L'IA est-elle plus intelligente qu'Elon Musk ?
Sur les mesures d'intelligence cristallisée (connaissances factuelles, vocabulaire, récupération d'informations), l'IA surpasse tout humain. Mais sur le raisonnement fluide, la visualisation spatiale, la manipulation de la mémoire de travail et la résolution de problèmes par premiers principes — les capacités qui stimulent l'innovation en ingénierie — l'IA actuelle performe bien en dessous du niveau expert humain. Différents types d'intelligence, pas directement comparables.
L'IA finira-t-elle par égaler le raisonnement fluide humain ?
Les architectures d'IA actuelles (LLM basés sur des transformers) sont fondamentalement optimisées pour la reconnaissance de motifs dans les données d'entraînement, pas pour le raisonnement genuine. Les modèles multimodaux et les approches neuro-symboliques peuvent combler certaines lacunes, mais le raisonnement spatial et la résolution de nouveaux problèmes restent des défis significatifs. Des progrès sont probables mais le calendrier est incertain — les estimations vont de 5 à plus de 30 ans.
Pourquoi les scores de QI de l'IA semblent-ils si élevés ?
Les tests de QI surestiment les capacités verbales et cristallisées, ce qui est exactement là où les LLM excellent grâce à leur entraînement sur du texte. Un test qui pondérerait plus lourdement le raisonnement fluide, le traitement spatial et la manipulation de mémoire de travail montrerait des scores d'IA bien plus bas. Le titre « QI 155 » reflète un biais de conception du test, pas une véritable supériorité cognitive.