Quel est le QI de Llama 4 ?
Dr. Daria Dudnik 10 min read 0 views

Quel est le QI de Llama 4 ?

Llama 4 obtient 112 au test de QI Mensa Norway et se classe dans le top 15 de l'Intelligence Index. Nous analysons chaque benchmark et expliquons ce qui rend le modèle open-source de Meta unique.

Llama 4 : le champion open-source de Meta

Llama 4 est le modèle open-source flagship de Meta AI, la division de recherche de l'une des plus grandes entreprises technologiques du monde. Lancé début 2026, Llama 4 obtient 112 au test de QI Mensa Norway et se classe dans le top 15 de l'Artificial Analysis Intelligence Index v4.1. Cela le place au-dessus de DeepSeek V4 Pro (111) mais en dessous de Kimi K3 (118), Qwen 3.5 (115) et des modèles de frontière (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).

Ce qui rend Llama 4 unique, c'est sa nature open-source à grande échelle. Contrairement aux modèles fermés d'OpenAI, Anthropic ou Google, les poids de Llama 4 sont librement disponibles au téléchargement et au déploiement local. Cela en a fait la base de milliers de modèles dérivés, fine-tunes et applications — faisant de Llama 4 non pas juste un modèle, mais tout un écosystème.

Llama 4 est le modèle du peuple : un modèle qui peut ne pas être le plus intelligent, mais que n'importe qui peut télécharger, modifier et exécuter sur son propre matériel. Pour les chercheurs, les startups et les organisations qui nécessitent un contrôle total de leur infrastructure d'IA, Llama 4 offre quelque chose qu'aucun modèle fermé ne peut : la liberté.

Scores clés :

  • Artificial Analysis Intelligence Index : top 15 (score ~43-44)
  • QI Mensa Norway (TrackingAI) : 112 (supérieur à la moyenne)
  • AI IQ composite (VexoWire) : ~112 estimé
  • GDPval-AA v2 : top 15
  • Humanity's Last Exam : top 15
  • Taux d'hallucination : modéré
  • Coût : gratuit (auto-hébergé) ou 0,20/0,60 par 1M tokens (via fournisseurs)
  • Paramètres : 405B (plus grande variante)
  • Open-source : oui, poids librement disponibles
  • Contexte : 128K tokens

1. La révolution open-source

Llama 4 représente l'engagement de Meta envers l'IA open-source — la conviction que l'IA devrait être accessible à tous, pas contrôlée par quelques entreprises. Alors qu'OpenAI, Anthropic et Google gardent leurs modèles derrière des APIs, Meta publie les poids complets du modèle, permettant à quiconque de télécharger, étudier, modifier et déployer Llama 4 sur son propre matériel.

Cela a des implications profondes :

  • Démocratisation : quiconque dispose de matériel suffisant peut exécuter un modèle d'IA state-of-the-art
  • Personnalisation : les développeurs peuvent fine-tuner Llama 4 pour des domaines, langues ou tâches spécifiques
  • Confidentialité : les organisations peuvent exécuter Llama 4 localement, garantissant que les données ne quittent jamais leur infrastructure
  • Innovation : les chercheurs peuvent étudier les internes du modèle, menant à de nouvelles percées
  • Écosystème : des milliers de modèles dérivés se construisent sur Llama 4, créant un riche écosystème
  • Coût : Llama 4 auto-hébergé est gratuit (au-delà des coûts matériels), l'option la moins chère à grande échelle

L'écosystème Llama comprend :

  • Llama 4 Base : le modèle pré-entraîné original
  • Llama 4 Instruct : fine-tuned pour le suivi d'instructions
  • Llama 4 Guard : variante avec filtre de sécurité
  • Fine-tunes communautaires : des milliers de variantes spécifiques à un domaine
  • Versions quantifiées : modèles compressés fonctionnant sur matériel grand public
  • Llama 4 Vision : variante multimodale avec compréhension d'images

Aucun autre modèle d'IA n'a engendré un écosystème aussi riche. Bien que GPT-5.5 et Claude puissent être plus intelligents, ce sont des boîtes noires. Llama 4 est transparent, modifiable et piloté par la communauté.


2. Analyse des benchmarks

Test QI Mensa Norway : 112 (supérieur à la moyenne)

Consiste en 36 questions de reconnaissance de motifs visuels. Llama 4 obtient 112 — au-dessus de la moyenne humaine de 100, dans la gamme « supérieur à la moyenne ». Comparable à DeepSeek V4 Pro (111), en dessous de Qwen 3.5 (115), Kimi K3 (118) et des modèles de frontière (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).

Un QI de 112 signifie que Llama 4 est plus intelligent qu'environ 79% des humains — les 21% supérieurs de l'intelligence humaine. Si c'était une personne, elle serait comparable à un étudiant universitaire capable ou un professionnel qualifié. Pas un génie, mais certainement brillant et compétent.

Artificial Analysis Intelligence Index : top 15

Sur l'Intelligence Index, Llama 4 se classe dans le top 15 mondial avec un score estimé de ~43-44. Cela le place compétitif avec DeepSeek V4 Pro (44,3) mais derrière Qwen 3.5 (~45-46), Kimi K3 (~45-47), Gemini (46,5) et les modèles de frontière.

Décomposition des composants de l'Index :

  • GDPval-AA v2 : Llama 4 performe adéquatement, bénéficiant de son grand nombre de paramètres pour diverses tâches agentiques
  • AA-Omniscience : Llama 4 a un taux d'hallucination modéré — meilleur que les petits modèles mais pire que Claude
  • GPQA : Llama 4 performe raisonnablement sur les questions scientifiques de niveau troisième cycle
  • HLE : Llama 4 se classe dans le top 15 au Humanity's Last Exam
  • ARC-AGI : Llama 4 performe adéquatement sur le raisonnement abstrait
  • LMSYS Arena : Llama 4 obtient des scores solides de préférence humaine, particulièrement pour les tâches ouvertes

AI IQ composite (VexoWire) : ~112

Le QI composite de VexoWire combine plusieurs tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Le QI composite estimé de Llama 4 est ~112 — cohérent avec son score Mensa Norway. Cela le place dans la gamme « supérieur à la moyenne », plus intelligent qu'environ 79% des humains.

GDPval-AA v2 : top 15

Sur le benchmark agentique, Llama 4 se classe dans le top 15. Son grand nombre de paramètres (405B) lui donne une connaissance et une capacité de raisonnement substantielles, mais il reste derrière les modèles de frontière sur les tâches complexes multi-étapes. Pour des charges de travail agentiques modérées, Llama 4 est compétent.

Humanity's Last Exam (HLE) : top 15

Sur les questions académiques les plus difficiles, Llama 4 se classe dans le top 15 parmi les modèles d'IA. Les vastes données d'entraînement de Meta et la grande capacité du modèle l'aident à bien performer à travers les disciplines, bien qu'il ne corresponde pas aux modèles de frontière sur les questions les plus spécialisées.


3. Que signifie un QI de 112 ?

Pour mettre le QI de 112 de Llama 4 en contexte :

  • 85-115 (68% des gens) : Intelligence moyenne
  • 115-130 (14%) : Supérieur à la moyenne à élevée
  • 130-145 (2%) : Surdoué — qualifie pour Mensa (top 2%)
  • 145-160 (0,1%) : Hautement surdoué / génie

Llama 4, à 112, se situe dans la partie supérieure de la gamme « moyenne » — plus intelligent qu'environ 79% des humains. Si c'était une personne, elle serait comparable à un étudiant universitaire capable ou un professionnel qualifié. Pas un génie, mais certainement brillant et compétent.

C'est comparable à DeepSeek V4 Pro (111) mais en dessous des autres modèles :

  • Qwen 3.5 : 115 (supérieur à la moyenne)
  • Kimi K3 : 118 (supérieur à la moyenne)
  • Claude Opus 4.8 : ~130 (surdoué)
  • Gemini 3.1 Pro : 141 (hautement surdoué)
  • GPT-5.5 : ~145 (génie)
  • Grok-4.20 : 145 (génie)

L'écart avec les modèles de frontière est d'environ 18-33 points de QI. Mais Llama 4 compense par sa nature open-source — pour les applications qui nécessitent un contrôle total, une confidentialité ou une personnalisation, l'ouverture de Llama 4 peut compenser l'écart de QI.


4. Où Llama 4 excelle

Liberté open-source

Les poids de Llama 4 sont librement disponibles au téléchargement et au déploiement local. C'est sa caractéristique déterminante. Aucun autre modèle de premier plan n'offre ce niveau d'ouverture. Pour les organisations qui nécessitent un contrôle total de leur infrastructure d'IA, Llama 4 est la seule option parmi les modèles de pointe.

Personnalisation et fine-tuning

Comme les poids sont disponibles, les développeurs peuvent fine-tuner Llama 4 pour des domaines, langues ou tâches spécifiques. Cela a mené à des milliers de fine-tunes communautaires — modèles médicaux, modèles juridiques, modèles de programmation, modèles d'écriture créative et plus. Aucun modèle fermé n'offre ce niveau de personnalisation.

Confidentialité et sécurité des données

Avec Llama 4, les organisations peuvent exécuter le modèle entièrement sur leur propre matériel, garantissant que les données ne quittent jamais leur infrastructure. Pour la santé, la finance, la défense et autres industries sensibles, c'est critique. Aucune donnée ne va à des APIs tierces.

Coût à grande échelle

Llama 4 auto-hébergé est gratuit (au-delà des coûts matériels). À grande échelle, cela peut être considérablement moins cher que de payer des frais API par token. Pour les organisations avec de grands volumes d'inférence, l'investissement matériel s'amortit rapidement.

Écosystème communautaire

L'écosystème Llama est inégalé. Des milliers de développeurs contribuent des outils, des fine-tunes, des quantifications et des optimisations. Cette approche pilotée par la communauté signifie que Llama 4 bénéficie d'innovation collective — les améliorations viennent de partout, pas seulement de Meta.

Transparence

Contrairement aux modèles fermés, l'architecture et les poids de Llama 4 sont transparents. Les chercheurs peuvent étudier comment le modèle fonctionne, identifier les biais, comprendre les échecs et proposer des améliorations. Cette transparence est essentielle pour le progrès scientifique et le développement responsable de l'IA.

Optimisation matérielle

La communauté a développé de nombreuses versions quantifiées de Llama 4 qui peuvent fonctionner sur du matériel grand public — de 8-bit à 4-bit à 2-bit. Cela signifie que vous pouvez exécuter un modèle d'IA capable sur un GPU haut de gamme, pas seulement dans un centre de données.


5. Où Llama 4 pèche

QI brut et raisonnement complexe

Avec un QI de 112, Llama 4 est en dessous des modèles de frontière sur les tâches de raisonnement complexe. Pour les problèmes les plus difficiles — mathématiques compétitives, puzzles logiques avancés, raisonnement scientifique de pointe — Claude, GPT-5.5 et Gemini sont substantiellement meilleurs. L'écart de 18-33 points de QI est significatif.

Taux d'hallucination

Llama 4 a un taux d'hallucination modéré — meilleur que les petits modèles mais pire que Claude (35,9%) et GPT-5.5. Pour les applications où la précision factuelle est critique — recherche, droit, médecine — Claude reste plus fiable.

Fenêtre de contexte

Avec une fenêtre de contexte de 128K tokens, Llama 4 est adéquat mais pas exceptionnel. Kimi K3 (2M), Gemini (1M) et Qwen 3.5 (256K) offrent des fenêtres de contexte plus grandes. Pour les tâches qui nécessitent de traiter de très longs documents, d'autres modèles sont de meilleurs choix.

Capacités multimodales

Bien que Llama 4 Vision existe, ses capacités multimodales sont moins polies que Qwen 3.5 (texte, image, audio, vidéo) ou Gemini (texte, image, audio, vidéo). Pour les applications qui nécessitent une compréhension multimodale robuste, Qwen 3.5 ou Gemini sont de meilleurs choix.

Intelligence émotionnelle

Le QE (intelligence émotionnelle) de Llama 4 est estimé à ~105 — inférieur à Claude (~132), GPT-5.5 (~120), Gemini (~115) et Qwen 3.5 (~107), mais comparable à DeepSeek (~105). Ses réponses tendent à être plus fonctionnelles et moins émotionnellement nuancées. Pour les apps de thérapie, le service client ou les interactions humaines sensibles, Claude est le meilleur choix.

Exigences matérielles

Le modèle complet de 405B paramètres nécessite du matériel significatif — plusieurs GPUs haut de gamme pour l'inférence. Bien que les versions quantifiées aident, exécuter Llama 4 en pleine qualité est coûteux en termes de matériel. Pour les organisations sans ressources de calcul suffisantes, les modèles basés sur API peuvent être plus pratiques.

Sécurité et alignement

Bien que Llama 4 Guard existe pour le filtrage de sécurité, la nature open-source signifie que des acteurs malveillants peuvent retirer les mesures de sécurité. Meta fournit des directives mais ne peut pas les imposer. Pour les applications nécessitant une sécurité garantie, les modèles fermés avec des garde-fous imposés peuvent être plus appropriés.


6. Llama 4 vs autres modèles

Modèle Intelligence Index QI Mensa Norway AI IQ est. Open-source Coût/1M Contexte Paramètres
Llama 4 ~43-44 (top 15) 112 ~112 oui (gratuit) gratuit (auto-hébergé) 128K 405B
Claude Opus 4.8 55,7 ~130 ~132 non 5/25 200K inconnu
GPT-5.5 54,8 ~145 ~136 non 5/30 400K inconnu
Gemini 3.1 Pro 46,5 141 ~131 non 2/12 1M inconnu
Grok-4.20 top 5 145 ~140 non 3/15 256K inconnu
DeepSeek V4 Pro 44,3 ~111 ~111 oui 0,44/0,87 128K inconnu
Qwen 3.5 ~45-46 (top 10) 115 ~115 oui 0,50/1,50 256K inconnu
Kimi K3 ~45-47 (top 10) 118 ~118 non 0,55/2,19 2M inconnu

L'image : Llama 4 est le champion open-source — pas le plus intelligent, mais le plus accessible. Claude est le professionnel capable — le meilleur en tâches réelles. GPT-5.5 est le génie des tests — le meilleur en maths et raisonnement visuel. Gemini est le champion du rapport qualité-prix — meilleur coût-efficacité parmi les modèles de frontière. Grok-4.20 est le champion du QI brut — QI le plus élevé avec personnalité. DeepSeek est le champion budgétaire — l'API la moins chère. Qwen 3.5 est le touche-à-tout — le plus polyvalent. Et Kimi est le champion du contexte long — la plus grande fenêtre de contexte.

Pour les organisations qui ont besoin d'open-source, de confidentialité, de personnalisation ou de coût à grande échelle, Llama 4 est le choix évident. C'est le modèle du peuple — pas le plus intelligent, mais le plus libre.


7. Qu'est-ce que cela signifie pour les humains ?

Llama 4 opère à un QI de ~112 — plus intelligent qu'environ 79% des humains. Mais :

  • Le QI n'est pas tout : un QI de 112 est au-dessus de la moyenne et suffisant pour la plupart des tâches pratiques
  • L'ouverture compte plus que le QI brut pour de nombreuses applications : pour les applications sensibles à la confidentialité ou nécessitant une personnalisation, l'ouverture de Llama 4 est plus précieuse qu'un QI plus élevé
  • La liberté permet l'innovation : les poids ouverts de Llama 4 ont engendré tout un écosystème d'innovation que les modèles fermés ne peuvent égaler
  • La transparence construit la confiance : pouvoir inspecter les internes du modèle construit une confiance que les boîtes noires ne peuvent pas
  • Connaissance ≠ compréhension : comme tous les modèles d'IA, Llama 4 a accès à de vastes connaissances mais ne « comprend » pas véritablement comme un humain
  • Pas de conscience : un QI élevé ne signifie pas la sentience. Llama 4 est un système sophistiqué de reconnaissance de motifs, pas un être pensant
  • La communauté drive le progrès : l'écosystème Llama prouve que la collaboration ouverte peut produire des modèles compétitifs avec des systèmes fermés milliardaires

La réponse la plus honnête : Llama 4 est plus intelligent que 79% des humains aux tests cognitifs, et pour les applications qui nécessitent de l'ouverture, de la confidentialité ou de la personnalisation, c'est le choix le plus intelligent — non pas parce qu'il est le plus intelligent, mais parce qu'il est le plus libre.

Comment votre QI se compare-t-il à Llama 4 ? Réalisez l'évaluation professionnelle de QI de NeuroLab.
Passer le test maintenant →


Conclusion

💡 Points clés
- Le QI de Llama 4 est 112 au Mensa Norway — supérieur à la moyenne, plus intelligent qu'~79% des personnes.

  • Top 15 sur l'Intelligence Index — compétitif avec DeepSeek, derrière Qwen 3.5, Kimi et les modèles de frontière.
  • Pleinement open-source — poids librement disponibles pour téléchargement, étude et déploiement local.
  • 405B paramètres — l'un des plus grands modèles open-source disponibles.
  • Idéal pour : applications sensibles à la confidentialité, besoins de personnalisation, coût à grande échelle, recherche, déploiements auto-hébergés, innovation pilotée par la communauté.
  • Pas idéal pour : QI brut (modèles de frontière gagnent), contexte long (Kimi gagne), multimodal (Qwen 3.5 ou Gemini gagnent), intelligence émotionnelle (Claude gagne), sécurité garantie (modèles fermés avec garde-fous imposés).
  • La leçon : l'intelligence ne consiste pas seulement à être le plus intelligent — mais à être le plus accessible. Llama 4 prouve que l'IA open-source peut rivaliser avec des systèmes fermés milliardaires, démocratisant l'accès à l'IA avancée pour tous.