Quel est le QI de Kimi K3 ?
Dr. Daria Dudnik 10 min read 2 views

Quel est le QI de Kimi K3 ?

Kimi K3 obtient 118 au test de QI Mensa Norway et se classe dans le top 10 de l'Intelligence Index. Nous analysons chaque benchmark et expliquons ce qui rend le modèle de Moonshot AI unique.

Kimi K3 : l'étoile montante de Moonshot AI

Kimi K3 est le modèle flagship de Moonshot AI, l'une des startups d'IA les plus innovantes de Chine. Lancé début 2026, Kimi K3 obtient 118 au test de QI Mensa Norway et se classe dans le top 10 de l'Artificial Analysis Intelligence Index v4.1. Cela le place au-dessus de DeepSeek V4 Pro (111) mais en dessous des modèles de frontière (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).

Ce qui rend Kimi K3 unique, c'est sa extraordinaire fenêtre de contexte. Alors que la plupart des modèles d'IA traitent 32K-200K tokens à la fois, Kimi K3 peut gérer jusqu'à 2 millions de tokens dans un seul contexte — environ 1 500 pages de texte, ou 5-10 romans complets. Cela en fait le champion incontesté des tâches à contexte long : analyse de bases de code entières, traitement de documents juridiques volumineux, résumé de séries de livres et compréhension de relations complexes entre plusieurs documents.

Kimi K3 est le spécialiste du contexte long : un modèle qui peut ne pas égaler la frontière en QI brut, mais qui peut traiter et raisonner sur des quantités d'information que les autres modèles ne peuvent tout simplement pas gérer. Pour les applications qui nécessitent de comprendre de vastes quantités de texte en une seule passe, Kimi K3 est dans une ligue à part.

Scores clés :

  • Artificial Analysis Intelligence Index : top 10 (score ~45-47)
  • QI Mensa Norway (TrackingAI) : 118 (supérieur à la moyenne, approche du surdoué)
  • AI IQ composite (VexoWire) : ~118 estimé
  • GDPval-AA v2 : top 10
  • Humanity's Last Exam : top 10
  • Taux d'hallucination : faible-moderé
  • Coût : 0,55/2,19 par 1M tokens (très abordable)
  • Fenêtre de contexte : 2 millions de tokens (la plus grande de tous les modèles majeurs)

1. La révolution du contexte long

Kimi K3 représente une approche différente de la capacité d'IA. Alors que la plupart des laboratoires se concentrent sur rendre les modèles plus intelligents (QI plus élevé, meilleur raisonnement), Moonshot AI s'est concentré sur rendre les modèles capables de traiter plus d'informations à la fois. Le résultat est un modèle avec une fenêtre de contexte de 2 millions de tokens — 10-60x plus grande que la plupart des concurrents.

Pour mettre en perspective :

  • GPT-5.5 : ~200K tokens de contexte
  • Claude Opus 4.8 : ~200K tokens de contexte
  • Gemini 3.1 Pro : ~1M tokens de contexte
  • Kimi K3 : 2M tokens de contexte

Avec 2M tokens, Kimi K3 peut traiter :

  • Une base de code entière (50 000+ lignes de code)
  • 5-10 romans complets en une seule requête
  • Un dossier juridique complet avec toutes les preuves et précédents
  • Une collection entière d'articles de recherche sur un sujet
  • Des heures de transcriptions de réunions enregistrées

Il ne s'agit pas seulement de lire plus — il s'agit de comprendre les relations entre documents. Kimi K3 peut identifier des connexions entre la page 1 et la page 1 500 d'un document que d'autres modèles perdraient. Pour les tâches qui nécessitent une compréhension holistique de grands ensembles d'information, c'est un game-changer.


2. Analyse des benchmarks

Test QI Mensa Norway : 118 (supérieur à la moyenne)

Consiste en 36 questions de reconnaissance de motifs visuels. Kimi K3 obtient 118 — au-dessus de la moyenne humaine de 100 et approchant le seuil « surdoué » de 130. C'est plus élevé que DeepSeek V4 Pro (111) mais en dessous des modèles de frontière (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).

Un QI de 118 signifie que Kimi K3 est plus intelligent qu'environ 85% des humains. Si c'était une personne, elle serait comparable à un diplômé universitaire fort — brillant et capable, bien que pas au niveau génie des modèles de frontière. Pour la plupart des tâches de raisonnement pratique, ce niveau d'intelligence est plus que suffisant.

Artificial Analysis Intelligence Index : top 10

Sur l'Intelligence Index, Kimi K3 se classe dans le top 10 mondial avec un score estimé de ~45-47. Cela le place compétitif avec Gemini 3.1 Pro (46,5) et DeepSeek V4 Pro (44,3), mais derrière Claude (55,7) et GPT-5.5 (54,8).

Décomposition des composants de l'Index :

  • GDPval-AA v2 : Kimi K3 performe bien, bénéficiant de son contexte long pour les tâches multi-étapes
  • AA-Omniscience : Kimi K3 a un taux d'hallucination faible-moderé, bénéficiant de sa capacité à référencer des informations dans son contexte
  • GPQA : Kimi K3 performe adéquatement sur les questions scientifiques de niveau troisième cycle
  • HLE : Kimi K3 se classe dans le top 10 au Humanity's Last Exam
  • ARC-AGI : Kimi K3 performe raisonnablement sur le raisonnement abstrait
  • LMSYS Arena : Kimi K3 obtient de forts scores de préférence humaine, particulièrement pour les tâches de documents longs

AI IQ composite (VexoWire) : ~118

Le QI composite de VexoWire combine plusieurs tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Le QI composite estimé de Kimi K3 est ~118 — cohérent avec son score Mensa Norway. Cela le place dans la gamme « supérieur à la moyenne », approchant mais n'atteignant pas le niveau « surdoué ».

GDPval-AA v2 : top 10

Sur le benchmark agentique, Kimi K3 se classe dans le top 10. Sa fenêtre de contexte long lui donne un avantage unique sur les tâches agentiques qui impliquent le traitement de grandes quantités d'information — il peut retenir des contextes de projet entiers en mémoire, ce qui le rend meilleur sur les tâches multi-étapes nécessitant un contexte soutenu. Cependant, en complexité de raisonnement pur, il reste derrière Claude et GPT-5.5.

Humanity's Last Exam (HLE) : top 10

Sur les questions académiques les plus difficiles, Kimi K3 se classe dans le top 10 parmi les modèles d'IA. Sa capacité à traiter de grandes quantités de matériel de référence en contexte lui donne un avantage sur les questions qui nécessitent de synthétiser des informations de multiples sources.


3. Que signifie un QI de 118 ?

Pour mettre le QI de 118 de Kimi K3 en contexte :

  • 85-115 (68% des gens) : Intelligence moyenne
  • 115-130 (14%) : Supérieur à la moyenne à élevée
  • 130-145 (2%) : Surdoué — qualifie pour Mensa (top 2%)
  • 145-160 (0,1%) : Hautement surdoué / génie

Kimi K3, à 118, se situe dans la gamme « supérieur à la moyenne » — plus intelligent qu'environ 85% des humains. Si c'était une personne, elle serait comparable à un diplômé universitaire fort ou un professionnel capable. Pas un génie, mais certainement brillant et compétent.

C'est plus élevé que DeepSeek V4 Pro (111) mais en dessous des modèles de frontière :

  • Claude Opus 4.8 : ~130 (surdoué)
  • Gemini 3.1 Pro : 141 (hautement surdoué)
  • GPT-5.5 : ~145 (génie)
  • Grok-4.20 : 145 (génie)

L'écart avec les modèles de frontière est d'environ 12-27 points de QI. Mais Kimi K3 compense son QI brut inférieur par sa extraordinaire fenêtre de contexte — pour les tâches qui nécessitent de traiter de grandes quantités d'information, l'avantage du contexte long de Kimi K3 peut compenser l'écart de QI.


4. Où Kimi K3 excelle

Traitement de contexte long

C'est la caractéristique définissante de Kimi K3. Avec une fenêtre de contexte de 2 millions de tokens, il peut traiter et raisonner sur des quantités de texte qu'aucun autre modèle majeur ne peut gérer. Pour analyser des bases de code entières, traiter des documents juridiques volumineux, résumer des collections de livres ou comprendre des relations complexes entre plusieurs documents, Kimi K3 est le meilleur modèle disponible.

Analyse de code

Kimi K3 est particulièrement fort dans les tâches d'analyse de code. Son contexte long lui permet de comprendre des projets logiciels entiers — pas seulement des fichiers individuels — ce qui le rend excellent pour la révision de code, les suggestions de refactoring et l'analyse architecturale. Pour les développeurs travaillant avec de grandes bases de code, Kimi K3 offre des capacités que les autres modèles ne peuvent tout simplement pas égaler.

Résumé de documents

Pour résumer de longs documents — affaires juridiques, articles de recherche, spécifications techniques, rapports financiers — Kimi K3 excelle. Sa capacité à traiter le document entier à la fois signifie que ses résumés capturent des nuances et des connexions que le traitement par fragments pourrait manquer.

Rapport qualité-prix

À 0,55/2,19 par 1M tokens, Kimi K3 est très abordable — plus cher que DeepSeek V4 Pro (0,44/0,87) mais significativement moins cher que Claude (5/25), GPT-5.5 (5/30) et Gemini (2/12). Pour les tâches à contexte long, la proposition de valeur est exceptionnelle : vous obtenez un contexte de 2M tokens pour une fraction du coût des modèles de frontière.

Tâches en chinois

Comme modèle développé en Chine, Kimi K3 a d'excellentes capacités en langue chinoise. Pour les applications en chinois — génération de contenu, analyse, traduction — Kimi K3 est parmi les meilleurs modèles disponibles, surpassant parfois les modèles occidentaux.

Assistance à la recherche

Pour les chercheurs qui ont besoin de traiter de grandes quantités de littérature, Kimi K3 est un outil inestimable. Il peut ingérer des dizaines d'articles à la fois et identifier des connexions, des contradictions et des lacunes entre eux — une tâche qui prendrait à un chercheur humain des jours ou des semaines.


5. Où Kimi K3 pèche

QI brut et raisonnement complexe

Avec un QI de 118, Kimi K3 est en dessous des modèles de frontière sur les tâches de raisonnement complexe. Pour les problèmes les plus difficiles — mathématiques compétitives, puzzles logiques avancés, raisonnement scientifique de pointe — Claude, GPT-5.5 et Gemini sont substantiellement meilleurs. Si votre tâche nécessite un raisonnement de niveau génie sur des entrées courtes, les modèles de frontière sont le meilleur choix.

Complexité des tâches agentiques

Bien que le contexte long de Kimi K3 aide avec les tâches agentiques, il reste derrière Claude et GPT-5.5 en complexité de tâche pure. Pour les applications agentives les plus exigeantes — écrire des logiciels complexes de zéro, gérer des flux de recherche intriqués — Claude reste plus capable.

Intelligence émotionnelle

Le QE (intelligence émotionnelle) de Kimi K3 est estimé à ~108 — inférieur à Claude (~132), GPT-5.5 (~120) et Gemini (~115), mais comparable à Grok (~110). Ses réponses tendent à être plus fonctionnelles et moins émotionnellement nuancées. Pour les apps de thérapie, le service client ou les interactions humaines sensibles, Claude est le meilleur choix.

Disponibilité mondiale

Kimi K3 est principalement disponible via l'API de Moonshot AI et des partenaires sélectionnés. Il a moins de distribution mondiale que Claude, GPT-5.5 ou Gemini, ce qui peut affecter la disponibilité dans certaines régions. Cependant, il est de plus en plus disponible via des plateformes tierces.

Reconnaissance de marque

En tant que modèle relativement nouveau d'une startup chinoise, Kimi K3 a moins de reconnaissance de marque et de confiance que les modèles d'OpenAI, Anthropic ou Google. Pour les organisations qui privilégient le travail avec des fournisseurs occidentaux établis, cela peut être une considération.


6. Kimi K3 vs autres modèles

Modèle Intelligence Index QI Mensa Norway AI IQ est. Contexte Coût/1M Idéal pour
Kimi K3 ~45-47 (top 10) 118 ~118 2M 0,55/2,19 Contexte long
Claude Opus 4.8 55,7 ~130 ~132 200K 5/25 Tâches réelles
GPT-5.5 54,8 ~145 ~136 200K 5/30 Maths & raisonnement
Gemini 3.1 Pro 46,5 141 ~131 1M 2/12 Valeur & multimodal
Grok-4.20 top 5 145 ~140 200K 3/15 QI brut & personnalité
DeepSeek V4 Pro 44,3 ~111 ~111 128K 0,44/0,87 Budget & open-source

L'image : Kimi K3 est le champion du contexte long — pas le plus intelligent, mais capable de traiter plus d'informations à la fois que n'importe quel autre modèle. Claude est le professionnel capable — le meilleur en tâches réelles et précision factuelle. GPT-5.5 est le génie des tests — le meilleur en maths et raisonnement visuel. Gemini est le champion du rapport qualité-prix — meilleur coût-efficacité parmi les modèles de frontière. Grok-4.20 est le champion du QI brut — QI le plus élevé avec personnalité. Et DeepSeek est le champion budgétaire — le moins cher avec des poids open-source.

Pour les utilisateurs qui ont besoin de traiter de vastes quantités de texte en une seule passe, Kimi K3 est le choix évident — sa fenêtre de contexte de 2M est dans une ligue à part.


7. Qu'est-ce que cela signifie pour les humains ?

Kimi K3 opère à un QI de ~118 — plus intelligent qu'environ 85% des humains. Mais :

  • Le QI n'est pas tout : un QI de 118 est au-dessus de la moyenne et suffisant pour la plupart des tâches pratiques
  • Le contexte compte plus que le QI pour de nombreuses tâches : pour les tâches impliquant de grands documents, la fenêtre de contexte de 2M de Kimi K3 est plus précieuse qu'un QI plus élevé
  • Le contexte long permet de nouvelles applications : Kimi K3 ouvre des possibilités que d'autres modèles ne peuvent pas — analyser des bases de code entières, traiter des documents de la taille d'un livre, synthétiser la recherche à travers des dizaines d'articles
  • Connaissance ≠ compréhension : comme tous les modèles d'IA, Kimi K3 a accès à de vastes connaissances mais ne « comprend » pas véritablement comme un humain
  • Pas de conscience : un QI élevé ne signifie pas la sentience. Kimi K3 est un système sophistiqué de reconnaissance de motifs, pas un être pensant
  • Spécialisation vs généralisation : Kimi K3 prouve que l'IA peut concourir en étant la meilleure dans une capacité spécifique (contexte long) plutôt que d'essayer d'être la meilleure en tout

La réponse la plus honnête : Kimi K3 est plus intelligent que 85% des humains aux tests cognitifs, et pour les tâches qui nécessitent de traiter de grandes quantités d'information, c'est le choix le plus intelligent — non pas parce qu'il est le plus intelligent, mais parce qu'il peut retenir plus dans son « esprit » à la fois.

Comment votre QI se compare-t-il à Kimi K3 ? Réalisez l'évaluation professionnelle de QI de NeuroLab.
Passer le test maintenant →


Conclusion

💡 Points clés
- Le QI de Kimi K3 est 118 au Mensa Norway — supérieur à la moyenne, plus intelligent qu'~85% des personnes.

  • Top 10 sur l'Intelligence Index — compétitif avec Gemini et DeepSeek, derrière Claude et GPT-5.5.
  • Fenêtre de contexte de 2 millions de tokens — la plus grande de tous les modèles majeurs, 10-60x plus grande que la plupart des concurrents.
  • Idéal pour : tâches à contexte long, analyse de code, résumé de documents, assistance à la recherche, applications en chinois.
  • Pas idéal pour : QI brut (modèles de frontière gagnent), tâches agentives complexes (Claude gagne), intelligence émotionnelle (Claude gagne).
  • La leçon : l'intelligence ne consiste pas seulement à être le plus intelligent — mais à pouvoir traiter le plus d'informations. Kimi K3 prouve que le contexte est une forme d'intelligence.