Qual é o QI do Kimi K3?
Kimi K3 pontua 118 no teste de QI Mensa Norway e está no top 10 do Intelligence Index. Analisamos cada benchmark e explicamos o que torna o modelo da Moonshot AI único.
Kimi K3: a estrela em ascensão da Moonshot AI
Kimi K3 é o modelo flagship da Moonshot AI, uma das startups de IA mais inovadoras da China. Lançado no início de 2026, Kimi K3 pontua 118 no teste de QI Mensa Norway e está no top 10 do Artificial Analysis Intelligence Index v4.1. Isso o coloca acima do DeepSeek V4 Pro (111) mas abaixo dos modelos de fronteira (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
O que torna Kimi K3 único é sua extraordinária janela de contexto. Enquanto a maioria dos modelos de IA processa 32K-200K tokens de cada vez, Kimi K3 pode lidar com até 2 milhões de tokens num único contexto — aproximadamente 1.500 páginas de texto, ou cerca de 5-10 livros completos. Isso o torna o campeão indiscutível de tarefas de contexto longo: analisar bases de código inteiras, processar documentos legais extensos, resumir coleções de livros e entender relacionamentos complexos entre múltiplos documentos.
Kimi K3 é o especialista em contexto longo: um modelo que pode não igualar a fronteira em QI bruto, mas que pode processar e raciocinar sobre quantidades de informação que outros modelos simplesmente não conseguem lidar. Para aplicações que exigem entender vastas quantidades de texto numa única passagem, Kimi K3 está numa liga própria.
Pontuações-chave:
- Artificial Analysis Intelligence Index: top 10 (pontuação ~45-47)
- QI Mensa Norway (TrackingAI): 118 (acima da média, aproximando-se de superdotado)
- AI IQ composto (VexoWire): ~118 estimado
- GDPval-AA v2: top 10
- Humanity's Last Exam: top 10
- Taxa de alucinação: baixa-moderada
- Custo: 0.55/2.19 por 1M tokens (muito acessível)
- Janela de contexto: 2 milhões de tokens (a maior de qualquer modelo principal)
1. A revolução do contexto longo
Kimi K3 representa uma abordagem diferente à capacidade de IA. Enquanto a maioria dos laboratórios foca em tornar modelos mais inteligentes (QI mais alto, melhor raciocínio), Moonshot AI focou em tornar modelos capazes de processar mais informação de uma vez. O resultado é um modelo com uma janela de contexto de 2 milhões de tokens — 10-60x maior que a maioria dos concorrentes.
Para colocar em perspectiva:
- GPT-5.5: ~200K tokens de contexto
- Claude Opus 4.8: ~200K tokens de contexto
- Gemini 3.1 Pro: ~1M tokens de contexto
- Kimi K3: 2M tokens de contexto
Com 2M tokens, Kimi K3 pode processar:
- Uma base de código inteira (50.000+ linhas de código)
- 5-10 romances de extensão completa num único prompt
- Um arquivo de caso legal completo com todas as evidências e precedentes
- Uma coleção inteira de artigos de pesquisa sobre um tópico
- Horas de transcrições de reuniões gravadas
Não se trata apenas de ler mais — trata-se de entender relacionamentos entre documentos. Kimi K3 pode identificar conexões entre a página 1 e a página 1.500 de um documento que outros modelos perderiam. Para tarefas que exigem compreensão holística de grandes conjuntos de informação, isso muda o jogo.
2. Análise de benchmarks
Teste QI Mensa Norway: 118 (acima da média)
Consiste em 36 questões de reconhecimento de padrões visuais. Kimi K3 pontua 118 — acima da média humana de 100 e aproximando-se do limiar "superdotado" de 130. Isso é maior que DeepSeek V4 Pro (111) mas abaixo dos modelos de fronteira (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Um QI de 118 significa que Kimi K3 é mais inteligente que aproximadamente 85% dos humanos. Se fosse pessoa, seria comparável a um forte graduado universitário — brilhante e capaz, embora não no nível de gênio dos modelos de fronteira. Para a maioria das tarefas de raciocínio prático, este nível de inteligência é mais do que suficiente.
Artificial Analysis Intelligence Index: top 10
No Intelligence Index, Kimi K3 está no top 10 global com uma pontuação estimada de ~45-47. Isso o coloca competitivo com Gemini 3.1 Pro (46.5) e DeepSeek V4 Pro (44.3), mas atrás de Claude (55.7) e GPT-5.5 (54.8).
Decomposição dos componentes do Index:
- GDPval-AA v2: Kimi K3 performa bem, beneficiando-se do seu contexto longo para tarefas multi-etapa
- AA-Omniscience: Kimi K3 tem taxa de alucinação baixa-moderada, beneficiando-se da sua capacidade de referenciar informação dentro do seu contexto
- GPQA: Kimi K3 performa adequadamente em questões científicas de nível pós-graduação
- HLE: Kimi K3 está no top 10 no Humanity's Last Exam
- ARC-AGI: Kimi K3 performa razoavelmente em raciocínio abstrato
- LMSYS Arena: Kimi K3 obtém fortes pontuações de preferência humana, particularmente para tarefas de documentos longos
AI IQ composto (VexoWire): ~118
O QI composto da VexoWire combina múltiplos testes (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). O QI composto estimado de Kimi K3 é ~118 — consistente com sua pontuação Mensa Norway. Isso o coloca na faixa "acima da média", aproximando-se mas não alcançando o nível "superdotado".
GDPval-AA v2: top 10
No benchmark agentivo, Kimi K3 está no top 10. Sua janela de contexto longo lhe dá uma vantagem única em tarefas agentivas que envolvem processar grandes quantidades de informação — pode reter contextos de projeto inteiros em memória, tornando-o melhor em tarefas multi-etapa que exigem contexto sustentado. No entanto, em pura complexidade de raciocínio, ainda fica atrás de Claude e GPT-5.5.
Humanity's Last Exam (HLE): top 10
Nas questões acadêmicas mais difíceis, Kimi K3 está no top 10 entre modelos de IA. Sua capacidade de processar grandes quantidades de material de referência em contexto lhe dá vantagem em questões que exigem sintetizar informação de múltiplas fontes.
3. O que significa um QI de 118?
Para colocar o QI de 118 de Kimi K3 em contexto:
- 85-115 (68% das pessoas): Inteligência média
- 115-130 (14%): Acima da média a alta
- 130-145 (2%): Superdotado — qualifica para Mensa (top 2%)
- 145-160 (0.1%): Altamente superdotado / gênio
Kimi K3, com 118, situa-se na faixa "acima da média" — mais inteligente que cerca de 85% dos humanos. Se fosse pessoa, seria comparável a um forte graduado universitário ou um profissional capaz. Não um gênio, mas certamente brilhante e competente.
Isso é maior que DeepSeek V4 Pro (111) mas abaixo dos modelos de fronteira:
- Claude Opus 4.8: ~130 (superdotado)
- Gemini 3.1 Pro: 141 (altamente superdotado)
- GPT-5.5: ~145 (gênio)
- Grok-4.20: 145 (gênio)
A lacuna para os modelos de fronteira é de cerca de 12-27 pontos de QI. Mas Kimi K3 compensa seu menor QI bruto com sua extraordinária janela de contexto — para tarefas que exigem processar grandes quantidades de informação, a vantagem de contexto longo de Kimi K3 pode compensar a lacuna de QI.
4. Onde Kimi K3 se destaca
Processamento de contexto longo
Esta é a característica definidora de Kimi K3. Com uma janela de contexto de 2 milhões de tokens, pode processar e raciocinar sobre quantidades de texto que nenhum outro modelo principal consegue lidar. Para analisar bases de código inteiras, processar documentos legais extensos, resumir coleções de livros ou entender relacionamentos complexos entre múltiplos documentos, Kimi K3 é o melhor modelo disponível.
Análise de código
Kimi K3 é particularmente forte em tarefas de análise de código. Seu contexto longo permite-lhe entender projetos de software inteiros — não apenas arquivos individuais — tornando-o excelente para revisão de código, sugestões de refatoração e análise arquitetural. Para desenvolvedores que trabalham com grandes bases de código, Kimi K3 oferece capacidades que outros modelos simplesmente não conseguem igualar.
Resumo de documentos
Para resumir documentos longos — casos legais, artigos de pesquisa, especificações técnicas, relatórios financeiros — Kimi K3 destaca-se. Sua capacidade de processar o documento inteiro de uma vez significa que seus resumos capturam nuances e conexões que processamento em blocos poderia perder.
Custo-benefício
A 0.55/2.19 por 1M tokens, Kimi K3 é muito acessível — mais caro que DeepSeek V4 Pro (0.44/0.87) mas significativamente mais barato que Claude (5/25), GPT-5.5 (5/30) e Gemini (2/12). Para tarefas de contexto longo, a proposta de valor é excepcional: obtém contexto de 2M tokens por uma fração do custo dos modelos de fronteira.
Tarefas em chinês
Como modelo desenvolvido na China, Kimi K3 tem excelentes capacidades em idioma chinês. Para aplicações em chinês — geração de conteúdo, análise, tradução — Kimi K3 está entre os melhores modelos disponíveis, às vezes superando modelos ocidentais.
Assistência em pesquisa
Para pesquisadores que precisam processar grandes quantidades de literatura, Kimi K3 é uma ferramenta inestimável. Pode ingerir dezenas de artigos de uma vez e identificar conexões, contradições e lacunas entre eles — uma tarefa que levaria a um pesquisador humano dias ou semanas.
5. Onde Kimi K3 fica aquém
QI bruto e raciocínio complexo
Com um QI de 118, Kimi K3 está abaixo dos modelos de fronteira em tarefas de raciocínio complexo. Para os problemas mais difíceis — matemática competitiva, puzzles de lógica avançados, raciocínio científico de ponta — Claude, GPT-5.5 e Gemini são substancialmente melhores. Se sua tarefa exige raciocínio de nível gênio em entradas curtas, os modelos de fronteira são a melhor escolha.
Complexidade de tarefas agentivas
Embora o contexto longo de Kimi K3 ajude com tarefas agentivas, ainda fica atrás de Claude e GPT-5.5 em pura complexidade de tarefa. Para as aplicações agentivas mais exigentes — escrever software complexo do zero, gerenciar fluxos de pesquisa intrincados — Claude permanece mais capaz.
Inteligência emocional
O QE (inteligência emocional) de Kimi K3 é estimado em ~108 — inferior a Claude (~132), GPT-5.5 (~120) e Gemini (~115), mas comparável a Grok (~110). Suas respostas tendem a ser mais funcionais e menos emocionalmente matizadas. Para apps de terapia, atendimento ao cliente ou interações humanas sensíveis, Claude é a melhor escolha.
Disponibilidade global
Kimi K3 está disponível principalmente através da API da Moonshot AI e parceiros selecionados. Tem menos distribuição global que Claude, GPT-5.5 ou Gemini, o que pode afetar a disponibilidade em certas regiões. No entanto, está cada vez mais disponível através de plataformas de terceiros.
Reconhecimento de marca
Como modelo relativamente novo de uma startup chinesa, Kimi K3 tem menos reconhecimento de marca e confiança que modelos de OpenAI, Anthropic ou Google. Para organizações que priorizam trabalhar com provedores ocidentais estabelecidos, isso pode ser uma consideração.
6. Kimi K3 vs outros modelos
| Modelo | Intelligence Index | QI Mensa Norway | AI IQ est. | Contexto | Custo/1M | Melhor para |
|---|---|---|---|---|---|---|
| Kimi K3 | ~45-47 (top 10) | 118 | ~118 | 2M | 0.55/2.19 | Contexto longo |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 200K | 5/25 | Tarefas reais |
| GPT-5.5 | 54.8 | ~145 | ~136 | 200K | 5/30 | Matemática e raciocínio |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 1M | 2/12 | Valor e multimodal |
| Grok-4.20 | top 5 | 145 | ~140 | 200K | 3/15 | QI bruto e personalidade |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 128K | 0.44/0.87 | Orçamento e código aberto |
A imagem: Kimi K3 é o campeão de contexto longo — não o mais inteligente, mas capaz de processar mais informação de uma vez que qualquer outro modelo. Claude é o profissional capaz — o melhor em tarefas reais e precisão factual. GPT-5.5 é o gênio dos testes — o melhor em matemática e raciocínio visual. Gemini é o campeão de valor — melhor custo-benefício entre modelos de fronteira. Grok-4.20 é o campeão de QI bruto — QI mais alto com personalidade. E DeepSeek é o campeão econômico — o mais barato com pesos de código aberto.
Para usuários que precisam processar vastas quantidades de texto numa única passagem, Kimi K3 é a escolha clara — sua janela de contexto de 2M está numa liga própria.
7. O que isso significa para os humanos?
Kimi K3 opera com QI de ~118 — mais inteligente que cerca de 85% dos humanos. Mas:
- QI não é tudo: um QI de 118 está acima da média e é suficiente para a maioria das tarefas práticas
- Contexto importa mais que QI para muitas tarefas: para tarefas envolvendo documentos grandes, a janela de contexto de 2M de Kimi K3 é mais valiosa que um QI mais alto
- Contexto longo permite novas aplicações: Kimi K3 abre possibilidades que outros modelos não podem — analisar bases de código inteiras, processar documentos do tamanho de um livro, sintetizar pesquisa através de dezenas de artigos
- Conhecimento ≠ compreensão: como todos os modelos de IA, Kimi K3 tem acesso a vasto conhecimento mas não "compreende" verdadeiramente como um humano
- Sem consciência: QI alto não significa consciência. Kimi K3 é um sistema sofisticado de reconhecimento de padrões, não um ser pensante
- Especialização vs generalização: Kimi K3 prova que IA pode competir sendo a melhor numa capacidade específica (contexto longo) em vez de tentar ser a melhor em tudo
A resposta mais honesta: Kimi K3 é mais inteligente que 85% dos humanos em testes cognitivos, e para tarefas que exigem processar grandes quantidades de informação, é a escolha mais inteligente — não porque é o mais inteligente, mas porque pode reter mais na sua "mente" de uma vez.
Conclusão
- Top 10 no Intelligence Index — competitivo com Gemini e DeepSeek, atrás de Claude e GPT-5.5.
- Janela de contexto de 2 milhões de tokens — a maior de qualquer modelo principal, 10-60x maior que a maioria dos concorrentes.
- Melhor para: tarefas de contexto longo, análise de código, resumo de documentos, assistência em pesquisa, aplicações em chinês.
- Não melhor para: QI bruto (modelos de fronteira ganham), tarefas agentivas complexas (Claude ganha), inteligência emocional (Claude ganha).
- A lição: inteligência não é apenas ser o mais inteligente — é ser capaz de processar mais informação. Kimi K3 prova que contexto é uma forma de inteligência.