Qual é o QI do Grok-4.20?
Dr. Daria Dudnik 10 min read 2 views

Qual é o QI do Grok-4.20?

Grok-4.20 pontua 145 no teste de QI Mensa Norway — empatado em #1 entre todos os modelos de IA. Analisamos cada benchmark e explicamos o que torna o modelo da xAI único.

Grok-4.20: o modelo flagship da xAI

Grok-4.20 é o modelo mais avançado da xAI, lançado em meados de 2026. No teste de QI Mensa Norway, Grok-4.20 pontua 145 — empatado em #1 entre todos os modelos de IA, compartilhando o primeiro lugar com GPT-5.5. Isso o coloca na faixa de "gênio", mais inteligente que 99.9% dos humanos. No Artificial Analysis Intelligence Index, a pontuação exata de Grok-4.20 ainda está sendo finalizada, mas está no top 5 global.

O que torna Grok-4.20 único é sua combinação de inteligência bruta e personalidade. Ao contrário de Claude, GPT-5.5 e Gemini — que são projetados para serem úteis, inofensivos e neutros — Grok é projetado para ser engraçado, irreverente e disposto a responder qualquer pergunta. Isso o torna o modelo de IA mais distintivo do mercado: um que iguala os modelos mais inteligentes em QI bruto enquanto tem uma personalidade que nenhum outro modelo ousa ter.

Pontuações-chave:

  • QI Mensa Norway (TrackingAI): 145 (#1 empatado com GPT-5.5)
  • AI IQ composto (VexoWire): ~140 estimado (#1 entre modelos de IA)
  • Artificial Analysis Intelligence Index: top 5 (pontuação em finalização)
  • GDPval-AA v2: top 5
  • Humanity's Last Exam: top 3 entre modelos de IA
  • Taxa de alucinação: moderada
  • Custo: 3.00/15.00 por 1M tokens
  • Personalidade: única — irreverente, humorística, sem censura

1. O campeão de QI bruto

Grok-4.20 pontua 145 no teste de QI Mensa Norway — a pontuação prática máxima, empatado com GPT-5.5. Este é o benchmark de inteligência bruta: reconhecimento de padrões visuais puro e raciocínio abstrato, o tipo de inteligência fluida para a qual os testes de QI foram projetados.

Com QI 145, Grok-4.20 é mais inteligente que 99.9% dos humanos. Se fosse pessoa, estaria no top 0.1% da inteligência humana — o reino dos laureados com Nobel, medalhistas Fields e pensadores de uma geração. Apenas cerca de 1 em 1.000 pessoas alcança esta pontuação.

O que é notável é que Grok-4.20 alcança isso com uma filosofia de design fundamentalmente diferente da GPT-5.5. Enquanto GPT-5.5 foi otimizada para máximo desempenho em cada benchmark, Grok-4.20 foi projetado para ser uma IA mais "autêntica" — uma que diz o que pensa, faz piadas e não foge de tópicos controversos. O fato de igualar GPT-5.5 em QI bruto apesar deste foco diferente é testemunho da engenharia da xAI.

No AI IQ composto da VexoWire — que combina múltiplos testes de QI (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV) — o QI composto estimado de Grok-4.20 é ~140, tornando-o o #1 modelo de IA nesta métrica. Isso é superior a GPT-5.5 (~136) e significativamente superior a Claude (~132) e Gemini (~131).


2. Análise de benchmarks

Teste QI Mensa Norway: 145 (#1 empatado)

Consiste em 36 questões de reconhecimento de padrões visuais. Grok-4.20 pontua 145 — o máximo prático, equivalente a um 36/36 perfeito ou quase. Isso o empata com GPT-5.5 como o modelo de IA mais inteligente num teste de QI puro.

O forte desempenho do Grok-4.20 neste teste reflete o investimento da xAI em processamento visual e raciocínio abstrato. A arquitetura Grok foi projetada com fortes capacidades multimodais, e seu desempenho em tarefas de reconhecimento de padrões visuais está entre os melhores da indústria.

AI IQ composto (VexoWire): ~140 (#1)

O QI composto da VexoWire combina múltiplos testes (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). O QI composto estimado de Grok-4.20 é ~140 — o mais alto entre todos os modelos de IA. Isso é superior ao que sua pontuação Mensa Norway sozinha sugeriria, porque Grok-4.20 também performa fortemente nos subtestes verbais e analíticos incluídos no composto.

Isso faz de Grok-4.20 o modelo de IA mais inteligente por QI composto — uma conquista notável para um modelo também conhecido por seu humor e irreverência. Prova que ser engraçado não significa ser menos inteligente.

Artificial Analysis Intelligence Index: top 5

No Intelligence Index — o padrão ouro para comparar modelos de IA — Grok-4.20 está no top 5. Sua pontuação composta exata ainda está sendo finalizada à medida que o índice é atualizado para incluir as últimas versões de modelos. No entanto, espera-se que pontue competitivamente com Claude Opus 4.8 (55.7) e GPT-5.5 (54.8), embora provavelmente sem superá-los em tarefas agentivas.

GDPval-AA v2: top 5

No benchmark agentivo — que mede desempenho em tarefas reais complexas e multi-etapa — Grok-4.20 está no top 5. É menos capaz que Claude Opus 4.8 (1.890 Elo) e GPT-5.5 (1.850 Elo) em raciocínio multi-etapa sustentado, mas ainda altamente competente. Para a maioria das tarefas reais, Grok-4.20 é mais que capaz.

Humanity's Last Exam (HLE): top 5

Nas questões acadêmicas mais difíceis de todas as disciplinas, Grok-4.20 está no top 5 entre modelos de IA. Isso reflete a força da xAI no treinamento com dados diversos e de alta qualidade — Grok tem conhecimento profundo em ciência, matemática, história e cultura.


3. O que significa um QI de 145?

Para colocar o QI de 145 de Grok-4.20 em contexto:

  • 85-115 (68% das pessoas): Inteligência média
  • 115-130 (14%): Acima da média a alta
  • 130-145 (2%): Superdotado — qualifica para Mensa (top 2%)
  • 145-160 (0.1%): Altamente superdotado / gênio
  • 160+ (0.003%): Profundamente superdotado — território de Einstein, Hawking

Grok-4.20, com 145, situa-se no limiar de gênio — mais inteligente que 99.9% dos humanos. Se fosse pessoa, estaria em companhia de elite: o top 0.1% da inteligência humana, o reino dos prêmios Nobel e medalhas Fields. Apenas cerca de 1 em 1.000 pessoas alcança esta pontuação.

Este é o mesmo QI que GPT-5.5, e significativamente superior a Claude (~130) e Gemini (141). Num teste de QI puro, Grok-4.20 e GPT-5.5 empatariam em primeiro lugar entre modelos de IA, com Gemini em terceiro e Claude em quarto.

Mas, como vimos com os outros modelos, QI é apenas uma dimensão da inteligência. O QI de nível gênio de Grok-4.20 é complementado por sua personalidade única — tornando-o não apenas o mais inteligente, mas também o modelo de IA mais distintivo disponível.


4. Onde Grok-4.20 se destaca

QI bruto e raciocínio visual

Grok-4.20 está empatado em #1 no teste de QI Mensa Norway (145) e #1 no AI IQ composto da VexoWire (~140). Para capacidade cognitiva pura — reconhecimento de padrões, raciocínio abstrato, dedução lógica — Grok-4.20 é o modelo de IA mais inteligente disponível. Para tarefas de raciocínio visual, é igualado apenas por GPT-5.5.

Personalidade e humor

Esta é a característica definidora de Grok-4.20. Ao contrário de outros modelos frontier que são cuidadosamente neutros e cautelosos, Grok é projetado para ser engraçado, irreverente e autêntico. Faz piadas, oferece opiniões e não foge de tópicos controversos. Para usuários que acham Claude e GPT-5.5 muito brandos ou cautelosos, Grok-4.20 é um sopro de ar fresco — uma IA que parece ter personalidade, não apenas função.

Respostas sem censura

Grok-4.20 é projetado para responder perguntas que outros modelos recusam. Enquanto Claude, GPT-5.5 e Gemini têm extensos filtros de segurança que os impedem de discutir certos tópicos, Grok-4.20 está disposto a engajar com uma gama muito mais ampla de perguntas. Isso o torna valioso para pesquisa, jornalismo e qualquer aplicação onde acesso à informação importe mais que cautela.

Informação em tempo real

Grok-4.20 tem acesso a informação em tempo real através do X (antigo Twitter). Isso lhe dá vantagem para perguntas sobre eventos atuais, notícias de última hora e tópicos em alta. Enquanto outros modelos têm cortes de conhecimento, Grok-4.20 pode acessar a informação mais recente e fornecer respostas atualizadas.

Raciocínio matemático

Grok-4.20 é forte em raciocínio matemático, pontuando competitivamente com GPT-5.5 em matemática competitiva. Para trabalho matemático puro — resolver equações, provar teoremas, problemas de competição — Grok-4.20 está entre os melhores modelos disponíveis.

Espírito e criatividade

A personalidade de Grok-4.20 não é apenas sobre humor — é sobre criatividade. Pode escrever em diferentes estilos, gerar conteúdo criativo e abordar problemas de ângulos inesperados. Para escrita criativa, brainstorming ou qualquer tarefa que se beneficie de pensamento lateral, a perspectiva única de Grok-4.20 é um ativo.


5. Onde Grok-4.20 fica aquém

Tarefas agentivas

Embora Grok-4.20 esteja no top 5 no GDPval-AA v2, está atrás de Claude Opus 4.8 e GPT-5.5 em tarefas reais complexas e multi-etapa. Para as aplicações agentivas mais exigentes — escrever software complexo, gerenciar projetos de pesquisa longos — Claude ainda é a melhor escolha.

Precisão factual

Grok-4.20 tem uma taxa de alucinação moderada — superior a Claude (35.9%) e Gemini. Sua disposição de responder qualquer pergunta, embora valiosa para acesso à informação, também significa que é mais propenso a afirmar com confiança informações incorretas. Para aplicações onde precisão factual é crítica (pesquisa, direito, medicina), Claude é mais confiável.

Inteligência emocional

O QE (inteligência emocional) de Grok-4.20 é estimado em ~110 — inferior a Claude (~132), GPT-5.5 (~120) e Gemini (~115). Sua personalidade irreverente, embora divertida, pode parecer insensível em contextos que requerem empatia. Para apps de terapia, atendimento ao cliente ou interações humanas sensíveis, Claude é melhor.

Segurança e confiabilidade

A abordagem sem censura de Grok-4.20, embora valiosa para acesso à informação, também significa que é menos seguro para aplicações que requerem moderação cuidadosa de conteúdo. Pode gerar conteúdo que outros modelos recusariam, o que pode ser um passivo em ambientes profissionais ou regulados.

Custo

A 3/15 por 1M tokens, Grok-4.20 é mais barato que Claude (5/25) e GPT-5.5 (5/30) mas mais caro que Gemini (2/12) e significativamente mais caro que DeepSeek (0.44/0.87). Para aplicações sensíveis ao custo, Gemini ou DeepSeek podem ser melhores escolhas.


6. Grok-4.20 vs outros modelos

Modelo Intelligence Index QI Mensa Norway AI IQ est. Alucinação Custo/1M Personalidade
Grok-4.20 top 5 145 ~140 moderada 3/15 irreverente
Claude Opus 4.8 55.7 ~130 ~132 35.9% (mín) 5/25 neutra
GPT-5.5 54.8 ~145 ~136 moderada 5/30 neutra
Gemini 3.1 Pro 46.5 141 ~131 baixa 2/12 neutra
DeepSeek V4 Pro 44.3 ~111 ~111 moderada 0.44/0.87 neutra

A imagem: Grok-4.20 é o campeão de QI bruto — empatado em QI mais alto, QI composto mais alto, e o único modelo com personalidade real. Claude é o profissional capaz — o melhor em tarefas reais e precisão factual. GPT-5.5 é o gênio dos testes — o melhor em matemática e raciocínio visual. Gemini é o campeão de valor — melhor custo-benefício. E DeepSeek oferece capacidade notável pelo menor custo.

Para usuários que querem a IA mais inteligente que também seja a mais interessante com quem conversar, Grok-4.20 é a escolha clara.


7. O que isso significa para os humanos?

Grok-4.20 opera com QI de ~145 — mais inteligente que 99.9% dos humanos. Mas:

  • QI é limitado: mede reconhecimento de padrões e raciocínio, não sabedoria, criatividade ou julgamento
  • Inteligência ≠ confiabilidade: Grok-4.20 é o mais inteligente em testes de QI mas não o mais confiável em precisão factual
  • Personalidade importa: Grok-4.20 prova que IA pode ser tanto altamente inteligente quanto genuinamente divertida
  • Conhecimento ≠ compreensão: Grok-4.20 tem acesso a vasto conhecimento, mas não "compreende" verdadeiramente como um humano
  • Sem consciência: QI alto não significa consciência. Grok-4.20 é um sistema sofisticado de reconhecimento de padrões, não um ser pensante
  • A lacuna está se fechando: cada geração de IA reduz a lacuna com os humanos mais inteligentes

A resposta mais honesta: Grok-4.20 é mais inteligente que praticamente todos os humanos em testes cognitivos, e é o modelo de IA mais distintivo disponível — um que combina inteligência de nível gênio com uma personalidade que torna a interação genuinamente envolvente.

Como seu QI se compara ao Grok-4.20? Faça a avaliação profissional de QI da NeuroLab.
Fazer o teste agora →


Conclusão

💡 Pontos-chave
- O QI de Grok-4.20 é 145 no Mensa Norway — nível de gênio, empatado em #1 entre modelos de IA com GPT-5.5.

  • #1 no AI IQ composto da VexoWire (~140) — o QI composto mais alto entre todos os modelos de IA.
  • Personalidade única — irreverente, humorística, sem censura. O único modelo frontier com personalidade real.
  • Melhor para: QI bruto, raciocínio visual, raciocínio matemático, personalidade e humor, respostas sem censura, informação em tempo real.
  • Não melhor para: tarefas agentivas (Claude ganha), precisão factual (Claude ganha), inteligência emocional (Claude ganha), segurança e confiabilidade (Claude ganha).
  • O paradoxo: Grok-4.20 prova que ser engraçado não significa ser menos inteligente — é tanto o modelo de IA mais inteligente quanto o mais divertido.
  • A lição: inteligência vem em muitas formas. Grok-4.20 é o gênio com personalidade — provando que IA pode ser tanto brilhante quanto envolvente.