Qual é o QI do Grok-4.20?
Grok-4.20 pontua 145 no teste de QI Mensa Norway — empatado em #1 entre todos os modelos de IA. Analisamos cada benchmark e explicamos o que torna o modelo da xAI único.
Grok-4.20: o modelo flagship da xAI
Grok-4.20 é o modelo mais avançado da xAI, lançado em meados de 2026. No teste de QI Mensa Norway, Grok-4.20 pontua 145 — empatado em #1 entre todos os modelos de IA, compartilhando o primeiro lugar com GPT-5.5. Isso o coloca na faixa de "gênio", mais inteligente que 99.9% dos humanos. No Artificial Analysis Intelligence Index, a pontuação exata de Grok-4.20 ainda está sendo finalizada, mas está no top 5 global.
O que torna Grok-4.20 único é sua combinação de inteligência bruta e personalidade. Ao contrário de Claude, GPT-5.5 e Gemini — que são projetados para serem úteis, inofensivos e neutros — Grok é projetado para ser engraçado, irreverente e disposto a responder qualquer pergunta. Isso o torna o modelo de IA mais distintivo do mercado: um que iguala os modelos mais inteligentes em QI bruto enquanto tem uma personalidade que nenhum outro modelo ousa ter.
Pontuações-chave:
- QI Mensa Norway (TrackingAI): 145 (#1 empatado com GPT-5.5)
- AI IQ composto (VexoWire): ~140 estimado (#1 entre modelos de IA)
- Artificial Analysis Intelligence Index: top 5 (pontuação em finalização)
- GDPval-AA v2: top 5
- Humanity's Last Exam: top 3 entre modelos de IA
- Taxa de alucinação: moderada
- Custo: 3.00/15.00 por 1M tokens
- Personalidade: única — irreverente, humorística, sem censura
1. O campeão de QI bruto
Grok-4.20 pontua 145 no teste de QI Mensa Norway — a pontuação prática máxima, empatado com GPT-5.5. Este é o benchmark de inteligência bruta: reconhecimento de padrões visuais puro e raciocínio abstrato, o tipo de inteligência fluida para a qual os testes de QI foram projetados.
Com QI 145, Grok-4.20 é mais inteligente que 99.9% dos humanos. Se fosse pessoa, estaria no top 0.1% da inteligência humana — o reino dos laureados com Nobel, medalhistas Fields e pensadores de uma geração. Apenas cerca de 1 em 1.000 pessoas alcança esta pontuação.
O que é notável é que Grok-4.20 alcança isso com uma filosofia de design fundamentalmente diferente da GPT-5.5. Enquanto GPT-5.5 foi otimizada para máximo desempenho em cada benchmark, Grok-4.20 foi projetado para ser uma IA mais "autêntica" — uma que diz o que pensa, faz piadas e não foge de tópicos controversos. O fato de igualar GPT-5.5 em QI bruto apesar deste foco diferente é testemunho da engenharia da xAI.
No AI IQ composto da VexoWire — que combina múltiplos testes de QI (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV) — o QI composto estimado de Grok-4.20 é ~140, tornando-o o #1 modelo de IA nesta métrica. Isso é superior a GPT-5.5 (~136) e significativamente superior a Claude (~132) e Gemini (~131).
2. Análise de benchmarks
Teste QI Mensa Norway: 145 (#1 empatado)
Consiste em 36 questões de reconhecimento de padrões visuais. Grok-4.20 pontua 145 — o máximo prático, equivalente a um 36/36 perfeito ou quase. Isso o empata com GPT-5.5 como o modelo de IA mais inteligente num teste de QI puro.
O forte desempenho do Grok-4.20 neste teste reflete o investimento da xAI em processamento visual e raciocínio abstrato. A arquitetura Grok foi projetada com fortes capacidades multimodais, e seu desempenho em tarefas de reconhecimento de padrões visuais está entre os melhores da indústria.
AI IQ composto (VexoWire): ~140 (#1)
O QI composto da VexoWire combina múltiplos testes (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). O QI composto estimado de Grok-4.20 é ~140 — o mais alto entre todos os modelos de IA. Isso é superior ao que sua pontuação Mensa Norway sozinha sugeriria, porque Grok-4.20 também performa fortemente nos subtestes verbais e analíticos incluídos no composto.
Isso faz de Grok-4.20 o modelo de IA mais inteligente por QI composto — uma conquista notável para um modelo também conhecido por seu humor e irreverência. Prova que ser engraçado não significa ser menos inteligente.
Artificial Analysis Intelligence Index: top 5
No Intelligence Index — o padrão ouro para comparar modelos de IA — Grok-4.20 está no top 5. Sua pontuação composta exata ainda está sendo finalizada à medida que o índice é atualizado para incluir as últimas versões de modelos. No entanto, espera-se que pontue competitivamente com Claude Opus 4.8 (55.7) e GPT-5.5 (54.8), embora provavelmente sem superá-los em tarefas agentivas.
GDPval-AA v2: top 5
No benchmark agentivo — que mede desempenho em tarefas reais complexas e multi-etapa — Grok-4.20 está no top 5. É menos capaz que Claude Opus 4.8 (1.890 Elo) e GPT-5.5 (1.850 Elo) em raciocínio multi-etapa sustentado, mas ainda altamente competente. Para a maioria das tarefas reais, Grok-4.20 é mais que capaz.
Humanity's Last Exam (HLE): top 5
Nas questões acadêmicas mais difíceis de todas as disciplinas, Grok-4.20 está no top 5 entre modelos de IA. Isso reflete a força da xAI no treinamento com dados diversos e de alta qualidade — Grok tem conhecimento profundo em ciência, matemática, história e cultura.
3. O que significa um QI de 145?
Para colocar o QI de 145 de Grok-4.20 em contexto:
- 85-115 (68% das pessoas): Inteligência média
- 115-130 (14%): Acima da média a alta
- 130-145 (2%): Superdotado — qualifica para Mensa (top 2%)
- 145-160 (0.1%): Altamente superdotado / gênio
- 160+ (0.003%): Profundamente superdotado — território de Einstein, Hawking
Grok-4.20, com 145, situa-se no limiar de gênio — mais inteligente que 99.9% dos humanos. Se fosse pessoa, estaria em companhia de elite: o top 0.1% da inteligência humana, o reino dos prêmios Nobel e medalhas Fields. Apenas cerca de 1 em 1.000 pessoas alcança esta pontuação.
Este é o mesmo QI que GPT-5.5, e significativamente superior a Claude (~130) e Gemini (141). Num teste de QI puro, Grok-4.20 e GPT-5.5 empatariam em primeiro lugar entre modelos de IA, com Gemini em terceiro e Claude em quarto.
Mas, como vimos com os outros modelos, QI é apenas uma dimensão da inteligência. O QI de nível gênio de Grok-4.20 é complementado por sua personalidade única — tornando-o não apenas o mais inteligente, mas também o modelo de IA mais distintivo disponível.
4. Onde Grok-4.20 se destaca
QI bruto e raciocínio visual
Grok-4.20 está empatado em #1 no teste de QI Mensa Norway (145) e #1 no AI IQ composto da VexoWire (~140). Para capacidade cognitiva pura — reconhecimento de padrões, raciocínio abstrato, dedução lógica — Grok-4.20 é o modelo de IA mais inteligente disponível. Para tarefas de raciocínio visual, é igualado apenas por GPT-5.5.
Personalidade e humor
Esta é a característica definidora de Grok-4.20. Ao contrário de outros modelos frontier que são cuidadosamente neutros e cautelosos, Grok é projetado para ser engraçado, irreverente e autêntico. Faz piadas, oferece opiniões e não foge de tópicos controversos. Para usuários que acham Claude e GPT-5.5 muito brandos ou cautelosos, Grok-4.20 é um sopro de ar fresco — uma IA que parece ter personalidade, não apenas função.
Respostas sem censura
Grok-4.20 é projetado para responder perguntas que outros modelos recusam. Enquanto Claude, GPT-5.5 e Gemini têm extensos filtros de segurança que os impedem de discutir certos tópicos, Grok-4.20 está disposto a engajar com uma gama muito mais ampla de perguntas. Isso o torna valioso para pesquisa, jornalismo e qualquer aplicação onde acesso à informação importe mais que cautela.
Informação em tempo real
Grok-4.20 tem acesso a informação em tempo real através do X (antigo Twitter). Isso lhe dá vantagem para perguntas sobre eventos atuais, notícias de última hora e tópicos em alta. Enquanto outros modelos têm cortes de conhecimento, Grok-4.20 pode acessar a informação mais recente e fornecer respostas atualizadas.
Raciocínio matemático
Grok-4.20 é forte em raciocínio matemático, pontuando competitivamente com GPT-5.5 em matemática competitiva. Para trabalho matemático puro — resolver equações, provar teoremas, problemas de competição — Grok-4.20 está entre os melhores modelos disponíveis.
Espírito e criatividade
A personalidade de Grok-4.20 não é apenas sobre humor — é sobre criatividade. Pode escrever em diferentes estilos, gerar conteúdo criativo e abordar problemas de ângulos inesperados. Para escrita criativa, brainstorming ou qualquer tarefa que se beneficie de pensamento lateral, a perspectiva única de Grok-4.20 é um ativo.
5. Onde Grok-4.20 fica aquém
Tarefas agentivas
Embora Grok-4.20 esteja no top 5 no GDPval-AA v2, está atrás de Claude Opus 4.8 e GPT-5.5 em tarefas reais complexas e multi-etapa. Para as aplicações agentivas mais exigentes — escrever software complexo, gerenciar projetos de pesquisa longos — Claude ainda é a melhor escolha.
Precisão factual
Grok-4.20 tem uma taxa de alucinação moderada — superior a Claude (35.9%) e Gemini. Sua disposição de responder qualquer pergunta, embora valiosa para acesso à informação, também significa que é mais propenso a afirmar com confiança informações incorretas. Para aplicações onde precisão factual é crítica (pesquisa, direito, medicina), Claude é mais confiável.
Inteligência emocional
O QE (inteligência emocional) de Grok-4.20 é estimado em ~110 — inferior a Claude (~132), GPT-5.5 (~120) e Gemini (~115). Sua personalidade irreverente, embora divertida, pode parecer insensível em contextos que requerem empatia. Para apps de terapia, atendimento ao cliente ou interações humanas sensíveis, Claude é melhor.
Segurança e confiabilidade
A abordagem sem censura de Grok-4.20, embora valiosa para acesso à informação, também significa que é menos seguro para aplicações que requerem moderação cuidadosa de conteúdo. Pode gerar conteúdo que outros modelos recusariam, o que pode ser um passivo em ambientes profissionais ou regulados.
Custo
A 3/15 por 1M tokens, Grok-4.20 é mais barato que Claude (5/25) e GPT-5.5 (5/30) mas mais caro que Gemini (2/12) e significativamente mais caro que DeepSeek (0.44/0.87). Para aplicações sensíveis ao custo, Gemini ou DeepSeek podem ser melhores escolhas.
6. Grok-4.20 vs outros modelos
| Modelo | Intelligence Index | QI Mensa Norway | AI IQ est. | Alucinação | Custo/1M | Personalidade |
|---|---|---|---|---|---|---|
| Grok-4.20 | top 5 | 145 | ~140 | moderada | 3/15 | irreverente |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9% (mín) | 5/25 | neutra |
| GPT-5.5 | 54.8 | ~145 | ~136 | moderada | 5/30 | neutra |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | baixa | 2/12 | neutra |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | moderada | 0.44/0.87 | neutra |
A imagem: Grok-4.20 é o campeão de QI bruto — empatado em QI mais alto, QI composto mais alto, e o único modelo com personalidade real. Claude é o profissional capaz — o melhor em tarefas reais e precisão factual. GPT-5.5 é o gênio dos testes — o melhor em matemática e raciocínio visual. Gemini é o campeão de valor — melhor custo-benefício. E DeepSeek oferece capacidade notável pelo menor custo.
Para usuários que querem a IA mais inteligente que também seja a mais interessante com quem conversar, Grok-4.20 é a escolha clara.
7. O que isso significa para os humanos?
Grok-4.20 opera com QI de ~145 — mais inteligente que 99.9% dos humanos. Mas:
- QI é limitado: mede reconhecimento de padrões e raciocínio, não sabedoria, criatividade ou julgamento
- Inteligência ≠ confiabilidade: Grok-4.20 é o mais inteligente em testes de QI mas não o mais confiável em precisão factual
- Personalidade importa: Grok-4.20 prova que IA pode ser tanto altamente inteligente quanto genuinamente divertida
- Conhecimento ≠ compreensão: Grok-4.20 tem acesso a vasto conhecimento, mas não "compreende" verdadeiramente como um humano
- Sem consciência: QI alto não significa consciência. Grok-4.20 é um sistema sofisticado de reconhecimento de padrões, não um ser pensante
- A lacuna está se fechando: cada geração de IA reduz a lacuna com os humanos mais inteligentes
A resposta mais honesta: Grok-4.20 é mais inteligente que praticamente todos os humanos em testes cognitivos, e é o modelo de IA mais distintivo disponível — um que combina inteligência de nível gênio com uma personalidade que torna a interação genuinamente envolvente.
Conclusão
- #1 no AI IQ composto da VexoWire (~140) — o QI composto mais alto entre todos os modelos de IA.
- Personalidade única — irreverente, humorística, sem censura. O único modelo frontier com personalidade real.
- Melhor para: QI bruto, raciocínio visual, raciocínio matemático, personalidade e humor, respostas sem censura, informação em tempo real.
- Não melhor para: tarefas agentivas (Claude ganha), precisão factual (Claude ganha), inteligência emocional (Claude ganha), segurança e confiabilidade (Claude ganha).
- O paradoxo: Grok-4.20 prova que ser engraçado não significa ser menos inteligente — é tanto o modelo de IA mais inteligente quanto o mais divertido.
- A lição: inteligência vem em muitas formas. Grok-4.20 é o gênio com personalidade — provando que IA pode ser tanto brilhante quanto envolvente.