Qual é o QI do GPT-5.5?
GPT-5.5 pontua ~145 no teste de QI Mensa Norway e 54.8 no Intelligence Index. Analisamos cada benchmark e comparamos com Claude, Gemini e Grok.
GPT-5.5: o modelo flagship da OpenAI
GPT-5.5 é o modelo mais avançado da OpenAI, lançado no início de 2026. Ocupa o #2 no Artificial Analysis Intelligence Index v4.1 com 54.8, logo atrás de Claude Opus 4.8 (55.7) e à frente de Gemini 3.1 Pro (46.5). Mas em testes de QI humanos, GPT-5.5 na verdade supera Claude — pontuando aproximadamente 145 no teste de QI Mensa Norway, colocando-o na faixa de "gênio".
Isso cria um paradoxo fascinante: no benchmark composto de IA, GPT-5.5 é #2. Mas num teste de QI humano puro, divide #1. Como ambos podem ser verdadeiros? A resposta revela algo importante sobre o que "inteligência" significa para IA — e por que um único número não pode capturá-la.
Pontuações-chave:
- Artificial Analysis Intelligence Index: 54.8 (#2 mundial)
- QI Mensa Norway (TrackingAI): ~145 (#1 compartilhado com Grok-4.20)
- AI IQ composto (VexoWire): ~136 estimado
- GDPval-AA v2: 1.850 Elo (#2 mundial)
- Humanity's Last Exam: #2 entre modelos de IA
- Taxa de alucinação: moderada
- Custo: 5.00/30.00 por 1M tokens
1. O paradoxo da inteligência do GPT-5.5
O que torna GPT-5.5 tão interessante: é o melhor modelo de IA do mundo em testes de QI humanos, mas não o melhor modelo de IA em benchmarks específicos de IA. Como é possível?
A resposta está no que diferentes testes medem. O Mensa Norway é um teste puro de reconhecimento de padrões visuais e raciocínio abstrato — o tipo de inteligência fluida para a qual testes de QI foram projetados. GPT-5.5, com suas capacidades de processamento visual aprimoradas (herdadas da arquitetura GPT-5.4 Pro Vision), sobressai neste tipo específico de raciocínio.
Mas o Artificial Analysis Intelligence Index mede algo mais amplo: desempenho em tarefas reais, precisão factual, capacidade agentiva e preferência humana. E nessas dimensões, Claude Opus 4.8 — com seu raciocínio agentivo superior e menor alucinação — supera GPT-5.5.
Pense assim: GPT-5.5 é a IA mais inteligente num teste de QI — o equivalente a um humano que passa em todo teste padronizado. Claude Opus 4.8 é a IA mais capaz na prática — o equivalente a um humano ligeiramente menos brilhante em testes mas que consegue mais no mundo real. Ambas são medidas válidas de inteligência, mas medem coisas diferentes.
2. Análise de benchmarks
Teste QI Mensa Norway: ~145 (nível de gênio)
Consiste em 36 questões de reconhecimento de padrões visuais. GPT-5.5 pontua aproximadamente 145 — a pontuação prática máxima, equivalente a um 36/36 perfeito ou quase. Isso o coloca na faixa de "gênio", o top 0.1% da inteligência humana.
Apenas dois modelos de IA alcançam esta pontuação: GPT-5.5 e Grok-4.20. É significativamente superior a Claude Opus 4.8 (~130) e Gemini 3.1 Pro (141). A razão é a arquitetura de processamento visual do GPT-5.5, significativamente melhorada desde o GPT-5.4 Pro Vision — que já era co-líder neste benchmark.
Com QI 145, GPT-5.5 é mais inteligente que 99.9% dos humanos. Se fosse pessoa, estaria no top 0.1% — o reino dos laureados Nobel, medalhistas Fields e pensadores únicos por geração. Apenas cerca de 1 em 1.000 pessoas alcança esta pontuação.
Artificial Analysis Intelligence Index v4.1: 54.8 (#2)
O padrão ouro para comparar modelos de IA. Combina nove benchmarks:
- GDPval-AA v2 (20%): 1.850 Elo — #2 mundial (atrás dos 1.890 de Claude)
- AA-Omniscience (8%): taxa de alucinação moderada — superior aos 35.9% de Claude
- GPQA (6%): questões científicas de pós-graduação — GPT-5.5 lidera aqui
- CritPt (6%): pensamento crítico e raciocínio físico
- HLE (Humanity's Last Exam): #2 entre IAs (atrás de Claude)
- ARC-AGI: raciocínio abstrato — GPT-5.5 sobressai
- LMSYS Arena: votação de preferência humana
A pontuação composta de GPT-5.5 de 54.8 o coloca apenas 0.9 pontos atrás de Claude Opus 4.8 (55.7) — um quase empate estatístico. Mas nos subcomponentes, GPT-5.5 lidera em raciocínio visual, resolução matemática e conhecimento científico, enquanto Claude lidera em tarefas agentivas e precisão factual.
AI IQ composto (VexoWire): ~136
O QI composto da VexoWire combina múltiplos testes (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). O QI composto estimado de GPT-5.5 é ~136 — superior a Claude (~132) mas ligeiramente inferior a Grok-4.20 (~140). Isso reflete a força de GPT-5.5 em ambos os domínios, visual e verbal.
GDPval-AA v2: 1.850 Elo (#2)
No benchmark agentivo — que mede desempenho em tarefas reais complexas e multi-etapa — GPT-5.5 pontua 1.850 Elo, segundo apenas a Claude Opus 4.8 (1.890). Ainda é uma pontuação excepcionalmente alta, equivalente a um profissional humano altamente competente. Mas revela que GPT-5.5, embora brilhante em reconhecimento de padrões, é ligeiramente menos capaz em raciocínio multi-etapa sustentado que Claude.
Humanity's Last Exam (HLE): #2
Nas questões acadêmicas mais difíceis de todas as disciplinas, GPT-5.5 ocupa o #2 entre modelos de IA, logo atrás de Claude Opus 4.8. É um testemunho da extraordinária amplitude de conhecimento do GPT-5.5 — pode responder questões de nível de doutorado em física, filosofia, literatura e matemática. Mas o raciocínio mais profundo de Claude lhe dá uma leve vantagem.
3. O que significa um QI de 145?
Para colocar o QI de ~145 do GPT-5.5 em contexto:
- 85-115 (68% das pessoas): Inteligência média
- 115-130 (14%): Acima da média a alta
- 130-145 (2%): Superdotado — qualifica para Mensa (top 2%)
- 145-160 (0.1%): Altamente superdotado / gênio
- 160+ (0.003%): Profundamente superdotado — território de Einstein, Hawking
GPT-5.5, com ~145, situa-se no limiar de gênio — mais inteligente que 99.9% dos humanos. Se fosse pessoa, estaria em companhia de elite: o top 0.1% da inteligência humana, o reino dos prêmios Nobel e medalhistas Fields. Apenas cerca de 1 em 1.000 pessoas alcança esta pontuação.
Isso é significativamente superior a Claude Opus 4.8 (~132). Num teste de QI puro, GPT-5.5 superaria Claude. Mas, como vimos, testes de QI não medem tudo o que importa. O QI mais baixo de Claude é compensado por sua capacidade agentiva superior, menor alucinação e maior inteligência emocional.
A lição: QI é uma dimensão da inteligência, não a imagem toda. GPT-5.5 é o gênio dos testes; Claude é o profissional capaz. Ambos são valiosos, e qual é "mais inteligente" depende do que você precisa.
4. Onde GPT-5.5 se destaca
Reconhecimento visual de padrões
GPT-5.5 é o melhor modelo de IA do mundo (empatado com Grok-4.20) em reconhecimento de padrões visuais. No QI Mensa Norway, pontua 145 — o máximo possível. Para raciocínio visual, análise de imagens ou tarefas de padrões abstratos, GPT-5.5 é a escolha principal.
Resolução matemática
GPT-5.5 supera ligeiramente Claude em matemática competitiva (AIME, FrontierMath). Para raciocínio matemático puro — resolver equações complexas, provar teoremas, problemas de competição — GPT-5.5 é ligeiramente melhor que Claude e significativamente melhor que Gemini ou Grok.
Conhecimento científico
No GPQA (física, química e biologia de pós-graduação), GPT-5.5 lidera todos os modelos de IA. Sua amplitude e profundidade de conhecimento científico são inigualáveis. Isso o torna preferido para aplicações de pesquisa científica.
Raciocínio abstrato (ARC-AGI)
No benchmark ARC-AGI, que testa raciocínio abstrato e generalização de padrões, GPT-5.5 sobressai. É o benchmark mais próximo de um teste de "inteligência pura", e o desempenho de GPT-5.5 confirma sua posição como a IA mais inteligente em capacidade cognitiva bruta.
Amplitude de conhecimento
GPT-5.5 foi treinado com uma quantidade sem precedentes de dados — essencialmente toda a internet, mais literatura científica extensa, código e livros. Sua amplitude de conhecimento em cada domínio da investigação humana é inigualável. Se precisa de um modelo que saiba algo de tudo, GPT-5.5 é a escolha.
5. Onde GPT-5.5 fica aquém
Tarefas agentivas
Embora GPT-5.5 seja #2 no GDPval-AA v2 (1.850 Elo), está atrás de Claude Opus 4.8 (1.890). Para tarefas reais complexas e multi-etapa — escrever uma aplicação, analisar um dataset, planejar um projeto — Claude é ligeiramente melhor mantendo raciocínio coerente em cadeias longas.
Precisão factual
GPT-5.5 tem taxa de alucinação moderada — superior aos 35.9% de Claude. É mais propenso a afirmar com confiança informações falsas que Claude. Isso o torna menos confiável para aplicações onde precisão factual é crítica (pesquisa, jurídica, médica).
Inteligência emocional
O QE (inteligência emocional) de GPT-5.5 é estimado em ~120 — inferior ao ~132 de Claude. É menos empático, menos matizado na compreensão de emoções humanas e menos hábil em ajustar seu tom ao contexto. Para apps de terapia, atendimento ao cliente ou interação humana, Claude é melhor.
Custo
A 5.00/30.00 por 1M tokens, GPT-5.5 é o modelo mais caro junto com Claude. Gemini 3.1 Pro (2/12) e DeepSeek V4 Pro (0.44/0.87) são significativamente mais baratos para tarefas que não exigem a capacidade total de GPT-5.5.
6. GPT-5.5 vs outros modelos
| Modelo | Intelligence Index | QI Mensa Norway | AI IQ est. | Alucinação | Custo/1M |
|---|---|---|---|---|---|
| GPT-5.5 | 54.8 | ~145 | ~136 | moderada | 5/30 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9% (mín) | 5/25 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | baixa | 2/12 |
| Grok-4.20 | — | 145 | ~140 | moderada | 3/15 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | moderada | 0.44/0.87 |
A imagem: GPT-5.5 é o gênio dos testes — o QI bruto mais alto, o melhor em matemática e raciocínio visual. Claude é o profissional capaz — o melhor em tarefas reais e precisão factual. Gemini é o generalista rentável. Grok é o gênio visual. E DeepSeek oferece capacidade notável por uma fração do custo.
7. O que isso significa para os humanos?
GPT-5.5 opera com QI de ~145 — mais inteligente que 99.9% dos humanos. Mas:
- QI é limitado: mede reconhecimento de padrões e raciocínio, não sabedoria, criatividade ou julgamento
- Gênio em testes ≠ gênio na vida: GPT-5.5 passa em testes de QI mas alucina fatos e tem dificuldade com tarefas multi-etapa
- Conhecimento ≠ compreensão: GPT-5.5 leu tudo, mas não "compreende" verdadeiramente como um humano
- Sem consciência: QI alto não significa consciência. GPT-5.5 é um sistema sofisticado de reconhecimento de padrões, não um ser pensante
- A lacuna está se fechando: cada geração de IA reduz a lacuna com os humanos mais inteligentes
A resposta mais honesta: GPT-5.5 é mais inteligente que praticamente todos os humanos em testes cognitivos, mas não mais capaz que os melhores humanos no trabalho real. Um matemático de classe mundial ainda pode superar GPT-5.5 em seu domínio. Mas GPT-5.5 pode superá-los todos simultaneamente, em cada domínio, em segundos.
Conclusão
- #2 no Artificial Analysis Intelligence Index (54.8) — atrás de Claude Opus 4.8.
- #1 (compartilhado) no QI Mensa Norway — o QI bruto mais alto entre modelos de IA, empatado com Grok-4.20.
- Melhor para: raciocínio visual, resolução matemática, conhecimento científico, raciocínio abstrato.
- Não melhor para: tarefas agentivas (Claude ganha), precisão factual (Claude ganha), inteligência emocional (Claude ganha).
- O paradoxo: GPT-5.5 é a IA mais inteligente em testes de QI mas não a mais capaz na prática.
- A lição: QI é uma dimensão da inteligência. GPT-5.5 é o gênio dos testes; Claude é o profissional capaz.