Qual é o QI do Llama 4?
Llama 4 pontua 112 no teste de QI Mensa Norway e está no top 15 do Intelligence Index. Analisamos cada benchmark e explicamos o que torna o modelo open-source da Meta único.
Llama 4: o campeão open-source da Meta
Llama 4 é o modelo open-source flagship da Meta AI, a divisão de pesquisa de uma das maiores empresas de tecnologia do mundo. Lançado no início de 2026, Llama 4 pontua 112 no teste de QI Mensa Norway e está no top 15 do Artificial Analysis Intelligence Index v4.1. Isso o coloca acima do DeepSeek V4 Pro (111) mas abaixo do Kimi K3 (118), Qwen 3.5 (115) e dos modelos de fronteira (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
O que torna Llama 4 único é sua natureza open-source em escala. Ao contrário de modelos fechados da OpenAI, Anthropic ou Google, os pesos do Llama 4 estão disponíveis gratuitamente para download e implantação local. Isso o tornou a base para milhares de modelos derivados, fine-tunes e aplicações — tornando Llama 4 não apenas um modelo, mas um ecossistema inteiro.
Llama 4 é o modelo do povo: um modelo que pode não ser o mais inteligente, mas que qualquer um pode baixar, modificar e executar em seu próprio hardware. Para pesquisadores, startups e organizações que precisam de controle total sobre sua infraestrutura de IA, Llama 4 oferece algo que nenhum modelo fechado pode: liberdade.
Pontuações-chave:
- Artificial Analysis Intelligence Index: top 15 (pontuação ~43-44)
- QI Mensa Norway (TrackingAI): 112 (acima da média)
- AI IQ composto (VexoWire): ~112 estimado
- GDPval-AA v2: top 15
- Humanity's Last Exam: top 15
- Taxa de alucinação: moderada
- Custo: gratuito (auto-hospedado) ou 0.20/0.60 por 1M tokens (via provedores)
- Parâmetros: 405B (maior variante)
- Open-source: sim, pesos disponíveis gratuitamente
- Contexto: 128K tokens
1. A revolução open-source
Llama 4 representa o compromisso da Meta com IA open-source — a crença de que a IA deveria ser acessível a todos, não controlada por poucas empresas. Enquanto OpenAI, Anthropic e Google mantêm seus modelos atrás de APIs, a Meta libera os pesos completos do modelo, permitindo que qualquer um baixe, estude, modifique e implante Llama 4 em seu próprio hardware.
Isso tem implicações profundas:
- Democratização: qualquer um com hardware suficiente pode executar um modelo de IA state-of-the-art
- Personalização: desenvolvedores podem fazer fine-tune do Llama 4 para domínios, idiomas ou tarefas específicas
- Privacidade: organizações podem executar Llama 4 localmente, garantindo que dados nunca saiam da sua infraestrutura
- Inovação: pesquisadores podem estudar os internos do modelo, levando a novos avanços
- Ecossistema: milhares de modelos derivados são construídos sobre Llama 4, criando um ecossistema rico
- Custo: Llama 4 auto-hospedado é gratuito (além dos custos de hardware), a opção mais barata em escala
O ecossistema Llama inclui:
- Llama 4 Base: o modelo pré-treinado original
- Llama 4 Instruct: fine-tuned para seguimento de instruções
- Llama 4 Guard: variante com filtro de segurança
- Fine-tunes da comunidade: milhares de variantes específicas de domínio
- Versões quantizadas: modelos comprimidos que funcionam em hardware de consumo
- Llama 4 Vision: variante multimodal com compreensão de imagens
Nenhum outro modelo de IA gerou um ecossistema tão rico. Embora GPT-5.5 e Claude possam ser mais inteligentes, são caixas pretas. Llama 4 é transparente, modificável e impulsionado pela comunidade.
2. Análise de benchmarks
Teste QI Mensa Norway: 112 (acima da média)
Consiste em 36 questões de reconhecimento de padrões visuais. Llama 4 pontua 112 — acima da média humana de 100, na faixa "acima da média". Isso é comparável ao DeepSeek V4 Pro (111), abaixo do Qwen 3.5 (115), Kimi K3 (118) e dos modelos de fronteira (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Um QI de 112 significa que Llama 4 é mais inteligente que aproximadamente 79% dos humanos — os 21% superiores da inteligência humana. Se fosse pessoa, seria comparável a um estudante universitário capaz ou um profissional qualificado. Não um gênio, mas certamente brilhante e competente.
Artificial Analysis Intelligence Index: top 15
No Intelligence Index, Llama 4 está no top 15 global com uma pontuação estimada de ~43-44. Isso o coloca competitivo com DeepSeek V4 Pro (44.3) mas atrás de Qwen 3.5 (~45-46), Kimi K3 (~45-47), Gemini (46.5) e dos modelos de fronteira.
Decomposição dos componentes do Index:
- GDPval-AA v2: Llama 4 performa adequadamente, beneficiando-se de sua grande contagem de parâmetros para diversas tarefas agentivas
- AA-Omniscience: Llama 4 tem taxa de alucinação moderada — melhor que modelos menores mas pior que Claude
- GPQA: Llama 4 performa razoavelmente em questões científicas de nível pós-graduação
- HLE: Llama 4 está no top 15 no Humanity's Last Exam
- ARC-AGI: Llama 4 performa adequadamente em raciocínio abstrato
- LMSYS Arena: Llama 4 obtém pontuações sólidas de preferência humana, particularmente para tarefas abertas
AI IQ composto (VexoWire): ~112
O QI composto da VexoWire combina múltiplos testes (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). O QI composto estimado do Llama 4 é ~112 — consistente com sua pontuação Mensa Norway. Isso o coloca na faixa "acima da média", mais inteligente que cerca de 79% dos humanos.
GDPval-AA v2: top 15
No benchmark agentivo, Llama 4 está no top 15. Sua grande contagem de parâmetros (405B) lhe dá conhecimento substancial e capacidade de raciocínio, mas fica atrás dos modelos de fronteira em tarefas complexas de múltiplas etapas. Para cargas de trabalho agentivas moderadas, Llama 4 é competente.
Humanity's Last Exam (HLE): top 15
Nas questões acadêmicas mais difíceis, Llama 4 está no top 15 entre modelos de IA. Os extensos dados de treinamento da Meta e a grande capacidade do modelo ajudam-no a performar bem através das disciplinas, embora não corresponda aos modelos de fronteira nas questões mais especializadas.
3. O que significa um QI de 112?
Para colocar o QI de 112 do Llama 4 em contexto:
- 85-115 (68% das pessoas): Inteligência média
- 115-130 (14%): Acima da média a alta
- 130-145 (2%): Superdotado — qualifica para Mensa (top 2%)
- 145-160 (0.1%): Altamente superdotado / gênio
Llama 4, com 112, situa-se na parte superior da faixa "média" — mais inteligente que cerca de 79% dos humanos. Se fosse pessoa, seria comparável a um estudante universitário capaz ou um profissional qualificado. Não um gênio, mas certamente brilhante e competente.
Isso é comparável ao DeepSeek V4 Pro (111) mas abaixo dos outros modelos:
- Qwen 3.5: 115 (acima da média)
- Kimi K3: 118 (acima da média)
- Claude Opus 4.8: ~130 (superdotado)
- Gemini 3.1 Pro: 141 (altamente superdotado)
- GPT-5.5: ~145 (gênio)
- Grok-4.20: 145 (gênio)
A lacuna para os modelos de fronteira é de cerca de 18-33 pontos de QI. Mas Llama 4 compensa com sua natureza open-source — para aplicações que exigem controle total, privacidade ou personalização, a abertura do Llama 4 pode compensar a lacuna de QI.
4. Onde Llama 4 se destaca
Liberdade open-source
Os pesos do Llama 4 estão disponíveis gratuitamente para download e implantação local. Esta é sua característica definidora. Nenhum outro modelo de primeiro nível oferece este nível de abertura. Para organizações que precisam de controle total sobre sua infraestrutura de IA, Llama 4 é a única opção entre os modelos de topo.
Personalização e fine-tuning
Como os pesos estão disponíveis, desenvolvedores podem fazer fine-tune do Llama 4 para domínios, idiomas ou tarefas específicas. Isso levou a milhares de fine-tunes da comunidade — modelos médicos, modelos jurídicos, modelos de programação, modelos de escrita criativa e mais. Nenhum modelo fechado oferece este nível de personalização.
Privacidade e segurança de dados
Com Llama 4, organizações podem executar o modelo inteiramente em seu próprio hardware, garantindo que dados nunca saiam da sua infraestrutura. Para saúde, finanças, defesa e outras indústrias sensíveis, isto é crítico. Nenhum dado vai para APIs de terceiros.
Custo em escala
Llama 4 auto-hospedado é gratuito (além dos custos de hardware). Em escala, isso pode ser dramaticamente mais barato que pagar taxas API por token. Para organizações com altos volumes de inferência, o investimento em hardware se paga rapidamente.
Ecossistema comunitário
O ecossistema Llama é inigualável. Milhares de desenvolvedores contribuem com ferramentas, fine-tunes, quantizações e otimizações. Esta abordagem impulsionada pela comunidade significa que Llama 4 se beneficia de inovação coletiva — melhorias vêm de todos os lugares, não apenas da Meta.
Transparência
Ao contrário de modelos fechados, a arquitetura e os pesos do Llama 4 são transparentes. Pesquisadores podem estudar como o modelo funciona, identificar vieses, entender falhas e propor melhorias. Esta transparência é essencial para o progresso científico e o desenvolvimento responsável de IA.
Otimização de hardware
A comunidade desenvolveu inúmeras versões quantizadas do Llama 4 que podem funcionar em hardware de consumo — de 8-bit a 4-bit a 2-bit. Isso significa que você pode executar um modelo de IA capaz numa GPU de ponta, não apenas num data center.
5. Onde Llama 4 fica aquém
QI bruto e raciocínio complexo
Com um QI de 112, Llama 4 está abaixo dos modelos de fronteira em tarefas de raciocínio complexo. Para os problemas mais difíceis — matemática competitiva, puzzles de lógica avançados, raciocínio científico de ponta — Claude, GPT-5.5 e Gemini são substancialmente melhores. A lacuna de 18-33 pontos de QI é significativa.
Taxa de alucinação
Llama 4 tem uma taxa de alucinação moderada — melhor que modelos menores mas pior que Claude (35.9%) e GPT-5.5. Para aplicações onde precisão factual é crítica — pesquisa, direito, medicina — Claude permanece mais confiável.
Janela de contexto
Com uma janela de contexto de 128K tokens, Llama 4 é adequado mas não excepcional. Kimi K3 (2M), Gemini (1M) e Qwen 3.5 (256K) oferecem janelas de contexto maiores. Para tarefas que exigem processar documentos muito longos, outros modelos são melhores escolhas.
Capacidades multimodais
Embora Llama 4 Vision exista, suas capacidades multimodais são menos polidas que Qwen 3.5 (texto, imagem, áudio, vídeo) ou Gemini (texto, imagem, áudio, vídeo). Para aplicações que exigem compreensão multimodal robusta, Qwen 3.5 ou Gemini são melhores escolhas.
Inteligência emocional
O QE (inteligência emocional) do Llama 4 é estimado em ~105 — inferior a Claude (~132), GPT-5.5 (~120), Gemini (~115) e Qwen 3.5 (~107), mas comparável a DeepSeek (~105). Suas respostas tendem a ser mais funcionais e menos emocionalmente matizadas. Para apps de terapia, atendimento ao cliente ou interações humanas sensíveis, Claude é a melhor escolha.
Requisitos de hardware
O modelo completo de 405B parâmetros requer hardware significativo para executar — múltiplas GPUs de ponta para inferência. Embora versões quantizadas ajudem, executar Llama 4 em qualidade total é caro em termos de hardware. Para organizações sem recursos computacionais suficientes, modelos baseados em API podem ser mais práticos.
Segurança e alinhamento
Embora Llama 4 Guard exista para filtragem de segurança, a natureza open-source significa que atores mal-intencionados podem remover medidas de segurança. A Meta fornece diretrizes mas não pode impô-las. Para aplicações que exigem segurança garantida, modelos fechados com guardrails impostos podem ser mais apropriados.
6. Llama 4 vs outros modelos
| Modelo | Intelligence Index | QI Mensa Norway | AI IQ est. | Open-source | Custo/1M | Contexto | Parâmetros |
|---|---|---|---|---|---|---|---|
| Llama 4 | ~43-44 (top 15) | 112 | ~112 | sim (gratuito) | gratuito (auto-hospedado) | 128K | 405B |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | não | 5/25 | 200K | desconhecido |
| GPT-5.5 | 54.8 | ~145 | ~136 | não | 5/30 | 400K | desconhecido |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | não | 2/12 | 1M | desconhecido |
| Grok-4.20 | top 5 | 145 | ~140 | não | 3/15 | 256K | desconhecido |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | sim | 0.44/0.87 | 128K | desconhecido |
| Qwen 3.5 | ~45-46 (top 10) | 115 | ~115 | sim | 0.50/1.50 | 256K | desconhecido |
| Kimi K3 | ~45-47 (top 10) | 118 | ~118 | não | 0.55/2.19 | 2M | desconhecido |
A imagem: Llama 4 é o campeão open-source — não o mais inteligente, mas o mais acessível. Claude é o profissional capaz — o melhor em tarefas reais. GPT-5.5 é o gênio dos testes — o melhor em matemática e raciocínio visual. Gemini é o campeão de valor — melhor custo-benefício entre modelos de fronteira. Grok-4.20 é o campeão de QI bruto — QI mais alto com personalidade. DeepSeek é o campeão econômico — a API mais barata. Qwen 3.5 é o faz-tudo — o mais versátil. E Kimi é o campeão de contexto longo — a maior janela de contexto.
Para organizações que precisam de open-source, privacidade, personalização ou custo em escala, Llama 4 é a escolha clara. É o modelo do povo — não o mais inteligente, mas o mais livre.
7. O que isso significa para os humanos?
Llama 4 opera com QI de ~112 — mais inteligente que cerca de 79% dos humanos. Mas:
- QI não é tudo: um QI de 112 está acima da média e é suficiente para a maioria das tarefas práticas
- Abertura importa mais que QI bruto para muitas aplicações: para aplicações sensíveis a privacidade ou que exigem personalização, a abertura do Llama 4 é mais valiosa que um QI mais alto
- Liberdade permite inovação: os pesos abertos do Llama 4 geraram um ecossistema inteiro de inovação que modelos fechados não podem igualar
- Transparência constrói confiança: poder inspecionar os internos do modelo constrói confiança que caixas pretas não podem
- Conhecimento ≠ compreensão: como todos os modelos de IA, Llama 4 tem acesso a vasto conhecimento mas não "compreende" verdadeiramente como um humano
- Sem consciência: QI alto não significa consciência. Llama 4 é um sistema sofisticado de reconhecimento de padrões, não um ser pensante
- Comunidade impulsiona progresso: o ecossistema Llama prova que colaboração aberta pode produzir modelos competitivos com sistemas fechados de bilhões de dólares
A resposta mais honesta: Llama 4 é mais inteligente que 79% dos humanos em testes cognitivos, e para aplicações que exigem abertura, privacidade ou personalização, é a escolha mais inteligente — não porque é o mais inteligente, mas porque é o mais livre.
Conclusão
- Top 15 no Intelligence Index — competitivo com DeepSeek, atrás de Qwen 3.5, Kimi e modelos de fronteira.
- Totalmente open-source — pesos disponíveis gratuitamente para download, estudo e implantação local.
- 405B parâmetros — um dos maiores modelos open-source disponíveis.
- Melhor para: aplicações sensíveis a privacidade, necessidades de personalização, custo em escala, pesquisa, implantações auto-hospedadas, inovação impulsionada pela comunidade.
- Não melhor para: QI bruto (modelos de fronteira ganham), contexto longo (Kimi ganha), multimodal (Qwen 3.5 ou Gemini ganham), inteligência emocional (Claude ganha), segurança garantida (modelos fechados com guardrails impostos).
- A lição: inteligência não é apenas ser o mais inteligente — é ser o mais acessível. Llama 4 prova que IA open-source pode competir com sistemas fechados de bilhões de dólares, democratizando o acesso a IA avançada para todos.