¿Cuál es el IQ de Llama 4?
Llama 4 obtiene 112 en el test de IQ Mensa Norway y se sitúa en el top 15 del Intelligence Index. Analizamos cada benchmark y explicamos qué hace único al modelo open-source de Meta.
Llama 4: el campeón open-source de Meta
Llama 4 es el modelo open-source insignia de Meta AI, la división de investigación de una de las empresas tecnológicas más grandes del mundo. Lanzado a principios de 2026, Llama 4 obtiene 112 en el test de IQ Mensa Norway y se sitúa en el top 15 del Artificial Analysis Intelligence Index v4.1. Esto lo coloca por encima de DeepSeek V4 Pro (111) pero por debajo de Kimi K3 (118), Qwen 3.5 (115) y los modelos de frontera (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Lo que hace único a Llama 4 es su naturaleza open-source a escala. A diferencia de modelos cerrados de OpenAI, Anthropic o Google, los pesos de Llama 4 están disponibles gratuitamente para descarga y despliegue local. Esto lo ha convertido en la base de miles de modelos derivados, fine-tunes y aplicaciones — haciendo de Llama 4 no solo un modelo, sino un ecosistema entero.
Llama 4 es el modelo del pueblo: un modelo que puede no ser el más inteligente, pero que cualquiera puede descargar, modificar y ejecutar en su propio hardware. Para investigadores, startups y organizaciones que necesitan control total sobre su infraestructura de IA, Llama 4 ofrece algo que ningún modelo cerrado puede: libertad.
Puntuaciones clave:
- Artificial Analysis Intelligence Index: top 15 (puntuación ~43-44)
- Mensa Norway IQ (TrackingAI): 112 (superior a la media)
- AI IQ compuesto (VexoWire): ~112 estimado
- GDPval-AA v2: top 15
- Humanity's Last Exam: top 15
- Tasa de alucinación: moderada
- Coste: gratis (auto-alojado) o 0,20/0,60 por 1M tokens (vía proveedores)
- Parámetros: 405B (variante más grande)
- Open-source: sí, pesos disponibles gratuitamente
- Contexto: 128K tokens
1. La revolución open-source
Llama 4 representa el compromiso de Meta con la IA open-source — la creencia de que la IA debería ser accesible para todos, no controlada por unas pocas empresas. Mientras OpenAI, Anthropic y Google mantienen sus modelos detrás de APIs, Meta libera los pesos completos del modelo, permitiendo a cualquiera descargar, estudiar, modificar y desplegar Llama 4 en su propio hardware.
Esto tiene implicaciones profundas:
- Democratización: cualquiera con hardware suficiente puede ejecutar un modelo de IA state-of-the-art
- Personalización: los desarrolladores pueden hacer fine-tune de Llama 4 para dominios, idiomas o tareas específicas
- Privacidad: las organizaciones pueden ejecutar Llama 4 localmente, asegurando que los datos nunca salgan de su infraestructura
- Innovación: los investigadores pueden estudiar los internos del modelo, llevando a nuevos avances
- Ecosistema: miles de modelos derivados se construyen sobre Llama 4, creando un ecosistema rico
- Coste: Llama 4 auto-alojado es gratis (más allá del coste del hardware), siendo la opción más barata a escala
El ecosistema Llama incluye:
- Llama 4 Base: el modelo pre-entrenado original
- Llama 4 Instruct: fine-tuned para seguimiento de instrucciones
- Llama 4 Guard: variante con filtro de seguridad
- Fine-tunes de la comunidad: miles de variantes específicas de dominio
- Versiones cuantizadas: modelos comprimidos que funcionan en hardware de consumo
- Llama 4 Vision: variante multimodal con comprensión de imágenes
Ningún otro modelo de IA ha generado un ecosistema tan rico. Aunque GPT-5.5 y Claude pueden ser más inteligentes, son cajas negras. Llama 4 es transparente, modificable y impulsado por la comunidad.
2. Análisis de benchmarks
Test de IQ Mensa Norway: 112 (superior a la media)
Consiste en 36 preguntas de reconocimiento de patrones visuales. Llama 4 obtiene 112 — por encima de la media humana de 100, en el rango "superior a la media". Esto es comparable a DeepSeek V4 Pro (111), por debajo de Qwen 3.5 (115), Kimi K3 (118) y los modelos de frontera (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Un IQ de 112 significa que Llama 4 es más inteligente que aproximadamente el 79% de los humanos — el 21% superior de la inteligencia humana. Si fuera persona, sería comparable a un estudiante universitario capaz o un profesional cualificado. No un genio, pero ciertamente brillante y competente.
Artificial Analysis Intelligence Index: top 15
En el Intelligence Index, Llama 4 se sitúa en el top 15 mundial con una puntuación estimada de ~43-44. Esto lo coloca competitivo con DeepSeek V4 Pro (44,3) pero por detrás de Qwen 3.5 (~45-46), Kimi K3 (~45-47), Gemini (46,5) y los modelos de frontera.
Desglose de los componentes del Index:
- GDPval-AA v2: Llama 4 rinde adecuadamente, beneficiándose de su gran recuento de parámetros para diversas tareas agentivas
- AA-Omniscience: Llama 4 tiene una tasa de alucinación moderada — mejor que modelos más pequeños pero peor que Claude
- GPQA: Llama 4 rinde razonablemente en preguntas de ciencia de nivel posgrado
- HLE: Llama 4 se sitúa en el top 15 en Humanity's Last Exam
- ARC-AGI: Llama 4 rinde adecuadamente en razonamiento abstracto
- LMSYS Arena: Llama 4 obtiene puntuaciones sólidas de preferencia humana, particularmente en tareas abiertas
AI IQ compuesto (VexoWire): ~112
El IQ compuesto de VexoWire combina múltiples tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). El IQ compuesto estimado de Llama 4 es ~112 — consistente con su puntuación de Mensa Norway. Esto lo sitúa en el rango "superior a la media", más inteligente que aproximadamente el 79% de los humanos.
GDPval-AA v2: top 15
En el benchmark agentivo, Llama 4 se sitúa en el top 15. Su gran recuento de parámetros (405B) le da conocimiento y capacidad de razonamiento sustanciales, pero queda por detrás de los modelos de frontera en tareas complejas de múltiples pasos. Para cargas de trabajo agentivas moderadas, Llama 4 es competente.
Humanity's Last Exam (HLE): top 15
En las preguntas académicas más difíciles, Llama 4 se sitúa en el top 15 entre modelos de IA. Los extensos datos de entrenamiento de Meta y la gran capacidad del modelo le ayudan a rendir bien en todas las disciplinas, aunque no iguala a los modelos de frontera en las preguntas más especializadas.
3. ¿Qué significa un IQ de 112?
Para poner el IQ de 112 de Llama 4 en contexto:
- 85-115 (68% de las personas): Inteligencia media
- 115-130 (14%): Superior a la media a alta
- 130-145 (2%): Superdotado — clasifica para Mensa (top 2%)
- 145-160 (0,1%): Altamente superdotado / genio
Llama 4, con 112, se sitúa en la parte superior del rango "media" — más inteligente que aproximadamente el 79% de los humanos. Si fuera persona, sería comparable a un estudiante universitario capaz o un profesional cualificado. No un genio, pero ciertamente brillante y competente.
Esto es comparable a DeepSeek V4 Pro (111) pero por debajo de otros modelos:
- Qwen 3.5: 115 (superior a la media)
- Kimi K3: 118 (superior a la media)
- Claude Opus 4.8: ~130 (superdotado)
- Gemini 3.1 Pro: 141 (altamente superdotado)
- GPT-5.5: ~145 (genio)
- Grok-4.20: 145 (genio)
La brecha con los modelos de frontera es de unos 18-33 puntos de IQ. Pero Llama 4 compensa con su naturaleza open-source — para aplicaciones que requieren control total, privacidad o personalización, la apertura de Llama 4 puede compensar la brecha de IQ.
4. Donde Llama 4 destaca
Libertad open-source
Los pesos de Llama 4 están disponibles gratuitamente para descarga y despliegue local. Esta es su característica definitoria. Ningún otro modelo de primer nivel ofrece este nivel de apertura. Para organizaciones que necesitan control total sobre su infraestructura de IA, Llama 4 es la única opción entre los modelos top.
Personalización y fine-tuning
Como los pesos están disponibles, los desarrolladores pueden hacer fine-tune de Llama 4 para dominios, idiomas o tareas específicas. Esto ha llevado a miles de fine-tunes de la comunidad — modelos médicos, modelos legales, modelos de programación, modelos de escritura creativa y más. Ningún modelo cerrado ofrece este nivel de personalización.
Privacidad y seguridad de datos
Con Llama 4, las organizaciones pueden ejecutar el modelo completamente en su propio hardware, asegurando que los datos nunca salgan de su infraestructura. Para sanidad, finanzas, defensa y otras industrias sensibles, esto es crítico. Ningún dato va a APIs de terceros.
Coste a escala
Llama 4 auto-alojado es gratis (más allá del coste del hardware). A escala, esto puede ser dramáticamente más barato que pagar tarifas API por token. Para organizaciones con altos volúmenes de inferencia, la inversión en hardware se amortiza rápidamente.
Ecosistema comunitario
El ecosistema Llama es inigualable. Miles de desarrolladores contribuyen herramientas, fine-tunes, cuantizaciones y optimizaciones. Este enfoque impulsado por la comunidad significa que Llama 4 se beneficia de innovación colectiva — las mejoras vienen de todas partes, no solo de Meta.
Transparencia
A diferencia de los modelos cerrados, la arquitectura y los pesos de Llama 4 son transparentes. Los investigadores pueden estudiar cómo funciona el modelo, identificar sesgos, entender fallos y proponer mejoras. Esta transparencia es esencial para el progreso científico y el desarrollo responsable de IA.
Optimización de hardware
La comunidad ha desarrollado numerosas versiones cuantizadas de Llama 4 que pueden funcionar en hardware de consumo — desde 8-bit hasta 4-bit hasta 2-bit. Esto significa que puedes ejecutar un modelo de IA capaz en una GPU de gama alta, no solo en un centro de datos.
5. Donde Llama 4 se queda corto
IQ bruto y razonamiento complejo
Con un IQ de 112, Llama 4 está por debajo de los modelos de frontera en tareas de razonamiento complejo. Para los problemas más difíciles — matemáticas competitivas, puzzles de lógica avanzados, razonamiento científico puntero — Claude, GPT-5.5 y Gemini son sustancialmente mejores. La brecha de 18-33 puntos de IQ es significativa.
Tasa de alucinación
Llama 4 tiene una tasa de alucinación moderada — mejor que modelos más pequeños pero peor que Claude (35,9%) y GPT-5.5. Para aplicaciones donde la precisión factual es crítica — investigación, derecho, medicina — Claude sigue siendo más fiable.
Ventana de contexto
Con una ventana de contexto de 128K tokens, Llama 4 es adecuado pero no excepcional. Kimi K3 (2M), Gemini (1M) y Qwen 3.5 (256K) ofrecen ventanas de contexto más grandes. Para tareas que requieren procesar documentos muy largos, otros modelos son mejores elecciones.
Capacidades multimodales
Aunque Llama 4 Vision existe, sus capacidades multimodales son menos pulidas que Qwen 3.5 (texto, imagen, audio, vídeo) o Gemini (texto, imagen, audio, vídeo). Para aplicaciones que requieren comprensión multimodal robusta, Qwen 3.5 o Gemini son mejores elecciones.
Inteligencia emocional
El EQ (inteligencia emocional) de Llama 4 se estima en ~105 — inferior a Claude (~132), GPT-5.5 (~120), Gemini (~115) y Qwen 3.5 (~107), pero comparable a DeepSeek (~105). Sus respuestas tienden a ser más funcionales y menos emocionalmente matizadas. Para apps de terapia, atención al cliente o interacciones humanas sensibles, Claude es la mejor elección.
Requisitos de hardware
El modelo completo de 405B parámetros requiere hardware significativo para ejecutarse — múltiples GPUs de gama alta para inferencia. Aunque las versiones cuantizadas ayudan, ejecutar Llama 4 a calidad completa es caro en términos de hardware. Para organizaciones sin recursos computacionales suficientes, los modelos basados en API pueden ser más prácticos.
Seguridad y alineación
Aunque Llama 4 Guard existe para filtrado de seguridad, la naturaleza open-source significa que actores malintencionados pueden eliminar las medidas de seguridad. Meta proporciona directrices pero no puede imponerlas. Para aplicaciones que requieren seguridad garantizada, los modelos cerrados con barreras impuestas pueden ser más apropiados.
6. Llama 4 vs otros modelos
| Modelo | Intelligence Index | Mensa Norway IQ | AI IQ est. | Open-source | Coste/1M | Contexto | Parámetros |
|---|---|---|---|---|---|---|---|
| Llama 4 | ~43-44 (top 15) | 112 | ~112 | sí (gratis) | gratis (auto-alojado) | 128K | 405B |
| Claude Opus 4.8 | 55,7 | ~130 | ~132 | no | 5/25 | 200K | desconocido |
| GPT-5.5 | 54,8 | ~145 | ~136 | no | 5/30 | 400K | desconocido |
| Gemini 3.1 Pro | 46,5 | 141 | ~131 | no | 2/12 | 1M | desconocido |
| Grok-4.20 | top 5 | 145 | ~140 | no | 3/15 | 256K | desconocido |
| DeepSeek V4 Pro | 44,3 | ~111 | ~111 | sí | 0,44/0,87 | 128K | desconocido |
| Qwen 3.5 | ~45-46 (top 10) | 115 | ~115 | sí | 0,50/1,50 | 256K | desconocido |
| Kimi K3 | ~45-47 (top 10) | 118 | ~118 | no | 0,55/2,19 | 2M | desconocido |
La imagen: Llama 4 es el campeón open-source — no el más inteligente, pero el más accesible. Claude es el profesional capaz — el mejor en tareas reales. GPT-5.5 es el genio del test — el mejor en matemáticas y razonamiento visual. Gemini es el campeón de valor — mejor rentabilidad entre modelos de frontera. Grok-4.20 es el campeón de IQ bruto — el IQ más alto con personalidad. DeepSeek es el campeón económico — la API más barata. Qwen 3.5 es el todoterreno — el más versátil. Y Kimi es el campeón de contexto largo — la mayor ventana de contexto.
Para organizaciones que necesitan open-source, privacidad, personalización o coste a escala, Llama 4 es la opción clara. Es el modelo del pueblo — no el más inteligente, pero el más libre.
7. ¿Qué significa esto para los humanos?
Llama 4 opera con un IQ de ~112 — más inteligente que aproximadamente el 79% de los humanos. Pero:
- El IQ no lo es todo: un IQ de 112 está por encima de la media y es suficiente para la mayoría de tareas prácticas
- La apertura importa más que el IQ bruto para muchas aplicaciones: para aplicaciones sensibles a la privacidad o que requieren personalización, la apertura de Llama 4 es más valiosa que un IQ más alto
- La libertad permite la innovación: los pesos abiertos de Llama 4 han generado un ecosistema entero de innovación que los modelos cerrados no pueden igualar
- La transparencia construye confianza: poder inspeccionar los internos del modelo construye confianza que las cajas negras no pueden
- Conocimiento ≠ comprensión: como todos los modelos de IA, Llama 4 tiene acceso a vasto conocimiento pero no "comprende" verdaderamente como un humano
- Sin conciencia: un IQ alto no significa consciencia. Llama 4 es un sistema sofisticado de reconocimiento de patrones, no un ser pensante
- La comunidad impulsa el progreso: el ecosistema Llama demuestra que la colaboración abierta puede producir modelos competitivos con sistemas cerrados de mil millones de dólares
La respuesta más honesta: Llama 4 es más inteligente que el 79% de los humanos en tests cognitivos, y para aplicaciones que requieren apertura, privacidad o personalización, es la opción más inteligente — no porque sea la más inteligente, sino porque es la más libre.
Conclusión
- Top 15 en el Intelligence Index — competitivo con DeepSeek, por detrás de Qwen 3.5, Kimi y modelos de frontera.
- Totalmente open-source — pesos disponibles gratuitamente para descarga, estudio y despliegue local.
- 405B parámetros — uno de los modelos open-source más grandes disponibles.
- Mejor para: aplicaciones sensibles a la privacidad, necesidades de personalización, coste a escala, investigación, despliegues auto-alojados, innovación impulsada por la comunidad.
- No mejor para: IQ bruto (modelos de frontera ganan), contexto largo (Kimi gana), multimodal (Qwen 3.5 o Gemini ganan), inteligencia emocional (Claude gana), seguridad garantizada (modelos cerrados con barreras impuestas).
- La lección: la inteligencia no es solo ser el más inteligente — es ser el más accesible. Llama 4 demuestra que la IA open-source puede competir con sistemas cerrados de mil millones de dólares, democratizando el acceso a IA avanzada para todos.