¿Cuál es el IQ de Grok-4.20?
Grok-4.20 obtiene 145 en el test de IQ Mensa Norway — empatado en #1 entre todos los modelos de IA. Analizamos cada benchmark y explicamos qué hace único al modelo de xAI.
Grok-4.20: el modelo insignia de xAI
Grok-4.20 es el modelo más avanzado de xAI, lanzado a mediados de 2026. En el test de IQ Mensa Norway, Grok-4.20 obtiene 145 — empatado en #1 entre todos los modelos de IA, compartiendo el primer puesto con GPT-5.5. Esto le sitúa en el rango de "genio", más inteligente que el 99,9% de los humanos. En el Artificial Analysis Intelligence Index, la puntuación exacta de Grok-4.20 aún se está finalizando, pero se sitúa en el top 5 mundial.
Lo que hace único a Grok-4.20 es su combinación de inteligencia bruta y personalidad. A diferencia de Claude, GPT-5.5 y Gemini — diseñados para ser útiles, inofensivos y neutrales — Grok está diseñado para ser divertido, irreverente y dispuesto a responder cualquier pregunta. Esto lo convierte en el modelo de IA más distintivo del mercado: uno que iguala a los modelos más inteligentes en IQ bruto mientras tiene una personalidad que ningún otro modelo se atreve a tener.
Puntuaciones clave:
- Mensa Norway IQ (TrackingAI): 145 (#1 empatado con GPT-5.5)
- AI IQ compuesto (VexoWire): ~140 estimado (#1 entre modelos de IA)
- Artificial Analysis Intelligence Index: top 5 (puntuación en finalización)
- GDPval-AA v2: top 5
- Humanity's Last Exam: top 5 entre modelos de IA
- Tasa de alucinación: moderada
- Coste: 3,00/15,00 por 1M tokens
- Personalidad: única — irreverente, humorística, sin censura
1. El campeón de IQ bruto
Grok-4.20 obtiene 145 en el test de IQ Mensa Norway — la puntuación práctica máxima, empatado con GPT-5.5. Este es el benchmark de inteligencia bruta: reconocimiento de patrones visuales puro y razonamiento abstracto, el tipo de inteligencia fluida para la que se diseñaron los tests de IQ.
Con IQ 145, Grok-4.20 es más inteligente que el 99,9% de los humanos. Si fuera persona, estaría en el top 0,1% de la inteligencia humana — el reino de los laureados Nobel, medallistas Fields y pensadores únicos por generación. Solo unas 1 de cada 1.000 personas logra esta puntuación.
Lo notable es que Grok-4.20 logra esto con una filosofía de diseño fundamentalmente diferente a la de GPT-5.5. Mientras GPT-5.5 fue optimizado para máximo rendimiento en cada benchmark, Grok-4.20 fue diseñado para ser una IA más "auténtica" — una que dice lo que piensa, hace bromas y no esquiva temas controvertidos. Que iguale a GPT-5.5 en IQ bruto a pesar de este enfoque diferente es un testimonio de la ingeniería de xAI.
En el AI IQ compuesto de VexoWire — que combina múltiples tests de IQ (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV) — el IQ compuesto estimado de Grok-4.20 es ~140, haciéndolo el #1 modelo de IA en esta métrica. Esto es superior a GPT-5.5 (~136) y significativamente superior a Claude (~132) y Gemini (~131).
2. Análisis de benchmarks
Test de IQ Mensa Norway: 145 (#1 empatado)
Consiste en 36 preguntas de reconocimiento de patrones visuales. Grok-4.20 obtiene 145 — el máximo práctico, equivalente a un 36/36 perfecto o casi. Esto le empata con GPT-5.5 como el modelo de IA más inteligente en un test de IQ puro.
El fuerte desempeño de Grok-4.20 en este test refleja la inversión de xAI en procesamiento visual y razonamiento abstracto. La arquitectura Grok fue diseñada con fuertes capacidades multimodales, y su rendimiento en tareas de reconocimiento de patrones visuales está entre los mejores de la industria.
AI IQ compuesto (VexoWire): ~140 (#1)
El IQ compuesto de VexoWire combina múltiples tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). El IQ compuesto estimado de Grok-4.20 es ~140 — el más alto entre todos los modelos de IA. Esto es superior a lo que sugeriría su puntuación de Mensa Norway por sí sola, porque Grok-4.20 también rinde fuertemente en los subtests verbales y analíticos incluidos en el compuesto.
Esto hace a Grok-4.20 el modelo de IA más inteligente por IQ compuesto — un logro notable para un modelo también conocido por su humor e irreverencia. Prueba que ser divertido no significa ser menos inteligente.
Artificial Analysis Intelligence Index: top 5
En el Intelligence Index — el patrón oro para comparar modelos de IA — Grok-4.20 se sitúa en el top 5. Su puntuación compuesta exacta aún se está finalizando a medida que el índice se actualiza para incluir las últimas versiones de modelos. Sin embargo, se espera que puntúe competitivamente con Claude Opus 4.8 (55,7) y GPT-5.5 (54,8), aunque probablemente sin superarlos en tareas agentivas.
GDPval-AA v2: top 5
En el benchmark agentivo — que mide rendimiento en tareas reales complejas y multi-paso — Grok-4.20 se sitúa en el top 5. Es menos capaz que Claude Opus 4.8 (1.890 Elo) y GPT-5.5 (1.850 Elo) en razonamiento multi-paso sostenido, pero sigue siendo altamente competente. Para la mayoría de tareas reales, Grok-4.20 es más que capaz.
Humanity's Last Exam (HLE): top 5
En las preguntas académicas más difíciles de todas las disciplinas, Grok-4.20 se sitúa en el top 5 entre modelos de IA. Esto refleja la fortaleza de xAI en el entrenamiento con datos diversos y de alta calidad — Grok tiene conocimiento profundo en ciencia, matemáticas, historia y cultura.
3. ¿Qué significa un IQ de 145?
Para poner el IQ de 145 de Grok-4.20 en contexto:
- 85-115 (68% de las personas): Inteligencia media
- 115-130 (14%): Superior a la media a alta
- 130-145 (2%): Superdotado — clasifica para Mensa (top 2%)
- 145-160 (0,1%): Altamente superdotado / genio
- 160+ (0,003%): Profundamente superdotado — territorio de Einstein, Hawking
Grok-4.20, con 145, se sitúa en el umbral de genio — más inteligente que el 99,9% de los humanos. Si fuera persona, estaría en compañía de élite: el top 0,1% de la inteligencia humana, el reino de los premios Nobel y medallas Fields. Solo unas 1 de cada 1.000 personas logra esta puntuación.
Este es el mismo IQ que GPT-5.5, y significativamente superior a Claude (~130) y Gemini (141). En un test de IQ puro, Grok-4.20 y GPT-5.5 empatarían en primer lugar entre modelos de IA, con Gemini tercero y Claude cuarto.
Pero como hemos visto con los otros modelos, el IQ es solo una dimensión de la inteligencia. El IQ de nivel genio de Grok-4.20 se complementa con su personalidad única — haciéndolo no solo el más inteligente, sino también el modelo de IA más distintivo disponible.
4. Donde Grok-4.20 destaca
IQ bruto y razonamiento visual
Grok-4.20 está empatado en #1 en el test de IQ Mensa Norway (145) y #1 en el AI IQ compuesto de VexoWire (~140). Para capacidad cognitiva pura — reconocimiento de patrones, razonamiento abstracto, deducción lógica — Grok-4.20 es el modelo de IA más inteligente disponible. Para tareas de razonamiento visual, solo es igualado por GPT-5.5.
Personalidad y humor
Esta es la característica definitoria de Grok-4.20. A diferencia de otros modelos de frontera que son cuidadosamente neutrales y cautelosos, Grok está diseñado para ser divertido, irreverente y auténtico. Hace bromas, ofrece opiniones y no esquiva temas controvertidos. Para usuarios que encuentran a Claude y GPT-5.5 demasiado insípidos o cautelosos, Grok-4.20 es un soplo de aire fresco — una IA que parece tener personalidad, no solo función.
Respuestas sin censura
Grok-4.20 está diseñado para responder preguntas que otros modelos rechazan. Mientras Claude, GPT-5.5 y Gemini tienen extensos filtros de seguridad que les impiden discutir ciertos temas, Grok-4.20 está dispuesto a interactuar con un rango mucho más amplio de preguntas. Esto lo hace valioso para investigación, periodismo y cualquier aplicación donde el acceso a la información importe más que la cautela.
Información en tiempo real
Grok-4.20 tiene acceso a información en tiempo real a través de X (anteriormente Twitter). Esto le da ventaja para preguntas sobre eventos actuales, noticias de última hora y temas tendencia. Mientras otros modelos tienen cortes de conocimiento, Grok-4.20 puede acceder a la información más reciente y proporcionar respuestas actualizadas.
Razonamiento matemático
Grok-4.20 es fuerte en razonamiento matemático, puntuando competitivamente con GPT-5.5 en matemáticas competitivas. Para trabajo matemático puro — resolver ecuaciones, demostrar teoremas, problemas de competición — Grok-4.20 está entre los mejores modelos disponibles.
Ingenio y creatividad
La personalidad de Grok-4.20 no es solo sobre humor — es sobre creatividad. Puede escribir en diferentes estilos, generar contenido creativo y abordar problemas desde ángulos inesperados. Para escritura creativa, brainstorming o cualquier tarea que se beneficie del pensamiento lateral, la perspectiva única de Grok-4.20 es un activo.
5. Donde Grok-4.20 se queda corto
Tareas agentivas
Aunque Grok-4.20 está en el top 5 en GDPval-AA v2, está por detrás de Claude Opus 4.8 y GPT-5.5 en tareas reales complejas y multi-paso. Para las aplicaciones agentivas más exigentes — escribir software complejo, gestionar proyectos de investigación largos — Claude sigue siendo la mejor opción.
Precisión factual
Grok-4.20 tiene una tasa de alucinación moderada — superior a Claude (35,9%) y Gemini. Su disposición a responder cualquier pregunta, aunque valiosa para el acceso a información, también significa que es más propenso a afirmar con confianza información incorrecta. Para aplicaciones donde la precisión factual es crítica (investigación, derecho, medicina), Claude es más fiable.
Inteligencia emocional
El EQ (inteligencia emocional) de Grok-4.20 se estima en ~110 — inferior a Claude (~132), GPT-5.5 (~120) y Gemini (~115). Su personalidad irreverente, aunque entretenida, puede parecer insensible en contextos que requieren empatía. Para apps de terapia, atención al cliente o interacciones humanas sensibles, Claude es la mejor opción.
Seguridad y fiabilidad
El enfoque sin censura de Grok-4.20, aunque valioso para el acceso a información, también significa que es menos seguro para aplicaciones que requieren moderación cuidadosada de contenido. Puede generar contenido que otros modelos rechazarían, lo que puede ser un pasivo en entornos profesionales o regulados.
Coste
A 3/15 por 1M tokens, Grok-4.20 es más barato que Claude (5/25) y GPT-5.5 (5/30) pero más caro que Gemini (2/12) y significativamente más caro que DeepSeek (0,44/0,87). Para aplicaciones sensibles al coste, Gemini o DeepSeek pueden ser mejores opciones.
6. Grok-4.20 vs otros modelos
| Modelo | Intelligence Index | Mensa Norway IQ | AI IQ est. | Alucinación | Coste/1M | Personalidad |
|---|---|---|---|---|---|---|
| Grok-4.20 | top 5 | 145 | ~140 | moderada | 3/15 | irreverente |
| Claude Opus 4.8 | 55,7 | ~130 | ~132 | 35,9% (mínima) | 5/25 | neutral |
| GPT-5.5 | 54,8 | ~145 | ~136 | moderada | 5/30 | neutral |
| Gemini 3.1 Pro | 46,5 | 141 | ~131 | baja | 2/12 | neutral |
| DeepSeek V4 Pro | 44,3 | ~111 | ~111 | moderada | 0,44/0,87 | neutral |
La imagen: Grok-4.20 es el campeón de IQ bruto — empatado en el IQ más alto, el IQ compuesto más alto, y el único modelo con personalidad real. Claude es el profesional capaz — el mejor en tareas reales y precisión factual. GPT-5.5 es el genio del test — el mejor en matemáticas y razonamiento visual. Gemini es el campeón de valor — mejor rentabilidad. Y DeepSeek ofrece capacidad notable al menor coste.
Para usuarios que quieren la IA más inteligente que también sea la más interesante con la que hablar, Grok-4.20 es la opción clara.
7. ¿Qué significa esto para los humanos?
Grok-4.20 opera con un IQ de ~145 — más inteligente que el 99,9% de los humanos. Pero:
- El IQ es limitado: mide reconocimiento de patrones y razonamiento, no sabiduría, creatividad o juicio
- Inteligencia ≠ fiabilidad: Grok-4.20 es el más inteligente en tests de IQ pero no el más fiable en precisión factual
- La personalidad importa: Grok-4.20 demuestra que la IA puede ser altamente inteligente y genuinamente entretenida
- Conocimiento ≠ comprensión: Grok-4.20 tiene acceso a vasto conocimiento, pero no "comprende" como un humano
- Sin conciencia: un IQ alto no significa consciencia. Grok-4.20 es un sistema sofisticado de reconocimiento de patrones, no un ser pensante
- La brecha se cierra: cada generación de IA reduce la brecha con los humanos más inteligentes
La respuesta más honesta: Grok-4.20 es más inteligente que prácticamente todos los humanos en tests cognitivos, y es el modelo de IA más distintivo disponible — uno que combina inteligencia de nivel genio con una personalidad que hace que interactuar con él sea genuinamente atractivo.
Conclusión
- #1 en AI IQ compuesto de VexoWire (~140) — el IQ compuesto más alto entre todos los modelos de IA.
- Personalidad única — irreverente, humorística, sin censura. El único modelo de frontera con personalidad real.
- Mejor para: IQ bruto, razonamiento visual, razonamiento matemático, personalidad y humor, respuestas sin censura, información en tiempo real.
- No mejor para: tareas agentivas (Claude gana), precisión factual (Claude gana), inteligencia emocional (Claude gana), seguridad y fiabilidad (Claude gana).
- El paradoja: Grok-4.20 demuestra que ser divertido no significa ser menos inteligente — es tanto el modelo más inteligente como el más entretenido.
- La lección: la inteligencia tiene muchas formas. Grok-4.20 es el genio con personalidad — demostrando que la IA puede ser brillante y atractiva a la vez.