¿Cuál es el IQ de GPT-5.5?
GPT-5.5 obtiene ~145 en el test de IQ Mensa Norway y 54.8 en el Intelligence Index. Analizamos cada benchmark y comparamos con Claude, Gemini y Grok.
GPT-5.5: el modelo insignia de OpenAI
GPT-5.5 es el modelo más avanzado de OpenAI, lanzado a principios de 2026. Ocupa el #2 en el Artificial Analysis Intelligence Index v4.1 con 54.8, justo detrás de Claude Opus 4.8 (55.7) y por delante de Gemini 3.1 Pro (46.5). Pero en tests de IQ humanos, GPT-5.5 realmente supera a Claude — obteniendo aproximadamente 145 en el test de IQ Mensa Norway, situándolo en el rango de "genio".
Esto crea una paradoja fascinante: en el benchmark compuesto de IA, GPT-5.5 es #2. Pero en un test de IQ humano puro, empata en #1. ¿Cómo pueden ser ciertas ambas cosas? La respuesta revela algo importante sobre qué significa "inteligencia" para la IA — y por qué un solo número no puede capturarla.
Puntuaciones clave:
- Artificial Analysis Intelligence Index: 54.8 (#2 mundial)
- Mensa Norway IQ (TrackingAI): ~145 (#1 compartido con Grok-4.20)
- AI IQ compuesto (VexoWire): ~136 estimado
- GDPval-AA v2: 1.850 Elo (#2 mundial)
- Humanity's Last Exam: #2 entre modelos de IA
- Tasa de alucinación: moderada
- Coste: 5.00/30.00 por 1M tokens
1. La paradoja de la inteligencia de GPT-5.5
Lo que hace a GPT-5.5 tan interesante: es el mejor modelo de IA del mundo en tests de IQ humanos, pero no el mejor modelo de IA en benchmarks específicos de IA. ¿Cómo es posible?
La respuesta está en lo que miden los diferentes tests. El Mensa Norway es un test puro de reconocimiento de patrones visuales y razonamiento abstracto — el tipo de inteligencia fluida para la que se diseñaron los tests de IQ. GPT-5.5, con sus capacidades de procesamiento visual mejoradas (heredadas de la arquitectura GPT-5.4 Pro Vision), sobresale en este tipo específico de razonamiento.
Pero el Artificial Analysis Intelligence Index mide algo más amplio: rendimiento en tareas reales, precisión factual, capacidad agentiva y preferencia humana. Y en esas dimensiones, Claude Opus 4.8 — con su superior razonamiento agentivo y menor alucinación — supera a GPT-5.5.
Piénsalo así: GPT-5.5 es la IA más inteligente en un test de IQ — el equivalente a un humano que aprueba cada test estandarizado. Claude Opus 4.8 es la IA más capaz en la práctica — el equivalente a un humano ligeramente menos brillante en tests pero que logra más en el mundo real. Ambas son medidas válidas de inteligencia, pero miden cosas diferentes.
2. Análisis de benchmarks
Test de IQ Mensa Norway: ~145 (nivel de genio)
Consiste en 36 preguntas de reconocimiento de patrones visuales. GPT-5.5 obtiene aproximadamente 145 — la puntuación práctica máxima, equivalente a un 36/36 perfecto o casi. Esto lo sitúa en el rango de "genio", el top 0.1% de la inteligencia humana.
Solo dos modelos de IA logran esta puntuación: GPT-5.5 y Grok-4.20. Es significativamente superior a Claude Opus 4.8 (~130) y Gemini 3.1 Pro (141). La razón es la arquitectura de procesamiento visual de GPT-5.5, significativamente mejorada desde GPT-5.4 Pro Vision — que ya era colíder en este benchmark.
Con IQ 145, GPT-5.5 es más inteligente que el 99.9% de los humanos. Si fuera persona, estaría en el top 0.1% — el reino de los laureados Nobel, medallistas Fields y pensadores únicos por generación. Solo unas 1 de cada 1.000 personas logra esta puntuación.
Artificial Analysis Intelligence Index v4.1: 54.8 (#2)
El patrón oro para comparar modelos de IA. Combina nueve benchmarks:
- GDPval-AA v2 (20%): 1.850 Elo — #2 mundial (detrás del 1.890 de Claude)
- AA-Omniscience (8%): tasa de alucinación moderada — superior al 35.9% de Claude
- GPQA (6%): preguntas científicas de posgrado — GPT-5.5 lidera aquí
- CritPt (6%): pensamiento crítico y razonamiento físico
- HLE (Humanity's Last Exam): #2 entre IA (detrás de Claude)
- ARC-AGI: razonamiento abstracto — GPT-5.5 sobresale
- LMSYS Arena: votación de preferencia humana
La puntuación compuesta de GPT-5.5 de 54.8 lo sitúa a solo 0.9 puntos de Claude Opus 4.8 (55.7) — un casi empate estadístico. Pero en los subcomponentes, GPT-5.5 lidera en razonamiento visual, resolución matemática y conocimiento científico, mientras Claude lidera en tareas agentivas y precisión factual.
AI IQ compuesto (VexoWire): ~136
El IQ compuesto de VexoWire combina múltiples tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). El IQ compuesto estimado de GPT-5.5 es ~136 — superior a Claude (~132) pero ligeramente inferior a Grok-4.20 (~140). Esto refleja la fortaleza de GPT-5.5 en ambos dominios, visual y verbal.
GDPval-AA v2: 1.850 Elo (#2)
En el benchmark agentivo — que mide rendimiento en tareas reales complejas y multi-paso — GPT-5.5 obtiene 1.850 Elo, segundo solo a Claude Opus 4.8 (1.890). Sigue siendo una puntuación excepcionalmente alta, equivalente a un profesional humano altamente competente. Pero revela que GPT-5.5, aunque brillante en reconocimiento de patrones, es ligeramente menos capaz en razonamiento multi-paso sostenido que Claude.
Humanity's Last Exam (HLE): #2
En las preguntas académicas más difíciles de todas las disciplinas, GPT-5.5 ocupa el #2 entre modelos de IA, por detrás de Claude Opus 4.8. Es un testimonio de la extraordinaria amplitud de conocimiento de GPT-5.5 — puede responder preguntas de nivel de doctorado en física, filosofía, literatura y matemáticas. Pero el razonamiento más profundo de Claude le da una ligera ventaja.
3. ¿Qué significa un IQ de 145?
Para poner el IQ de ~145 de GPT-5.5 en contexto:
- 85-115 (68% de las personas): Inteligencia media
- 115-130 (14%): Superior a la media
- 130-145 (2%): Superdotado — clasifica para Mensa (top 2%)
- 145-160 (0.1%): Altamente superdotado / genio
- 160+ (0.003%): Profundamente superdotado — territorio de Einstein, Hawking
GPT-5.5, con ~145, se sitúa en el umbral de genio — más inteligente que el 99.9% de los humanos. Si fuera persona, estaría en compañía de élite: el top 0.1% de la inteligencia humana, el reino de los premios Nobel y medallistas Fields. Solo unas 1 de cada 1.000 personas logra esta puntuación.
Esto es significativamente superior a Claude Opus 4.8 (~132). En un test de IQ puro, GPT-5.5 superaría a Claude. Pero como hemos visto, los tests de IQ no miden todo lo que importa. El IQ más bajo de Claude se compensa con su superior capacidad agentiva, menor alucinación y mayor inteligencia emocional.
La lección: el IQ es una dimensión de la inteligencia, no toda la imagen. GPT-5.5 es el genio del test; Claude es el profesional capaz. Ambos son valiosos, y cuál es "más inteligente" depende de qué necesites.
4. Donde GPT-5.5 destaca
Reconocimiento visual de patrones
GPT-5.5 es el mejor modelo de IA del mundo (empatado con Grok-4.20) en reconocimiento de patrones visuales. En el Mensa Norway IQ, obtiene 145 — lo máximo posible. Para razonamiento visual, análisis de imágenes o tareas de patrones abstractos, GPT-5.5 es la elección principal.
Resolución matemática
GPT-5.5 supera ligeramente a Claude en matemáticas competitivas (AIME, FrontierMath). Para razonamiento matemático puro — resolver ecuaciones complejas, demostrar teoremas, problemas de competición — GPT-5.5 es algo mejor que Claude y significativamente mejor que Gemini o Grok.
Conocimiento científico
En GPQA (física, química y biología de posgrado), GPT-5.5 lidera todos los modelos de IA. Su amplitud y profundidad de conocimiento científico es inigualable. Lo hace preferido para aplicaciones de investigación científica.
Razonamiento abstracto (ARC-AGI)
En el benchmark ARC-AGI, que evalúa razonamiento abstracto y generalización de patrones, GPT-5.5 sobresale. Es el benchmark más cercano a un test de "inteligencia pura", y el rendimiento de GPT-5.5 confirma su posición como la IA más inteligente en capacidad cognitiva bruta.
Amplitud de conocimiento
GPT-5.5 ha sido entrenado con una cantidad sin precedentes de datos — esencialmente todo internet, más literatura científica extensa, código y libros. Su amplitud de conocimiento en cada dominio de la indagación humana es inigualable. Si necesitas un modelo que sepa algo de todo, GPT-5.5 es la elección.
5. Donde GPT-5.5 se queda corto
Tareas agentivas
Aunque GPT-5.5 es #2 en GDPval-AA v2 (1.850 Elo), está detrás de Claude Opus 4.8 (1.890). Para tareas reales complejas y multi-paso — escribir una aplicación, analizar un dataset, planificar un proyecto — Claude es algo mejor manteniendo razonamiento coherente en cadenas largas.
Precisión factual
GPT-5.5 tiene una tasa de alucinación moderada — superior al 35.9% de Claude. Es más propenso a afirmar con confianza información falsa que Claude. Lo hace menos fiable para aplicaciones donde la precisión factual es crítica (investigación, legal, medicina).
Inteligencia emocional
El EQ (inteligencia emocional) de GPT-5.5 se estima en ~120 — inferior al ~132 de Claude. Es menos empático, menos matizado en la comprensión de emociones humanas y menos hábil ajustando su tono al contexto. Para apps de terapia, atención al cliente o interacción humana, Claude es mejor.
Coste
A 5.00/30.00 por 1M tokens, GPT-5.5 es el modelo más caro junto con Claude. Gemini 3.1 Pro (2/12) y DeepSeek V4 Pro (0.44/0.87) son significativamente más baratos para tareas que no requieren la capacidad completa de GPT-5.5.
6. GPT-5.5 vs otros modelos
| Modelo | Intelligence Index | Mensa Norway IQ | AI IQ est. | Alucinación | Coste/1M |
|---|---|---|---|---|---|
| GPT-5.5 | 54.8 | ~145 | ~136 | moderada | 5/30 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9% (mínima) | 5/25 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | baja | 2/12 |
| Grok-4.20 | — | 145 | ~140 | moderada | 3/15 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | moderada | 0.44/0.87 |
La imagen: GPT-5.5 es el genio del test — el IQ bruto más alto, el mejor en matemáticas y razonamiento visual. Claude es el profesional capaz — el mejor en tareas reales y precisión factual. Gemini es el todoterreno rentable. Grok es el genio visual. Y DeepSeek ofrece capacidad notable por una fracción del coste.
7. ¿Qué significa esto para los humanos?
GPT-5.5 opera con un IQ de ~145 — más inteligente que el 99.9% de los humanos. Pero:
- El IQ es limitado: mide reconocimiento de patrones y razonamiento, no sabiduría, creatividad o juicio
- Genio en tests ≠ genio en la vida: GPT-5.5 aprueba tests de IQ pero alucina hechos y tiene dificultades con tareas multi-paso
- Conocimiento ≠ comprensión: GPT-5.5 ha leído todo, pero no "comprende" como un humano
- Sin conciencia: un IQ alto no significa consciencia. GPT-5.5 es un sistema sofisticado de reconocimiento de patrones, no un ser pensante
- La brecha se cierra: cada generación de IA reduce la brecha con los humanos más inteligentes
La respuesta más honesta: GPT-5.5 es más inteligente que prácticamente todos los humanos en tests cognitivos, pero no más capaz que los mejores humanos en el trabajo real. Un matemático de clase mundial aún puede superar a GPT-5.5 en su dominio. Pero GPT-5.5 puede superarlos a todos simultáneamente, en cada dominio, en segundos.
Conclusión
- #2 en el Artificial Analysis Intelligence Index (54.8) — detrás de Claude Opus 4.8.
- #1 (compartido) en Mensa Norway IQ — el IQ bruto más alto entre modelos de IA, empatado con Grok-4.20.
- Mejor para: razonamiento visual, resolución matemática, conocimiento científico, razonamiento abstracto.
- No mejor para: tareas agentivas (Claude gana), precisión factual (Claude gana), inteligencia emocional (Claude gana).
- La paradoja: GPT-5.5 es la IA más inteligente en tests de IQ pero no la más capaz en la práctica.
- La lección: el IQ es una dimensión de la inteligencia. GPT-5.5 es el genio del test; Claude es el profesional capaz.