
¿Puede la IA igualar a Elon Musk? Estimando el QI de los LLM vs humanos
¿Cómo rinden GPT-4, Claude y Gemini en tests de QI reales comparados con humanos como Elon Musk? Analizamos las capacidades cognitivas de la IA, el razonamiento fluido y lo que los LLM pueden y no pueden hacer.
La pregunta que no se va
Cada pocos meses, un titular se vuelve viral: "La IA aprueba un test de QI con una puntuación de 155." La implicación es clara: la inteligencia artificial ha superado al genio humano, los Elon Musk del mundo son obsoletos. Pero, ¿hay algo de cierto en esto?
La respuesta corta: no. La respuesta más larga requiere entender qué miden los tests de QI, cómo los grandes modelos de lenguaje (LLM) procesan la información y por qué comparar la inteligencia humana y la artificial es como comparar un submarino con un nadador.
Este artículo examina la evidencia real — estudios revisados por pares del rendimiento cognitivo de los LLM, la estructura de los tests de QI y lo que sabemos sobre el perfil cognitivo de Elon Musk — para darte una respuesta honesta.
Qué miden realmente los tests de QI
Los tests de QI no son medidas únicas de "inteligencia." Evalúan una jerarquía de capacidades cognitivas, típicamente organizada en el modelo Cattell-Horn-Carroll (CHC):
- Razonamiento fluido (Gf): Resolución de problemas novedosos sin conocimiento previo
- Inteligencia cristalizada (Gc): Conocimiento adquirido y vocabulario
- Razonamiento cuantitativo (Gq): Reconocimiento de patrones numéricos
- Procesamiento visual (Gv): Razonamiento espacial y geométrico
- Memoria de trabajo (Gwm): Mantener y manipular información en la mente
- Velocidad de procesamiento (Gs): Rendimiento cognitivo rápido
Una puntuación de QI a gran escala agrega estos elementos, pero el perfil importa más que el número. Dos personas con QI 130 pueden tener perfiles de capacidad radicalmente diferentes — uno puede destacar en razonamiento verbal pero tener dificultades con tareas espaciales, mientras el otro muestra lo contrario.
Cómo se probaron los LLM
Varios estudios han administrado tests de QI humanos a grandes modelos de lenguaje. Los más rigurosos:
Bubeck et al. (2023) probaron GPT-4 con la escala WAIS-IV (Wechsler), encontrando que rendía en o por encima del percentil 99 en subpruebas verbales — Vocabulario, Semejanzas, Información — pero tenía dificultades con tareas de razonamiento espacial que requieren procesamiento visual. El estudio estimó el "QI verbal" de GPT-4 en aproximadamente 155.
Zhu et al. (2023) administraron las Matrices Progresivas de Raven (razonamiento fluido no verbal) a múltiples LLM. GPT-4 puntuó en el rango del percentil 75-90 — respetable, pero lejos del nivel de genio. Los autores notaron que los LLM a menudo resuelven problemas de matrices mediante coincidencia de patrones en los datos de entrenamiento en lugar de razonamiento fluido genuino.
Las propias evaluaciones de OpenAI (2023-2024) muestran a GPT-4 obteniendo 163 en la sección verbal del SAT (percentil 99) pero solo 710/800 en matemáticas — fuerte, pero no excepcional para los estándares de universidades de élite.
La ilusión verbal: por qué las puntuaciones de IA parecen infladas
Aquí está el problema central: los tests de QI son fuertemente verbales, y los LLM están entrenados con texto.
La WAIS-IV tiene 10 subpruebas centrales. Cinco son principalmente verbales: Vocabulario, Semejanzas, Información, Comprensión, Aritmética. Para estas, un LLM tiene una ventaja masiva — ha ingerido esencialmente todo el texto publicado en sus datos de entrenamiento. Cuando se le pregunta "¿Qué semejanza hay entre un reloj y un calendario?" el modelo no razona — recupera la respuesta de su modelo estadístico del lenguaje.
Esto es inteligencia cristalizada (Gc), no razonamiento fluido. Y es donde los LLM parecen más impresionantes. Pero la inteligencia cristalizada es la menos predictiva de la resolución de problemas del mundo real y la innovación. Mide lo que sabes, no cómo piensas.
Donde los LLM fallan: la brecha Musk
El perfil cognitivo de Elon Musk — basado en sus puntuaciones SAT y patrones de carrera — es asimétrico: razonamiento fluido muy alto, capacidad espacial excepcional, habilidades verbales fuertes pero no de élite. Esto es exactamente el perfil donde los LLM rinden peor.
Razonamiento espacial (Gv): Los LLM no pueden procesar nativamente información visual-espacial. Cuando se les pide rotar mentalmente objetos 3D o visualizar trayectorias de cohetes, fallan o dependen de soluciones alternativas basadas en texto. La capacidad de Musk para visualizar componentes de cohetes y sus interacciones en su cabeza — un factor clave en SpaceX — no tiene equivalente en LLM.
Manipulación de memoria de trabajo (Gwm): Aunque los LLM tienen ventanas de contexto grandes, no manipulan información en la memoria de trabajo como lo hacen los humanos. Coinciden patrones, no mantienen un modelo mental y lo transforman. La capacidad de Musk para mantener múltiples compensaciones de ingeniería simultáneamente y actualizarlas en tiempo real es una función de memoria de trabajo que la IA actual no puede replicar.
Razonamiento de primeros principios: La estrategia cognitiva característica de Musk — descomponer problemas hasta la física fundamental y construir desde ahí — requiere razonamiento fluido genuino, no recuperación. Cuando los LLM intentan el razonamiento de primeros principios, a menudo producen cadenas lógicamente rotas pero plausibles porque están interpolando entre ejemplos de entrenamiento en lugar de razonar desde axiomas.
Transferencia de aprendizaje entre dominios: Musk aplica el mismo conjunto de herramientas cognitivas a cohetes, coches, interfaces neuronales y redes sociales. Los LLM pueden generar texto sobre todos estos dominios, pero no pueden transferir una estrategia de solución de un dominio a otro como lo hace un experto humano.
- LLM: Vasta inteligencia cristalizada (Gc)
- LLM: Generación y recuperación rápida de texto
- LLM: Consistentes, incansables, escalables
- LLM: Fuertes en tests verbales estandarizados
- LLM: Razonamiento espacial débil (Gv)
- LLM: Sin manipulación genuina de memoria de trabajo
- LLM: El razonamiento de primeros principios a menudo se rompe
- LLM: Pobre transferencia de estrategias entre dominios
El problema de los benchmarks
Hay un problema metodológico más profundo: los tests de QI fueron diseñados para humanos, no para máquinas.
Cuando un humano toma las Matrices Progresivas de Raven, usa una combinación de memoria de trabajo, procesamiento visual y razonamiento fluido. Cuando un LLM toma el mismo test (convertido a texto), usa coincidencia de patrones estadística contra datos de entrenamiento. Estos son procesos cognitivos fundamentalmente diferentes que resultan producir resultados similares en un test específico.
Este es el problema de la Ley de Goodhart: cuando una medida se convierte en un objetivo, deja de ser una buena medida. Si optimizamos la IA para puntuar bien en tests de QI, no estamos haciendo a la IA más inteligente — la estamos haciendo mejor en tests de QI.
Una comparación más honesta usaría tests diseñados para distinguir la cognición humana de la coincidencia de patrones estadística:
- Problemas de física novedosos que no pueden estar en los datos de entrenamiento
- Razonamiento espacial de múltiples pasos que requiere simulación mental
- Preguntas adversariales diseñadas para exponer atajos de coincidencia de patrones
- Toma de decisiones en tiempo real bajo restricciones novedosas
En estas medidas, los LLM actuales rinden muy por debajo del nivel experto humano.
Lo que los números realmente dicen
Seamos concretos. Si comparamos el perfil cognitivo estimado de Musk (de la conversión del SAT) con el rendimiento medido de GPT-4:
| Capacidad | Musk (est.) | GPT-4 (medido) |
|---|---|---|
| Verbal/Cristalizada (Gc) | ~130-135 | ~155+ |
| Razonamiento fluido (Gf) | ~140-145 | ~115-125 |
| Espacial (Gv) | ~145+ | ~80-90 |
| Memoria de trabajo (Gwm) | ~135-140 | N/A (no aplicable) |
| Velocidad de procesamiento (Gs) | ~120-130 | Muy rápido, pero mecanismo diferente |
El panorama es claro: los LLM dominan la inteligencia cristalizada pero se quedan atrás significativamente en razonamiento fluido, capacidad espacial y manipulación de memoria de trabajo — exactamente las capacidades que impulsan la innovación en ingeniería y la resolución de problemas emprendedora.
¿Puede la IA reemplazar la función de Elon Musk?
La "función de Elon Musk" — como rol cognitivo, no como persona — implica:
- Identificar problemas novedosos que aún no tienen solución
- Razonar desde primeros principios en múltiples dominios técnicos
- Tomar decisiones de alto riesgo con información incompleta
- Integrar razonamiento espacial, cuantitativo y verbal en tiempo real
- Sostener esfuerzo y concentración en proyectos de varios años
La IA actual puede asistir con cada uno de estos pero no puede realizar la integración. GPT-4 puede ayudar a escribir código para una simulación de cohetes, pero no puede decidir si construir un cohete reutilizable. Puede analizar datos de química de baterías, pero no puede visualizar el comportamiento térmico de un nuevo diseño de celda.
La brecha no es solo sobre puntuaciones de QI — es sobre el tipo de inteligencia. El valor de Musk viene del razonamiento fluido aplicado a problemas novedosos, no de conocer hechos. Los LLM son lo opuesto: vasto conocimiento factual con capacidad limitada de resolución de problemas novedosos.
El futuro: ¿convergencia o divergencia?
La IA está mejorando rápidamente, pero las mejoras son desiguales. Los LLM están mejorando en tareas verbales (donde ya son sobrehumanos) pero el progreso en razonamiento espacial y razonamiento fluido genuino es más lento. Los enfoques más prometedores — modelos multimodales, arquitecturas neuro-simbólicas y IA encarnada — intentan cerrar las brechas espacial y de razonamiento, pero siguen estando lejos del nivel experto humano.
La predicción honesta: la IA aumentará cada vez más la cognición humana en los próximos 5-10 años, pero la "función Musk" — la integración creativa de múltiples tipos de razonamiento aplicada a desafíos de ingeniería novedosos — seguirá siendo una capacidad humana en el futuro previsible. No porque los humanos sean inherentemente superiores, sino porque el tipo de inteligencia requerida es exactamente el tipo con el que las arquitecturas de IA actuales tienen dificultades.
Veredicto
- Las puntuaciones de tests de QI sobreestiman la inteligencia de la IA porque los tests de QI son fuertemente verbales y los LLM están entrenados con texto
- Los LLM sobresalen en inteligencia cristalizada (saber cosas) pero se quedan atrás en razonamiento fluido (resolver problemas nuevos)
- El perfil cognitivo de Musk — alto razonamiento fluido, capacidad espacial excepcional — es exactamente donde la IA es más débil
- El titular "IA QI 155" es engañoso: mide un tipo diferente de inteligencia del que impulsa la innovación real
- La IA aumenta pero no puede reemplazar la integración creativa de tipos de razonamiento que define la cognición ingenieril experta
La pregunta no es si la IA alcanzará un QI de 155. Probablemente ya lo ha hecho — en las subpruebas que no importan para la innovación. La verdadera pregunta es si la IA desarrollará el razonamiento fluido, espacial e integrativo que permite a alguien mirar un problema que nadie ha resuelto y resolverlo. Ese es el test de Musk. Y hasta ahora, la IA lo suspende.