¿Cuál es el IQ de Qwen 3.5?
Qwen 3.5 obtiene 115 en el test de IQ Mensa Norway y se sitúa en el top 10 del Intelligence Index. Analizamos cada benchmark y explicamos qué hace único al modelo de Alibaba.
Qwen 3.5: el contendiente versátil de Alibaba
Qwen 3.5 es el modelo insignia de DAMO Academy de Alibaba, uno de los laboratorios de investigación de IA más grandes y mejor financiados de China. Lanzado a principios de 2026, Qwen 3.5 obtiene 115 en el test de IQ Mensa Norway y se sitúa en el top 10 del Artificial Analysis Intelligence Index v4.1. Esto lo coloca por encima de DeepSeek V4 Pro (111) y competitivo con Kimi K3 (118), pero por debajo de los modelos de frontera (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Lo que hace único a Qwen 3.5 es su versatilidad. A diferencia de DeepSeek (que se centra en el coste), Kimi (que se centra en la longitud del contexto) o Grok (que se centra en el IQ bruto), Qwen 3.5 aspira a ser un modelo versátil que destaca en una amplia gama de tareas. Tiene fuerte soporte multilingüe (27+ idiomas), excelentes capacidades multimodales (texto, imagen, audio, vídeo) y precios competitivos — haciéndolo la navaja suiza de los modelos de IA.
Qwen 3.5 es el todoterreno: un modelo que puede no ser el mejor absoluto en una sola cosa, pero que es muy bueno en casi todo. Para organizaciones que necesitan un único modelo para cargas de trabajo diversas — atención al cliente, generación de contenido, análisis de código, traducción, comprensión visual — Qwen 3.5 ofrece una combinación atractiva de capacidad, versatilidad y valor.
Puntuaciones clave:
- Artificial Analysis Intelligence Index: top 10 (puntuación ~45-46)
- Mensa Norway IQ (TrackingAI): 115 (superior a la media)
- AI IQ compuesto (VexoWire): ~115 estimado
- GDPval-AA v2: top 10
- Humanity's Last Exam: top 10
- Tasa de alucinación: baja-moderada
- Coste: 0,55/1,50 por 1M tokens (muy asequible)
- Multimodal: texto, imagen, audio, vídeo
- Idiomas: 27+ idiomas soportados
1. La ventaja de la versatilidad
Qwen 3.5 representa la apuesta de Alibaba de que el futuro de la IA no trata sobre ser el más inteligente, sino sobre ser el más versátil. Mientras otros laboratorios optimizan dimensiones específicas — IQ, coste, contexto, personalidad — Alibaba ha construido un modelo competitivo en todas ellas.
Considera el perfil:
- IQ: 115 (superior a la media, competitivo con otros modelos chinos)
- Coste: 0,55/1,50 por 1M tokens (entre los más baratos)
- Multimodal: texto, imagen, audio, vídeo (multimodal completo)
- Idiomas: 27+ idiomas (multilingüe de primera clase)
- Contexto: 256K tokens (respetable, aunque no nivel Kimi)
- Código abierto: pesos disponibles para despliegue local
Ningún atributo individual es el mejor de su clase, pero la combinación no tiene rival. DeepSeek es más barato pero carece de multimodal. Kimi tiene más contexto pero menos idiomas. Gemini es más inteligente pero más caro. Claude es más capaz pero de código cerrado. Qwen 3.5 pasa la aguja — lo suficientemente bueno en todo para ser el único modelo que necesitas.
Esta versatilidad hace a Qwen 3.5 particularmente atractivo para:
- Despliegues empresariales con cargas de trabajo diversas
- Aplicaciones internacionales que requieren muchos idiomas
- Aplicaciones multimodales que combinan texto, imagen y audio
- Organizaciones conscientes del coste que aún necesitan calidad
- Despliegues auto-alojados mediante pesos de código abierto
2. Análisis de benchmarks
Test de IQ Mensa Norway: 115 (superior a la media)
Consiste en 36 preguntas de reconocimiento de patrones visuales. Qwen 3.5 obtiene 115 — por encima de la media humana de 100, situándolo en el rango "superior a la media". Esto es mayor que DeepSeek V4 Pro (111), ligeramente inferior a Kimi K3 (118), y por debajo de los modelos de frontera (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Un IQ de 115 significa que Qwen 3.5 es más inteligente que aproximadamente el 84% de los humanos — el 16% superior de la inteligencia humana. Si fuera persona, sería comparable a un fuerte estudiante universitario o un profesional capaz. No un genio, pero ciertamente brillante y competente.
Artificial Analysis Intelligence Index: top 10
En el Intelligence Index, Qwen 3.5 se sitúa en el top 10 mundial con una puntuación estimada de ~45-46. Esto lo coloca competitivo con Gemini 3.1 Pro (46,5), Kimi K3 (~45-47) y DeepSeek V4 Pro (44,3), pero por detrás de Claude (55,7) y GPT-5.5 (54,8).
Desglose de los componentes del Index:
- GDPval-AA v2: Qwen 3.5 rinde bien, beneficiándose de sus capacidades multimodales para diversas tareas agentivas
- AA-Omniscience: Qwen 3.5 tiene una tasa de alucinación baja-moderada, beneficiándose de los extensos datos de entrenamiento de Alibaba
- GPQA: Qwen 3.5 rinde adecuadamente en preguntas de ciencia de nivel posgrado
- HLE: Qwen 3.5 se sitúa en el top 10 en Humanity's Last Exam
- ARC-AGI: Qwen 3.5 rinde razonablemente en razonamiento abstracto
- LMSYS Arena: Qwen 3.5 obtiene fuertes puntuaciones de preferencia humana, particularmente en tareas multilingües y multimodales
AI IQ compuesto (VexoWire): ~115
El IQ compuesto de VexoWire combina múltiples tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). El IQ compuesto estimado de Qwen 3.5 es ~115 — consistente con su puntuación de Mensa Norway. Esto lo sitúa en la frontera entre "media" y "superior a la media", más inteligente que aproximadamente el 84% de los humanos.
GDPval-AA v2: top 10
En el benchmark agentivo, Qwen 3.5 se sitúa en el top 10. Sus capacidades multimodales le dan ventaja en tareas agentivas que implican procesar diferentes tipos de datos — texto, imágenes y audio. Para cargas de trabajo agentivas moderadas, Qwen 3.5 es competente, aunque queda por detrás de Claude y GPT-5.5 en las tareas más complejas.
Humanity's Last Exam (HLE): top 10
En las preguntas académicas más difíciles, Qwen 3.5 se sitúa en el top 10 entre modelos de IA. Los sólidos datos de entrenamiento académico de Alibaba y la amplia base de conocimientos del modelo le ayudan a rendir bien en todas las disciplinas.
3. ¿Qué significa un IQ de 115?
Para poner el IQ de 115 de Qwen 3.5 en contexto:
- 85-115 (68% de las personas): Inteligencia media
- 115-130 (14%): Superior a la media a alta
- 130-145 (2%): Superdotado — clasifica para Mensa (top 2%)
- 145-160 (0,1%): Altamente superdotado / genio
Qwen 3.5, con 115, se sitúa justo en la frontera entre "media" y "superior a la media" — más inteligente que aproximadamente el 84% de los humanos. Si fuera persona, sería comparable a un fuerte estudiante universitario o un profesional capaz. No un genio, pero ciertamente brillante y competente.
Esto es mayor que DeepSeek V4 Pro (111) pero por debajo de los modelos de frontera:
- Claude Opus 4.8: ~130 (superdotado)
- Gemini 3.1 Pro: 141 (altamente superdotado)
- GPT-5.5: ~145 (genio)
- Grok-4.20: 145 (genio)
La brecha con los modelos de frontera es de unos 15-30 puntos de IQ. Pero Qwen 3.5 compensa con su versatilidad — para tareas que requieren comprensión multimodal, soporte multilingüe o cargas de trabajo diversas, las capacidades generales de Qwen 3.5 pueden compensar la brecha de IQ.
4. Donde Qwen 3.5 destaca
Soporte multilingüe
Qwen 3.5 soporta 27+ idiomas nativamente, haciéndolo uno de los modelos de IA más multilingües disponibles. No es solo traducción — el modelo está genuinamente entrenado en estos idiomas, entendiendo contexto cultural, modismos y matices. Para aplicaciones internacionales, Qwen 3.5 está entre las mejores opciones.
Capacidades multimodales
Qwen 3.5 puede procesar texto, imágenes, audio y vídeo — haciéndolo un verdadero modelo multimodal. Esto permite aplicaciones que los modelos solo de texto no pueden manejar: respuesta a preguntas visuales, análisis de imágenes, transcripción de audio, comprensión de vídeo y más. Para aplicaciones que combinan múltiples tipos de medios, Qwen 3.5 es excepcionalmente capaz.
Rentabilidad
A 0,55/1,50 por 1M tokens, Qwen 3.5 es muy asequible — ligeramente más caro que DeepSeek V4 Pro (0,44/0,87) pero significativamente más barato que Claude (5/25), GPT-5.5 (5/30) y Gemini (2/12). Dadas sus capacidades multimodales y soporte multilingüe, la propuesta de valor es excelente.
Disponibilidad de código abierto
Los pesos de Qwen 3.5 están disponibles para despliegue local, haciéndolo uno de los pocos modelos multimodales de código abierto. Esto es significativo — la mayoría de modelos multimodales (GPT-5.5, Gemini) son de código cerrado. Para organizaciones que necesitan capacidades multimodales con privacidad de datos, Qwen 3.5 es una de las mejores opciones.
Tareas en chino
Como modelo desarrollado en China, Qwen 3.5 tiene excelentes capacidades en idioma chino. Para aplicaciones en chino, Qwen 3.5 está entre los mejores modelos disponibles, a menudo superando a los modelos occidentales en tareas específicas de chino.
Preparación empresarial
La infraestructura de Alibaba y su experiencia empresarial hacen a Qwen 3.5 particularmente adecuado para despliegues empresariales. El modelo está disponible a través de Alibaba Cloud con SLAs de nivel empresarial, certificaciones de cumplimiento y soporte de integración. Para empresas que buscan un modelo de IA fiable y versátil, Qwen 3.5 es una opción fuerte.
5. Donde Qwen 3.5 se queda corto
IQ bruto y razonamiento complejo
Con un IQ de 115, Qwen 3.5 está por debajo de los modelos de frontera en tareas de razonamiento complejo. Para los problemas más difíciles — matemáticas competitivas, puzzles de lógica avanzados, razonamiento científico puntero — Claude, GPT-5.5 y Gemini son sustancialmente mejores. Si tu tarea requiere razonamiento de nivel genio, los modelos de frontera son la mejor elección.
Ventana de contexto
Con una ventana de contexto de 256K tokens, Qwen 3.5 es adecuado pero no excepcional. Kimi K3 (2M) y Gemini (1M) ofrecen ventanas de contexto significativamente mayores. Para tareas que requieren procesar documentos muy largos en una sola pasada, Kimi K3 o Gemini son mejores elecciones.
Complejidad de tareas agentivas
Aunque las capacidades multimodales de Qwen 3.5 ayudan con diversas tareas agentivas, queda por detrás de Claude y GPT-5.5 en pura complejidad de tarea. Para las aplicaciones agentivas más exigentes — escribir software complejo desde cero, gestionar flujos de investigación intrincados — Claude sigue siendo más capaz.
Inteligencia emocional
El EQ (inteligencia emocional) de Qwen 3.5 se estima en ~107 — inferior a Claude (~132), GPT-5.5 (~120) y Gemini (~115), pero comparable a DeepSeek (~105) y Grok (~110). Sus respuestas tienden a ser más funcionales y menos emocionalmente matizadas. Para apps de terapia, atención al cliente o interacciones humanas sensibles, Claude es la mejor elección.
Tasa de alucinación
Aunque Qwen 3.5 tiene una tasa de alucinación baja-moderada, no es tan baja como Claude (35,9%). Para aplicaciones donde la precisión factual es crítica — investigación, derecho, medicina — Claude sigue siendo más fiable.
6. Qwen 3.5 vs otros modelos
| Modelo | Intelligence Index | Mensa Norway IQ | AI IQ est. | Multimodal | Coste/1M | Idiomas | Código abierto |
|---|---|---|---|---|---|---|---|
| Qwen 3.5 | ~45-46 (top 10) | 115 | ~115 | texto+imagen+audio+vídeo | 0,55/1,50 | 27+ | sí |
| Claude Opus 4.8 | 55,7 | ~130 | ~132 | texto+imagen | 5/25 | ~20 | no |
| GPT-5.5 | 54,8 | ~145 | ~136 | texto+imagen+audio | 5/30 | ~50 | no |
| Gemini 3.1 Pro | 46,5 | 141 | ~131 | texto+imagen+audio+vídeo | 2/12 | ~40 | no |
| Grok-4.20 | top 5 | 145 | ~140 | texto+imagen | 3/15 | ~20 | no |
| DeepSeek V4 Pro | 44,3 | ~111 | ~111 | solo texto | 0,44/0,87 | ~10 | sí |
| Kimi K3 | ~45-47 (top 10) | 118 | ~118 | solo texto | 0,55/2,19 | ~10 | no |
La imagen: Qwen 3.5 es el todoterreno — no el mejor en una sola cosa, pero muy bueno en casi todo. Claude es el profesional capaz — el mejor en tareas reales y precisión factual. GPT-5.5 es el genio del test — el mejor en matemáticas y razonamiento visual. Gemini es el campeón de valor — mejor rentabilidad entre modelos de frontera. Grok-4.20 es el campeón de IQ bruto — el IQ más alto con personalidad. DeepSeek es el campeón económico — el más barato con código abierto. Y Kimi es el campeón de contexto largo — la mayor ventana de contexto.
Para organizaciones que necesitan versatilidad — multimodal, multilingüe, asequible, código abierto — Qwen 3.5 es la opción clara. Es la navaja suiza de los modelos de IA.
7. ¿Qué significa esto para los humanos?
Qwen 3.5 opera con un IQ de ~115 — más inteligente que aproximadamente el 84% de los humanos. Pero:
- El IQ no lo es todo: un IQ de 115 está por encima de la media y es suficiente para la mayoría de tareas prácticas
- La versatilidad importa más que el IQ bruto para muchas aplicaciones: para cargas de trabajo diversas, las capacidades generales de Qwen 3.5 son más valiosas que un IQ más alto en un modelo más estrecho
- Lo multimodal es el futuro: la capacidad de Qwen 3.5 para procesar texto, imágenes, audio y vídeo abre aplicaciones que los modelos solo de texto no pueden manejar
- Lo multilingüe permite alcance global: con 27+ idiomas, Qwen 3.5 puede servir a usuarios en su idioma nativo — una capacidad que importa para aplicaciones globales
- Conocimiento ≠ comprensión: como todos los modelos de IA, Qwen 3.5 tiene acceso a vasto conocimiento pero no "comprende" verdaderamente como un humano
- Sin conciencia: un IQ alto no significa consciencia. Qwen 3.5 es un sistema sofisticado de reconocimiento de patrones, no un ser pensante
- El código abierto empodera la innovación: los pesos abiertos de Qwen 3.5 permiten a investigadores y desarrolladores construir soluciones personalizadas, ajustar para dominios específicos y ejecutar localmente
La respuesta más honesta: Qwen 3.5 es más inteligente que el 84% de los humanos en tests cognitivos, y para aplicaciones que requieren versatilidad — multimodal, multilingüe, asequible — es la opción más inteligente — no porque sea la más inteligente, sino porque es la más capaz en la gama más amplia de tareas.
Conclusión
- Top 10 en el Intelligence Index — competitivo con Gemini, Kimi y DeepSeek, por detrás de Claude y GPT-5.5.
- Multimodal completo — texto, imagen, audio y vídeo en un solo modelo.
- 27+ idiomas — uno de los modelos de IA más multilingües disponibles.
- Código abierto — pesos disponibles para despliegue local, permitiendo privacidad y personalización.
- Mejor para: cargas de trabajo empresariales diversas, aplicaciones internacionales, tareas multimodales, organizaciones conscientes del coste, despliegues auto-alojados.
- No mejor para: IQ bruto (modelos de frontera ganan), contexto largo (Kimi gana), tareas agentivas complejas (Claude gana), inteligencia emocional (Claude gana).
- La lección: la inteligencia no es solo ser el más inteligente — es ser el más versátil. Qwen 3.5 demuestra que ser bueno en todo puede ser más valioso que ser el mejor en una cosa.