Какой IQ у GPT-5.5?
GPT-5.5 набирает ~145 на тесте Mensa Norway IQ и 54.8 на Intelligence Index. Разбираем каждый бенчмарк, объясняем числа и сравниваем с Claude, Gemini и Grok.
GPT-5.5: флагманская модель OpenAI
GPT-5.5 — самая продвинутая модель OpenAI, выпущенная в начале 2026 года. Она занимает #2 на Artificial Analysis Intelligence Index v4.1 с баллом 54.8, сразу за Claude Opus 4.8 (55.7) и впереди Gemini 3.1 Pro (46.5). Но на человеческих IQ-тестах GPT-5.5 фактически обходит Claude — набирая примерно 145 на Mensa Norway IQ, попадая в диапазон «гения».
Это создаёт увлекательный парадокс: на композитном AI-бенчмарке GPT-5.5 — #2. Но на чистом человеческом IQ-тесте она делит #1. Как это возможно? Ответ раскрывает кое-что важное о том, что значит «интеллект» для AI — и почему одно число не может его охватить.
Ключевые оценки:
- Artificial Analysis Intelligence Index: 54.8 (#2 в мире)
- Mensa Norway IQ (TrackingAI): ~145 (#1 совместно с Grok-4.20)
- AI IQ композит (VexoWire): ~136 оценочно
- GDPval-AA v2: 1,850 Elo (#2 в мире)
- Humanity's Last Exam: #2 среди AI-моделей
- Уровень галлюцинаций: умеренный
- Стоимость: 5.00/30.00 за 1M токенов
1. Парадокс интеллекта GPT-5.5
Что делает GPT-5.5 такой интересной: это лучшая AI-модель в мире на человеческих IQ-тестах, но не лучшая AI-модель на AI-специфичных бенчмарках. Как это возможно?
Ответ в том, что измеряют разные тесты. Mensa Norway IQ — чистый тест визуального распознавания паттернов и абстрактного рассуждения, тот вид подвижного интеллекта, для которого IQ-тесты и создавались. GPT-5.5 с улучшенными визуальными возможностями (унаследованными от архитектуры GPT-5.4 Pro Vision) превосходна именно в этом типе рассуждения.
Но Artificial Analysis Intelligence Index измеряет более широкое: производительность на реальных задачах, фактическую точность, агентную способность и человеческие предпочтения. И в этих измерениях Claude Opus 4.8 — с превосходным агентным рассуждением и более низким уровнем галлюцинаций — обходит GPT-5.5.
Представьте так: GPT-5.5 — умнейшая AI на IQ-тесте — эквивалент человека, который щёлкает любой стандартизированный тест. Claude Opus 4.8 — самая способная AI на практике — эквивалент человека, чуть менее блестящего на тестах, но делающего больше в реальном мире. Оба — валидные меры интеллекта, но они измеряют разное.
2. Разбор бенчмарков
Mensa Norway IQ: ~145 (уровень гения)
Mensa Norway IQ состоит из 36 вопросов на визуальное распознавание паттернов. GPT-5.5 набирает примерно 145 — максимальный практический балл, эквивалент идеального или почти идеального 36/36. Это помещает её в диапазон «гения» — топ 0.1% человеческого интеллекта.
Только две AI-модели достигают этого балла: GPT-5.5 и Grok-4.20. Это значительно выше Claude Opus 4.8 (~130) и Gemini 3.1 Pro (141). Причина — визуальная архитектура GPT-5.5, значительно улучшенная от GPT-5.4 Pro Vision, которая сама была со-лидером на этом бенчмарке.
На IQ 145 GPT-5.5 умнее 99.9% людей. Если бы она была человеком, она была бы в топ 0.1% — сфере нобелевских лауреатов, филдсовских медалистов и мыслителей одного поколения. Примерно 1 из 1000 человек достигает этого балла.
Artificial Analysis Intelligence Index v4.1: 54.8 (#2)
Intelligence Index — золотой стандарт для сравнения AI-моделей. Он объединяет девять бенчмарков:
- GDPval-AA v2 (20%): 1,850 Elo — #2 в мире (после Claude 1,890)
- AA-Omniscience (8%): умеренный уровень галлюцинаций — выше, чем у Claude 35.9%
- GPQA (6%): научные вопросы аспирантского уровня — GPT-5.5 здесь лидирует
- CritPt (6%): критическое мышление и физическое рассуждение
- HLE (Humanity's Last Exam): #2 среди AI-моделей (после Claude)
- ARC-AGI: абстрактное рассуждение — GPT-5.5 превосходна
- LMSYS Arena: голосование людей за предпочтения
Композитный балл GPT-5.5 54.8 ставит её всего на 0.9 балла позади Claude Opus 4.8 (55.7) — статистическая почти ничья. Но в подкомпонентах GPT-5.5 лидирует в визуальном рассуждении, математическом решении задач и научных знаниях, тогда как Claude — в агентных задачах и фактической точности.
AI IQ композит (VexoWire): ~136
Композитный IQ VexoWire объединяет несколько тестов (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Оценочный композитный IQ GPT-5.5 — ~136 — выше Claude (~132), но чуть ниже Grok-4.20 (~140). Это отражает силу GPT-5.5 в обоих доменах — визуальном и вербальном.
GDPval-AA v2: 1,850 Elo (#2)
На агентном бенчмарке — измеряющем производительность на сложных многошаговых реальных задачах — GPT-5.5 набирает 1,850 Elo, второй после Claude Opus 4.8 (1,890). Это всё ещё исключительно высокий балл, примерно соответствует высококомпетентному профессионалу-человеку. Но это показывает, что GPT-5.5, будучи блестящей в распознавании паттернов, чуть менее способна в удержании многошагового рассуждения, чем Claude.
Humanity's Last Exam (HLE): #2
На сложнейших академических вопросах по всем дисциплинам GPT-5.5 занимает #2 среди AI-моделей, едва позади Claude Opus 4.8. Это свидетельство экстраординарной широты знаний GPT-5.5 — она может отвечать на вопросы уровня PhD по физике, философии, литературе и математике. Но более глубокое рассуждение Claude даёт ей небольшое преимущество.
3. Что означает IQ 145?
Чтобы контекстуализировать IQ ~145 GPT-5.5:
- 85-115 (68% людей): средний интеллект
- 115-130 (14%): выше среднего до высокого среднего
- 130-145 (2%): одарённые — квалификация для Mensa (топ 2%)
- 145-160 (0.1%): высоко одарённые / гении
- 160+ (0.003%): исключительно одарённые — уровень Эйнштейна, Хокинга
GPT-5.5 с ~145 находится прямо на пороге гения — умнее 99.9% людей. Если бы она была человеком, она была бы в элитной компании: топ 0.1% человеческого интеллекта, сфере нобелевских лауреатов и филдсовских медалистов. Примерно 1 из 1000 человек достигает этого балла.
Это значительно выше Claude Opus 4.8 (~132). На чистом IQ-тесте GPT-5.5 обошла бы Claude. Но, как мы видели, IQ-тесты измеряют не всё, что важно. Более низкий IQ Claude компенсируется превосходной агентной способностью, более низким уровнем галлюцинаций и более высоким эмоциональным интеллектом.
Урок: IQ — одно измерение интеллекта, не вся картина. GPT-5.5 — гений-тестировщик. Claude — способный профессионал. Оба ценны, и какая «умнее» — зависит от того, что вам нужно.
4. Где GPT-5.5 сильна
Визуальное распознавание паттернов
GPT-5.5 — лучшая AI-модель в мире (совместно с Grok-4.20) на задачах визуального распознавания паттернов. На Mensa Norway IQ она набирает 145 — максимально возможное. Если нужна модель для визуального рассуждения, анализа изображений или абстрактных паттернов — GPT-5.5 топ-выбор.
Математическое решение задач
GPT-5.5 немного обходит Claude на соревновательной математике (AIME, FrontierMath). Для чистого математического рассуждения — решения сложных уравнений, доказательства теорем, соревновательных задач — GPT-5.5 чуть лучше Claude и значительно лучше Gemini или Grok.
Научные знания
На GPQA (физика, химия и биология аспирантского уровня) GPT-5.5 лидирует среди всех AI-моделей. Её широта и глубина научных знаний не имеют равных. Это делает её предпочтительной для научных исследований.
Абстрактное рассуждение (ARC-AGI)
На бенчмарке ARC-AGI, проверяющем абстрактное рассуждение и обобщение паттернов, GPT-5.5 превосходна. Это ближайший бенчмарк к «чистому интеллекту», и результаты GPT-5.5 здесь подтверждают её позицию как умнейшей AI на raw когнитивную способность.
Широта знаний
GPT-5.5 обучена на беспрецедентном объёме данных — по сути весь интернет, плюс обширная научная литература, код и книги. Её широта знаний по каждому домену человеческого знания не имеет равных. Если нужна модель, которая знает понемногу обо всём — GPT-5.5 выбор.
5. Где GPT-5.5 отстаёт
Агентные задачи
Хотя GPT-5.5 #2 на GDPval-AA v2 (1,850 Elo), она позади Claude Opus 4.8 (1,890). Для сложных многошаговых реальных задач — написания ПО, анализа данных, планирования исследования — Claude чуть лучше удерживает связное рассуждение на длинных цепочках.
Фактическая точность
У GPT-5.5 умеренный уровень галлюцинаций — выше, чем у Claude 35.9%. Она чаще уверенно утверждает ложную информацию, чем Claude. Это делает её менее надёжной для применений, где критична фактическая точность (исследования, юриспруденция, медицина).
Эмоциональный интеллект
EQ (эмоциональный интеллект) GPT-5.5 оценочно ~120 — ниже, чем у Claude ~132. Она менее эмпатична, менее nuanced в понимании человеческих эмоций и менее искусна в подстройке тона к контексту. Для терапевтических приложений, службы поддержки или человеческого взаимодействия Claude — лучший выбор.
Стоимость
5.00/30.00 за 1M токенов — GPT-5.5 самая дорогая модель наряду с Claude. Gemini 3.1 Pro (2/12) и DeepSeek V4 Pro (0.44/0.87) значительно дешевле для задач, не требующих полной мощности GPT-5.5.
6. GPT-5.5 vs другие модели
| Модель | Intelligence Index | Mensa Norway IQ | AI IQ оцен. | Галлюцинации | Стоимость/1M |
|---|---|---|---|---|---|
| GPT-5.5 | 54.8 | ~145 | ~136 | умеренные | 5/30 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9% (низшие) | 5/25 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | низкие | 2/12 |
| Grok-4.20 | — | 145 | ~140 | умеренные | 3/15 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | умеренные | 0.44/0.87 |
Картина: GPT-5.5 — гений-тестировщик — высший raw IQ, лучшая в математике и визуальном рассуждении. Claude — способный профессионал — лучшая в реальных задачах и фактической точности. Gemini — экономичный универсал. Grok — визуальный гений. А DeepSeek предлагает замечательную способность за часть стоимости.
7. Что это значит для людей?
GPT-5.5 работает на IQ ~145 — умнее 99.9% людей. Но:
- IQ узок: измеряет распознавание паттернов и рассуждение, не мудрость, креативность или суждение
- Гений на тестах ≠ гений в жизни: GPT-5.5 щёлкает IQ-тесты, но галлюцинирует факты и испытывает трудности с многошаговыми задачами
- Знание ≠ понимание: GPT-5.5 прочитала всё, но не «понимает» так, как человек
- Нет сознания: высокий IQ не значит sentience. GPT-5.5 — сложная система распознавания паттернов, не мыслящее существо
- Разрыв сокращается: каждое поколение AI уменьшает разрыв с умнейшими людьми
Самый честный ответ: GPT-5.5 умнее практически всех людей на когнитивных тестах, но не более способна, чем лучшие люди в реальной работе. Математик мирового класса может перехитрить GPT-5.5 в своей области. Но GPT-5.5 может перехитрить их всех одновременно, во всех областях, за секунды.
Заключение
- #2 на Artificial Analysis Intelligence Index (54.8) — после Claude Opus 4.8.
- #1 (совместно) на Mensa Norway IQ — высший raw IQ среди AI-моделей, совместно с Grok-4.20.
- Лучше всего для: визуального рассуждения, математического решения задач, научных знаний, абстрактного рассуждения.
- Не лучше всего для: агентных задач (Claude), фактической точности (Claude), эмоционального интеллекта (Claude).
- Парадокс: GPT-5.5 — умнейшая AI на IQ-тестах, но не самая способная AI на практике.
- Урок: IQ — одно измерение интеллекта. GPT-5.5 — гений-тестировщик; Claude — способный профессионал.
