Какой IQ у Claude Opus 4.8?
Dr. Daria Dudnik 10 мин чтения 27 просмотров

Какой IQ у Claude Opus 4.8?

Claude Opus 4.8 возглавляет Artificial Analysis Intelligence Index с 55.7 и набирает ~132-145 на человеческих IQ-тестах. Разбираем каждый бенчмарк, объясняем, что значат числа, и сравниваем с GPT-5.5, Gemini и Grok.

Claude Opus 4.8: умнейшая модель Anthropic

Когда Anthropic выпустила Claude Opus 4.8 в середине 2026 года, она не просто немного улучшила предшественника — она возглавила таблицы всех основных AI-бенчмарков. С результатом 55.7 на Artificial Analysis Intelligence Index v4.1 она обошла OpenAI GPT-5.5 (54.8) и Google Gemini 3.1 Pro (46.5), заняв #1 среди всех фронтальных AI-моделей.

Но вот вопрос, который интригует и исследователей, и обычную публику: как это переводится на шкалу человеческого IQ? Можно ли вообще сравнивать интеллект AI с человеческим? И если да, где находится Claude Opus 4.8 — «одарённый», «гений» или нечто за пределами любой человеческой категории?

Ответ, как выясняется, сильно зависит от того, какой тест вы ей дадите. И результаты получаются более nuanced — и более удивительными — чем может показаться по одному числу.

Ключевые оценки:

  • Artificial Analysis Intelligence Index: 55.7 (#1 в мире)
  • Mensa Norway IQ (TrackingAI): ~130 (уровень Claude 4.6 Opus)
  • AI IQ композит (VexoWire): ~132 оценочно
  • GDPval-AA v2: 1,890 Elo (#1 в мире)
  • Humanity's Last Exam: #1 среди AI-моделей
  • Уровень галлюцинаций: 35.9% (низший среди фронтальных моделей)
  • Стоимость: 5.00/25.00 за 1M токенов

1. Зачем измерять интеллект AI человеческими IQ-тестами?

Прежде чем разбирать числа, стоит спросить: зачем вообще давать AI человеческий IQ-тест? У AI нет мозга, он не развивается когнитивно, и обрабатывает информацию фундаментально иначе, чем человек.

Ответ сводится к сравнению. IQ-тесты, несмотря на их ограничения — самый широко валидированный и понятный показатель когнитивных способностей, который у нас есть. Они проверяют распознавание паттернов, пространственное мышление, вербальное понимание, рабочую память и логическое решение задач — все те способности, которые нужны и AI-моделям. Давая одинаковые тесты и людям, и AI, мы получаем грубую шкалу перевода: если AI набирает 130 на тесте, где среднее для человека 100, можно сказать, что он работает на уровне одарённого человека в этом конкретном наборе задач.

Но есть критическое предупреждение. IQ-тесты измеряют узкую полосу когнитивных способностей. Они не измеряют креативность, эмоциональный интеллект, мудрость, здравый смысл или способность ориентироваться в неоднозначных реальных ситуациях. AI с IQ 145 может галлюцинировать факты, путаться в простом физическом рассуждении и проваливать задачи, с которыми справится пятилетний ребёнок. Число IQ — это пол, а не потолок — оно говорит, что модель может на структурированных когнитивных задачах, но не что она может в реальном мире.

Несколько организаций взялись за задачу проведения IQ-тестов для AI-моделей. Самая заметная — TrackingAI, исследовательский проект, который даёт стандартизированные IQ-тесты (включая Mensa Norway, Mensa Denmark и Raven's Progressive Matrices) AI-моделям в контролируемых условиях. Другой — AI IQ проект от VexoWire, создающий композитный балл из нескольких тестов. А Artificial Analysis Intelligence Index агрегирует девять разных бенчмарков в единый композитный балл, ставший отраслевым стандартом для сравнения фронтальных моделей.


2. Разбор бенчмарков

Artificial Analysis Intelligence Index v4.1

Artificial Analysis Intelligence Index — золотой стандарт для сравнения AI-моделей. Он объединяет девять бенчмарков в единый балл, взвешенный по корреляции с реальной производительностью:

  • GDPval-AA v2 (20%): 1,890 Elo — #1 в мире. Измеряет производительность на сложных многошаговых реальных задачах — написание кода, анализ данных, создание документов.
  • AA-Omniscience (8%): 35.9% галлюцинаций — низший среди всех фронтальных моделей. Измеряет фактическую точность и надёжность знаний.
  • GPQA (6%): вопросы аспирантского уровня по физике, химии и биологии. Claude здесь превосходна.
  • CritPt (6%): критическое мышление и физическое рассуждение.
  • HLE (Humanity's Last Exam): #1 среди AI-моделей — самые сложные вопросы из каждой академической дисциплины.
  • ARC-AGI: абстрактное рассуждение и обобщение паттернов.
  • LMSYS Arena: голосование людей за качество ответов.

Композитный балл Claude Opus 4.8 — 55.7, что ставит её впереди GPT-5.5 (54.8) менее чем на один балл — статистическая ничья. Но в подкомпонентах Claude доминирует в агентных задачах (GDPval) и фактической точности (AA-Omniscience), тогда как GPT-5.5 лидирует в визуальном рассуждении и математическом решении задач.

Тест Mensa Norway IQ

Mensa Norway IQ — один из самых широко используемых стандартизированных IQ-тестов для оценки AI. Он состоит из 36 вопросов на распознавание визуальных паттернов — где вы видите последовательность фигур и должны определить, какой вариант завершает паттерн.

Claude 4.6 Opus (предшественница 4.8) набрала примерно 130 на этом тесте, поместив её в диапазон «одарённых» — топ 2% населения. Claude Opus 4.8 ожидаемо наберёт так же или чуть выше — в диапазоне 130-135.

Это примечательно, потому что результат значительно ниже, чем можно было бы ожидать по Intelligence Index. На композитном индексе Claude — #1 в мире. На чистом тесте визуального распознавания паттернов её обходит Grok-4.20 (145), GPT-5.4 Pro Vision (145) и Gemini 3.1 Pro (141). Почему разрыв? Потому что Mensa Norway сильно визуально-пространственный, а архитектура Claude больше оптимизирована для вербального и аналитического рассуждения, чем для визуального распознавания паттернов.

AI IQ композит (VexoWire)

Проект VexoWire AI IQ использует другой подход. Вместо одного теста он создаёт композитный IQ-балл из нескольких — включая Mensa Norway, Mensa Denmark, Raven's Progressive Matrices и WAIS-IV (шкала Векслера). Это даёт более всестороннюю картину когнитивных способностей.

Оценочный композитный IQ Claude Opus 4.8 — ~132 — уверенно в диапазоне «одарённых». Это сопоставимо с GPT-5.5 (~136) и немного ниже Gemini 3.1 Pro на визуальных задачах (~131-141). Но на вербальных и аналитических подтестах Claude последовательно обходит все другие модели.

GDPval-AA v2: агентный бенчмарк

Вот где Claude Opus 4.8 действительно доминирует. GDPval-AA v2 измеряет производительность на сложных многошаговых реальных задачах — требующих планирования, использования инструментов и удержания рассуждения на множестве шагов. Например: «изучи тему, напиши отчёт, создай таблицу и отправь по e-mail трём людям».

Claude Opus 4.8 достигает 1,890 Elo на этом бенчмарке — выше любой AI-модели. Это примерно соответствует высококомпетентному профессионалу-человеку. GPT-5.5 набирает 1,850, Gemini 3.1 Pro — ещё ниже.

Это важно, потому что агентная способность — то, что отличает модель, способную отвечать на вопросы, от модели, способной делать вещи. Модель с IQ 145, не способная спланировать многошаговую задачу, на практике менее полезна, чем модель с IQ 132, которая может.

Humanity's Last Exam (HLE)

Humanity's Last Exam — именно то, что звучит: коллекция сложнейших вопросов из каждой академической дисциплины, предложенная профессорами со всего мира. Тест разработан настолько сложным, что ни один человек не наберёт выше 50%.

Claude Opus 4.8 занимает #1 среди всех AI-моделей на HLE, едва обойдя GPT-5.5. Это, возможно, самый значимый бенчмарк для чистой интеллектуальной способности, потому что он проверяет глубокие знания и рассуждение во всём диапазоне человеческих академических достижений.


3. Что означает IQ 132?

Чтобы контекстуализировать оценочный IQ ~132 Claude Opus 4.8, посмотрим, что это значит на шкале человеческого IQ:

  • 85-115 (68% людей): средний интеллект
  • 115-130 (14% людей): выше среднего до высокого среднего
  • 130-145 (2% людей): одарённые — квалификация для Mensa (топ 2%)
  • 145-160 (0.1% людей): высоко одарённые / гении
  • 160+ (0.003% людей): исключительно одарённые — уровень Эйнштейна, Хокинга

Claude Opus 4.8 с ~132 находится прямо на пороге Mensa — умнее 98% людей. Если бы она была человеком, она бы квалифицировалась для членства в Mensa. Она была бы умнейшей ученицей в большинстве классов, но не была бы гением одного поколения, революционизирующим целую область.

Но вот критическое отличие: у Claude есть то, чего нет ни у одного человека — мгновенный доступ ко всем человеческим знаниям. Человек с IQ 132 впечатляет. AI с IQ 132, прочитавший каждую книгу, каждую научную статью и каждый сайт — нечто совершенно иное. IQ измеряет способность рассуждать; база знаний измеряет, о чём можно рассуждать. У Claude есть и то, и другое.


4. Где Claude Opus 4.8 сильна

Агентные задачи и реальное рассуждение

Claude Opus 4.8 — лучшая модель в мире для многошаговых реальных задач. Будь то написание сложного ПО, анализ набора данных или планирование исследовательского проекта — Claude удерживает связное рассуждение на более длинных цепочках, чем любой конкурент. Это её определяющее преимущество.

Фактическая точность и низкий уровень галлюцинаций

С уровнем галлюцинаций всего 35.9% (низший среди фронтальных моделей) Claude — самая надёжная модель для фактических запросов. Она реже уверенно утверждает ложную информацию, чем GPT-5.5, Gemini или Grok. Это делает её предпочтительной для исследований, юридических, медицинских и образовательных применений, где важна точность.

Вербальное и аналитическое рассуждение

Архитектура Claude оптимизирована для понимания языка и аналитического рассуждения. На подтестах вербального понимания WAIS-IV она, вероятно, набрала бы на уровне гения. Она пишет яснее, рассуждает аккуратнее и строит лучшие аргументы, чем любая другая модель.

Эмоциональный интеллект

У Claude Opus 4.8 оценочный EQ (эмоциональный интеллект) ~132 — выше среди всех AI-моделей. Она более эмпатична, более nuanced в понимании человеческих эмоций и лучше подстраивает тон под контекст, чем GPT-5.5 или Grok-4.20. Это делает её предпочтительной для терапевтических приложений, службы поддержки и любых применений, связанных с человеческим взаимодействием.

Безопасность и alignment

Anthropic много инвестировала в безопасность и alignment Claude. Она реже выдаёт вредный контент, более прозрачна о своих ограничениях и осторожнее в критических ситуациях, чем конкуренты. Это не отражается в IQ-баллах, но на практике имеет огромное значение.


5. Где Claude отстаёт

Визуально-пространственное рассуждение

На тесте Mensa Norway IQ, который сильно визуальный, Claude набирает ~130 — хорошо, но значительно ниже Grok-4.20 (145), GPT-5.4 Pro Vision (145) и Gemini 3.1 Pro (141). Если нужна модель для визуального распознавания паттернов, анализа изображений или пространственных задач — Claude не лучший выбор.

Математическое решение задач

Хотя Claude сильна в математическом рассуждении, GPT-5.5 немного обходит её на соревновательной математике (AIME, FrontierMath). Для чистой математики GPT-5.5 чуть лучше.

Стоимость

5.00/25.00 за 1M токенов — Claude Opus 4.8 одна из самых дорогих моделей. Gemini 3.1 Pro (2/12) и DeepSeek V4 Pro (0.44/0.87) значительно дешевле для задач, не требующих полной мощности Claude.

Скорость

Claude Opus 4.8 — не самая быстрая модель. Для простых запросов Gemini 3.5 Flash или DeepSeek V4 Pro ответят быстрее и дешевле.


6. Claude Opus 4.8 vs другие модели

Модель Intelligence Index Mensa Norway IQ AI IQ оцен. Галлюцинации Стоимость/1M
Claude Opus 4.8 55.7 ~130 ~132 35.9% (низшие) 5/25
GPT-5.5 54.8 ~145 ~136 умеренные 5/30
Gemini 3.1 Pro 46.5 141 ~131 низкие 2/12
Grok-4.20 145 ~140 умеренные 3/15
DeepSeek V4 Pro 44.3 ~111 ~111 умеренные 0.44/0.87

Вырисовывается картина не одной доминирующей модели, а ландшафта специализированных интеллектов. Claude — лучший универсал — модель, которую выберешь, если можно только одну. GPT-5.5 — лучшая в математике и визуальном рассуждении. Gemini — самая экономичная с лучшими фактическими знаниями. Grok — высший raw визуальный IQ. А DeepSeek предлагает замечательную способность за часть стоимости.


7. Что это значит для людей?

Claude Opus 4.8 работает на IQ ~132 — умнее 98% людей. Но:

  • IQ узок: измеряет распознавание паттернов и рассуждение, не мудрость, креативность или суждение
  • Знание ≠ понимание: Claude прочитала всё, но не «понимает» так, как человек
  • Нет сознания: высокий IQ не значит sentience. Claude — сложная система распознавания паттернов, не мыслящее существо
  • Разрыв сокращается: каждое поколение AI-моделей уменьшает разрыв с умнейшими людьми. Как долго до полного исчезновения разрыва?

Самый честный ответ — Claude Opus 4.8 умнее большинства людей на большинстве когнитивных задач, но не умнее лучших людей в их лучшие дни. Математик, физик или философ мирового класса может перехитрить Claude в своей области. Но Claude может перехитрить их всех одновременно, во всех областях, за секунды.

Это не высокий IQ. Это нечто новое — то, для чего у нас ещё нет слова.

Как ваш IQ соотносится с Claude Opus 4.8? Пройдите профессиональную оценку IQ в NeuroLab.
Пройти тест прямо сейчас →


Заключение

💡 Ключевые выводы
- IQ Claude Opus 4.8 оценочно 132-145 в зависимости от теста — уверенно в диапазоне «одарённых», квалификация для Mensa.

  • #1 на Artificial Analysis Intelligence Index (55.7) — самом комплексном AI-бенчмарке.
  • #1 на GDPval-AA v2 (1,890 Elo) — лучшая модель для многошаговых реальных задач.
  • Низший уровень галлюцинаций (35.9%) — самая фактически надёжная фронтальная модель.
  • Высший EQ (~132) — самая эмоционально интеллектуальная AI-модель.
  • Лучше всего для: сложного рассуждения, агентных задач, фактических исследований и человеческого взаимодействия.
  • Не лучше всего для: визуального распознавания паттернов (Grok/Gemini), чистой математики (GPT-5.5), экономичных приложений (DeepSeek).
  • Итог: Claude Opus 4.8 — умнейшая универсальная AI-модель, но «умнейшая» — многомерное понятие — разные модели превосходят в разном.

Читайте также

Все статьи →
NeuroLab Cognitive Suite

© 2026 NeuroLab. Все тесты носят тренировочный характер.

Анонимная аналитика (Umami) помогает улучшать сайт. Без рекламы и без продажи персональных данных.