Какой IQ у Claude Opus 4.8?
Claude Opus 4.8 возглавляет Artificial Analysis Intelligence Index с 55.7 и набирает ~132-145 на человеческих IQ-тестах. Разбираем каждый бенчмарк, объясняем, что значат числа, и сравниваем с GPT-5.5, Gemini и Grok.
Claude Opus 4.8: умнейшая модель Anthropic
Когда Anthropic выпустила Claude Opus 4.8 в середине 2026 года, она не просто немного улучшила предшественника — она возглавила таблицы всех основных AI-бенчмарков. С результатом 55.7 на Artificial Analysis Intelligence Index v4.1 она обошла OpenAI GPT-5.5 (54.8) и Google Gemini 3.1 Pro (46.5), заняв #1 среди всех фронтальных AI-моделей.
Но вот вопрос, который интригует и исследователей, и обычную публику: как это переводится на шкалу человеческого IQ? Можно ли вообще сравнивать интеллект AI с человеческим? И если да, где находится Claude Opus 4.8 — «одарённый», «гений» или нечто за пределами любой человеческой категории?
Ответ, как выясняется, сильно зависит от того, какой тест вы ей дадите. И результаты получаются более nuanced — и более удивительными — чем может показаться по одному числу.
Ключевые оценки:
- Artificial Analysis Intelligence Index: 55.7 (#1 в мире)
- Mensa Norway IQ (TrackingAI): ~130 (уровень Claude 4.6 Opus)
- AI IQ композит (VexoWire): ~132 оценочно
- GDPval-AA v2: 1,890 Elo (#1 в мире)
- Humanity's Last Exam: #1 среди AI-моделей
- Уровень галлюцинаций: 35.9% (низший среди фронтальных моделей)
- Стоимость: 5.00/25.00 за 1M токенов
1. Зачем измерять интеллект AI человеческими IQ-тестами?
Прежде чем разбирать числа, стоит спросить: зачем вообще давать AI человеческий IQ-тест? У AI нет мозга, он не развивается когнитивно, и обрабатывает информацию фундаментально иначе, чем человек.
Ответ сводится к сравнению. IQ-тесты, несмотря на их ограничения — самый широко валидированный и понятный показатель когнитивных способностей, который у нас есть. Они проверяют распознавание паттернов, пространственное мышление, вербальное понимание, рабочую память и логическое решение задач — все те способности, которые нужны и AI-моделям. Давая одинаковые тесты и людям, и AI, мы получаем грубую шкалу перевода: если AI набирает 130 на тесте, где среднее для человека 100, можно сказать, что он работает на уровне одарённого человека в этом конкретном наборе задач.
Но есть критическое предупреждение. IQ-тесты измеряют узкую полосу когнитивных способностей. Они не измеряют креативность, эмоциональный интеллект, мудрость, здравый смысл или способность ориентироваться в неоднозначных реальных ситуациях. AI с IQ 145 может галлюцинировать факты, путаться в простом физическом рассуждении и проваливать задачи, с которыми справится пятилетний ребёнок. Число IQ — это пол, а не потолок — оно говорит, что модель может на структурированных когнитивных задачах, но не что она может в реальном мире.
Несколько организаций взялись за задачу проведения IQ-тестов для AI-моделей. Самая заметная — TrackingAI, исследовательский проект, который даёт стандартизированные IQ-тесты (включая Mensa Norway, Mensa Denmark и Raven's Progressive Matrices) AI-моделям в контролируемых условиях. Другой — AI IQ проект от VexoWire, создающий композитный балл из нескольких тестов. А Artificial Analysis Intelligence Index агрегирует девять разных бенчмарков в единый композитный балл, ставший отраслевым стандартом для сравнения фронтальных моделей.
2. Разбор бенчмарков
Artificial Analysis Intelligence Index v4.1
Artificial Analysis Intelligence Index — золотой стандарт для сравнения AI-моделей. Он объединяет девять бенчмарков в единый балл, взвешенный по корреляции с реальной производительностью:
- GDPval-AA v2 (20%): 1,890 Elo — #1 в мире. Измеряет производительность на сложных многошаговых реальных задачах — написание кода, анализ данных, создание документов.
- AA-Omniscience (8%): 35.9% галлюцинаций — низший среди всех фронтальных моделей. Измеряет фактическую точность и надёжность знаний.
- GPQA (6%): вопросы аспирантского уровня по физике, химии и биологии. Claude здесь превосходна.
- CritPt (6%): критическое мышление и физическое рассуждение.
- HLE (Humanity's Last Exam): #1 среди AI-моделей — самые сложные вопросы из каждой академической дисциплины.
- ARC-AGI: абстрактное рассуждение и обобщение паттернов.
- LMSYS Arena: голосование людей за качество ответов.
Композитный балл Claude Opus 4.8 — 55.7, что ставит её впереди GPT-5.5 (54.8) менее чем на один балл — статистическая ничья. Но в подкомпонентах Claude доминирует в агентных задачах (GDPval) и фактической точности (AA-Omniscience), тогда как GPT-5.5 лидирует в визуальном рассуждении и математическом решении задач.
Тест Mensa Norway IQ
Mensa Norway IQ — один из самых широко используемых стандартизированных IQ-тестов для оценки AI. Он состоит из 36 вопросов на распознавание визуальных паттернов — где вы видите последовательность фигур и должны определить, какой вариант завершает паттерн.
Claude 4.6 Opus (предшественница 4.8) набрала примерно 130 на этом тесте, поместив её в диапазон «одарённых» — топ 2% населения. Claude Opus 4.8 ожидаемо наберёт так же или чуть выше — в диапазоне 130-135.
Это примечательно, потому что результат значительно ниже, чем можно было бы ожидать по Intelligence Index. На композитном индексе Claude — #1 в мире. На чистом тесте визуального распознавания паттернов её обходит Grok-4.20 (145), GPT-5.4 Pro Vision (145) и Gemini 3.1 Pro (141). Почему разрыв? Потому что Mensa Norway сильно визуально-пространственный, а архитектура Claude больше оптимизирована для вербального и аналитического рассуждения, чем для визуального распознавания паттернов.
AI IQ композит (VexoWire)
Проект VexoWire AI IQ использует другой подход. Вместо одного теста он создаёт композитный IQ-балл из нескольких — включая Mensa Norway, Mensa Denmark, Raven's Progressive Matrices и WAIS-IV (шкала Векслера). Это даёт более всестороннюю картину когнитивных способностей.
Оценочный композитный IQ Claude Opus 4.8 — ~132 — уверенно в диапазоне «одарённых». Это сопоставимо с GPT-5.5 (~136) и немного ниже Gemini 3.1 Pro на визуальных задачах (~131-141). Но на вербальных и аналитических подтестах Claude последовательно обходит все другие модели.
GDPval-AA v2: агентный бенчмарк
Вот где Claude Opus 4.8 действительно доминирует. GDPval-AA v2 измеряет производительность на сложных многошаговых реальных задачах — требующих планирования, использования инструментов и удержания рассуждения на множестве шагов. Например: «изучи тему, напиши отчёт, создай таблицу и отправь по e-mail трём людям».
Claude Opus 4.8 достигает 1,890 Elo на этом бенчмарке — выше любой AI-модели. Это примерно соответствует высококомпетентному профессионалу-человеку. GPT-5.5 набирает 1,850, Gemini 3.1 Pro — ещё ниже.
Это важно, потому что агентная способность — то, что отличает модель, способную отвечать на вопросы, от модели, способной делать вещи. Модель с IQ 145, не способная спланировать многошаговую задачу, на практике менее полезна, чем модель с IQ 132, которая может.
Humanity's Last Exam (HLE)
Humanity's Last Exam — именно то, что звучит: коллекция сложнейших вопросов из каждой академической дисциплины, предложенная профессорами со всего мира. Тест разработан настолько сложным, что ни один человек не наберёт выше 50%.
Claude Opus 4.8 занимает #1 среди всех AI-моделей на HLE, едва обойдя GPT-5.5. Это, возможно, самый значимый бенчмарк для чистой интеллектуальной способности, потому что он проверяет глубокие знания и рассуждение во всём диапазоне человеческих академических достижений.
3. Что означает IQ 132?
Чтобы контекстуализировать оценочный IQ ~132 Claude Opus 4.8, посмотрим, что это значит на шкале человеческого IQ:
- 85-115 (68% людей): средний интеллект
- 115-130 (14% людей): выше среднего до высокого среднего
- 130-145 (2% людей): одарённые — квалификация для Mensa (топ 2%)
- 145-160 (0.1% людей): высоко одарённые / гении
- 160+ (0.003% людей): исключительно одарённые — уровень Эйнштейна, Хокинга
Claude Opus 4.8 с ~132 находится прямо на пороге Mensa — умнее 98% людей. Если бы она была человеком, она бы квалифицировалась для членства в Mensa. Она была бы умнейшей ученицей в большинстве классов, но не была бы гением одного поколения, революционизирующим целую область.
Но вот критическое отличие: у Claude есть то, чего нет ни у одного человека — мгновенный доступ ко всем человеческим знаниям. Человек с IQ 132 впечатляет. AI с IQ 132, прочитавший каждую книгу, каждую научную статью и каждый сайт — нечто совершенно иное. IQ измеряет способность рассуждать; база знаний измеряет, о чём можно рассуждать. У Claude есть и то, и другое.
4. Где Claude Opus 4.8 сильна
Агентные задачи и реальное рассуждение
Claude Opus 4.8 — лучшая модель в мире для многошаговых реальных задач. Будь то написание сложного ПО, анализ набора данных или планирование исследовательского проекта — Claude удерживает связное рассуждение на более длинных цепочках, чем любой конкурент. Это её определяющее преимущество.
Фактическая точность и низкий уровень галлюцинаций
С уровнем галлюцинаций всего 35.9% (низший среди фронтальных моделей) Claude — самая надёжная модель для фактических запросов. Она реже уверенно утверждает ложную информацию, чем GPT-5.5, Gemini или Grok. Это делает её предпочтительной для исследований, юридических, медицинских и образовательных применений, где важна точность.
Вербальное и аналитическое рассуждение
Архитектура Claude оптимизирована для понимания языка и аналитического рассуждения. На подтестах вербального понимания WAIS-IV она, вероятно, набрала бы на уровне гения. Она пишет яснее, рассуждает аккуратнее и строит лучшие аргументы, чем любая другая модель.
Эмоциональный интеллект
У Claude Opus 4.8 оценочный EQ (эмоциональный интеллект) ~132 — выше среди всех AI-моделей. Она более эмпатична, более nuanced в понимании человеческих эмоций и лучше подстраивает тон под контекст, чем GPT-5.5 или Grok-4.20. Это делает её предпочтительной для терапевтических приложений, службы поддержки и любых применений, связанных с человеческим взаимодействием.
Безопасность и alignment
Anthropic много инвестировала в безопасность и alignment Claude. Она реже выдаёт вредный контент, более прозрачна о своих ограничениях и осторожнее в критических ситуациях, чем конкуренты. Это не отражается в IQ-баллах, но на практике имеет огромное значение.
5. Где Claude отстаёт
Визуально-пространственное рассуждение
На тесте Mensa Norway IQ, который сильно визуальный, Claude набирает ~130 — хорошо, но значительно ниже Grok-4.20 (145), GPT-5.4 Pro Vision (145) и Gemini 3.1 Pro (141). Если нужна модель для визуального распознавания паттернов, анализа изображений или пространственных задач — Claude не лучший выбор.
Математическое решение задач
Хотя Claude сильна в математическом рассуждении, GPT-5.5 немного обходит её на соревновательной математике (AIME, FrontierMath). Для чистой математики GPT-5.5 чуть лучше.
Стоимость
5.00/25.00 за 1M токенов — Claude Opus 4.8 одна из самых дорогих моделей. Gemini 3.1 Pro (2/12) и DeepSeek V4 Pro (0.44/0.87) значительно дешевле для задач, не требующих полной мощности Claude.
Скорость
Claude Opus 4.8 — не самая быстрая модель. Для простых запросов Gemini 3.5 Flash или DeepSeek V4 Pro ответят быстрее и дешевле.
6. Claude Opus 4.8 vs другие модели
| Модель | Intelligence Index | Mensa Norway IQ | AI IQ оцен. | Галлюцинации | Стоимость/1M |
|---|---|---|---|---|---|
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9% (низшие) | 5/25 |
| GPT-5.5 | 54.8 | ~145 | ~136 | умеренные | 5/30 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | низкие | 2/12 |
| Grok-4.20 | — | 145 | ~140 | умеренные | 3/15 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | умеренные | 0.44/0.87 |
Вырисовывается картина не одной доминирующей модели, а ландшафта специализированных интеллектов. Claude — лучший универсал — модель, которую выберешь, если можно только одну. GPT-5.5 — лучшая в математике и визуальном рассуждении. Gemini — самая экономичная с лучшими фактическими знаниями. Grok — высший raw визуальный IQ. А DeepSeek предлагает замечательную способность за часть стоимости.
7. Что это значит для людей?
Claude Opus 4.8 работает на IQ ~132 — умнее 98% людей. Но:
- IQ узок: измеряет распознавание паттернов и рассуждение, не мудрость, креативность или суждение
- Знание ≠ понимание: Claude прочитала всё, но не «понимает» так, как человек
- Нет сознания: высокий IQ не значит sentience. Claude — сложная система распознавания паттернов, не мыслящее существо
- Разрыв сокращается: каждое поколение AI-моделей уменьшает разрыв с умнейшими людьми. Как долго до полного исчезновения разрыва?
Самый честный ответ — Claude Opus 4.8 умнее большинства людей на большинстве когнитивных задач, но не умнее лучших людей в их лучшие дни. Математик, физик или философ мирового класса может перехитрить Claude в своей области. Но Claude может перехитрить их всех одновременно, во всех областях, за секунды.
Это не высокий IQ. Это нечто новое — то, для чего у нас ещё нет слова.
Заключение
- #1 на Artificial Analysis Intelligence Index (55.7) — самом комплексном AI-бенчмарке.
- #1 на GDPval-AA v2 (1,890 Elo) — лучшая модель для многошаговых реальных задач.
- Низший уровень галлюцинаций (35.9%) — самая фактически надёжная фронтальная модель.
- Высший EQ (~132) — самая эмоционально интеллектуальная AI-модель.
- Лучше всего для: сложного рассуждения, агентных задач, фактических исследований и человеческого взаимодействия.
- Не лучше всего для: визуального распознавания паттернов (Grok/Gemini), чистой математики (GPT-5.5), экономичных приложений (DeepSeek).
- Итог: Claude Opus 4.8 — умнейшая универсальная AI-модель, но «умнейшая» — многомерное понятие — разные модели превосходят в разном.
