Какой IQ у Claude Opus 4.8?
Claude Opus 4.8 возглавляет Artificial Analysis Intelligence Index с баллом 55.7. Но как это переводится на шкалу человеческого IQ? Разбираем бенчмарки, оценки и их значение.
Claude Opus 4.8: умнейшая модель Anthropic
Claude Opus 4.8 — флагманская AI-модель Anthropic, выпущенная в середине 2026 года. Она возглавляет Artificial Analysis Intelligence Index v4.1 с баллом 55.7, незначительно опережая GPT-5.5 от OpenAI (54.8).
Но как это соотносится с человеческим IQ? Ответ зависит от бенчмарка.
- Mensa Norway IQ (TrackingAI): ~130 (уровень Claude 4.6 Opus)
- AI IQ композит (VexoWire): ~132 оценочный
- GDPval-AA v2: 1,890 Elo (#1 в мире)
- Humanity's Last Exam: #1 среди AI-моделей
1. Разбор бенчмарков
Artificial Analysis Intelligence Index v4.1
Claude Opus 4.8 набирает 55.7 — композит из девяти тестов:
- GDPval-AA v2 (20%): 1,890 Elo — #1
- Terminal-Bench 2.1 (16%): сильный результат
- τ³-Bench Banking (14%): сильный результат
- Humanity's Last Exam (12%): #1
- GPQA (6%), SciCode (8%), AA-Omniscience (8%)
Тест Mensa Norway
На бенчмарке TrackingAI (апрель 2026) Claude 4.6 Opus набрал 130. Opus 4.8 ожидается на уровне 132-135.
AI IQ композит
Проект AI IQ оценивает Claude Opus 4.7 в ~132. Opus 4.8 вероятно на уровне ~134-136.
Тест iqscore.io
Claude Sonnet 5 набрал 145 (идеально 36/36). Opus 4.8 вероятно matched или превзошёл бы это.
2. Где Claude Opus 4.8 силён
Агентные задачи
Opus 4.8 лидирует в GDPval-AA v2 с 1,890 Elo — ~67% win rate против GPT-5.5. Это измеряет реальную интеллектуальную работу.
Научное мышление
Opus 4.8 лидирует в Humanity's Last Exam, обойдя OpenAI и Google. Также превосходит Gemini 3.1 Pro в CritPt (физика).
Низкий уровень галлюцинаций
35.9% — существенно ниже, чем у Google и OpenAI. AA-Omniscience: 27.4, #2 после Gemini 3.1 Pro.
Эффективность
Opus 4.8 использует на 15% меньше ходов и на 35% меньше токенов, чем Opus 4.7, при росте балла на 4 пункта.
3. Где он отстаёт
Стоимость
5.00/25.00 за 1M токенов — дорого. DeepSeek V4 Pro: 0.04 за задачу vs.1.78 у Opus 4.8.
Скорость
~6.4 минуты на задачу. Gemini 3.5 Flash — 1.6 минуты при балле 50.2.
Пространственное мышление
На визуальном тесте Mensa Norway модели Claude исторически набирают меньше, чем vision-модели (GPT-5.4 Pro: 145, Grok-4.20: 145).
4. Сравнение с другими моделями
| Модель | Intelligence Index | Оценочный IQ | Цена/1M токенов |
|---|---|---|---|
| Claude Opus 4.8 | 55.7 | ~132-145 | 5/25 |
| GPT-5.5 | 54.8 | ~136 | 5/30 |
| Gemini 3.1 Pro | 46.5 | ~131 | 2/12 |
| Grok-4.20 | — | 145 | 3/15 |
| DeepSeek V4 Pro | 44.3 | ~111 | 0.44/0.87 |
5. Что это значит для людей?
Claude Opus 4.8 работает на когнитивном уровне, превышающем 98% людей по стандартным IQ-тестам. Но:
- AI IQ «зубчатый»: силён в анализе, но не может завязать шнурки
- Распознавание паттернов ≠ понимание: решает задачи без сознания
- Бенчмарки можно оптимизировать: данные обучения могут включать похожие задачи
- Человеческий IQ шире: эмоциональный, социальный, физический интеллект важны
Заключение
- Возглавляет Artificial Analysis Intelligence Index: 55.7, впереди GPT-5.5.
- #1 по агентным задачам (GDPval-AA) и Humanity's Last Exam.
- Самый низкий уровень галлюцинаций среди前沿-моделей.
- Дорогой, но способный: лучше всего для сложной интеллектуальной работы.
- AI IQ ≠ человеческий IQ: оценки измеряют конкретные когнитивные измерения.