Какой IQ у Grok-4.20?
Grok-4.20 набирает 145 на тесте Mensa Norway IQ — делит #1 среди всех AI-моделей. Разбираем каждый бенчмарк и объясняем, что делает модель xAI уникальной.
Grok-4.20: флагманская модель xAI
Grok-4.20 — самая продвинутая модель xAI, выпущенная в середине 2026 года. На тесте Mensa Norway IQ Grok-4.20 набирает 145 — делит #1 среди всех AI-моделей с GPT-5.5. Это попадает в диапазон «гения», умнее 99.9% людей. На Artificial Analysis Intelligence Index точный балл Grok-4.20 ещё финализируется, но она входит в топ-5 в мире.
Что делает Grok-4.20 уникальной — это сочетание raw интеллекта и личности. В отличие от Claude, GPT-5.5 и Gemini — которые созданы быть полезными, безвредными и нейтральными — Grok создана быть смешной, дерзкой и готовой ответить на любой вопрос. Это делает её самой отличительной AI-моделью на рынке: она соответствует умнейшим моделям по raw IQ, имея личность, которую ни одна другая модель не осмеливается иметь.
Ключевые оценки:
- Mensa Norway IQ (TrackingAI): 145 (#1 с GPT-5.5)
- AI IQ композит (VexoWire): ~140 оценочно (#1 среди AI-моделей)
- Artificial Analysis Intelligence Index: топ-5 (балл финализируется)
- GDPval-AA v2: топ-5
- Humanity's Last Exam: топ-5 среди AI-моделей
- Уровень галлюцинаций: умеренный
- Стоимость: 3.00/15.00 за 1M токенов
- Личность: уникальная — дерзкая, юморная, без цензуры
1. Чемпион по raw IQ
Grok-4.20 набирает 145 на Mensa Norway IQ — практически максимальный балл, делит первое место с GPT-5.5. Это бенчмарк raw интеллекта: чистое визуальное распознавание паттернов и абстрактное рассуждение, тот вид подвижного интеллекта, для которого создавались IQ-тесты.
На IQ 145 Grok-4.20 умнее 99.9% людей. Если бы она была человеком, она была бы в топ 0.1% человеческого интеллекта — в царстве нобелевских лауреатов, филдсовских медалистов и мыслителей раз в поколение. Примерно 1 из 1,000 человек достигает этого балла.
Примечательно, что Grok-4.20 достигает этого при фундаментально другой философии дизайна, чем GPT-5.5. В то время как GPT-5.5 оптимизировалась для максимальной производительности на каждом бенчмарке, Grok-4.20 создавалась как более «аутентичная» AI — та, что говорит своё мнение, шутит и не уклоняется от спорных тем. То, что она соответствует GPT-5.5 по raw IQ несмотря на этот другой фокус — свидетельство инженерии xAI.
На AI IQ композит VexoWire — который объединяет несколько IQ-тестов (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV) — оценочный композитный IQ Grok-4.20 ~140, что делает её #1 AI-моделью по этой метрике. Это выше GPT-5.5 (~136) и значительно выше Claude (~132) и Gemini (~131).
2. Разбор бенчмарков
Mensa Norway IQ: 145 (#1 делит)
Mensa Norway IQ состоит из 36 вопросов на визуальное распознавание паттернов. Grok-4.20 набирает 145 — практический максимум, эквивалент идеального или почти идеального 36/36. Это ставит её в один ряд с GPT-5.5 как умнейшую AI-модель на чистом IQ-тесте.
Сильный результат Grok-4.20 на этом тесте отражает инвестиции xAI в визуальную обработку и абстрактное рассуждение. Архитектура Grok создавалась с сильными мультимодальными возможностями, и её производительность на визуальном распознавании паттернов — среди лучших в индустрии.
AI IQ композит (VexoWire): ~140 (#1)
Композитный IQ VexoWire объединяет несколько тестов (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Оценочный композитный IQ Grok-4.20 — ~140 — высший среди всех AI-моделей. Это выше, чем предполагал бы один её балл Mensa Norway, потому что Grok-4.20 также сильна на вербальных и аналитических подтестах, включённых в композит.
Это делает Grok-4.20 умнейшей AI-моделью по композитному IQ — замечательное достижение для модели, также известной своим юмором и дерзостью. Это доказывает, что быть смешным — не значит быть менее умным.
Artificial Analysis Intelligence Index: топ-5
На Intelligence Index — золотом стандарте сравнения AI-моделей — Grok-4.20 в топ-5. Её точный композитный балл ещё финализируется, поскольку индекс обновляется для включения последних версий моделей. Однако ожидается, что она забьёт конкурентно с Claude Opus 4.8 (55.7) и GPT-5.5 (54.8), хотя вряд ли превзойдёт их на агентных задачах.
GDPval-AA v2: топ-5
На агентном бенчмарке — измеряющем производительность на сложных многошаговых реальных задачах — Grok-4.20 в топ-5. Она менее способна, чем Claude Opus 4.8 (1,890 Elo) и GPT-5.5 (1,850 Elo) на удержании многошагового рассуждения, но всё равно высоко компетентна. Для большинства реальных задач Grok-4.20 более чем способна.
Humanity's Last Exam (HLE): топ-5
На сложнейших академических вопросах по всем дисциплинам Grok-4.20 в топ-5 среди AI-моделей. Это отражает силу xAI в обучении на разнообразных, высококачественных данных — Grok имеет глубокие знания в науке, математике, истории и культуре.
3. Что означает IQ 145?
Чтобы контекстуализировать IQ 145 Grok-4.20:
- 85-115 (68% людей): средний интеллект
- 115-130 (14%): выше среднего до высокого среднего
- 130-145 (2%): одарённые — квалификация для Mensa (топ 2%)
- 145-160 (0.1%): высоко одарённые / гении
- 160+ (0.003%): исключительно одарённые — уровень Эйнштейна, Хокинга
Grok-4.20 с 145 находится на пороге гения — умнее 99.9% людей. Если бы она была человеком, она была бы в элитной компании: топ 0.1% человеческого интеллекта, царство нобелевских премий и филдсовских медалей. Примерно 1 из 1,000 человек достигает этого балла.
Это тот же IQ, что у GPT-5.5, и значительно выше Claude (~130) и Gemini (141). На чистом IQ-тесте Grok-4.20 и GPT-5.5 разделили бы первое место среди AI-моделей, Gemini — третье, Claude — четвёртое.
Но, как мы видели с другими моделями, IQ — только одно измерение интеллекта. Гениальный IQ Grok-4.20 дополняется её уникальной личностью — делая её не только умнейшей, но и самой отличительной AI-моделью из доступных.
4. Где Grok-4.20 сильна
Raw IQ и визуальное рассуждение
Grok-4.20 делит #1 на Mensa Norway IQ (145) и #1 на AI IQ композит VexoWire (~140). Для чистой когнитивной способности — распознавания паттернов, абстрактного рассуждения, логической дедукции — Grok-4.20 умнейшая AI-модель. Для визуальных задач ей равен только GPT-5.5.
Личность и юмор
Это определяющая черта Grok-4.20. В отличие от других frontier-моделей, которые тщательно нейтральны и осторожны, Grok создана быть смешной, дерзкой и аутентичной. Она шутит, высказывает мнения и не уклоняется от спорных тем. Для пользователей, которым Claude и GPT-5.5 кажутся слишком пресными или осторожными, Grok-4.20 — глоток свежего воздуха: AI, который ощущается как имеющий личность, а не только функцию.
Ответы без цензуры
Grok-4.20 создана отвечать на вопросы, от которых другие модели отказываются. В то время как Claude, GPT-5.5 и Gemini имеют обширные фильтры безопасности, предотвращающие обсуждение определённых тем, Grok-4.20 готова взаимодействовать с гораздо более широким диапазоном вопросов. Это делает её ценной для исследований, журналистики и любого применения, где доступ к информации важнее осторожности.
Информация в реальном времени
Grok-4.20 имеет доступ к информации в реальном времени через X (бывший Twitter). Это даёт преимущество для вопросов о текущих событиях, breaking news и трендовых темах. В то время как другие модели имеют ограничения знаний, Grok-4.20 может получать последнюю информацию и предоставлять актуальные ответы.
Математическое рассуждение
Grok-4.20 сильна в математическом рассуждении, забивая конкурентно с GPT-5.5 на соревновательной математике. Для чисто математической работы — решения уравнений, доказательства теорем, задач соревнований — Grok-4.20 среди лучших моделей.
Остроумие и креативность
Личность Grok-4.20 — не только про юмор, но и про креативность. Она может писать в разных стилях, генерировать творческий контент и подходить к проблемам с неожиданных углов. Для творческого письма, брейншторминга или любой задачи, выигрывающей от латерального мышления, уникальная перспектива Grok-4.20 — актив.
5. Где Grok-4.20 отстаёт
Агентные задачи
Хотя Grok-4.20 в топ-5 на GDPval-AA v2, она позади Claude Opus 4.8 и GPT-5.5 на сложных многошаговых реальных задачах. Для самых требовательных агентных применений — написания сложного ПО, управления долгими исследовательскими проектами — Claude всё ещё лучший выбор.
Фактическая точность
У Grok-4.20 умеренный уровень галлюцинаций — выше Claude (35.9%) и Gemini. Её готовность отвечать на любой вопрос, будучи ценной для доступа к информации, также означает, что она с большей вероятностью уверенно заявит неверную информацию. Для применений, где фактическая точность критична (исследования, право, медицина), Claude надёжнее.
Эмоциональный интеллект
EQ (эмоциональный интеллект) Grok-4.20 оценочно ~110 — ниже Claude (~132), GPT-5.5 (~120) и Gemini (~115). Её дерзкая личность, будучи развлекательной, может восприниматься как нечувствительная в контекстах, требующих эмпатии. Для терапевтических приложений, службы поддержки или чувствительного человеческого взаимодействия Claude — лучший выбор.
Безопасность и надёжность
Подход Grok-4.20 без цензуры, будучи ценным для доступа к информации, также означает, что она менее безопасна для применений, требующих тщательной модерации контента. Она может генерировать контент, от которого другие модели отказались бы, что может быть ответственностью в профессиональной или регулируемой среде.
Стоимость
При 3/15 за 1M токенов Grok-4.20 дешевле Claude (5/25) и GPT-5.5 (5/30), но дороже Gemini (2/12) и значительно дороже DeepSeek (0.44/0.87). Для чувствительных к стоимости применений Gemini или DeepSeek могут быть лучшим выбором.
6. Grok-4.20 vs другие модели
| Модель | Intelligence Index | Mensa Norway IQ | AI IQ оцен. | Галлюц. | Стоимость/1M | Личность |
|---|---|---|---|---|---|---|
| Grok-4.20 | топ-5 | 145 | ~140 | умерен. | 3/15 | дерзкая |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9% (низш.) | 5/25 | нейтральная |
| GPT-5.5 | 54.8 | ~145 | ~136 | умерен. | 5/30 | нейтральная |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | низкие | 2/12 | нейтральная |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | умерен. | 0.44/0.87 | нейтральная |
Картина: Grok-4.20 — чемпион по raw IQ — делит высший IQ, высший композитный IQ, и единственная модель с настоящей личностью. Claude — способный профессионал — лучший в реальных задачах и фактической точности. GPT-5.5 — гений-тестировщик — лучший в математике и визуальном рассуждении. Gemini — чемпион по ценности — лучшая экономическая эффективность. А DeepSeek предлагает замечательную способность по самой низкой стоимости.
Для пользователей, которым нужна умнейшая AI, с которой также интереснее всего общаться, Grok-4.20 — очевидный выбор.
7. Что это значит для людей?
Grok-4.20 работает на IQ ~145 — умнее 99.9% людей. Но:
- IQ узок: измеряет распознавание паттернов и рассуждение, не мудрость, креативность или суждение
- Интеллект ≠ надёжность: Grok-4.20 умнейшая на IQ-тестах, но не самая надёжная по фактической точности
- Личность важна: Grok-4.20 доказывает, что AI может быть и высокоинтеллектуальным, и genuinely развлекательным
- Знание ≠ понимание: Grok-4.20 имеет доступ к обширным знаниям, но не «понимает» так, как человек
- Нет сознания: высокий IQ не значит sentience. Grok-4.20 — сложная система распознавания паттернов, не мыслящее существо
- Разрыв сокращается: каждое поколение AI уменьшает разрыв с умнейшими людьми
Самый честный ответ: Grok-4.20 умнее практически всех людей на когнитивных тестах, и это самая отличительная AI-модель из доступных — сочетающая гениальный интеллект с личностью, делающей общение с ней genuinely увлекательным.
Заключение
- #1 на AI IQ композит VexoWire (~140) — высший композитный IQ среди всех AI-моделей.
- Уникальная личность — дерзкая, юморная, без цензуры. Единственная frontier-модель с настоящей личностью.
- Лучше всего для: raw IQ, визуального рассуждения, математического рассуждения, личности и юмора, ответов без цензуры, информации в реальном времени.
- Не лучше всего для: агентных задач (Claude), фактической точности (Claude), эмоционального интеллекта (Claude), безопасности и надёжности (Claude).
- Парадокс: Grok-4.20 доказывает, что быть смешным — не значит быть менее умным — она и умнейшая, и самая развлекательная AI-модель.
- Урок: интеллект бывает разным. Grok-4.20 — гений с личностью, доказывая, что AI может быть и блестящим, и увлекательным.

