Может ли AI сравниться с Илоном Маском? Оценка IQ LLM vs людей
NeuroLab Team 12 мин чтения 0 просмотров

Может ли AI сравниться с Илоном Маском? Оценка IQ LLM vs людей

Как GPT-4, Claude и Gemini справляются с реальными IQ-тестами по сравнению с людьми уровня Илона Маска? Анализируем когнитивные способности AI, fluid reasoning и что LLM могут и не могут.

Вопрос, который не отпускает

Каждые несколько месяцев вирусным становится заголовок: «AI проходит IQ-тест с результатом 155». Подразумевается: искусственный интеллект превзошёл человеческий гений, Илоны Маски мира не нужны. Но хоть что-то из этого правда?

Короткий ответ: нет. Развёрнутый ответ требует понимания того, что измеряют IQ-тесты, как большие языковые модели (LLM) обрабатывают информацию и почему сравнивать человеческий и машинный интеллект — это как сравнивать подводную лодку с пловцом.

Эта статья рассматривает реальные доказательства — рецензируемые исследования когнитивных способностей LLM, структуру IQ-тестов и то, что мы знаем о когнитивном профиле Илона Маска — чтобы дать честный ответ.

Что на самом деле измеряют IQ-тесты

IQ-тесты — не единая мера «умности». Они оценивают иерархию когнитивных способностей, обычно организованную в модель Cattell-Horn-Carroll (CHC):

  • Подвижный интеллект (Gf): решение новых задач без опоры на предыдущие знания
  • Кристаллизованный интеллект (Gc): накопленные знания и словарный запас
  • Количественное мышление (Gq): распознавание числовых закономерностей
  • Визуальная обработка (Gv): пространственное и геометрическое мышление
  • Рабочая память (Gwm): удержание и преобразование информации в уме
  • Скорость обработки (Gs): быстрота когнитивной переработки

Полный IQ-балл агрегирует эти показатели, но профиль важнее числа. Два человека с IQ 130 могут иметь совершенно разные профили способностей — один может преуспевать в вербальном мышлении, но испытывать трудности с пространственными задачами, а другой — наоборот.

155
IQ-балл, который часто приписывают Илону Маску в интернете — без какого-либо первоисточника

Как тестировали LLM

Несколько исследований проводили человеческие IQ-тесты с большими языковыми моделями. Наиболее строгие:

Bubeck et al. (2023) протестировали GPT-4 по шкале WAIS-IV (Wechsler), обнаружив, что модель выполняет вербальные подтесты — Словарь, Сходства, Информация — на уровне 99-го перцентиля или выше, но испытывает трудности с задачами пространственного мышления, требующими визуальной обработки. Исследование оценило «вербальный IQ» GPT-4 приблизительно в 155.

Zhu et al. (2023) провели Прогрессивные матрицы Равена (невербальный подвижный интеллект) на нескольких LLM. GPT-4 набрал в диапазоне 75-90-го перцентиля — достойно, но далеко от гениального уровня. Авторы отметили, что LLM часто решают матричные задачи через сопоставление паттернов в обучающих данных, а не через подлинное рассуждение.

Собственные оценки OpenAI (2023-2024) показывают, что GPT-4 набирает 163 на вербальной части SAT (99-й перцентиль), но только 710/800 на математической — сильно, но не исключительно по стандартам элитных университетов.

Вербальная иллюзия: почему оценки AI выглядят завышенными

Вот главная проблема: IQ-тесты сильно вербальны, а LLM обучены на тексте.

WAIS-IV содержит 10 основных подтестов. Пять преимущественно вербальные: Словарь, Сходства, Информация, Понимание, Арифметика. Для них LLM имеет огромное преимущество — она поглотила практически весь опубликованный текст в обучающих данных. На вопрос «В чём сходство между часами и календарём?» модель не рассуждает — она извлекает ответ из своей статистической модели языка.

Это кристаллизованный интеллект (Gc), а не подвижное рассуждение. И именно здесь LLM выглядят наиболее впечатляюще. Но кристаллизованный интеллект менее всего предсказывает реальное решение задач и инновации. Он измеряет, что вы знаете, а не как вы думаете.

💡 Ключевое различие
LLM превосходят в кристаллизованном интеллекте (знании фактов), но показывают смешанные результаты в подвижном рассуждении (решении новых задач). IQ-тесты перегружены вербальными/кристаллизованными способностями, из-за чего оценки AI кажутся выше их реальной способности решать задачи.

Где LLM проигрывают: разрыв Маска

Когнитивный профиль Илона Маска — на основе его баллов SAT и карьерных паттернов — асимметричен: очень высокий подвижный интеллект, исключительные пространственные способности, сильные, но не элитные вербальные навыки. Это именно тот профиль, где LLM работают хуже всего.

Пространственное мышление (Gv): LLM не могут изначально обрабатывать визуально-пространственную информацию. Когда их просят мысленно вращать 3D-объекты или визуализировать траектории ракет, они терпят неудачу или используют текстовые обходные пути. Способность Маска визуализировать компоненты ракеты и их взаимодействие в голове — ключевой фактор в SpaceX — не имеет LLM-эквивалента.

Манипуляция рабочей памятью (Gwm): Хотя у LLM большие контекстные окна, они не манипулируют информацией в рабочей памяти так, как люди. Они сопоставляют паттерны, они не удерживают ментальную модель и преобразуют её. Способность Маска одновременно держать в уме множество инженерных компромиссов и обновлять их в реальном времени — функция рабочей памяти, которую текущий AI не может воспроизвести.

Рассуждение от первых принципов: Фирменная когнитивная стратегия Маска — разложение задач до фундаментальной физики и построение вверх — требует подлинного подвижного рассуждения, а не извлечения. Когда LLM пытаются рассуждать от первых принципов, они часто производят правдоподобно звучащие, но логически ошибочные цепочки, потому что интерполируют между обучающими примерами, а не рассуждают от аксиом.

Трансферное обучение между областями: Маск применяет один и тот же когнитивный инструментарий к ракетам, автомобилям, нейроинтерфейсам и социальным медиа. LLM могут генерировать текст обо всех этих областях, но не могут перенести стратегию решения из одной области в другую так, как это делает человек-эксперт.

✓ За
  • LLM: Огромный кристаллизованный интеллект (Gc)
  • LLM: Быстрая генерация и извлечение текста
  • LLM: Последовательны, неутомимы, масштабируемы
  • LLM: Сильны на стандартизированных вербальных тестах
✗ Против
  • LLM: Слабое пространственное мышление (Gv)
  • LLM: Нет подлинной манипуляции рабочей памятью
  • LLM: Рассуждение от первых принципов часто ломается
  • LLM: Слабый перенос стратегий между областями

Проблема бенчмарков

Есть более глубокая методологическая проблема: IQ-тесты разработаны для людей, а не для машин.

Когда человек проходит Прогрессивные матрицы Равена, он использует комбинацию рабочей памяти, визуальной обработки и подвижного рассуждения. Когда LLM проходит тот же тест (конвертированный в текст), он использует статистическое сопоставление паттернов с обучающими данными. Это фундаментально разные когнитивные процессы, которые случается давать похожий результат на конкретном тесте.

Это проблема закона Гудхарта: когда мера становится целью, она перестаёт быть хорошей мерой. Если мы оптимизируем AI для высоких баллов на IQ-тестах, мы не делаем AI умнее — мы делаем его лучше в прохождении IQ-тестов.

Более честное сравнение использовало бы тесты, разработанные для различения человеческого познания и статистического сопоставления паттернов:

  • Новые физические задачи, которых нет в обучающих данных
  • Многошаговое пространственное рассуждение, требующее ментального моделирования
  • Адверсариальные вопросы, разработанные для выявления шорткатов сопоставления паттернов
  • Принятие решений в реальном времени в новых условиях

По этим меркам текущие LLM работают значительно ниже уровня человеческого эксперта.

Что на самом деле говорят цифры

Будем конкретны. Сравним оценочный когнитивный профиль Маска (из конвертации SAT) с измеренными показателями GPT-4:

Способность Маск (оценка) GPT-4 (измерено)
Вербальный/Кристаллизованный (Gc) ~130-135 ~155+
Подвижный интеллект (Gf) ~140-145 ~115-125
Пространственный (Gv) ~145+ ~80-90
Рабочая память (Gwm) ~135-140 Н/Д (неприменимо)
Скорость обработки (Gs) ~120-130 Очень быстро, но другой механизм

Картина ясна: LLM доминируют в кристаллизованном интеллекте, но значительно отстают в подвижном рассуждении, пространственных способностях и манипуляции рабочей памятью — именно тех способностях, которые движут инженерные инновации и предпринимательское решение задач.

2x
Оценочный кристаллизованный IQ GPT-4 примерно в 2 раза превышает его оценочный IQ подвижного рассуждения — противоположно профилю Маска

Может ли AI заменить функцию Илона Маска?

«Функция Илона Маска» — как когнитивная роль, а не человек — включает:

  1. Определение новых проблем, у которых ещё нет решений
  2. Рассуждение от первых принципов в нескольких технических областях
  3. Принятие решений с высокими ставками при неполной информации
  4. Интеграция пространственного, количественного и вербального рассуждения в реальном времени
  5. Поддержание усилий и фокуса на многолетних проектах

Текущий AI может помогать с каждым из этих пунктов, но не может выполнить интеграцию. GPT-4 может помочь написать код для симуляции ракеты, но не может решить, стоит ли строить многоразовую ракету. Он может анализировать данные химии аккумуляторов, но не может визуализировать тепловое поведение новой ячейки.

Разрыв не только в IQ-баллах — он в типе интеллекта. Ценность Маска — в подвижном рассуждении, применённом к новым задачам, а не в знании фактов. LLM — наоборот: огромные фактические знания с ограниченным решением новых задач.

Будущее: конвергенция или дивергенция?

AI быстро улучшается, но улучшения неравномерны. LLM становятся лучше в вербальных задачах (где они уже сверхчеловеческие), но прогресс в пространственном мышлении и подлинном подвижном рассуждении медленнее. Наиболее перспективные подходы — мультимодальные модели, нейросимволические архитектуры и embodied AI — пытаются закрыть пространственный и рассудительный разрыв, но остаются далеки от уровня человеческого эксперта.

Честный прогноз: AI будет всё больше дополнять человеческое познание в ближайшие 5-10 лет, но «функция Маска» — творческая интеграция нескольких типов рассуждения, применённая к новым инженерным задачам — останется человеческой способностью в обозримом будущем. Не потому что люди изначально превосходнее, а потому что тип требуемого интеллекта — именно тот, с которым текущие AI-архитектуры struggle.

Вердикт

  • Оценки IQ-тестов завышают интеллект AI, потому что IQ-тесты сильно вербальны, а LLM обучены на тексте
  • LLM превосходят в кристаллизованном интеллекте (знании фактов), но отстают в подвижном рассуждении (решении новых задач)
  • Когнитивный профиль Маска — высокий подвижный интеллект, исключительные пространственные способности — именно там, где AI слабее всего
  • Заголовок «AI IQ 155» вводит в заблуждение: он измеряет другой тип интеллекта, чем тот, что движет реальные инновации
  • AI дополняет, но не может заменить творческую интеграцию типов рассуждения, которая определяет экспертное инженерное познание

Вопрос не в том, достигнет ли AI IQ 155. Вероятно, уже достиг — на подтестах, которые не важны для инноваций. Настоящий вопрос — разовьёт ли AI подвижное, пространственное и интегративное рассуждение, позволяющее посмотреть на нерешённую проблему и разобраться в ней. Это тест Маска. И пока AI его проваливает.

Какой IQ у больших языковых моделей вроде GPT-4?
Исследования оценивают вербальный IQ GPT-4 приблизительно в 155 по вербальным подтестам WAIS-IV, но его результаты на невербальных задачах подвижного интеллекта (как матрицы Равена) значительно ниже — около 75-90-го перцентиля. Высокие вербальные баллы отражают кристаллизованный интеллект (извлечение обучающих данных), а не подлинную способность решать задачи.
Может ли AI пройти настоящий IQ-тест?
AI можно administer IQ-тесты, но результаты не напрямую сопоставимы с человеческими. IQ-тесты разработаны для человеческой когнитивной архитектуры — они измеряют рабочую память, пространственную обработку и подвижное рассуждение через модальности, которые LLM не используют изначально. Конвертация визуально-пространственных задач в текст меняет природу задачи.
AI умнее Илона Маска?
По показателям кристаллизованного интеллекта (фактические знания, словарь, извлечение информации) AI превосходит любого человека. Но по подвижному рассуждению, пространственной визуализации, манипуляции рабочей памятью и решению задач от первых принципов — способностям, которые движут инженерные инновации — текущий AI работает значительно ниже уровня человеческого эксперта. Разные типы интеллекта, не напрямую сопоставимые.
В конце концов AI сравняется с человеческим подвижным рассуждением?
Текущие AI-архитектуры (трансформерные LLM) фундаментально оптимизированы для сопоставления паттернов в обучающих данных, а не для подлинного рассуждения. Мультимодальные модели и нейросимволические подходы могут закрыть некоторые пробелы, но пространственное мышление и решение новых задач остаются серьёзными вызовами. Прогресс вероятен, но временные рамки неопределённы — оценки варьируются от 5 до 30+ лет.
Почему оценки IQ у AI кажутся такими высокими?
IQ-тесты перегружены вербальными и кристаллизованными способностями — именно тем, в чём LLM превосходны благодаря обучению на тексте. Тест, который взвешивал бы подвижное рассуждение, пространственную обработку и манипуляцию рабочей памятью более тяжело, показал бы гораздо более низкие оценки AI. Заголовок «IQ 155» отражает систематическую ошибку дизайна теста, а не реальное когнитивное превосходство.

Читайте также

Все статьи →