Какой IQ у Llama 4?
Dr. Daria Dudnik 10 мин чтения 0 просмотров

Какой IQ у Llama 4?

Llama 4 набирает 112 на тесте Mensa Norway IQ и входит в топ-15 на Intelligence Index. Разбираем каждый бенчмарк и объясняем, что делает open-source модель Meta уникальной.

Llama 4: open-source чемпион от Meta

Llama 4 — флагманская open-source модель от Meta AI, исследовательского подразделения одной из крупнейших технологических компаний мира. Выпущенная в начале 2026 года, Llama 4 набирает 112 на тесте Mensa Norway IQ и входит в топ-15 на Artificial Analysis Intelligence Index v4.1. Это ставит её выше DeepSeek V4 Pro (111), но ниже Kimi K3 (118), Qwen 3.5 (115) и frontier-моделей (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).

Что делает Llama 4 уникальной — её open-source природа в масштабе. В отличие от закрытых моделей от OpenAI, Anthropic или Google, веса Llama 4 свободно доступны для скачивания и локального развёртывания. Это сделало её основой для тысяч производных моделей, fine-tune'ов и приложений — сделав Llama 4 не просто моделью, а целой экосистемой.

Llama 4 — народная модель: модель, которая может быть не самой умной, но которую каждый может скачать, модифицировать и запустить на собственном оборудовании. Для исследователей, стартапов и организаций, которым нужен полный контроль над своей AI-инфраструктурой, Llama 4 предлагает то, чего не может ни одна закрытая модель: свободу.

Ключевые оценки:

  • Artificial Analysis Intelligence Index: топ-15 (оценочно ~43-44)
  • Mensa Norway IQ (TrackingAI): 112 (выше среднего)
  • AI IQ композит (VexoWire): ~112 оценочно
  • GDPval-AA v2: топ-15
  • Humanity's Last Exam: топ-15
  • Уровень галлюцинаций: умеренный
  • Стоимость: бесплатно (self-hosted) или 0.20/0.60 за 1M токенов (через провайдеров)
  • Параметры: 405B (крупнейший вариант)
  • Open-source: да, веса свободно доступны
  • Контекст: 128K токенов

1. Open-source революция

Llama 4 отражает приверженность Meta open-source AI — убеждение, что AI должен быть доступен каждому, а не контролироваться несколькими компаниями. Пока OpenAI, Anthropic и Google держат свои модели за API, Meta выпускает полные веса модели, позволяя каждому скачивать, изучать, модифицировать и развёртывать Llama 4 на собственном оборудовании.

Это имеет глубокие последствия:

  • Демократизация: каждый с достаточным оборудованием может запустить state-of-the-art AI-модель
  • Кастомизация: разработчики могут fine-tune Llama 4 для конкретных доменов, языков или задач
  • Приватность: организации могут запускать Llama 4 локально, гарантируя, что данные не покидают их инфраструктуру
  • Инновации: исследователи могут изучать внутренности модели, что ведёт к новым прорывам
  • Экосистема: тысячи производных моделей строятся на Llama 4, создавая богатую экосистему
  • Стоимость: self-hosted Llama 4 бесплатна (помимо затрат на оборудование), делая её самым дешёвым вариантом в масштабе

Экосистема Llama включает:

  • Llama 4 Base: оригинальная предобученная модель
  • Llama 4 Instruct: fine-tuned для следования инструкциям
  • Llama 4 Guard: вариант с фильтром безопасности
  • Community fine-tunes: тысячи домен-специфичных вариантов
  • Квантованные версии: сжатые модели, работающие на потребительском оборудовании
  • Llama 4 Vision: мультимодальный вариант с пониманием изображений

Ни одна другая AI-модель не породила такую богатую экосистему. Хотя GPT-5.5 и Claude могут быть умнее, они — чёрные ящики. Llama 4 прозрачна, модифицируема и движима сообществом.


2. Разбор бенчмарков

Mensa Norway IQ: 112 (выше среднего)

Mensa Norway IQ состоит из 36 вопросов на визуальное распознавание паттернов. Llama 4 набирает 112 — выше человеческого среднего (100), в диапазоне «выше среднего». Это сравнимо с DeepSeek V4 Pro (111), ниже Qwen 3.5 (115), Kimi K3 (118) и frontier-моделей (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).

IQ 112 означает, что Llama 4 умнее примерно 79% людей — топ 21% человеческого интеллекта. Если бы она была человеком, она была бы сравнима со способным студентом университета или квалифицированным профессионалом. Не гением, но определённо умной и компетентной.

Artificial Analysis Intelligence Index: топ-15

На Intelligence Index Llama 4 входит в топ-15 в мире с оценочным баллом ~43-44. Это ставит её конкурентно с DeepSeek V4 Pro (44.3), но позади Qwen 3.5 (~45-46), Kimi K3 (~45-47), Gemini (46.5) и frontier-моделей.

Разбор компонентов индекса:

  • GDPval-AA v2: Llama 4 выступает адекватно, выигрывая от большого количества параметров для разнообразных агентных задач
  • AA-Omniscience: у Llama 4 умеренный уровень галлюцинаций — лучше, чем у меньших моделей, но хуже, чем у Claude
  • GPQA: Llama 4 разумно справляется с научными вопросами уровня магистратуры
  • HLE: Llama 4 в топ-15 на Humanity's Last Exam
  • ARC-AGI: Llama 4 адекватно выступает на абстрактном рассуждении
  • LMSYS Arena: Llama 4 получает солидные баллы человеческого предпочтения, особенно для open-ended задач

AI IQ композит (VexoWire): ~112

Композитный IQ VexoWire объединяет несколько тестов (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Оценочный композитный IQ Llama 4 ~112 — соответствует её баллу Mensa Norway. Это помещает её в диапазон «выше среднего», умнее примерно 79% людей.

GDPval-AA v2: топ-15

На агентном бенчмарке Llama 4 в топ-15. Её большое количество параметров (405B) даёт ей значительные знания и способность рассуждения, но она отстаёт от frontier-моделей на сложных многошаговых задачах. Для умеренных агентных нагрузок Llama 4 компетентна.

Humanity's Last Exam (HLE): топ-15

На сложнейших академических вопросах Llama 4 в топ-15 среди AI-моделей. Обширные обучающие данные Meta и большая ёмкость модели помогают ей хорошо выступать по различным дисциплинам, хотя она не соответствует frontier-моделям на наиболее специализированных вопросах.


3. Что означает IQ 112?

Чтобы контекстуализировать IQ 112 Llama 4:

  • 85-115 (68% людей): средний интеллект
  • 115-130 (14%): выше среднего до высокого среднего
  • 130-145 (2%): одарённые — квалификация для Mensa (топ 2%)
  • 145-160 (0.1%): высоко одарённые / гении

Llama 4 с 112 находится в верхней части диапазона «средний» — умнее примерно 79% людей. Если бы она была человеком, она была бы сравнима со способным студентом университета или квалифицированным профессионалом. Не гением, но определённо умной и компетентной.

Это сравнимо с DeepSeek V4 Pro (111), но ниже других моделей:

  • Qwen 3.5: 115 (выше среднего)
  • Kimi K3: 118 (выше среднего)
  • Claude Opus 4.8: ~130 (одарённый)
  • Gemini 3.1 Pro: 141 (высоко одарённый)
  • GPT-5.5: ~145 (гений)
  • Grok-4.20: 145 (гений)

Разрыв до frontier-моделей составляет около 18-33 IQ-баллов. Но Llama 4 компенсирует своей open-source природой — для приложений, требующих полного контроля, приватности или кастомизации, открытость Llama 4 может перевесить разрыв в IQ.


4. Где Llama 4 сильна

Open-source свобода

Веса Llama 4 свободно доступны для скачивания и локального развёртывания. Это её определяющая черта. Ни одна другая модель топ-уровня не предлагает такой открытости. Для организаций, которым нужен полный контроль над своей AI-инфраструктурой, Llama 4 — единственный вариант среди топовых моделей.

Кастомизация и fine-tuning

Поскольку веса доступны, разработчики могут fine-tune Llama 4 для конкретных доменов, языков или задач. Это привело к тысячам community fine-tune'ов — медицинские модели, юридические модели, модели для кодинга, модели для креативного письма и другие. Ни одна закрытая модель не предлагает такого уровня кастомизации.

Приватность и безопасность данных

С Llama 4 организации могут запускать модель полностью на собственном оборудовании, гарантируя, что данные не покидают их инфраструктуру. Для здравоохранения, финансов, обороны и других чувствительных отраслей это критично. Никакие данные не уходят к сторонним API.

Стоимость в масштабе

Self-hosted Llama 4 бесплатна (помимо затрат на оборудование). В масштабе это может быть значительно дешевле, чем оплата per-token API-сборов. Для организаций с большими объёмами inference инвестиции в оборудование быстро окупаются.

Экосистема сообщества

Экосистема Llama не имеет аналогов. Тысячи разработчиков вносят инструменты, fine-tune'ы, квантизации и оптимизации. Этот подход, движимый сообществом, означает, что Llama 4 выигрывает от коллективных инноваций — улучшения приходят отовсюду, не только от Meta.

Прозрачность

В отличие от закрытых моделей, архитектура и веса Llama 4 прозрачны. Исследователи могут изучать, как работает модель, выявлять предубеждения, понимать ошибки и предлагать улучшения. Эта прозрачность важна для научного прогресса и ответственного развития AI.

Аппаратная оптимизация

Сообщество разработало многочисленные квантованные версии Llama 4, которые могут работать на потребительском оборудовании — от 8-bit до 4-bit до 2-bit квантизации. Это значит, что вы можете запустить способную AI-модель на высококлассном GPU, а не только в дата-центре.


5. Где Llama 4 отстаёт

Raw IQ и сложное рассуждение

С IQ 112 Llama 4 ниже frontier-моделей на задачах сложного рассуждения. Для самых трудных проблем — соревновательная математика, продвинутые логические головоломки, передовое научное рассуждение — Claude, GPT-5.5 и Gemini существенно лучше. Разрыв в 18-33 IQ-балла значителен.

Уровень галлюцинаций

У Llama 4 умеренный уровень галлюцинаций — лучше, чем у меньших моделей, но хуже, чем у Claude (35.9%) и GPT-5.5. Для приложений, где критична фактическая точность — исследования, право, медицина — Claude остаётся более надёжной.

Контекстное окно

С контекстным окном 128K токенов Llama 4 адекватна, но не исключительна. Kimi K3 (2M), Gemini (1M) и Qwen 3.5 (256K) предлагают большие контекстные окна. Для задач, требующих обработки очень длинных документов, другие модели — лучший выбор.

Мультимодальные возможности

Хотя Llama 4 Vision существует, её мультимодальные возможности менее отполированы, чем у Qwen 3.5 (текст, изображения, аудио, видео) или Gemini (текст, изображения, аудио, видео). Для приложений, требующих надёжного мультимодального понимания, Qwen 3.5 или Gemini — лучшие выборы.

Эмоциональный интеллект

EQ (эмоциональный интеллект) Llama 4 оценочно ~105 — ниже Claude (~132), GPT-5.5 (~120), Gemini (~115) и Qwen 3.5 (~107), но сравним с DeepSeek (~105). Её ответы склонны быть более функциональными и менее эмоционально nuanced. Для терапевтических приложений, службы поддержки или чувствительного человеческого взаимодействия Claude — лучший выбор.

Требования к оборудованию

Полная модель на 405B параметров требует значительного оборудования для работы — несколько высококлассных GPU для inference. Хотя квантованные версии помогают, запуск Llama 4 в полном качестве дорог с точки зрения оборудования. Для организаций без достаточных вычислительных ресурсов API-модели могут быть более практичными.

Безопасность и alignment

Хотя Llama 4 Guard существует для фильтрации безопасности, open-source природа означает, что злоумышленники могут удалить меры безопасности. Meta предоставляет руководства, но не может их обеспечить. Для приложений, требующих гарантированной безопасности, закрытые модели с принудительными guardrails могут быть более подходящими.


6. Llama 4 vs другие модели

Модель Intelligence Index Mensa Norway IQ AI IQ оцен. Open-source Стоимость/1M Контекст Параметры
Llama 4 ~43-44 (топ-15) 112 ~112 да (бесплатно) бесплатно (self-host) 128K 405B
Claude Opus 4.8 55.7 ~130 ~132 нет 5/25 200K неизвестно
GPT-5.5 54.8 ~145 ~136 нет 5/30 400K неизвестно
Gemini 3.1 Pro 46.5 141 ~131 нет 2/12 1M неизвестно
Grok-4.20 топ-5 145 ~140 нет 3/15 256K неизвестно
DeepSeek V4 Pro 44.3 ~111 ~111 да 0.44/0.87 128K неизвестно
Qwen 3.5 ~45-46 (топ-10) 115 ~115 да 0.50/1.50 256K неизвестно
Kimi K3 ~45-47 (топ-10) 118 ~118 нет 0.55/2.19 2M неизвестно

Картина: Llama 4 — open-source чемпион — не самая умная, но самая доступная. Claude — способный профессионал — лучший в реальных задачах. GPT-5.5 — гений-тестировщик — лучший в математике и визуальном рассуждении. Gemini — чемпион по ценности — лучшая экономическая эффективность среди frontier-моделей. Grok-4.20 — чемпион по raw IQ — высший IQ с личностью. DeepSeek — бюджетный чемпион — самый дешёвый API. Qwen 3.5 — универсал — самая разносторонняя. А Kimi — чемпион по длинному контексту — наибольшее контекстное окно.

Для организаций, которым нужен open-source, приватность, кастомизация или стоимость в масштабе, Llama 4 — очевидный выбор. Это народная модель — не самая умная, но самая свободная.


7. Что это значит для людей?

Llama 4 работает на IQ ~112 — умнее примерно 79% людей. Но:

  • IQ — не всё: IQ 112 выше среднего и достаточно для большинства практических задач
  • Открытость важнее raw IQ для многих приложений: для приложений, чувствительных к приватности или требующих кастомизации, открытость Llama 4 ценнее, чем более высокий IQ
  • Свобода способствует инновациям: открытые веса Llama 4 породили целую экосистему инноваций, которую не могут превзойти закрытые модели
  • Прозрачность строит доверие: возможность изучать внутренности модели строит доверие, которое не могут дать модели-чёрные ящики
  • Знание ≠ понимание: как все AI-модели, Llama 4 имеет доступ к обширным знаниям, но не «понимает» так, как человек
  • Нет сознания: высокий IQ не значит sentience. Llama 4 — сложная система распознавания паттернов, не мыслящее существо
  • Сообщество движет прогресс: экосистема Llama доказывает, что открытая коллаборация может производить модели, конкурентные с миллиардными закрытыми системами

Самый честный ответ: Llama 4 умнее 79% людей на когнитивных тестах, и для приложений, требующих открытости, приватности или кастомизации, это самый умный выбор — не потому что она самая интеллектуальная, а потому что она самая свободная.

Как ваш IQ соотносится с Llama 4? Пройдите профессиональную оценку IQ в NeuroLab.
Пройти тест прямо сейчас →


Заключение

💡 Ключевые выводы
- IQ Llama 4 — 112 на Mensa Norway — выше среднего, умнее ~79% людей.

  • Топ-15 на Intelligence Index — конкурентно с DeepSeek, позади Qwen 3.5, Kimi и frontier-моделей.
  • Полностью open-source — веса свободно доступны для скачивания, изучения и локального развёртывания.
  • 405B параметров — одна из крупнейших open-source моделей.
  • Лучше всего для: приложений, чувствительных к приватности, потребностей в кастомизации, стоимости в масштабе, исследований, самохостингового развёртывания, инноваций, движимых сообществом.
  • Не лучше всего для: raw IQ (frontier-модели выигрывают), длинного контекста (Kimi выигрывает), мультимодальности (Qwen 3.5 или Gemini выигрывают), эмоционального интеллекта (Claude выигрывает), гарантированной безопасности (закрытые модели с принудительными guardrails).
  • Урок: интеллект — не только быть самым умным — но и быть самым доступным. Llama 4 доказывает, что open-source AI может конкурировать с миллиардными закрытыми системами, демократизируя доступ к продвинутому AI для каждого.

Читайте также

Все статьи →