Какой IQ у Llama 4?
Llama 4 набирает 112 на тесте Mensa Norway IQ и входит в топ-15 на Intelligence Index. Разбираем каждый бенчмарк и объясняем, что делает open-source модель Meta уникальной.
Llama 4: open-source чемпион от Meta
Llama 4 — флагманская open-source модель от Meta AI, исследовательского подразделения одной из крупнейших технологических компаний мира. Выпущенная в начале 2026 года, Llama 4 набирает 112 на тесте Mensa Norway IQ и входит в топ-15 на Artificial Analysis Intelligence Index v4.1. Это ставит её выше DeepSeek V4 Pro (111), но ниже Kimi K3 (118), Qwen 3.5 (115) и frontier-моделей (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Что делает Llama 4 уникальной — её open-source природа в масштабе. В отличие от закрытых моделей от OpenAI, Anthropic или Google, веса Llama 4 свободно доступны для скачивания и локального развёртывания. Это сделало её основой для тысяч производных моделей, fine-tune'ов и приложений — сделав Llama 4 не просто моделью, а целой экосистемой.
Llama 4 — народная модель: модель, которая может быть не самой умной, но которую каждый может скачать, модифицировать и запустить на собственном оборудовании. Для исследователей, стартапов и организаций, которым нужен полный контроль над своей AI-инфраструктурой, Llama 4 предлагает то, чего не может ни одна закрытая модель: свободу.
Ключевые оценки:
- Artificial Analysis Intelligence Index: топ-15 (оценочно ~43-44)
- Mensa Norway IQ (TrackingAI): 112 (выше среднего)
- AI IQ композит (VexoWire): ~112 оценочно
- GDPval-AA v2: топ-15
- Humanity's Last Exam: топ-15
- Уровень галлюцинаций: умеренный
- Стоимость: бесплатно (self-hosted) или 0.20/0.60 за 1M токенов (через провайдеров)
- Параметры: 405B (крупнейший вариант)
- Open-source: да, веса свободно доступны
- Контекст: 128K токенов
1. Open-source революция
Llama 4 отражает приверженность Meta open-source AI — убеждение, что AI должен быть доступен каждому, а не контролироваться несколькими компаниями. Пока OpenAI, Anthropic и Google держат свои модели за API, Meta выпускает полные веса модели, позволяя каждому скачивать, изучать, модифицировать и развёртывать Llama 4 на собственном оборудовании.
Это имеет глубокие последствия:
- Демократизация: каждый с достаточным оборудованием может запустить state-of-the-art AI-модель
- Кастомизация: разработчики могут fine-tune Llama 4 для конкретных доменов, языков или задач
- Приватность: организации могут запускать Llama 4 локально, гарантируя, что данные не покидают их инфраструктуру
- Инновации: исследователи могут изучать внутренности модели, что ведёт к новым прорывам
- Экосистема: тысячи производных моделей строятся на Llama 4, создавая богатую экосистему
- Стоимость: self-hosted Llama 4 бесплатна (помимо затрат на оборудование), делая её самым дешёвым вариантом в масштабе
Экосистема Llama включает:
- Llama 4 Base: оригинальная предобученная модель
- Llama 4 Instruct: fine-tuned для следования инструкциям
- Llama 4 Guard: вариант с фильтром безопасности
- Community fine-tunes: тысячи домен-специфичных вариантов
- Квантованные версии: сжатые модели, работающие на потребительском оборудовании
- Llama 4 Vision: мультимодальный вариант с пониманием изображений
Ни одна другая AI-модель не породила такую богатую экосистему. Хотя GPT-5.5 и Claude могут быть умнее, они — чёрные ящики. Llama 4 прозрачна, модифицируема и движима сообществом.
2. Разбор бенчмарков
Mensa Norway IQ: 112 (выше среднего)
Mensa Norway IQ состоит из 36 вопросов на визуальное распознавание паттернов. Llama 4 набирает 112 — выше человеческого среднего (100), в диапазоне «выше среднего». Это сравнимо с DeepSeek V4 Pro (111), ниже Qwen 3.5 (115), Kimi K3 (118) и frontier-моделей (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
IQ 112 означает, что Llama 4 умнее примерно 79% людей — топ 21% человеческого интеллекта. Если бы она была человеком, она была бы сравнима со способным студентом университета или квалифицированным профессионалом. Не гением, но определённо умной и компетентной.
Artificial Analysis Intelligence Index: топ-15
На Intelligence Index Llama 4 входит в топ-15 в мире с оценочным баллом ~43-44. Это ставит её конкурентно с DeepSeek V4 Pro (44.3), но позади Qwen 3.5 (~45-46), Kimi K3 (~45-47), Gemini (46.5) и frontier-моделей.
Разбор компонентов индекса:
- GDPval-AA v2: Llama 4 выступает адекватно, выигрывая от большого количества параметров для разнообразных агентных задач
- AA-Omniscience: у Llama 4 умеренный уровень галлюцинаций — лучше, чем у меньших моделей, но хуже, чем у Claude
- GPQA: Llama 4 разумно справляется с научными вопросами уровня магистратуры
- HLE: Llama 4 в топ-15 на Humanity's Last Exam
- ARC-AGI: Llama 4 адекватно выступает на абстрактном рассуждении
- LMSYS Arena: Llama 4 получает солидные баллы человеческого предпочтения, особенно для open-ended задач
AI IQ композит (VexoWire): ~112
Композитный IQ VexoWire объединяет несколько тестов (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Оценочный композитный IQ Llama 4 ~112 — соответствует её баллу Mensa Norway. Это помещает её в диапазон «выше среднего», умнее примерно 79% людей.
GDPval-AA v2: топ-15
На агентном бенчмарке Llama 4 в топ-15. Её большое количество параметров (405B) даёт ей значительные знания и способность рассуждения, но она отстаёт от frontier-моделей на сложных многошаговых задачах. Для умеренных агентных нагрузок Llama 4 компетентна.
Humanity's Last Exam (HLE): топ-15
На сложнейших академических вопросах Llama 4 в топ-15 среди AI-моделей. Обширные обучающие данные Meta и большая ёмкость модели помогают ей хорошо выступать по различным дисциплинам, хотя она не соответствует frontier-моделям на наиболее специализированных вопросах.
3. Что означает IQ 112?
Чтобы контекстуализировать IQ 112 Llama 4:
- 85-115 (68% людей): средний интеллект
- 115-130 (14%): выше среднего до высокого среднего
- 130-145 (2%): одарённые — квалификация для Mensa (топ 2%)
- 145-160 (0.1%): высоко одарённые / гении
Llama 4 с 112 находится в верхней части диапазона «средний» — умнее примерно 79% людей. Если бы она была человеком, она была бы сравнима со способным студентом университета или квалифицированным профессионалом. Не гением, но определённо умной и компетентной.
Это сравнимо с DeepSeek V4 Pro (111), но ниже других моделей:
- Qwen 3.5: 115 (выше среднего)
- Kimi K3: 118 (выше среднего)
- Claude Opus 4.8: ~130 (одарённый)
- Gemini 3.1 Pro: 141 (высоко одарённый)
- GPT-5.5: ~145 (гений)
- Grok-4.20: 145 (гений)
Разрыв до frontier-моделей составляет около 18-33 IQ-баллов. Но Llama 4 компенсирует своей open-source природой — для приложений, требующих полного контроля, приватности или кастомизации, открытость Llama 4 может перевесить разрыв в IQ.
4. Где Llama 4 сильна
Open-source свобода
Веса Llama 4 свободно доступны для скачивания и локального развёртывания. Это её определяющая черта. Ни одна другая модель топ-уровня не предлагает такой открытости. Для организаций, которым нужен полный контроль над своей AI-инфраструктурой, Llama 4 — единственный вариант среди топовых моделей.
Кастомизация и fine-tuning
Поскольку веса доступны, разработчики могут fine-tune Llama 4 для конкретных доменов, языков или задач. Это привело к тысячам community fine-tune'ов — медицинские модели, юридические модели, модели для кодинга, модели для креативного письма и другие. Ни одна закрытая модель не предлагает такого уровня кастомизации.
Приватность и безопасность данных
С Llama 4 организации могут запускать модель полностью на собственном оборудовании, гарантируя, что данные не покидают их инфраструктуру. Для здравоохранения, финансов, обороны и других чувствительных отраслей это критично. Никакие данные не уходят к сторонним API.
Стоимость в масштабе
Self-hosted Llama 4 бесплатна (помимо затрат на оборудование). В масштабе это может быть значительно дешевле, чем оплата per-token API-сборов. Для организаций с большими объёмами inference инвестиции в оборудование быстро окупаются.
Экосистема сообщества
Экосистема Llama не имеет аналогов. Тысячи разработчиков вносят инструменты, fine-tune'ы, квантизации и оптимизации. Этот подход, движимый сообществом, означает, что Llama 4 выигрывает от коллективных инноваций — улучшения приходят отовсюду, не только от Meta.
Прозрачность
В отличие от закрытых моделей, архитектура и веса Llama 4 прозрачны. Исследователи могут изучать, как работает модель, выявлять предубеждения, понимать ошибки и предлагать улучшения. Эта прозрачность важна для научного прогресса и ответственного развития AI.
Аппаратная оптимизация
Сообщество разработало многочисленные квантованные версии Llama 4, которые могут работать на потребительском оборудовании — от 8-bit до 4-bit до 2-bit квантизации. Это значит, что вы можете запустить способную AI-модель на высококлассном GPU, а не только в дата-центре.
5. Где Llama 4 отстаёт
Raw IQ и сложное рассуждение
С IQ 112 Llama 4 ниже frontier-моделей на задачах сложного рассуждения. Для самых трудных проблем — соревновательная математика, продвинутые логические головоломки, передовое научное рассуждение — Claude, GPT-5.5 и Gemini существенно лучше. Разрыв в 18-33 IQ-балла значителен.
Уровень галлюцинаций
У Llama 4 умеренный уровень галлюцинаций — лучше, чем у меньших моделей, но хуже, чем у Claude (35.9%) и GPT-5.5. Для приложений, где критична фактическая точность — исследования, право, медицина — Claude остаётся более надёжной.
Контекстное окно
С контекстным окном 128K токенов Llama 4 адекватна, но не исключительна. Kimi K3 (2M), Gemini (1M) и Qwen 3.5 (256K) предлагают большие контекстные окна. Для задач, требующих обработки очень длинных документов, другие модели — лучший выбор.
Мультимодальные возможности
Хотя Llama 4 Vision существует, её мультимодальные возможности менее отполированы, чем у Qwen 3.5 (текст, изображения, аудио, видео) или Gemini (текст, изображения, аудио, видео). Для приложений, требующих надёжного мультимодального понимания, Qwen 3.5 или Gemini — лучшие выборы.
Эмоциональный интеллект
EQ (эмоциональный интеллект) Llama 4 оценочно ~105 — ниже Claude (~132), GPT-5.5 (~120), Gemini (~115) и Qwen 3.5 (~107), но сравним с DeepSeek (~105). Её ответы склонны быть более функциональными и менее эмоционально nuanced. Для терапевтических приложений, службы поддержки или чувствительного человеческого взаимодействия Claude — лучший выбор.
Требования к оборудованию
Полная модель на 405B параметров требует значительного оборудования для работы — несколько высококлассных GPU для inference. Хотя квантованные версии помогают, запуск Llama 4 в полном качестве дорог с точки зрения оборудования. Для организаций без достаточных вычислительных ресурсов API-модели могут быть более практичными.
Безопасность и alignment
Хотя Llama 4 Guard существует для фильтрации безопасности, open-source природа означает, что злоумышленники могут удалить меры безопасности. Meta предоставляет руководства, но не может их обеспечить. Для приложений, требующих гарантированной безопасности, закрытые модели с принудительными guardrails могут быть более подходящими.
6. Llama 4 vs другие модели
| Модель | Intelligence Index | Mensa Norway IQ | AI IQ оцен. | Open-source | Стоимость/1M | Контекст | Параметры |
|---|---|---|---|---|---|---|---|
| Llama 4 | ~43-44 (топ-15) | 112 | ~112 | да (бесплатно) | бесплатно (self-host) | 128K | 405B |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | нет | 5/25 | 200K | неизвестно |
| GPT-5.5 | 54.8 | ~145 | ~136 | нет | 5/30 | 400K | неизвестно |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | нет | 2/12 | 1M | неизвестно |
| Grok-4.20 | топ-5 | 145 | ~140 | нет | 3/15 | 256K | неизвестно |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | да | 0.44/0.87 | 128K | неизвестно |
| Qwen 3.5 | ~45-46 (топ-10) | 115 | ~115 | да | 0.50/1.50 | 256K | неизвестно |
| Kimi K3 | ~45-47 (топ-10) | 118 | ~118 | нет | 0.55/2.19 | 2M | неизвестно |
Картина: Llama 4 — open-source чемпион — не самая умная, но самая доступная. Claude — способный профессионал — лучший в реальных задачах. GPT-5.5 — гений-тестировщик — лучший в математике и визуальном рассуждении. Gemini — чемпион по ценности — лучшая экономическая эффективность среди frontier-моделей. Grok-4.20 — чемпион по raw IQ — высший IQ с личностью. DeepSeek — бюджетный чемпион — самый дешёвый API. Qwen 3.5 — универсал — самая разносторонняя. А Kimi — чемпион по длинному контексту — наибольшее контекстное окно.
Для организаций, которым нужен open-source, приватность, кастомизация или стоимость в масштабе, Llama 4 — очевидный выбор. Это народная модель — не самая умная, но самая свободная.
7. Что это значит для людей?
Llama 4 работает на IQ ~112 — умнее примерно 79% людей. Но:
- IQ — не всё: IQ 112 выше среднего и достаточно для большинства практических задач
- Открытость важнее raw IQ для многих приложений: для приложений, чувствительных к приватности или требующих кастомизации, открытость Llama 4 ценнее, чем более высокий IQ
- Свобода способствует инновациям: открытые веса Llama 4 породили целую экосистему инноваций, которую не могут превзойти закрытые модели
- Прозрачность строит доверие: возможность изучать внутренности модели строит доверие, которое не могут дать модели-чёрные ящики
- Знание ≠ понимание: как все AI-модели, Llama 4 имеет доступ к обширным знаниям, но не «понимает» так, как человек
- Нет сознания: высокий IQ не значит sentience. Llama 4 — сложная система распознавания паттернов, не мыслящее существо
- Сообщество движет прогресс: экосистема Llama доказывает, что открытая коллаборация может производить модели, конкурентные с миллиардными закрытыми системами
Самый честный ответ: Llama 4 умнее 79% людей на когнитивных тестах, и для приложений, требующих открытости, приватности или кастомизации, это самый умный выбор — не потому что она самая интеллектуальная, а потому что она самая свободная.
Заключение
- Топ-15 на Intelligence Index — конкурентно с DeepSeek, позади Qwen 3.5, Kimi и frontier-моделей.
- Полностью open-source — веса свободно доступны для скачивания, изучения и локального развёртывания.
- 405B параметров — одна из крупнейших open-source моделей.
- Лучше всего для: приложений, чувствительных к приватности, потребностей в кастомизации, стоимости в масштабе, исследований, самохостингового развёртывания, инноваций, движимых сообществом.
- Не лучше всего для: raw IQ (frontier-модели выигрывают), длинного контекста (Kimi выигрывает), мультимодальности (Qwen 3.5 или Gemini выигрывают), эмоционального интеллекта (Claude выигрывает), гарантированной безопасности (закрытые модели с принудительными guardrails).
- Урок: интеллект — не только быть самым умным — но и быть самым доступным. Llama 4 доказывает, что open-source AI может конкурировать с миллиардными закрытыми системами, демократизируя доступ к продвинутому AI для каждого.