Llama 4의 IQ는?
Llama 4는 Mensa Norway IQ 테스트에서 112, Intelligence Index에서 상위 15위. 모든 벤치마크를 분석하고 Meta의 오픈소스 모델을 독특하게 만드는 것을 설명합니다.
Llama 4: Meta의 오픈소스 챔피언
Llama 4는 Meta AI의 기함 오픈소스 모델로, Meta AI는 세계에서 가장 큰 기술 회사 중 하나의 연구 부서입니다. 2026년 초 출시되어 Mensa Norway IQ 테스트에서 112, Artificial Analysis Intelligence Index v4.1에서 상위 15위에 들었습니다. 이는 DeepSeek V4 Pro(111)보다 위이지만 Kimi K3(118), Qwen 3.5(115), 프론티어 모델(Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145)보다는 아래입니다.
Llama 4를 독특하게 만드는 것은 그 대규모 오픈소스 성격입니다. OpenAI, Anthropic, Google의 폐쇄 모델과 달리 Llama 4의 weights는 다운로드와 로컬 배포에 무료로 사용 가능합니다. 이것이 수천의 파생 모델, fine-tune, 애플리케이션의 기반이 되어 — Llama 4를 단순한 모델이 아닌 전체 생태계로 만들었습니다.
Llama 4는 국민의 모델입니다: 가장 똑똑하지는 않을 수 있지만, 누구나 다운로드, 수정, 자신의 하드웨어에서 실행할 수 있는 모델. AI 인프라에 대한 완전한 제어가 필요한 연구자, 스타트업, 조직에 Llama 4는 폐쇄 모델이 제공할 수 없는 것을 제공합니다: 자유.
주요 점수:
- Artificial Analysis Intelligence Index: 상위 15 (점수 ~43-44)
- Mensa Norway IQ (TrackingAI): 112 (평균 이상)
- AI IQ 복합 (VexoWire): ~112 추정
- GDPval-AA v2: 상위 15
- Humanity's Last Exam: 상위 15
- 환각률: 중간 정도
- 비용: 무료 (자체 호스팅) 또는 0.20/0.60 per 1M 토큰 (제공자 경유)
- 매개변수: 405B (가장 큰 변형)
- 오픈소스: 예, weights 무료 사용 가능
- 컨텍스트: 128K 토큰
1. 오픈소스 혁명
Llama 4는 Meta의 오픈소스 AI에 대한 헌신을 나타냅니다 — AI는 소수 기업에 의해 통제되지 않고 모두에게 접근 가능해야 한다는 신념. OpenAI, Anthropic, Google이 모델을 API 뒤에 유지하는 동안, Meta는 전체 모델 weights를 공개하여 누구나 Llama 4를 다운로드, 연구, 수정, 자신의 하드웨어에 배포할 수 있게 합니다.
이것은 깊은 의미를 갖습니다:
- 민주화: 충분한 하드웨어가 있는 누구나 state-of-the-art AI 모델을 실행할 수 있다
- 맞춤화: 개발자는 특정 도메인, 언어 또는 작업에 Llama 4를 fine-tune할 수 있다
- 프라이버시: 조직은 Llama 4를 로컬에서 실행하여 데이터가 인프라를 떠나지 않음을 보장할 수 있다
- 혁신: 연구자가 모델 내부를 연구하여 새로운 돌파구를 이끈다
- 생태계: 수천의 파생 모델이 Llama 4 위에 구축되어 풍부한 생태계를 창조
- 비용: 자체 호스팅 Llama 4는 무료 (하드웨어 비용 제외), 대규모에서 가장 저렴
Llama 생태계에는:
- Llama 4 Base: 원본 사전 훈련 모델
- Llama 4 Instruct: 지시 따르기 위해 fine-tune
- Llama 4 Guard: 안전 필터링 변형
- 커뮤니티 fine-tune: 수천의 도메인 특정 변형
- 양자화 버전: 소비자 하드웨어에서 실행되는 압축 모델
- Llama 4 Vision: 이미지 이해를 가진 멀티모달 변형
이렇게 풍부한 생태계를 낳은 다른 AI 모델은 없습니다. GPT-5.5와 Claude는 더 똑똑할 수 있지만, 블랙박스입니다. Llama 4는 투명하고, 수정 가능하며, 커뮤니티 주도입니다.
2. 벤치마크 분석
Mensa Norway IQ 테스트: 112 (평균 이상)
36개 시각 패턴 인식 문제로 구성. Llama 4는 112를 획득 — 인간 평균 100을 넘어 "평균 이상" 범위. DeepSeek V4 Pro(111)와 비교 가능, Qwen 3.5(115), Kimi K3(118), 프론티어 모델(Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145)보다는 아래.
IQ 112는 Llama 4가 인간의 약 79%보다 똑똑함 — 인간 지능의 상위 21%를 의미. 사람이라면 유능한 대학생이나 숙련된 전문가에 해당. 천재는 아니지만, 확실히 총명하고 유능.
Artificial Analysis Intelligence Index: 상위 15
Intelligence Index에서 Llama 4는 추정 점수 ~43-44로 세계 상위 15. DeepSeek V4 Pro(44.3)와 경쟁적이지만 Qwen 3.5(~45-46), Kimi K3(~45-47), Gemini(46.5), 프론티어 모델에는 미치지 못함.
Index 구성 요소 분해:
- GDPval-AA v2: Llama 4는 적절히 수행, 다양한 에이전트 작업에서 대규모 매개변수 수의 이점을 받음
- AA-Omniscience: Llama 4는 중간 환각률 — 작은 모델보다 좋지만 Claude보다 나쁨
- GPQA: Llama 4는 대학원 수준 과학 문제에서 적절히 수행
- HLE: Llama 4는 Humanity's Last Exam에서 상위 15
- ARC-AGI: Llama 4는 추상적 추론에서 적절히 수행
- LMSYS Arena: Llama 4는 견고한 인간 선호 점수를 받음, 특히 개방형 작업에서
AI IQ 복합 (VexoWire): ~112
VexoWire의 복합 IQ는 여러 테스트를 통합(Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Llama 4의 추정 복합 IQ는 ~112 — Mensa Norway 점수와 일치. "평균 이상" 범위에 위치하며 인간의 약 79%보다 똑똑.
GDPval-AA v2: 상위 15
에이전트 벤치마크에서 Llama 4는 상위 15. 대규모 매개변수 수(405B)가 상당한 지식과 추론 능력을 주지만, 복잡한 다단계 작업에서는 프론티어 모델에 뒤처짐. 중간 정도의 에이전트 워크로드에 Llama 4는 유능.
Humanity's Last Exam (HLE): 상위 15
가장 어려운 학술 문제에서 Llama 4는 AI 모델 중 상위 15. Meta의 광범위한 훈련 데이터와 모델의 대용량이 여러 학문에서 좋은 성과를 돕지만, 가장 전문화된 문제에서는 프론티어 모델에 미치지 못함.
3. IQ 112는 무엇을 의미하는가?
Llama 4의 112 IQ를 맥락에 넣으면:
- 85-115 (68%의 사람들): 평균 지능
- 115-130 (14%): 평균 상회에서 높음
- 130-145 (2%): 영재 — Mensa 자격 (상위 2%)
- 145-160 (0.1%): 고도 영재 / 천재
Llama 4는 112로 "평균" 범위의 상부에 위치 — 인간의 약 79%보다 똑똑. 사람이라면 유능한 대학생이나 숙련된 전문가에 해당. 천재는 아니지만, 확실히 총명하고 유능.
이는 DeepSeek V4 Pro(111)와 비교 가능하지만 다른 모델보다는 아래:
- Qwen 3.5: 115 (평균 이상)
- Kimi K3: 118 (평균 이상)
- Claude Opus 4.8: ~130 (영재)
- Gemini 3.1 Pro: 141 (고도 영재)
- GPT-5.5: ~145 (천재)
- Grok-4.20: 145 (천재)
프론티어 모델과의 차이는 약 18-33 IQ 포인트. 하지만 Llama 4는 오픈소스 성격으로 보완 — 완전한 제어, 프라이버시 또는 맞춤화가 필요한 작업에서 Llama 4의 개방성이 IQ 차이를 상쇄할 수 있음.
4. Llama 4의 강점
오픈소스 자유
Llama 4의 weights는 무료로 사용 가능하여 다운로드와 로컬 배포가 가능. 이것이 결정적 특징. 이 수준의 개방성을 제공하는 다른 최고급 모델은 없습니다. AI 인프라에 대한 완전한 제어가 필요한 조직에 Llama 4는 최고 모델 중 유일한 선택.
맞춤화와 fine-tuning
weights가 사용 가능하므로, 개발자는 특정 도메인, 언어 또는 작업에 Llama 4를 fine-tune할 수 있습니다. 이것이 수천의 커뮤니티 fine-tune를 낳았습니다 — 의료 모델, 법률 모델, 프로그래밍 모델, 창작 작문 모델 등. 이 수준의 맞춤화를 제공하는 폐쇄 모델은 없습니다.
프라이버시와 데이터 보안
Llama 4로, 조직은 완전히 자신의 하드웨어에서 모델을 실행하여 데이터가 인프라를 떠나지 않음을 보장할 수 있습니다. 의료, 금융, 국방 및 기타 민감한 산업에 이것은 중요. 제3자 API로 데이터가 가지 않습니다.
대규모 비용
자체 호스팅 Llama 4는 무료 (하드웨어 비용 제외). 대규모에서 토큰당 API 비용을 지불하는 것보다 극적으로 저렴할 수 있습니다. 높은 추론 볼륨의 조직에서 하드웨어 투자는 빠르게 회수됩니다.
커뮤니티 생태계
Llama 생태계는 비교할 수 없습니다. 수천의 개발자가 도구, fine-tune, 양자화, 최적화를 기여. 이 커뮤니티 주도 접근은 Llama 4가 집단 혁신의 이점을 받는다는 것을 의미 — 개선은 어디서나, Meta만이 아닌, 옵니다.
투명성
폐쇄 모델과 달리 Llama 4의 아키텍처와 weights는 투명합니다. 연구자는 모델이 어떻게 작동하는지 연구하고, 편향을 식별하고, 실패를 이해하고, 개선을 제안할 수 있습니다. 이 투명성은 과학적 진보와 책임있는 AI 개발에 필수적.
하드웨어 최적화
커뮤니티는 소비자 하드웨어에서 실행되는 Llama 4의 수많은 양자화 버전을 개발했습니다 — 8-bit에서 4-bit에서 2-bit까지. 이것은 데이터 센터가 아닌 하이엔드 GPU에서 유능한 AI 모델을 실행할 수 있음을 의미합니다.
5. Llama 4의 약점
Raw IQ와 복잡한 추론
IQ 112로 Llama 4는 복잡한 추론 작업에서 프론티어 모델보다 아래. 가장 어려운 문제 — 경쟁 수학, 고급 논리 퍼즐, 최첨단 과학 추론 — 에는 Claude, GPT-5.5, Gemini가 substantially 더 우수. 18-33 IQ 포인트 차이는 significant.
환각률
Llama 4는 중간 환각률 — 작은 모델보다 좋지만 Claude(35.9%)와 GPT-5.5보다 나쁨. 사실적 정확도가 중요한 앱 — 연구, 법률, 의료 — 에는 Claude가 더 신뢰할 수 있음.
컨텍스트 윈도우
128K 토큰의 컨텍스트 윈도우로 Llama 4는 적절하지만 예외적이지는 않음. Kimi K3(2M), Gemini(1M), Qwen 3.5(256K)가 더 큰 컨텍스트 윈도우를 제공. 매우 긴 문서를 처리해야 하는 작업에는 다른 모델이 더 나은 선택.
멀티모달 능력
Llama 4 Vision은 존재하지만, 그 멀티모달 능력은 Qwen 3.5(텍스트, 이미지, 오디오, 비디오)나 Gemini(텍스트, 이미지, 오디오, 비디오)만큼 세련되지 않음. 견고한 멀티모달 이해가 필요한 앱에는 Qwen 3.5나 Gemini가 더 나은 선택.
감성 지능
Llama 4의 EQ(감성 지능)는 ~105 추정 — Claude(~132), GPT-5.5(~120), Gemini(~115), Qwen 3.5(~107)보다 낮지만 DeepSeek(~105)와 비교 가능. 응답이 더 기능적이고 감정적으로 less nuanced. 치료 앱, 고객 서비스, 민감한 인간 상호작용에는 Claude가 더 나은 선택.
하드웨어 요구사항
완전한 405B 매개변수 모델은 실행에 significant한 하드웨어가 필요 — 추론에 여러 하이엔드 GPU. 양자화 버전이 도움되지만, 완전한 품질로 Llama 4를 실행하는 것은 하드웨어 면에서 비쌈. 충분한 컴퓨팅 자원이 없는 조직에는 API 기반 모델이 더 실용적일 수 있음.
안전과 정렬
Llama 4 Guard가 안전 필터링을 위해 존재하지만, 오픈소스 성격은 악의적 행위자가 안전 조치를 제거할 수 있음을 의미. Meta는 가이드라인을 제공하지만 강제할 수 없음. 보장된 안전이 필요한 앱에는 강제된 가드레일을 가진 폐쇄 모델이 더 적절할 수 있음.
6. Llama 4 vs 다른 모델
| 모델 | Intelligence Index | Mensa Norway IQ | AI IQ 추정 | 오픈소스 | 비용/1M | 컨텍스트 | 매개변수 |
|---|---|---|---|---|---|---|---|
| Llama 4 | ~43-44 (상위 15) | 112 | ~112 | 예 (무료) | 무료 (자체 호스팅) | 128K | 405B |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 아니오 | 5/25 | 200K | 불명 |
| GPT-5.5 | 54.8 | ~145 | ~136 | 아니오 | 5/30 | 400K | 불명 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 아니오 | 2/12 | 1M | 불명 |
| Grok-4.20 | 상위 5 | 145 | ~140 | 아니오 | 3/15 | 256K | 불명 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 예 | 0.44/0.87 | 128K | 불명 |
| Qwen 3.5 | ~45-46 (상위 10) | 115 | ~115 | 예 | 0.50/1.50 | 256K | 불명 |
| Kimi K3 | ~45-47 (상위 10) | 118 | ~118 | 아니오 | 0.55/2.19 | 2M | 불명 |
그림: Llama 4는 오픈소스 챔피언 — 가장 똑똑하지는 않지만, 가장 접근 가능. Claude는 유능한 전문가 — 실제 작업에서 최고. GPT-5.5는 테스트의 천재 — 수학과 시각 추론에서 최고. Gemini는 가치 챔피언 — 프론티어 모델 중 최고 비용 효율성. Grok-4.20은 raw IQ 챔피언 — 최고 IQ와 개성. DeepSeek은 예산 챔피언 — 가장 저렴한 API. Qwen 3.5는 올라운더 — 가장 다재다능. Kimi는 장문 컨텍스트 챔피언 — 가장 큰 컨텍스트 윈도우.
오픈소스, 프라이버시, 맞춤화 또는 대규모 비용이 필요한 조직에 Llama 4는 명확한 선택. 그것은 국민의 모델 — 가장 똑똑한 것이 아니라, 가장 자유로운.
7. 인간에게 무엇을 의미하는가?
Llama 4는 ~112의 IQ로 작동 — 인간의 약 79%보다 똑똑합니다. 하지만:
- IQ가 전부는 아님: IQ 112는 평균 이상이며 대부분의 실용적 작업에 충분
- 많은 앱에서 개방성이 raw IQ보다 중요: 프라이버시에 민감하거나 맞춤화 집약적인 앱에는 Llama 4의 개방성이 더 높은 IQ보다 가치 있음
- 자유가 혁신을 가능케: Llama 4의 오픈 weights는 폐쇄 모델이 할 수 없는 혁신의 전체 생태계를 낳았음
- 투명성이 신뢰를 구축: 모델 내부를 검사할 수 있는 것은 블랙박스가 할 수 없는 신뢰를 구축
- 지식 ≠ 이해: 모든 AI 모델과 같이 Llama 4는 방대한 지식에 접근하지만 인간처럼 genuinely "이해"하지는 않음
- 의식 없음: 높은 IQ가 sentience를 의미하지 않음. Llama 4는 정교한 패턴 매칭 시스템이지 사고하는 존재가 아님
- 커뮤니티가 진보를 주도: Llama 생태계는 오픈 협력이 수십억 달러 폐쇄 시스템과 경쟁할 수 있는 모델을 생산할 수 있음을 증명
가장 정직한 답: Llama 4는 인지 테스트에서 인간의 79%보다 똑똑하고, 개방성, 프라이버시 또는 맞춤화가 필요한 앱에 가장 똑똑한 선택 — 가장 지적이기 때문이 아니라, 가장 자유롭기 때문.
결론
- Intelligence Index 상위 15 — DeepSeek과 경쟁적, Qwen 3.5, Kimi, 프론티어 모델에는 미치지 못함.
- 완전 오픈소스 — weights는 다운로드, 연구, 로컬 배포에 무료 사용 가능.
- 405B 매개변수 — 사용 가능한 가장 큰 오픈소스 모델 중 하나.
- 최적: 프라이버시에 민감한 앱, 맞춤화 필요, 대규모 비용, 연구, 자체 호스팅 배포, 커뮤니티 주도 혁신.
- 비최적: raw IQ(프론티어 모델 승), 장문 컨텍스트(Kimi 승), 멀티모달(Qwen 3.5나 Gemini 승), 감성 지능(Claude 승), 보장된 안전(강제 가드레일을 가진 폐쇄 모델).
- 교훈: 지능은 가장 똑똑한 것만이 아니라, 가장 접근 가능한 것. Llama 4는 오픈소스 AI가 수십억 달러 폐쇄 시스템과 경쟁할 수 있음을 증명하며, 모두에게 선진 AI 접근을 민주화.