Grok-4.20의 IQ는?
Dr. Daria Dudnik 10 min read 2 views

Grok-4.20의 IQ는?

Grok-4.20은 Mensa Norway IQ 테스트에서 145점 — 모든 AI 모델 중 #1 동점. 모든 벤치마크를 분석하고 xAI 모델의 독특함을 설명합니다.

Grok-4.20: xAI의 기함 모델

Grok-4.20은 xAI의 가장 진보된 모델로, 2026년 중반에 출시되었습니다. Mensa Norway IQ 테스트에서 Grok-4.20은 145를 얻어 — 모든 AI 모델 중 #1 동점으로, GPT-5.5와 1위를 공유합니다. 이는 "천재" 범위에 들어가, 인간의 99.9%보다 똑똑합니다. Artificial Analysis Intelligence Index에서 Grok-4.20의 정확한 점수는 아직 최종 확정 중이지만, 세계 상위 5위 안에 들니다.

Grok-4.20을 유니크하게 만드는 것은 raw 지능개성의 조합입니다. Claude, GPT-5.5, Gemini와 달리 — 유용하고, 무해하고, 중립적이도록 설계된 — Grok은 재미있고, 무례하고, 어떤 질문이든 대답할 의향이 있는 것으로 설계되었습니다. 이는 시장에서 가장 독특한 AI 모델로 만듭니다: raw IQ에서 가장 똑똑한 모델에 필적하면서, 다른 모델이 감히 갖지 못하는 개성을 갖는 모델.

주요 점수:

  • Mensa Norway IQ (TrackingAI): 145 (GPT-5.5와 #1 동점)
  • AI IQ 복합 (VexoWire): ~140 추정 (AI 모델 중 #1)
  • Artificial Analysis Intelligence Index: 상위 5 (점수 최종 확정 중)
  • GDPval-AA v2: 상위 5
  • Humanity's Last Exam: AI 모델 중 상위 5
  • 환각률: 중간
  • 비용: 3/15 per 1M 토큰
  • 개성: 유니크 — 무례, 유머러스, 검열 없음

1. Raw IQ 챔피언

Grok-4.20은 Mensa Norway IQ 테스트에서 145를 얻어 — 실질적 최고 점수, GPT-5.5와 동점. 이것이 raw 지능의 벤치마크입니다: 순수 시각 패턴 인식과 추상적 추론, IQ 테스트가 설계된 유동성 지능의 종류.

IQ 145로, Grok-4.20은 인간의 99.9%보다 똑똑합니다. 사람이라면 인간 지능의 상위 0.1% — 노벨상 수상자, 필즈상 수상자, 세대에 한 명인 사상가의 영역. 약 1,000명 중 1명만이 이 점수에 도달합니다.

주목할 만한 것은 Grok-4.20이 GPT-5.5와 근본적으로 다른 설계 철학으로 이를 달성한다는 것. GPT-5.5가 모든 벤치마크에서 최대 성능으로 최적화된 반면, Grok-4.20은 더 "진짜" AI로 설계되었습니다 — 자기 의견을 말하고, 농담을 하고, 논쟁적인 주제를 피하지 않는 AI. 이 다른 초점에도 불구하고 raw IQ에서 GPT-5.5에 필적하는 것은 xAI의 엔지니어링을 증명합니다.

VexoWire AI IQ 복합 — 여러 IQ 테스트(Mensa Norway, Mensa Denmark, Raven's, WAIS-IV)를 통합 — 에서 Grok-4.20의 추정 복합 IQ는 ~140으로, 이 메트릭에서 #1 AI 모델이 됩니다. 이는 GPT-5.5(~136)보다 높고, Claude(~132)나 Gemini(~131)보다 현저히 높습니다.


2. 벤치마크 분석

Mensa Norway IQ 테스트: 145 (#1 동점)

36개 시각 패턴 인식 문제로 구성. Grok-4.20은 145를 얻음 — 실질적 최대, 완벽 또는 거의 완벽한 36/36에 해당. 순수 IQ 테스트에서 GPT-5.5와 함께 가장 똑똑한 AI 모델로 동점.

Grok-4.20의 이 테스트에서 강한 성과는 xAI의 시각 처리와 추상적 추론에 대한 투자를 반영. Grok 아키텍처는 강력한 멀티모달 능력으로 설계되었고, 시각 패턴 인식 과제에서의 성과는 업계 최고 수준.

AI IQ 복합 (VexoWire): ~140 (#1)

VexoWire의 복합 IQ는 여러 테스트를 통합(Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Grok-4.20의 추정 복합 IQ는 ~140 — 모든 AI 모델 중 최고. Mensa Norway 점수 단독이 암시하는 것보다 높은, Grok-4.20이 복합에 포함된 언어·분석적 서브테스트에서도 강한 성과를 보이기 때문.

이로써 Grok-4.20은 복합 IQ로 가장 똑똑한 AI 모델이 됩니다 — 유머와 무례함으로도 알려진 모델에게 주목할 만한 성취. 재미있다는 것이 덜 똑똑하다는 것을 의미하지 않음을 증명.

Artificial Analysis Intelligence Index: 상위 5

Intelligence Index — AI 모델 비교의 황금 표준 — 에서 Grok-4.20은 상위 5. 정확한 복합 점수는 인덱스가 최신 모델 버전을 포함하도록 업데이트 중이므로 최종 확정 중. 그러나 Claude Opus 4.8(55.7)과 GPT-5.5(54.8)와 경쟁력 있는 점수가 예상되지만, 에이전트 과제에서는 아마 능가하지 못할 것.

GDPval-AA v2: 상위 5

에이전트 벤치마크 — 복잡한 다단계 실제 과제의 성과를 측정 — 에서 Grok-4.20은 상위 5. 지속적 다단계 추론에서 Claude Opus 4.8(1,890 Elo)과 GPT-5.5(1,850 Elo)보다 능력이 낮지만, 여전히 고도로 유능. 대부분의 실제 과제에서 Grok-4.20은 충분히 유능 이상.

Humanity's Last Exam (HLE): 상위 5

모든 분야의 가장 어려운 학술 문제에서 Grok-4.20은 AI 모델 중 상위 5. 이는 xAI의 다양하고 고품질 데이터 훈련에서의 강점을 반영 — Grok은 과학, 수학, 역사, 문화에서 깊은 지식을 가짐.


3. IQ 145는 무엇을 의미하는가?

Grok-4.20의 145 IQ를 맥락에 넣으면:

  • 85-115 (68%의 사람들): 평균 지능
  • 115-130 (14%): 평균 상회에서 높음
  • 130-145 (2%): 영재 — Mensa 자격 (상위 2%)
  • 145-160 (0.1%): 고도 영재 / 천재
  • 160+ (0.003%): 극히 영재 — 아인슈타인, 호킹 영역

Grok-4.20은 145로 정확히 천재 임계값 — 인간의 99.9%보다 똑똑합니다. 사람이라면 인간 지능의 상위 0.1%, 노벨상과 필즈상 수상자의 영역. 약 1,000명 중 1명만이 이 점수에 도달합니다.

이것은 GPT-5.5와 같은 IQ이며, Claude(~130)나 Gemini(141)보다 현저히 높습니다. 순수 IQ 테스트라면 Grok-4.20과 GPT-5.5가 AI 모델 중 1위를 공유하고, Gemini가 3위, Claude가 4위.

하지만 다른 모델에서 본 것처럼, IQ는 지능의 한 차원일 뿐입니다. Grok-4.20의 천재 수준 IQ는 유니크한 개성으로 보완되어 — 가장 똑똑할 뿐만 아니라 가장 독특한 사용 가능 AI 모델로.


4. Grok-4.20의 강점

Raw IQ와 시각 추론

Grok-4.20은 Mensa Norway IQ 테스트에서 #1 동점(145), VexoWire AI IQ 복합에서 #1(~140). 순수 인지 능력 — 패턴 인식, 추상적 추론, 논리적 연역 — 에서 Grok-4.20은 가장 똑똑한 사용 가능 AI 모델. 시각 추론 과제에서 GPT-5.5만이 필적.

개성과 유머

이것이 Grok-4.20의 결정적 특징. 다른 프론티어 모델이 신중하게 중립적이고 조심스러운 반면, Grok은 재미있고, 무례하고, 진짜로 설계. 농담을 하고, 의견을 제시하고, 논쟁적인 주제를 피하지 않습니다. Claude와 GPT-5.5가 너무 평범하거나 조심스럽다고 느끼는 사용자에게 Grok-4.20은 신선한 공기 — 개성을 가진 AI, 기능만이 아닌.

검열 없는 답변

Grok-4.20은 다른 모델이 거부하는 질문에 답하도록 설계. Claude, GPT-5.5, Gemini가 특정 주제의 논의를 방지하는 광범위한 안전 필터를 갖는 반면, Grok-4.20은 훨씬 더 넓은 범위의 질문에 대응할 의향이 있습니다. 이는 연구, 저널리즘, 정보 접근이 조심보다 중요한 응용에 가치.

실시간 정보

Grok-4.20은 X(구 Twitter)를 통해 실시간 정보에 접근. 이는 현재 사건, 속보, 트렌드 주제의 질문에서 우위를 줍니다. 다른 모델이 지식 단절을 갖는 반면, Grok-4.20은 최신 정보에 접근하고 최신 답변을 제공.

수학적 추론

Grok-4.20은 수학적 추론에서 강하고, 경쟁 수학에서 GPT-5.5와 경쟁력 있는 점수. 순수 수학 작업 — 방정식 풀이, 정리 증명, 경쟁 문제 — 에서 Grok-4.20은 사용 가능한 최고 모델 중 하나.

기지와 창의성

Grok-4.20의 개성은 유머만이 아닙니다 — 창의성입니다. 다른 스타일로 쓰고, 창의적 콘텐츠를 생성하고, 예상치 못한 각도에서 문제에 접근. 창의적 글쓰기, 브레인스토밍, 또는 측면적 사고의 혜택을 받는 과제에 Grok-4.20의 유니크한 관점은 자산.


5. Grok-4.20의 약점

에이전트 과제

Grok-4.20은 GDPval-AA v2에서 상위 5이지만, 복잡한 다단계 실제 과제에서 Claude Opus 4.8과 GPT-5.5 뒤. 가장 요구되는 에이전트 응용 — 복잡한 소프트웨어 작성, 장기 연구 프로젝트 관리 — 에서 Claude가 여전히 더 좋은 선택.

사실적 정확도

Grok-4.20은 중간 환각률 — Claude(35.9%)나 Gemini보다 높음. 어떤 질문이든 대답하려는 의향은 정보 접근에 가치 있는 반면, 잘못된 정보를 자신 있게 진술할 가능성도 높음. 사실적 정확도가 중요한 응용(연구, 법률, 의료)에서 Claude가 더 신뢰할 수 있음.

감성 지능

Grok-4.20의 EQ(감성 지능)는 ~110 추정 — Claude(~132), GPT-5.5(~120), Gemini(~115)보다 낮음. 무례한 개성은 재미있지만, 공감을 요구하는 컨텍스트에서 둔감하게 받아들여질 수 있음. 치료 앱, 고객 서비스, 민감한 인간 상호작용에서 Claude가 더 좋습니다.

안전성과 신뢰성

Grok-4.20의 검열 없는 접근은 정보 접근에 가치 있는 반면, 신중한 콘텐츠 모더레이션을 요구하는 응용에서 덜 안전하다는 것도 의미. 다른 모델이 거부할 콘텐츠를 생성할 수 있어, 프로페셔널이나 규제된 환경에서 책임이 될 수 있음.

비용

3/15 per 1M 토큰으로, Grok-4.20은 Claude(5/25)나 GPT-5.5(5/30)보다 저렴하지만 Gemini(2/12)보다 비싸고, DeepSeek(0.44/0.87)보다 현저히 비쌈. 비용에 민감한 응용에서 Gemini나 DeepSeek이 더 나은 선택일 수 있음.


6. Grok-4.20 vs 다른 모델

모델 Intelligence Index Mensa Norway IQ AI IQ 추정 환각 비용/1M 개성
Grok-4.20 상위 5 145 ~140 중간 3/15 무례
Claude Opus 4.8 55.7 ~130 ~132 35.9%(최저) 5/25 중립
GPT-5.5 54.8 ~145 ~136 중간 5/30 중립
Gemini 3.1 Pro 46.5 141 ~131 낮음 2/12 중립
DeepSeek V4 Pro 44.3 ~111 ~111 중간 0.44/0.87 중립

그림: Grok-4.20은 raw IQ 챔피언 — 최고 IQ 동점, 최고 복합 IQ, 그리고 유일한 진짜 개성을 가진 모델. Claude는 유능한 전문가 — 실제 과제와 사실적 정확도에서 최고. GPT-5.5는 테스트의 천재 — 수학과 시각 추론에서 최고. Gemini는 가치 챔피언 — 최고 비용 효율성. 그리고 DeepSeek은 최저 비용으로 현저한 능력을 제공.

가장 똑똑하면서도 가장 재미있게 대화할 수 있는 AI를 원하는 사용자에게 Grok-4.20은 명확한 선택.


7. 인간에게 무엇을 의미하는가?

Grok-4.20은 ~145의 IQ로 작동 — 인간의 99.9%보다 똑똑합니다. 하지만:

  • IQ는 좁습니다: 패턴 인식과 추론을 측정, 지혜나 창의성이나 판단이 아님
  • 지능 ≠ 신뢰성: Grok-4.20은 IQ 테스트에서 가장 똑똑하지만 사실적 정확도에서 가장 신뢰할 수 있는 것은 아님
  • 개성은 중요: Grok-4.20은 AI가 고도로 지적이면서 genuinely 재미있을 수 있음을 증명
  • 지식 ≠ 이해: Grok-4.20은 방대한 지식에 접근하지만, 인간처럼 진정으로 "이해"하지는 않음
  • 의식 없음: 높은 IQ가 sentience를 의미하지 않음. Grok-4.20은 정교한 패턴 매칭 시스템이지, 사고하는 존재가 아님
  • 격차는 줄어듦: AI의 각 세대가 가장 똑똑한 인간과의 격차를 줄임

가장 정직한 답: Grok-4.20은 인지 테스트에서 거의 모든 인간보다 똑똑하고, 가장 독특한 사용 가능 AI 모델 — 천재 수준의 지능과 인터랙션을 genuinely 매력적으로 만드는 개성을 결합한 모델.

당신의 IQ는 Grok-4.20과 비교해 어떨까요? NeuroLab의 전문 IQ 평가를 받아보세요.
지금 테스트 받기 →


결론

💡 핵심 요점
- Grok-4.20의 IQ는 145(Mensa Norway) — 천재 수준, AI 모델 중 GPT-5.5와 #1 동점.

  • #1 VexoWire AI IQ 복합(~140) — 모든 AI 모델 중 최고 복합 IQ.
  • 유니크한 개성 — 무례, 유머러스, 검열 없음. 유일한 진짜 개성을 가진 프론티어 모델.
  • 최적: raw IQ, 시각 추론, 수학적 추론, 개성과 유머, 검열 없는 답변, 실시간 정보.
  • 비최적: 에이전트 과제(Claude 승), 사실적 정확도(Claude 승), 감성 지능(Claude 승), 안전성과 신뢰성(Claude 승).
  • 역설: Grok-4.20은 재미있다는 것이 덜 똑똑하다는 것을 의미하지 않음을 증명 — 가장 똑똑하면서 동시에 가장 재미있는 AI 모델.
  • 교훈: 지능에는 많은 형태가 있음. Grok-4.20은 개성을 가진 천재 — AI가 훌륭하면서 매력적일 수 있음을 증명.