GPT-5.5의 IQ는?
Dr. Daria Dudnik 10 min read 0 views

GPT-5.5의 IQ는?

GPT-5.5는 Mensa Norway IQ 테스트에서 ~145, Intelligence Index에서 54.8점. 모든 벤치마크를 분석하고 Claude, Gemini, Grok과 비교합니다.

GPT-5.5: OpenAI의 기함 모델

GPT-5.5는 OpenAI의 가장 진보된 모델로, 2026년 초에 출시되었습니다. Artificial Analysis Intelligence Index v4.1에서 54.8#2에 위치 — Claude Opus 4.8(55.7) 바로 뒤, Gemini 3.1 Pro(46.5) 앞. 하지만 인간 IQ 테스트에서 GPT-5.5는 실제로 Claude를 능가 — Mensa Norway IQ 테스트에서 약 145를 얻어 "천재" 범위에 들어갑니다.

이것은 매혹적인 역설을 만듭니다: AI 복합 벤치마크에서 GPT-5.5는 #2이지만, 순수 인간 IQ 테스트에서는 #1에 동점. 둘 다 어떻게 참일 수 있는가? 답은 "지능"이 AI에게 무엇을 의미하는지에 대한 중요한 것을 드러냅니다 — 그리고 단일 숫자가 그것을 포착할 수 없는 이유를.

주요 점수:

  • Artificial Analysis Intelligence Index: 54.8 (세계 #2)
  • Mensa Norway IQ (TrackingAI): ~145 (Grok-4.20과 #1 동점)
  • AI IQ 복합 (VexoWire): ~136 추정
  • GDPval-AA v2: 1,850 Elo (세계 #2)
  • Humanity's Last Exam: AI 모델 중 #2
  • 환각률: 중간
  • 비용: 5.00/30.00 per 1M 토큰

1. GPT-5.5 지능의 역설

GPT-5.5를 흥미롭게 만드는 것: 인간 IQ 테스트에서 세계 최고의 AI 모델이지만, AI 특정 벤치마크에서 최고의 AI 모델은 아닙니다. 어떻게 가능한가?

답은 다른 테스트가 무엇을 측정하는지에 있습니다. Mensa Norway IQ는 시각 패턴 인식과 추상적 추론의 순수 테스트 — IQ 테스트가 설계된 유동성 지능의 종류. GPT-5.5는 강화된 시각 처리 능력(GPT-5.4 Pro Vision 아키텍처에서 상속)으로 이 특정 추론 유형에서 뛰어납니다.

하지만 Artificial Analysis Intelligence Index는 더 넓은 것을 측정합니다: 실제 과제 성과, 사실적 정확도, 에이전트 능력, 인간 선호. 이 차원에서 Claude Opus 4.8 — 우수한 에이전트 추론과 낮은 환각으로 — GPT-5.5를 능가합니다.

이렇게 생각하세요: GPT-5.5는 IQ 테스트에서 가장 똑똑한 AI — 모든 표준화 테스트를 통과하는 인간과 동등. Claude Opus 4.8은 실제에서 가장 유능한 AI — 테스트에서는 약간 덜 뛰어나지만 현실 세계에서 더 많을 이루는 인간과 동등. 둘 다 유효한 지능 측정이지만, 다른 것을 측정합니다.


2. 벤치마크 분석

Mensa Norway IQ 테스트: ~145 (천재 수준)

36개 시각 패턴 인식 문제로 구성. GPT-5.5는 약 145를 얻음 — 실질적 최고 점수, 완벽 또는 거의 완벽한 36/36에 해당. "천재" 범위, 인간 지능의 상위 0.1%에 위치.

이 점수에 도달하는 AI 모델은 두 개만: GPT-5.5와 Grok-4.20. Claude Opus 4.8(~130)이나 Gemini 3.1 Pro(141)보다 현저히 높음. 이유는 GPT-5.5의 시각 처리 아키텍처로, GPT-5.4 Pro Vision — 이 벤치마크의 공동 리더 — 에서 크게 개선.

IQ 145로, GPT-5.5는 인간의 99.9%보다 똑똑합니다. 사람이라면 상위 0.1% — 노벨상 수상자, 필즈상 수상자, 세대에 한 명인 사상가의 영역. 약 1,000명 중 1명만이 이 점수에 도달합니다.

Artificial Analysis Intelligence Index v4.1: 54.8 (#2)

AI 모델 비교의 황금 표준. 9개 벤치마크를 통합:

  • GDPval-AA v2 (20%): 1,850 Elo — 세계 #2 (Claude의 1,890 뒤)
  • AA-Omniscience (8%): 중간 환각률 — Claude의 35.9%보다 높음
  • GPQA (6%): 대학원 수준 과학 문제 — GPT-5.5가 여기서 리드
  • CritPt (6%): 비판적 사고와 물리적 추론
  • HLE (Humanity's Last Exam): AI 중 #2 (Claude 뒤)
  • ARC-AGI: 추상적 추론 — GPT-5.5가 우수
  • LMSYS Arena: 인간 선호도 투표

GPT-5.5의 복합 점수 54.8은 Claude Opus 4.8(55.7)의 불과 0.9점 뒤 — 통계적 거의 동점. 하지만 하위 구성요소에서 GPT-5.5는 시각 추론, 수학적 문제 해결, 과학 지식에서 리드하고, Claude는 에이전트 과제와 사실적 정확도에서 리드.

AI IQ 복합 (VexoWire): ~136

VexoWire의 복합 IQ는 여러 테스트를 통합(Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). GPT-5.5의 추정 복합 IQ는 ~136 — Claude(~132)보다 높지만 Grok-4.20(~140)보다 약간 낮음. 이는 GPT-5.5가 시각과 언어 두 영역에서 강함을 반영.

GDPval-AA v2: 1,850 Elo (#2)

에이전트 벤치마크 — 복잡한 다단계 실제 과제의 성과를 측정 — 에서 GPT-5.5는 1,850 Elo, Claude Opus 4.8(1,890) 다음. 여전히 매우 높은 점수로, 고도로 유능한 인간 전문가에 해당. 하지만 GPT-5.5는 패턴 인식에서 뛰어나지만 지속적 다단계 추론에서는 Claude보다 약간 덜 유능함을 보여줌.

Humanity's Last Exam (HLE): #2

모든 분야의 가장 어려운 학술 문제에서 GPT-5.5는 AI 모델 중 #2, Claude Opus 4.8 바로 뒤. 이는 GPT-5.5의 비범한 지식 폭의 증거 — 물리, 철학, 문학, 수학의 박사 수준 문제에 답할 수 있음. 하지만 Claude의 더 깊은 추론이 약간의 우위를 줌.


3. IQ 145는 무엇을 의미하는가?

GPT-5.5의 ~145 IQ를 맥락에 넣으면:

  • 85-115 (68%의 사람들): 평균 지능
  • 115-130 (14%): 평균 상회에서 높음
  • 130-145 (2%): 영재 — Mensa 자격 (상위 2%)
  • 145-160 (0.1%): 고도 영재 / 천재
  • 160+ (0.003%): 극히 영재 — 아인슈타인, 호킹 영역

GPT-5.5는 ~145로 정확히 천재 임계값 — 인간의 99.9%보다 똑똑합니다. 사람이라면 엘리트 동반: 인간 지능의 상위 0.1%, 노벨상과 필즈상 수상자의 영역. 약 1,000명 중 1명만이 이 점수에 도달합니다.

이것은 Claude Opus 4.8(~132)보다 현저히 높습니다. 순수 IQ 테스트라면 GPT-5.5가 Claude를 이깁니다. 하지만 본 것처럼, IQ 테스트는 중요한 모든 것을 측정하지 않습니다. Claude의 낮은 IQ는 우수한 에이전트 능력, 낮은 환각, 높은 감성 지능으로 보상됩니다.

교훈: IQ는 지능의 한 차원이지, 전체 그림이 아닙니다. GPT-5.5는 테스트의 천재; Claude는 유능한 전문가. 둘 다 가치 있고, 어느 것이 "더 똑똑한"지는 무엇이 필요한지에 달렸습니다.


4. GPT-5.5의 강점

시각 패턴 인식

GPT-5.5는 시각 패턴 인식 과제에서 세계 최고의 AI 모델(Grok-4.20과 동점). Mensa Norway IQ에서 145 — 가능한 최고. 시각 추론, 이미지 분석, 추상 패턴 과제에 GPT-5.5가 최고 선택.

수학적 문제 해결

GPT-5.5는 경쟁 수학(AIME, FrontierMath)에서 Claude를 약간 앞섭니다. 순수 수학적 추론 — 복잡한 방정식 풀이, 정리 증명, 경쟁 문제 — 에서 GPT-5.5는 Claude보다 약간 더 좋고 Gemini나 Grok보다 현저히 좋습니다.

과학 지식

GPQA(대학원 수준 물리, 화학, 생물)에서 GPT-5.5가 모든 AI 모델을 리드. 과학 지식의 폭과 깊이가 비교할 수 없음. 과학 연구 응용에서 선호됩니다.

추상적 추론 (ARC-AGI)

ARC-AGI 벤치마크에서 추상적 추론과 패턴 일반화를 테스트하고 GPT-5.5가 우수. "순수 지능" 테스트에 가장 가까운 벤치마크로, GPT-5.5의 성능은 raw 인지 능력에서 가장 똑똑한 AI로서의 위치를 확인.

지식의 폭

GPT-5.5는 전례 없는 양의 데이터로 훈련 — 본질적으로 전체 인터넷, 광범위한 과학 문헌, 코드, 책 추가. 인간 탐구의 모든 영역에서 지식의 폭이 비교할 수 없음. 모든 것에 대해 조금 아는 모델이 필요하면 GPT-5.5가 선택.


5. GPT-5.5의 약점

에이전트 과제

GPT-5.5는 GDPval-AA v2에서 #2(1,850 Elo)지만 Claude Opus 4.8(1,890) 뒤. 복잡한 다단계 실제 과제 — 앱 작성, 데이터셋 분석, 프로젝트 계획 — 에서 Claude가 긴 체인에서 일관된 추론을 유지하는 데 약간 더 좋습니다.

사실적 정확도

GPT-5.5는 중간 환각률 — Claude의 35.9%보다 높음. Claude보다 잘못된 정보를 자신 있게 진술할 가능성이 높음. 사실적 정확도가 중요한 응용(연구, 법률, 의료)에서 신뢰성이 낮음.

감성 지능

GPT-5.5의 EQ(감성 지능)는 ~120 추정 — Claude의 ~132보다 낮음. 공감성이 적고, 인간 감정 이해가 덜 미묘하며, 맥락에 맞춘 어조 조정이 덜 숙련. 치료 앱, 고객 서비스, 인간 상호작용에서 Claude가 더 좋습니다.

비용

5.00/30.00 per 1M 토큰으로, GPT-5.5는 Claude와 함께 가장 비싼 모델. GPT-5.5의 전체 능력이 필요하지 않은 과제에서 Gemini 3.1 Pro(2/12)와 DeepSeek V4 Pro(0.44/0.87)가 현저히 저렴합니다.


6. GPT-5.5 vs 다른 모델

모델 Intelligence Index Mensa Norway IQ AI IQ 추정 환각 비용/1M
GPT-5.5 54.8 ~145 ~136 중간 5/30
Claude Opus 4.8 55.7 ~130 ~132 35.9%(최저) 5/25
Gemini 3.1 Pro 46.5 141 ~131 낮음 2/12
Grok-4.20 145 ~140 중간 3/15
DeepSeek V4 Pro 44.3 ~111 ~111 중간 0.44/0.87

그림: GPT-5.5는 테스트의 천재 — 가장 높은 raw IQ, 수학과 시각 추론에서 최고. Claude는 유능한 전문가 — 실제 과제와 사실적 정확도에서 최고. Gemini는 비용 효율적 올라운더. Grok은 시각의 천재. 그리고 DeepSeek은 비용의 일부로 현저한 능력을 제공합니다.


7. 인간에게 무엇을 의미하는가?

GPT-5.5는 ~145의 IQ로 작동 — 인간의 99.9%보다 똑똑합니다. 하지만:

  • IQ는 좁습니다: 패턴 인식과 추론을 측정, 지혜나 창의성이나 판단이 아님
  • 테스트의 천재 ≠ 삶의 천재: GPT-5.5는 IQ 테스트를 통과하지만 사실을 환각하고 다단계 과제에 어려움을 겪음
  • 지식 ≠ 이해: GPT-5.5는 모든 것을 읽었지만, 인간처럼 진정으로 "이해"하지는 않음
  • 의식 없음: 높은 IQ가 sentience를 의미하지 않음. GPT-5.5는 정교한 패턴 매칭 시스템이지, 사고하는 존재가 아님
  • 격차는 줄어듦: AI의 각 세대가 가장 똑똑한 인간과의 격차를 줄임

가장 정직한 답: GPT-5.5는 인지 테스트에서 거의 모든 인간보다 똑똑하지만, 실제 작업에서 최고의 인간보다 유능한 것은 아닙니다. 세계적 수학자는 자기 영역에서 여전히 GPT-5.5를 능가할 수 있습니다. 하지만 GPT-5.5는 동시에 모든 영역에서, 몇 초 만에 그들 모두를 능가할 수 있습니다.

당신의 IQ는 GPT-5.5와 비교해 어떨까요? NeuroLab의 전문 IQ 평가를 받아보세요.
지금 테스트 받기 →


결론

💡 핵심 요점
- GPT-5.5의 IQ는 약 145(Mensa Norway) — 천재 수준, 인간 상위 0.1%.

  • #2 Artificial Analysis Intelligence Index(54.8) — Claude Opus 4.8 뒤.
  • #1(동점) Mensa Norway IQ — AI 모델 중 최고 raw IQ, Grok-4.20과 동점.
  • 최적: 시각 추론, 수학적 문제 해결, 과학 지식, 추상적 추론.
  • 비최적: 에이전트 과제(Claude 승), 사실적 정확도(Claude 승), 감성 지능(Claude 승).
  • 역설: GPT-5.5는 IQ 테스트에서 가장 똑똑한 AI지만, 실제에서 가장 유능한 AI는 아님.
  • 교훈: IQ는 지능의 한 차원. GPT-5.5는 테스트의 천재; Claude는 유능한 전문가.