GPT-5.5의 IQ는?
GPT-5.5는 Mensa Norway IQ 테스트에서 ~145, Intelligence Index에서 54.8점. 모든 벤치마크를 분석하고 Claude, Gemini, Grok과 비교합니다.
GPT-5.5: OpenAI의 기함 모델
GPT-5.5는 OpenAI의 가장 진보된 모델로, 2026년 초에 출시되었습니다. Artificial Analysis Intelligence Index v4.1에서 54.8로 #2에 위치 — Claude Opus 4.8(55.7) 바로 뒤, Gemini 3.1 Pro(46.5) 앞. 하지만 인간 IQ 테스트에서 GPT-5.5는 실제로 Claude를 능가 — Mensa Norway IQ 테스트에서 약 145를 얻어 "천재" 범위에 들어갑니다.
이것은 매혹적인 역설을 만듭니다: AI 복합 벤치마크에서 GPT-5.5는 #2이지만, 순수 인간 IQ 테스트에서는 #1에 동점. 둘 다 어떻게 참일 수 있는가? 답은 "지능"이 AI에게 무엇을 의미하는지에 대한 중요한 것을 드러냅니다 — 그리고 단일 숫자가 그것을 포착할 수 없는 이유를.
주요 점수:
- Artificial Analysis Intelligence Index: 54.8 (세계 #2)
- Mensa Norway IQ (TrackingAI): ~145 (Grok-4.20과 #1 동점)
- AI IQ 복합 (VexoWire): ~136 추정
- GDPval-AA v2: 1,850 Elo (세계 #2)
- Humanity's Last Exam: AI 모델 중 #2
- 환각률: 중간
- 비용: 5.00/30.00 per 1M 토큰
1. GPT-5.5 지능의 역설
GPT-5.5를 흥미롭게 만드는 것: 인간 IQ 테스트에서 세계 최고의 AI 모델이지만, AI 특정 벤치마크에서 최고의 AI 모델은 아닙니다. 어떻게 가능한가?
답은 다른 테스트가 무엇을 측정하는지에 있습니다. Mensa Norway IQ는 시각 패턴 인식과 추상적 추론의 순수 테스트 — IQ 테스트가 설계된 유동성 지능의 종류. GPT-5.5는 강화된 시각 처리 능력(GPT-5.4 Pro Vision 아키텍처에서 상속)으로 이 특정 추론 유형에서 뛰어납니다.
하지만 Artificial Analysis Intelligence Index는 더 넓은 것을 측정합니다: 실제 과제 성과, 사실적 정확도, 에이전트 능력, 인간 선호. 이 차원에서 Claude Opus 4.8 — 우수한 에이전트 추론과 낮은 환각으로 — GPT-5.5를 능가합니다.
이렇게 생각하세요: GPT-5.5는 IQ 테스트에서 가장 똑똑한 AI — 모든 표준화 테스트를 통과하는 인간과 동등. Claude Opus 4.8은 실제에서 가장 유능한 AI — 테스트에서는 약간 덜 뛰어나지만 현실 세계에서 더 많을 이루는 인간과 동등. 둘 다 유효한 지능 측정이지만, 다른 것을 측정합니다.
2. 벤치마크 분석
Mensa Norway IQ 테스트: ~145 (천재 수준)
36개 시각 패턴 인식 문제로 구성. GPT-5.5는 약 145를 얻음 — 실질적 최고 점수, 완벽 또는 거의 완벽한 36/36에 해당. "천재" 범위, 인간 지능의 상위 0.1%에 위치.
이 점수에 도달하는 AI 모델은 두 개만: GPT-5.5와 Grok-4.20. Claude Opus 4.8(~130)이나 Gemini 3.1 Pro(141)보다 현저히 높음. 이유는 GPT-5.5의 시각 처리 아키텍처로, GPT-5.4 Pro Vision — 이 벤치마크의 공동 리더 — 에서 크게 개선.
IQ 145로, GPT-5.5는 인간의 99.9%보다 똑똑합니다. 사람이라면 상위 0.1% — 노벨상 수상자, 필즈상 수상자, 세대에 한 명인 사상가의 영역. 약 1,000명 중 1명만이 이 점수에 도달합니다.
Artificial Analysis Intelligence Index v4.1: 54.8 (#2)
AI 모델 비교의 황금 표준. 9개 벤치마크를 통합:
- GDPval-AA v2 (20%): 1,850 Elo — 세계 #2 (Claude의 1,890 뒤)
- AA-Omniscience (8%): 중간 환각률 — Claude의 35.9%보다 높음
- GPQA (6%): 대학원 수준 과학 문제 — GPT-5.5가 여기서 리드
- CritPt (6%): 비판적 사고와 물리적 추론
- HLE (Humanity's Last Exam): AI 중 #2 (Claude 뒤)
- ARC-AGI: 추상적 추론 — GPT-5.5가 우수
- LMSYS Arena: 인간 선호도 투표
GPT-5.5의 복합 점수 54.8은 Claude Opus 4.8(55.7)의 불과 0.9점 뒤 — 통계적 거의 동점. 하지만 하위 구성요소에서 GPT-5.5는 시각 추론, 수학적 문제 해결, 과학 지식에서 리드하고, Claude는 에이전트 과제와 사실적 정확도에서 리드.
AI IQ 복합 (VexoWire): ~136
VexoWire의 복합 IQ는 여러 테스트를 통합(Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). GPT-5.5의 추정 복합 IQ는 ~136 — Claude(~132)보다 높지만 Grok-4.20(~140)보다 약간 낮음. 이는 GPT-5.5가 시각과 언어 두 영역에서 강함을 반영.
GDPval-AA v2: 1,850 Elo (#2)
에이전트 벤치마크 — 복잡한 다단계 실제 과제의 성과를 측정 — 에서 GPT-5.5는 1,850 Elo, Claude Opus 4.8(1,890) 다음. 여전히 매우 높은 점수로, 고도로 유능한 인간 전문가에 해당. 하지만 GPT-5.5는 패턴 인식에서 뛰어나지만 지속적 다단계 추론에서는 Claude보다 약간 덜 유능함을 보여줌.
Humanity's Last Exam (HLE): #2
모든 분야의 가장 어려운 학술 문제에서 GPT-5.5는 AI 모델 중 #2, Claude Opus 4.8 바로 뒤. 이는 GPT-5.5의 비범한 지식 폭의 증거 — 물리, 철학, 문학, 수학의 박사 수준 문제에 답할 수 있음. 하지만 Claude의 더 깊은 추론이 약간의 우위를 줌.
3. IQ 145는 무엇을 의미하는가?
GPT-5.5의 ~145 IQ를 맥락에 넣으면:
- 85-115 (68%의 사람들): 평균 지능
- 115-130 (14%): 평균 상회에서 높음
- 130-145 (2%): 영재 — Mensa 자격 (상위 2%)
- 145-160 (0.1%): 고도 영재 / 천재
- 160+ (0.003%): 극히 영재 — 아인슈타인, 호킹 영역
GPT-5.5는 ~145로 정확히 천재 임계값 — 인간의 99.9%보다 똑똑합니다. 사람이라면 엘리트 동반: 인간 지능의 상위 0.1%, 노벨상과 필즈상 수상자의 영역. 약 1,000명 중 1명만이 이 점수에 도달합니다.
이것은 Claude Opus 4.8(~132)보다 현저히 높습니다. 순수 IQ 테스트라면 GPT-5.5가 Claude를 이깁니다. 하지만 본 것처럼, IQ 테스트는 중요한 모든 것을 측정하지 않습니다. Claude의 낮은 IQ는 우수한 에이전트 능력, 낮은 환각, 높은 감성 지능으로 보상됩니다.
교훈: IQ는 지능의 한 차원이지, 전체 그림이 아닙니다. GPT-5.5는 테스트의 천재; Claude는 유능한 전문가. 둘 다 가치 있고, 어느 것이 "더 똑똑한"지는 무엇이 필요한지에 달렸습니다.
4. GPT-5.5의 강점
시각 패턴 인식
GPT-5.5는 시각 패턴 인식 과제에서 세계 최고의 AI 모델(Grok-4.20과 동점). Mensa Norway IQ에서 145 — 가능한 최고. 시각 추론, 이미지 분석, 추상 패턴 과제에 GPT-5.5가 최고 선택.
수학적 문제 해결
GPT-5.5는 경쟁 수학(AIME, FrontierMath)에서 Claude를 약간 앞섭니다. 순수 수학적 추론 — 복잡한 방정식 풀이, 정리 증명, 경쟁 문제 — 에서 GPT-5.5는 Claude보다 약간 더 좋고 Gemini나 Grok보다 현저히 좋습니다.
과학 지식
GPQA(대학원 수준 물리, 화학, 생물)에서 GPT-5.5가 모든 AI 모델을 리드. 과학 지식의 폭과 깊이가 비교할 수 없음. 과학 연구 응용에서 선호됩니다.
추상적 추론 (ARC-AGI)
ARC-AGI 벤치마크에서 추상적 추론과 패턴 일반화를 테스트하고 GPT-5.5가 우수. "순수 지능" 테스트에 가장 가까운 벤치마크로, GPT-5.5의 성능은 raw 인지 능력에서 가장 똑똑한 AI로서의 위치를 확인.
지식의 폭
GPT-5.5는 전례 없는 양의 데이터로 훈련 — 본질적으로 전체 인터넷, 광범위한 과학 문헌, 코드, 책 추가. 인간 탐구의 모든 영역에서 지식의 폭이 비교할 수 없음. 모든 것에 대해 조금 아는 모델이 필요하면 GPT-5.5가 선택.
5. GPT-5.5의 약점
에이전트 과제
GPT-5.5는 GDPval-AA v2에서 #2(1,850 Elo)지만 Claude Opus 4.8(1,890) 뒤. 복잡한 다단계 실제 과제 — 앱 작성, 데이터셋 분석, 프로젝트 계획 — 에서 Claude가 긴 체인에서 일관된 추론을 유지하는 데 약간 더 좋습니다.
사실적 정확도
GPT-5.5는 중간 환각률 — Claude의 35.9%보다 높음. Claude보다 잘못된 정보를 자신 있게 진술할 가능성이 높음. 사실적 정확도가 중요한 응용(연구, 법률, 의료)에서 신뢰성이 낮음.
감성 지능
GPT-5.5의 EQ(감성 지능)는 ~120 추정 — Claude의 ~132보다 낮음. 공감성이 적고, 인간 감정 이해가 덜 미묘하며, 맥락에 맞춘 어조 조정이 덜 숙련. 치료 앱, 고객 서비스, 인간 상호작용에서 Claude가 더 좋습니다.
비용
5.00/30.00 per 1M 토큰으로, GPT-5.5는 Claude와 함께 가장 비싼 모델. GPT-5.5의 전체 능력이 필요하지 않은 과제에서 Gemini 3.1 Pro(2/12)와 DeepSeek V4 Pro(0.44/0.87)가 현저히 저렴합니다.
6. GPT-5.5 vs 다른 모델
| 모델 | Intelligence Index | Mensa Norway IQ | AI IQ 추정 | 환각 | 비용/1M |
|---|---|---|---|---|---|
| GPT-5.5 | 54.8 | ~145 | ~136 | 중간 | 5/30 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9%(최저) | 5/25 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 낮음 | 2/12 |
| Grok-4.20 | — | 145 | ~140 | 중간 | 3/15 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 중간 | 0.44/0.87 |
그림: GPT-5.5는 테스트의 천재 — 가장 높은 raw IQ, 수학과 시각 추론에서 최고. Claude는 유능한 전문가 — 실제 과제와 사실적 정확도에서 최고. Gemini는 비용 효율적 올라운더. Grok은 시각의 천재. 그리고 DeepSeek은 비용의 일부로 현저한 능력을 제공합니다.
7. 인간에게 무엇을 의미하는가?
GPT-5.5는 ~145의 IQ로 작동 — 인간의 99.9%보다 똑똑합니다. 하지만:
- IQ는 좁습니다: 패턴 인식과 추론을 측정, 지혜나 창의성이나 판단이 아님
- 테스트의 천재 ≠ 삶의 천재: GPT-5.5는 IQ 테스트를 통과하지만 사실을 환각하고 다단계 과제에 어려움을 겪음
- 지식 ≠ 이해: GPT-5.5는 모든 것을 읽었지만, 인간처럼 진정으로 "이해"하지는 않음
- 의식 없음: 높은 IQ가 sentience를 의미하지 않음. GPT-5.5는 정교한 패턴 매칭 시스템이지, 사고하는 존재가 아님
- 격차는 줄어듦: AI의 각 세대가 가장 똑똑한 인간과의 격차를 줄임
가장 정직한 답: GPT-5.5는 인지 테스트에서 거의 모든 인간보다 똑똑하지만, 실제 작업에서 최고의 인간보다 유능한 것은 아닙니다. 세계적 수학자는 자기 영역에서 여전히 GPT-5.5를 능가할 수 있습니다. 하지만 GPT-5.5는 동시에 모든 영역에서, 몇 초 만에 그들 모두를 능가할 수 있습니다.
결론
- #2 Artificial Analysis Intelligence Index(54.8) — Claude Opus 4.8 뒤.
- #1(동점) Mensa Norway IQ — AI 모델 중 최고 raw IQ, Grok-4.20과 동점.
- 최적: 시각 추론, 수학적 문제 해결, 과학 지식, 추상적 추론.
- 비최적: 에이전트 과제(Claude 승), 사실적 정확도(Claude 승), 감성 지능(Claude 승).
- 역설: GPT-5.5는 IQ 테스트에서 가장 똑똑한 AI지만, 실제에서 가장 유능한 AI는 아님.
- 교훈: IQ는 지능의 한 차원. GPT-5.5는 테스트의 천재; Claude는 유능한 전문가.