DeepSeek V4의 IQ는?
DeepSeek V4 Pro는 Mensa Norway IQ 테스트에서 111, Intelligence Index에서 44.3을 받습니다. 모든 벤치마크를 분석하고 최고의 예산 AI 모델인 이유를 설명합니다.
DeepSeek V4 Pro: 중국의 오픈소스 챔피언
DeepSeek V4 Pro는 DeepSeek의 기함 모델로, 저비용과 고성능의 조합으로 세계를 놀라게 한 중국 AI 연구소입니다. 2026년 초 출시되어 Mensa Norway IQ 테스트에서 111, Artificial Analysis Intelligence Index v4.1에서 44.3을 획득 — 세계 상위 10위에 들지만, 프론티어 모델(Claude 55.7, GPT-5.5 54.8)에는 크게 뒤집니다.
DeepSeek V4 Pro를 remarkable하게 만드는 것은 raw 지능이 아니라 가격입니다. 0.44/0.87 per 1M 토큰으로, Claude(5/25)와 GPT-5.5(5/30)의 약 10분의 1, Gemini(2/12)의 약 5분의 1 비용입니다. Claude에 1회 쿼리하는 가격으로 DeepSeek V4 Pro에 10회 쿼리할 수 있습니다. 그러면서도 IQ 테스트에서 111 — 인간의 약 25%보다 높습니다.
DeepSeek V4 Pro는 서민의 AI입니다: 지능의 프론티어에서 경쟁하지 않지만, 실질적으로 무료인 가격으로 유능한 AI를 모두에게 제공하는 모델. 학생, 취미가, 중소기업, 비용 민감 시장의 개발자에게 DeepSeek V4 Pro는 종종 유일한 실행 가능한 선택입니다.
주요 점수:
- Artificial Analysis Intelligence Index: 44.3 (세계 상위 10)
- Mensa Norway IQ (TrackingAI): 111 (인간 평균 이상)
- AI IQ 복합 (VexoWire): ~111 추정
- GDPval-AA v2: 상위 10
- Humanity's Last Exam: 상위 10
- 환각률: 중간
- 비용: 0.44/0.87 per 1M 토큰 (모든 주요 모델 중 최저)
- 오픈소스: 로컬 배포 가능 weights
1. 예산 혁명
DeepSeek V4 Pro는 AI 환경에서 근본적인 변화를 나타냅니다: 지능의 민주화. 미국 연구소(OpenAI, Anthropic, Google, xAI)가 프론티어에서 경쟁하는 동안 — IQ 점수를 130에서 140에서 145로 밀어붙이는 — DeepSeek은 다른 목표에 집중했습니다: 유능한 AI를 모두에게 저렴하게 만드는 것.
0.44 per 1M 입력 토큰,0.87 per 1M 출력으로, DeepSeek V4 Pro는 놀라울 정도로 저렴합니다. 예를 들어: 전형적인 책 길이 문서(약 100,000 토큰) 처리는 입력 약 0.04, 출력 약0.09입니다. 같은 작업이 Gemini면 0.50-1.00, Claude나 GPT-5.5면 1.00-3.00입니다.
이것은 단순한 할인이 아니라 — 다른 제품 카테고리입니다. DeepSeek V4 Pro는 다음에 AI를 접근 가능하게 만듭니다:
- 학생: $20/월 구독을 감당할 수 없는
- 중소기업: 개발 시장에서
- 취미가와 실험자
- 개발자: 대용량 앱 구축
- 연구자: 제한된 예산으로 대규모 데이터셋 처리
remarkable한 것은: DeepSeek V4 Pro는 genuinely 유능합니다. Mensa Norway IQ 테스트에서 111 — 인간 평균 100을 넘고, 인간의 약 25%보다 높습니다. 천재는 아니지만, 대부분의 일상 작업에 충분히 똑똑합니다: 글쓰기, 프로그래밍, 분석, 번역, 요약.
2. 벤치마크 분석
Mensa Norway IQ 테스트: 111 (평균 이상)
36개 시각 패턴 인식 문제로 구성. DeepSeek V4 Pro는 111을 획득 — 인간 평균 100을 넘어, "평균 이상" 범위에 위치. 인간의 약 25%보다 높지만, 프론티어 모델(Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145)에는 크게 미치지 못합니다.
IQ 111은 DeepSeek V4 Pro가 똑똑한 대학생 수준에서 시각 패턴을 인식하고 추상적으로 추론할 수 있음을 의미합니다. 가장 어려운 퍼즐은 풀지 못하지만, 대부분의 일상적 추론 작업을 유능하게 처리합니다.
DeepSeek V4 Pro(111)와 프론티어 모델(130-145)의 차이는 significant — 약 20-35 IQ 포인트, 또는 약 1-2 표준편차. 이는 프론티어 모델이 순수 인지 테스트에서 substantially 더 똑똑함을 의미합니다. 하지만 천재 수준 추론이 필요하지 않은 작업 — 즉 대부분 — 에는 DeepSeek V4 Pro가 충분 이상입니다.
Artificial Analysis Intelligence Index v4.1: 44.3 (상위 10)
Intelligence Index에서 DeepSeek V4 Pro는 44.3을 획득 — 세계 상위 10이지만, 프론티어 리더(Claude 55.7, GPT-5.5 54.8)에서 약 10-11 포인트 뒤. 이 차이는 significant하지만 가격 차이를 고려하면 예상됩니다.
Index 구성 요소 분해:
- GDPval-AA v2: DeepSeek은 합리적으로 점수하지만 복잡한 다단계 작업에서 Claude와 GPT-5.5에 뒤처짐
- AA-Omniscience: DeepSeek은 중간 환각률 — Claude만큼 낮지 않지만 대부분 용도에 허용 가능
- GPQA: DeepSeek은 대학원 수준 과학 문제에서 적절히 수행
- HLE: DeepSeek은 Humanity's Last Exam에서 상위 10
- ARC-AGI: DeepSeek은 프론티어 모델에 비해 추상적 추론에서 어려움
- LMSYS Arena: DeepSeek은 괜찮은 인간 선호 점수를 받음, 특히 프로그래밍 작업에서
AI IQ 복합 (VexoWire): ~111
VexoWire의 복합 IQ는 여러 테스트를 통합(Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). DeepSeek V4 Pro의 추정 복합 IQ는 ~111 — Mensa Norway 점수와 일치. "평균 이상" 범위에 확고히 위치하며, 똑똑한 인간과 비견되지만 천재 수준에는 크게 미치지 못함.
GDPval-AA v2: 상위 10
에이전트 벤치마크에서 DeepSeek V4 Pro는 상위 10. 복잡한 다단계 작업에서 Claude(1,890 Elo)와 GPT-5.5(1,850 Elo)보다 significantly 덜 유능하지만, 중간 정도의 에이전트 워크로드를 처리할 수 있습니다. 간단한 자동화, 기본 프로그래밍 작업, 직접적인 다단계 지시에 DeepSeek V4 Pro는 유능합니다.
Humanity's Last Exam (HLE): 상위 10
가장 어려운 학술 문제에서 DeepSeek V4 Pro는 AI 모델 중 상위 10. 이는 DeepSeek의 학술 및 과학 데이터에 대한 강력한 훈련을 반영 — 모델은 모든 분야에서 폭넓은 지식을 갖지만, 프론티어 모델의 추론 깊이에는 미치지 못합니다.
3. IQ 111은 무엇을 의미하는가?
DeepSeek V4 Pro의 111 IQ를 맥락에 넣으면:
- 85-115 (68%의 사람들): 평균 지능
- 115-130 (14%): 평균 상회에서 높음
- 130-145 (2%): 영재 — Mensa 자격 (상위 2%)
- 145-160 (0.1%): 고도 영재 / 천재
DeepSeek V4 Pro는 111로 평균 범위의 상단에 위치 — 인간의 약 25%보다 똑똑하지만, "평균 이상" 임계값 115에 완전히 도달하지는 않음. 사람이라면 똑똑한 대학생이나 유능한 전문가에 해당 — 천재는 아니지만 확실히 유능.
이는 프론티어 모델보다 눈에 띄게 낮습니다:
- Claude Opus 4.8: ~130 (영재)
- Gemini 3.1 Pro: 141 (고도 영재)
- GPT-5.5: ~145 (천재)
- Grok-4.20: 145 (천재)
차이는 significant — 약 20-35 IQ 포인트. 하지만 핵심 질문은: 당신의 사용 사례에 차이가 중요한가? 대부분의 일상 작업 — 이메일 작성, 문서 요약, 기본 프로그래밍, 번역 — 에는 IQ 111이 충분 이상. 프론티어 모델의 우위는 가장 어려운 문제에서 나타납니다: 복잡한 수학적 증명, 복잡한 다단계 추론, 최첨단 연구 문제.
4. DeepSeek V4 Pro의 강점
비용 효율성
이것이 DeepSeek V4 Pro의 결정적 특징. 0.44/0.87 per 1M 토큰으로, 압도적으로 가장 저렴한 주요 AI 모델. 대용량 앱 — 수천 사용자에게 서비스하는 챗봇, 대량 문서 처리, 대규모 데이터 분석 — 에는 비용 절감이 엄청납니다. Claude나 GPT-5.5 1회 쿼리 가격으로 10-30회 DeepSeek 쿼리를 실행할 수 있습니다.
프로그래밍 및 기술 작업
DeepSeek V4 Pro는 프로그래밍 작업에 특히 강합니다. DeepSeek은 코드 훈련 데이터에 크게 투자했고, HumanEval과 MBPP 같은 벤치마크에서 좋은 성과. 프론티어 가격을 감당할 수 없지만 코딩 어시스턴트가 필요한 개발자에게 DeepSeek V4 Pro는 훌륭한 선택.
오픈소스 가용성
DeepSeek V4 Pro의 weights는 로컬 배포에 사용 가능. 이는 조직이 자체 하드웨어에서 모델을 실행하고, API 비용을 완전히 피하고, 데이터를 비공개로 유지할 수 있음을 의미합니다. 보안 중시 조직, 제한된 환경의 연구자, 완전한 제어가 필요한 개발자에게 이는 큰 이점.
다국어 지원
DeepSeek V4 Pro는 중국어와 영어로 광범위하게 훈련되었으며, 다른 주요 언어도 강력히 지원. 중국어 앱에는 DeepSeek이 최고의 모델 중 하나 — 때로는 중국어 작업에서 서양 모델을 능가.
수학적 추론
GPT-5.5 수준은 아니지만, DeepSeek V4 Pro는 수학적 추론에서 유능. 대부분의 고교·대학 수준 수학 문제를 풀 수 있고, 산술과 대수를 안정적으로 처리. 일상 수학 작업에는 충분 이상.
속도
DeepSeek V4 Pro는 빠름 — 더 작은 크기와 최적화된 아키텍처로 빠른 응답 생성. 레이턴시가 중요한 앱 — 실시간 채팅, 인터랙티브 도구, 고객 서비스 — 에 DeepSeek V4 Pro는 반응성 좋은 성능을 제공.
5. DeepSeek V4 Pro의 약점
Raw IQ와 복잡한 추론
IQ 111로, DeepSeek V4 Pro는 복잡한 추론 작업에서 프론티어 모델보다 significantly 낮습니다. 가장 어려운 문제 — 경쟁 수학, 고급 논리 퍼즐, 다단계 추상 추론 — 에는 프론티어 모델이 substantially 더 우수. 당신의 작업이 천재 수준 추론을 필요로 한다면, DeepSeek V4 Pro는 Claude나 GPT-5.5가 성공할 곳에서 어려움을 겪을 것입니다.
에이전트 작업
GDPval-AA v2에서 DeepSeek V4 Pro는 상위 10이지만 Claude와 GPT-5.5에 크게 뒤처집니다. 복잡한 다단계 실제 작업 — 대규모 소프트웨어 프로젝트 작성, 연구 워크플로 관리, 복잡한 계획 실행 — 에 DeepSeek V4 Pro는 신뢰성이 낮습니다. 간단한 에이전트 작업은 처리하지만 복잡한 것에는 어려움.
환각률
DeepSeek V4 Pro는 중간 환각률 — Claude(35.9%)와 Gemini보다 높음. 특히 틈새나 전문 주제에서 잘못된 정보를 자신 있게 진술할 가능성이 더 높음. 사실적 정확도가 중요한 앱(연구, 법률, 의료)에서 Claude가 더 신뢰할 수 있음.
감성 지능
DeepSeek V4 Pro의 EQ(감성 지능)는 ~105 추정 — 모든 프론티어 모델(Claude ~132, GPT-5.5 ~120, Gemini ~115, Grok ~110)보다 낮음. 응답이 더 기계적이고 인간 감정 이해에서 less nuanced. 치료 앱, 고객 서비스, 민감한 인간 상호작용에는 이는 한계.
안전성과 정렬
DeepSeek V4 Pro는 중국 규제 요구사항을 따르며, 특정 정치적으로 민감한 질문을 거부할 수 있습니다. 이는 서양 모델의 안전 필터(유해 콘텐츠에 초점)와 다르며, 특정 주제에서의 유용성에 영향을 미칠 수 있습니다.
6. DeepSeek V4 Pro vs 다른 모델
| 모델 | Intelligence Index | Mensa Norway IQ | AI IQ 추정 | 환각 | 비용/1M | 오픈소스 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 중간 | 0.44/0.87 | 예 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9%(최저) | 5/25 | 아니오 |
| GPT-5.5 | 54.8 | ~145 | ~136 | 중간 | 5/30 | 아니오 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 낮음 | 2/12 | 아니오 |
| Grok-4.20 | 상위 5 | 145 | ~140 | 중간 | 3/15 | 아니오 |
그림: DeepSeek V4 Pro는 예산 챔피언 — 가장 똑똑하지는 않지만, 압도적으로 가장 저렴. Claude는 유능한 전문가 — 실제 작업과 사실적 정확도에서 최고. GPT-5.5는 테스트의 천재 — 수학과 시각 추론에서 최고. Gemini는 가치 챔피언 — 프론티어 모델 중 최고 비용 효율성. Grok-4.20은 raw IQ 챔피언 — 최고 IQ와 유니크한 개성.
최저 가격에 유능한 AI를 원하는 사용자에게 DeepSeek V4 Pro는 명확한 선택. 가장 어려운 문제에서 프론티어 모델에 필적하지 않지만, 일상 작업의 90%에는 충분 이상 — 극히 일부 비용으로.
7. 인간에게 무엇을 의미하는가?
DeepSeek V4 Pro는 ~111의 IQ로 작동 — 인간의 약 25%보다 똑똑합니다. 하지만:
- IQ가 전부는 아님: IQ 111은 평균 이상이며 대부분의 실용적 작업에 충분
- 대부분의 용도에서 비용이 IQ보다 중요: 일상 앱에서 DeepSeek의 10배 비용 절감이 프론티어 모델과의 20-35 포인트 IQ 차이보다 중요한 경우가 많음
- 오픈소스가 혁신을 가능케: DeepSeek의 오픈 weights는 연구자와 개발자가 맞춤 솔루션을 구축하고, 특정 도메인에 fine-tune하고, 로컬에서 실행하는 것을 가능케
- 지식 ≠ 이해: 모든 AI 모델과 같이 DeepSeek은 방대한 지식에 접근하지만 인간처럼 genuinely "이해"하지는 않음
- 의식 없음: 높은 IQ가 sentience를 의미하지 않음. DeepSeek은 정교한 패턴 매칭 시스템이지 사고하는 존재가 아님
- AI의 민주화: DeepSeek V4 Pro는 유능한 AI가 비쌀 필요 없음을 증명 — 모두에게 접근 가능할 수 있음
가장 정직한 답: DeepSeek V4 Pro는 인지 테스트에서 인간의 4분의 1보다 똑똑하고, 대부분의 실용적 목적에서 가장 똑똑한 선택 — 가장 지적이기 때문이 아니라 달러당 최대 가치를 제공하기 때문.
결론
- 44.3 on Intelligence Index — 세계 상위 10이지만 프론티어 모델에서 ~10 포인트 뒤.
- 모든 주요 모델 중 최저 비용 — 0.44/0.87 per 1M 토큰, Claude나 GPT-5.5의 약 10분의 1.
- 오픈소스 — 로컬 배포 가능 weights, 프라이버시와 맞춤화를 가능케.
- 최적: 비용 민감 앱, 프로그래밍, 대용량 작업, 중국어 앱, 로컬 배포.
- 비최적: 복잡한 추론(프론티어 모델 승), 에이전트 작업(Claude 승), 사실적 정확도(Claude 승), 감성 지능(Claude 승).
- 교훈: 지능은 가장 똑똑한 것만이 아니라 접근 가능한 것. DeepSeek V4 Pro는 AI를 민주화하고 유능한 지능을 모두에게 제공.