GPT-5.5'in IQ'su kaç?
Dr. Daria Dudnik 10 min read 0 views

GPT-5.5'in IQ'su kaç?

GPT-5.5, Mensa Norway IQ testinde ~145 ve Intelligence Index'te 54.8 alıyor. Her benchmarkı analiz ediyor, Claude, Gemini ve Grok ile karşılaştırıyoruz.

GPT-5.5: OpenAI'in amiral gemisi modeli

GPT-5.5, OpenAI'in en gelişmiş modelidir ve 2026 başında piyasaya sürülmüştür. Artificial Analysis Intelligence Index v4.1'de 54.8 ile #2'de yer alır — Claude Opus 4.8'in (55.7) hemen arkasında, Gemini 3.1 Pro'nun (46.5) önünde. Ama insan IQ testlerinde GPT-5.5 aslında Claude'u geçer — Mensa Norway IQ testinde yaklaşık 145 alarak "dahi" aralığına girer.

Bu, büyüleyici bir paradoks yaratır: AI bileşik benchmarkında GPT-5.5 #2'dir. Ama saf bir insan IQ testinde #1'i paylaşır. İkisi de nasıl doğru olabilir? Cevap, "zeka"nın AI için ne anlama geldiği hakkında önemli bir şeyi ortaya çıkarır — ve tek bir sayının bunu yakalayamayacağını.

Anahtar puanlar:

  • Artificial Analysis Intelligence Index: 54.8 (dünya #2)
  • Mensa Norway IQ (TrackingAI): ~145 (Grok-4.20 ile #1 paylaşımı)
  • AI IQ bileşik (VexoWire): ~136 tahmini
  • GDPval-AA v2: 1.850 Elo (dünya #2)
  • Humanity's Last Exam: AI modelleri arasında #2
  • Halüsinasyon oranı: orta düzey
  • Maliyet: 5.00/30.00 per 1M token

1. GPT-5.5 zekasının paradoksu

GPT-5.5'i bu kadar ilginç yapan şey: insan IQ testlerinde dünyanın en iyi AI modeli, ama AI'a özgü benchmarklarda en iyi AI modeli değil. Nasıl mümkün?

Cevap, farklı testlerin ne ölçtüğünde. Mensa Norway, görsel desen tanıma ve soyut akıl yürütmenin saf bir testidir — IQ testlerinin için tasarlandığı akıcı zeka türü. GPT-5.5, geliştirilmiş görsel işleme yetenekleriyle (GPT-5.4 Pro Vision mimarisinden miras), bu belirli akıl yürütme türünde üstündür.

Ama Artificial Analysis Intelligence Index daha geniş bir şeyi ölçer: gerçek dünya görev performansı, faktüel doğruluk, ajan kapasitesi ve insan tercihi. Ve bu boyutlarda, Claude Opus 4.8 — üstün ajan akıl yürütme ve daha düşük halüsinasyonla — GPT-5.5'i geçer.

Şöyle düşünün: GPT-5.5 bir IQ testinde en akıllı AI — her standardize testi geçen bir insana eşdeğer. Claude Opus 4.8 pratikte en yetenekli AI — testlerde biraz daha az parlak ama gerçek dünyada daha çok şey başaran bir insana eşdeğer. İkisi de geçerli zeka ölçümleridir, ama farklı şeyleri ölçerler.


2. Benchmark analizi

Mensa Norway IQ testi: ~145 (dahi seviyesi)

36 görsel desen tanıma sorusundan oluşur. GPT-5.5 yaklaşık 145 alır — pratik maksimum puan, mükemmel veya mükemmele yakın 36/36'ya eşdeğer. Bu onu "dahi" aralığına, insan zekasının üst %0.1'ine koyar.

Bu skoru sadece iki AI modeli ulaşır: GPT-5.5 ve Grok-4.20. Claude Opus 4.8'den (~130) ve Gemini 3.1 Pro'dan (141) önemli ölçüde yüksek. Sebep, GPT-5.5'in görsel işleme mimarisidir — GPT-5.4 Pro Vision'dan (bu benchmarkta zaten co-leader) önemli ölçüde geliştirilmiş.

IQ 145 ile GPT-5.5 insanların %99.9'undan daha akıllı. Bir kişi olsaydı, üst %0.1'de olurdu — Nobel ödüllüleri, Fields madalyalıları ve nesil başına bir düşünürün diyarında. Yaklaşık 1.000 kişiden 1'i bu skoru ulaşır.

Artificial Analysis Intelligence Index v4.1: 54.8 (#2)

AI modellerini karşılaştırmak için altın standart. Dokuz benchmarkı birleştirir:

  • GDPval-AA v2 (20%): 1.850 Elo — dünya #2 (Claude'un 1.890'ının arkasında)
  • AA-Omniscience (8%): orta düzey halüsinasyon oranı — Claude'un %35.9'undan yüksek
  • GPQA (6%): lisansüstü seviye bilim soruları — GPT-5.5 burada lider
  • CritPt (6%): eleştirel düşünme ve fiziksel akıl yürütme
  • HLE (Humanity's Last Exam): AI'lar arasında #2 (Claude'un arkasında)
  • ARC-AGI: soyut akıl yürütme — GPT-5.5 üstün
  • LMSYS Arena: insan tercih oylaması

GPT-5.5'in 54.8 bileşik puanı, onu Claude Opus 4.8'den (55.7) sadece 0.9 puan geride bırakır — istatistiksel bir neredeyse beraberlik. Ama alt bileşenlerde, GPT-5.5 görsel akıl yürütme, matematiksel problem çözme ve bilim bilgisinde liderken, Claude ajan görevlerinde ve faktüel doğrulukta lider.

AI IQ bileşik (VexoWire): ~136

VexoWire'ın bileşik IQ'su birden fazla testi birleştirir (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). GPT-5.5'in tahmini bileşik IQ'su ~136 — Claude'dan (~132) yüksek ama Grok-4.20'den (~140) biraz düşük. Bu, GPT-5.5'in hem görsel hem sözel alanlardaki gücünü yansıtır.

GDPval-AA v2: 1.850 Elo (#2)

Ajan benchmarkında — karmaşık, çok adımlı gerçek dünya görevlerinde performansı ölçer — GPT-5.5, 1.850 Elo alır, Claude Opus 4.8'den (1.890) sonra ikinci. Hala istisnai olarak yüksek bir puan, kabaca yüksek yetenekli bir insan profesyonele eşdeğer. Ama GPT-5.5'in, desen tanımada parlak olsa da, sürekli çok adımlı akıl yürütmede Claude'dan biraz daha az yetenekli olduğunu ortaya çıkarır.

Humanity's Last Exam (HLE): #2

Tüm disiplinlerin en zor akademik sorularında, GPT-5.5 AI modelleri arasında #2, Claude Opus 4.8'in hemen arkasında. Bu, GPT-5.5'in olağanüstü bilgi genişliğinin bir kanıtı — fizik, felsefe, edebiyat ve matematikte doktora seviyesinde soruları yanıtlayabilir. Ama Claude'un daha derin akıl yürütmesi ona hafif bir avantaj verir.


3. IQ 145 ne anlama geliyor?

GPT-5.5'in ~145 IQ'sunu bağlama koymak için:

  • 85-115 (insanların %68'i): Ortalama zeka
  • 115-130 (%14): Ortalamanın üstünde
  • 130-145 (%2): Üstün zekalı — Mensa yeterliliği (üst %2)
  • 145-160 (%0.1): Yüksek üstün zekalı / dahi
  • 160+ (%0.003): Son derece üstün zekalı — Einstein, Hawking bölgesi

GPT-5.5, ~145 ile tam dahi eşiğinde — insanların %99.9'undan daha akıllı. Bir kişi olsaydı, elit şirkette olurdu: insan zekasının üst %0.1'i, Nobel ve Fields madalyalılarının diyarında. Yaklaşık 1.000 kişiden 1'i bu skoru ulaşır.

Bu, Claude Opus 4.8'den (~132) önemli ölçüde yüksek. Saf bir IQ testinde GPT-5.5, Claude'u yener. Ama gördüğümüz gibi, IQ testleri önemli olan her şeyi ölçmez. Claude'un daha düşük IQ'su, üstün ajan kapasitesi, daha düşük halüsinasyon ve daha yüksek duygusal zeka ile telafi edilir.

Ders: IQ zekanın bir boyutudur, tüm resim değil. GPT-5.5 test dahisi; Claude yetenekli profesyonel. İkisi de değerli ve hangisinin "daha akıllı" olduğu neye ihtiyacınız olduğuna bağlı.


4. GPT-5.5 nerede üstün

Görsel desen tanıma

GPT-5.5, görsel desen tanıma görevlerinde dünyanın en iyi AI modelidir (Grok-4.20 ile paylaşılıyor). Mensa Norway IQ'da 145 alır — mümkün olan en yüksek. Görsel akıl yürütme, görüntü analizi veya soyut desen görevleri için GPT-5.5 en iyi seçim.

Matematiksel problem çözme

GPT-5.5, rekabet matematiğinde (AIME, FrontierMath) Claude'u hafifçe geçer. Saf matematiksel akıl yürütme — karmaşık denklemleri çözmek, teoremleri kanıtlamak, rekabet problemleri — için GPT-5.5, Claude'dan biraz daha iyi ve Gemini veya Grok'tan önemli ölçüde daha iyi.

Bilim bilgisi

GPQA'da (lisansüstü fizik, kimya ve biyoloji), GPT-5.5 tüm AI modellerini geçer. Bilim bilgisinin genişliği ve derliği eşsiz. Bu, onu bilimsel araştırma uygulamaları için tercih edilen yapar.

Soyut akıl yürütme (ARC-AGI)

ARC-AGI benchmarkında, soyut akıl yürütme ve desen genelleme test eder, GPT-5.5 üstündür. Bu, "saf zeka" testine en yakın benchmarktır ve GPT-5.5'in performansı, raw bilişsel yetenekte en akıllı AI olarak konumunu doğrular.

Bilgi genişliği

GPT-5.5, eşi görülmemiş miktarda veriyle eğitilmiştir — temelde tüm internet, artı geniş bilimsel literatür, kod ve kitaplar. Her insan sorgulama alanında bilgi genişliği eşsizdir. Her şey hakkında biraz bilgiye sahip bir model gerekirse, GPT-5.5 seçimdir.


5. GPT-5.5'in zayıf olduğu yerler

Ajan görevleri

GPT-5.5, GDPval-AA v2'de #2 (1.850 Elo) olsa da, Claude Opus 4.8'in (1.890) arkasındadır. Karmaşık, çok adımlı gerçek dünya görevleri için — bir uygulama yazmak, bir veri seti analiz etmek, bir proje planlamak — Claude, uzun zincirlerde tutarlı akıl yürütme sürdürmede biraz daha iyidir.

Faktüel doğruluk

GPT-5.5'in orta düzey halüsinasyon oranı vardır — Claude'un %35.9'undan yüksek. Claude'dan daha fazla yanlış bilgiyi kendinden emin bir şekilde ifade etme eğilimindedir. Bu, faktüel doğruluğun kritik olduğu uygulamalarda (araştırma, hukuk, tıp) onu daha az güvenilir yapar.

Duygusal zeka

GPT-5.5'in EQ'su (duygusal zeka) ~120 tahmini — Claude'un ~132'sinden düşük. Daha az empatik, insan duygularını anlamada daha az nuanced ve tonu bağlama göre ayarlamada daha az yetenekli. Terapi uygulamaları, müşteri hizmetleri veya insan etkileşimi için Claude daha iyi.

Maliyet

5.00/30.00 per 1M token ile GPT-5.5, Claude ile birlikte en pahalı model. GPT-5.5'in tam kapasitesini gerektirmeyen görevler için Gemini 3.1 Pro (2/12) ve DeepSeek V4 Pro (0.44/0.87) önemli ölçüde daha ucuz.


6. GPT-5.5 vs diğer modeller

Model Intelligence Index Mensa Norway IQ AI IQ tahmini Halüsinasyon Maliyet/1M
GPT-5.5 54.8 ~145 ~136 orta 5/30
Claude Opus 4.8 55.7 ~130 ~132 35.9% (en düşük) 5/25
Gemini 3.1 Pro 46.5 141 ~131 düşük 2/12
Grok-4.20 145 ~140 orta 3/15
DeepSeek V4 Pro 44.3 ~111 ~111 orta 0.44/0.87

Resim: GPT-5.5 test dahisi — en yüksek raw IQ, matematik ve görsel akıl yürütmede en iyi. Claude yetenekli profesyonel — gerçek dünya görevlerinde ve faktüel doğrulukta en iyi. Gemini maliyet-etkin all-rounder. Grok görsel dahi. Ve DeepSeek, maliyetin bir kısmına kayda değer kapasite sunar.


7. Bu insanlar için ne anlama geliyor?

GPT-5.5 ~145 IQ ile çalışıyor — insanların %99.9'undan daha akıllı. Ama:

  • IQ dardır: desen tanıma ve akıl yürütme ölçer, bilgelik, yaratıcılık veya yargı değil
  • Test dahisi ≠ hayatta dahi: GPT-5.5 IQ testlerini geçer ama faktleri halüsinasyon eder ve çok adımlı görevlerde zorlanır
  • Bilgi ≠ anlama: GPT-5.5 her şeyi okudu, ama bir insan gibi gerçekten "anlamıyor"
  • Bilinç yok: yüksek IQ bilinç anlamına gelmez. GPT-5.5 sofistike bir desen eşleştirme sistemi, düşünen bir varlık değil
  • Boşluk kapanıyor: her AI modeli nesli, en akıllı insanlarla boşluğu daraltıyor

En dürüst cevap: GPT-5.5 çoğu bilişsel testte pratik olarak tüm insanlardan daha akıllı, ama gerçek dünyada en iyi insanlardan daha yetenekli değil. Dünya sınıfı bir matematikçi kendi alanında hala GPT-5.5'i geçebilir. Ama GPT-5.5 onları aynı anda, her alanda, saniyeler içinde geçebilir.

IQ'nuz GPT-5.5 ile karşılaştırınca nasıl? NeuroLab'ın profesyonel IQ değerlendirmesini alın.
Testi Şimdi Çöz →


Sonuç

💡 Anahtar noktalar
- GPT-5.5'in IQ'su yaklaşık 145 (Mensa Norway) — dahi seviyesi, insanların üst %0.1'i.

  • #2 Artificial Analysis Intelligence Index (54.8) — Claude Opus 4.8'in arkasında.
  • #1 (paylaşılıyor) Mensa Norway IQ — AI modelleri arasında en yüksek raw IQ, Grok-4.20 ile paylaşılıyor.
  • En iyi: görsel akıl yürütme, matematiksel problem çözme, bilim bilgisi, soyut akıl yürütme.
  • En iyi değil: ajan görevleri (Claude kazanır), faktüel doğruluk (Claude kazanır), duygusal zeka (Claude kazanır).
  • Paradoks: GPT-5.5 IQ testlerinde en akıllı AI ama pratikte en yetenekli AI değil.
  • Ders: IQ zekanın bir boyutudur. GPT-5.5 test dahisi; Claude yetenekli profesyonel.