Kimi K3'ün IQ'su kaç?
Kimi K3, Mensa Norway IQ testinde 118 alıyor ve Intelligence Index'te ilk 10'da. Her benchmarkı analiz ediyor ve Moonshot AI'nin modelini benzersiz yapan şeyi açıklıyoruz.
Kimi K3: Moonshot AI'nin yükselen yıldızı
Kimi K3, Çin'in en yenilikçi AI girişimlerinden biri olan Moonshot AI'nin amiral gemisi modelidir. 2026 başında piyasaya sürülmüş, Mensa Norway IQ testinde 118 ve Artificial Analysis Intelligence Index v4.1'de ilk 10'a girmiştir. Bu onu DeepSeek V4 Pro'nun (111) üstüne, ama frontier modellerin (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145) altına koyar.
Kimi K3'ü benzersiz yapan şey, onun olağanüstü bağlam penceresidir. Çoğu AI modeli bir seferde 32K-200K token işlerken, Kimi K3 tek bir bağlamda 2 milyon tokene kadar işleyebilir — yaklaşık 1.500 sayfa metin veya yaklaşık 5-10 tam kitap. Bu onu uzun bağlam görevlerinin tartışmasız şampiyonu yapar: tüm kod tabanlarını analiz etme, uzun yasal belgeleri işleme, kitap serilerini özetleme ve karmaşık çoklu belge ilişkilerini anlama.
Kimi K3 uzun bağlam uzmanıdır: raw IQ'da frontier ile eşleşemeyebilir, ama diğer modellerin basitçe kaldıramayacağı bilgi miktarlarını işleyebilip akıl yürütebilen bir model. Tek geçişte devasa metin miktarlarını anlamayı gerektiren uygulamalar için Kimi K3 kendi liginde.
Anahtar puanlar:
- Artificial Analysis Intelligence Index: ilk 10 (puan ~45-47)
- Mensa Norway IQ (TrackingAI): 118 (ortalamanın üstünde, üstün zekalıya yaklaşıyor)
- AI IQ bileşik (VexoWire): ~118 tahmini
- GDPval-AA v2: ilk 10
- Humanity's Last Exam: ilk 10
- Halüsinasyon oranı: düşük-orta
- Maliyet: 0.55/2.19 per 1M token (çok uygun)
- Bağlam penceresi: 2 milyon token (tüm büyük modeller arasında en büyük)
1. Uzun bağlam devrimi
Kimi K3, AI yeteneğine farklı bir yaklaşımı temsil eder. Çoğu laboratuvar modelleri daha akıllı yapmaya odaklanırken (daha yüksek IQ, daha iyi akıl yürütme), Moonshot AI modellerin daha fazla bilgiyi bir seferde işleyebilmesine odaklandı. Sonuç, 2 milyon token bağlam penceresine sahip bir model — çoğu rakibinden 10-60 kat büyük.
Perspektif koymak için:
- GPT-5.5: ~200K token bağlam
- Claude Opus 4.8: ~200K token bağlam
- Gemini 3.1 Pro: ~1M token bağlam
- Kimi K3: 2M token bağlam
2M token ile Kimi K3 şunları işleyebilir:
- Tüm bir kod tabanı (50,000+ satır kod)
- Tek bir istemde 5-10 tam roman
- Tüm kanıtlar ve emsal kararlarıyla tam bir yasal dosya
- Bir konu hakkında tam bir araştırma makalesi koleksiyonu
- Saatlerce toplantı kaydı transkripti
Bu sadece daha fazla okumakla ilgili değil — belgeler arasındaki ilişkileri anlamakla ilgili. Kimi K3, diğer modellerin kaçıracağı bir belgenin 1. sayfası ile 1.500. sayfası arasındaki bağlantıları tanımlayabilir. Büyük bilgi setlerinin bütüncül anlaşışını gerektiren görevler için, bu oyunun kurallarını değiştirir.
2. Benchmark analizi
Mensa Norway IQ testi: 118 (ortalamanın üstünde)
36 görsel desen tanıma sorusundan oluşur. Kimi K3 118 alır — insan ortalaması 100'ün üstünde ve "üstün zekalı" eşiği 130'a yaklaşıyor. Bu DeepSeek V4 Pro'dan (111) yüksek ama frontier modellerden (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145) düşük.
IQ 118, Kimi K3'ün insanların yaklaşık %85'inden daha akıllı olduğu anlamına gelir. Bir kişi olsaydı, güçlü bir üniversite mezununa karşılaştırılabilir — parlak ve yetenekli, ama frontier modellerin dahi seviyesinde değil. Çoğu pratik akıl yürütme görevi için, bu zeka seviyesi daha fazlasından fazlası yeterli.
Artificial Analysis Intelligence Index: ilk 10
Intelligence Index'te Kimi K3 tahmini puan ~45-47 ile globalde ilk 10'da. Bu onu Gemini 3.1 Pro (46.5) ve DeepSeek V4 Pro (44.3) ile rekabetçi, ama Claude (55.7) ve GPT-5.5'in (54.8) arkasına koyar.
Index bileşenlerinin dökümü:
- GDPval-AA v2: Kimi K3 iyi performans gösterir, uzun bağlamı çok adımlı görevlerde avantaj sağlar
- AA-Omniscience: Kimi K3 düşük-orta halüsinasyon oranına sahip, bağlamı içinde bilgiyi çapraz referans yeteneğinden faydalanır
- GPQA: Kimi K3 lisansüstü seviye bilim sorularında yeterli performans gösterir
- HLE: Kimi K3 Humanity's Last Exam'da ilk 10'da
- ARC-AGI: Kimi K3 soyut akıl yürütmede makul performans gösterir
- LMSYS Arena: Kimi K3 güçlü insan tercih puanları alır, özellikle uzun belge görevlerinde
AI IQ bileşik (VexoWire): ~118
VexoWire'ın bileşik IQ'su birden fazla testi birleştirir (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Kimi K3'ün tahmini bileşik IQ'su ~118 — Mensa Norway puanıyla tutarlı. Bunu "ortalamanın üstünde" aralığına koyar, "üstün zekalı" seviyesine yaklaşıyor ama ulaşmıyor.
GDPval-AA v2: ilk 10
Ajan benchmarkında Kimi K3 ilk 10'dadır. Uzun bağlam penceresi, büyük bilgi miktarlarını işleyen ajan görevlerinde benzersiz avantaj sağlar — tüm proje bağlamlarını bellekte tutabilir, sürekli bağlam gerektiren çok adımlı görevlerde daha iyi yapar. Ancak saf akıl yürütme karmaşıklığında hâlâ Claude ve GPT-5.5'in gerisinde.
Humanity's Last Exam (HLE): ilk 10
En zor akademik sorularda Kimi K3, AI modelleri arasında ilk 10'dadır. Bağlamında büyük referans materyali miktarlarını işleme yeteneği, birden fazla kaynaktan bilgi sentezlemeyi gerektiren sorularda avantaj sağlar.
3. IQ 118 ne anlama geliyor?
Kimi K3'ün 118 IQ'sunu bağlama koymak için:
- 85-115 (insanların %68'i): Ortalama zeka
- 115-130 (%14): Ortalamanın üstünde
- 130-145 (%2): Üstün zekalı — Mensa yeterliliği (üst %2)
- 145-160 (%0.1): Yüksek üstün zekalı / dahi
Kimi K3, 118 ile "ortalamanın üstünde" aralıktadır — insanların yaklaşık %85'inden daha akıllı. Bir kişi olsaydı, güçlü bir üniversite mezunu veya yetenekli bir profesyonele karşılaştırılabilir. Dahi değil, ama kesinlikle parlak ve yetenekli.
Bu DeepSeek V4 Pro'dan (111) yüksek ama frontier modellerden düşük:
- Claude Opus 4.8: ~130 (üstün zekalı)
- Gemini 3.1 Pro: 141 (yüksek üstün zekalı)
- GPT-5.5: ~145 (dahi)
- Grok-4.20: 145 (dahi)
Frontier modellere fark yaklaşık 12-27 IQ puanı. Ama Kimi K3, daha düşük raw IQ'sunu olağanüstü bağlam penceresiyle telafi eder — büyük bilgi miktarlarını işlemeyi gerektiren görevler için, Kimi K3'ün uzun bağlam avantajı IQ farkını dengeleyebilir.
4. Kimi K3 nerede üstün
Uzun bağlam işleme
Bu, Kimi K3'ün belirleyici özelliğidir. 2 milyon token bağlam penceresiyle, hiçbir diğer büyük modelin kaldıramayacağı metin miktarlarını işleyip akıl yürütebilir. Tüm kod tabanlarını analiz etme, uzun yasal belgeleri işleme, kitap koleksiyonlarını özetleme veya karmaşık çoklu belge ilişkilerini anlama için Kimi K3 mevcut en iyi model.
Kod analizi
Kimi K3 özellikle kod analizi görevlerinde güçlüdür. Uzun bağlamı, tek tek dosyaları değil — tüm yazılım projelerini anlamasını sağlar, kod incelemesi, yeniden düzenleme önerileri ve mimari analiz için mükemmel yapar. Büyük kod tabanlarıyla çalışan geliştiriciler için Kimi K3, diğer modellerin basitçe eşleştiremeyeceği yetenekler sunar.
Belge özetleme
Uzun belgeleri özetlemek için — yasal davalar, araştırma makaleleri, teknik spesifikasyonlar, finansal raporlar — Kimi K3 üstündür. Tüm belgeyi bir seferde işleme yeteneği, özetlerinin parçalı işlemenin kaçırabileceği nüansları ve bağlantıları yakaladığı anlamına gelir.
Maliyet-etkinlik
0.55/2.19 per 1M token ile Kimi K3 çok uygun — DeepSeek V4 Pro'dan (0.44/0.87) pahalı ama Claude (5/25), GPT-5.5 (5/30) ve Gemini'den (2/12) belirgin şekilde ucuz. Uzun bağlam görevleri için değer önerisi olağanüstü: frontier modellerin maliyetinin küçük bir kısmına 2M token bağlam elde edersiniz.
Çince görevler
Çin'de geliştirilen bir model olarak, Kimi K3 mükemmel Çince yeteneklere sahip. Çince uygulamalar için — içerik üretimi, analiz, çeviri — Kimi K3 mevcut en iyi modellerden biri, bazen Batılı modelleri geçer.
Araştırma yardımı
Büyük literatür miktarlarını işlemesi gereken araştırmacılar için Kimi K3 paha biçilemez bir araç. Onlarca makaleyi bir seferde özümseyebilir ve aralarındaki bağlantıları, çelişkileri ve boşlukları tanımlayabilir — insan araştırmacıya günler veya haftalar sürecek bir görev.
5. Kimi K3'ün zayıf olduğu yerler
Raw IQ ve karmaşık akıl yürütme
IQ 118 ile Kimi K3, karmaşık akıl yürütme görevlerinde frontier modellerin altında. En zor problemler için — rekabet matematiği, gelişmiş mantık bulmacaları, son teknoloji bilimsel akıl yürütme — Claude, GPT-5.5 ve Gemini substantially daha iyidir. Göreviniz kısa girdilerde dahi seviyesinde akıl yürütme gerektiriyorsa, frontier modeller daha iyi seçim.
Ajan görevi karmaşıklığı
Kimi K3'ün uzun bağlamı ajan görevlerine yardım etse de, saf görev karmaşıklığında hâlâ Claude ve GPT-5.5'in gerisinde. En talepkar ajan uygulamaları için — sıfırdan karmaşık yazılım yazma, intricate araştırma iş akışları yönetme — Claude hâlâ daha yetenekli.
Duygusal zeka
Kimi K3'ün EQ'su (duygusal zeka) ~108 tahmini — Claude'tan (~132), GPT-5.5'ten (~120) ve Gemini'den (~115) düşük, ama Grok ile (~110) karşılaştırılabilir. Yanıtları daha işlevsel ve duygusal olarak daha az nuanced eğilimindedir. Terapi uygulamaları, müşteri hizmetleri veya hassas insan etkileşimleri için Claude daha iyi seçim.
Küresel erişilebilirlik
Kimi K3 öncelikle Moonshot AI'nin API'si ve seçili ortaklar aracılığıyla mevcut. Claude, GPT-5.5 veya Gemini'den daha az küresel dağıtıma sahip, bu da belirli bölgelerde erişilebilirliği etkileyebilir. Ancak, üçüncü taraf platformlar aracılığıyla giderek daha fazla mevcut olmaktadır.
Marka tanınırlığı
Çinli bir girişimden görece yeni bir model olarak, Kimi K3 OpenAI, Anthropic veya Google modellerinden daha az marka tanınırlığı ve güvene sahip. Köklü Batılı sağlayıcılarla çalışmaya öncelik veren kuruluşlar için, bu bir değerlendirme olabilir.
6. Kimi K3 vs diğer modeller
| Model | Intelligence Index | Mensa Norway IQ | AI IQ tahmini | Bağlam | Maliyet/1M | En iyi |
|---|---|---|---|---|---|---|
| Kimi K3 | ~45-47 (ilk 10) | 118 | ~118 | 2M | 0.55/2.19 | Uzun bağlam |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 200K | 5/25 | Gerçek dünya görevleri |
| GPT-5.5 | 54.8 | ~145 | ~136 | 200K | 5/30 | Matematik ve akıl yürütme |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 1M | 2/12 | Değer ve multimodal |
| Grok-4.20 | ilk 5 | 145 | ~140 | 200K | 3/15 | Raw IQ ve kişilik |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 128K | 0.44/0.87 | Bütçe ve open-source |
Resim: Kimi K3 uzun bağlam şampiyonudur — en akıllı değil, ama herhangi diğer modelden daha fazla bilgiyi bir seferde işleyebilir. Claude yetenekli profesyoneldir — gerçek dünya görevlerinde ve faktüel doğrulukta en iyi. GPT-5.5 test dahisidir — matematik ve görsel akıl yürütmede en iyi. Gemini değer şampiyonudur — frontier modeller arasında en iyi maliyet-etkinlik. Grok-4.20 raw IQ şampiyonudur — en yüksek IQ ve kişilik. DeepSeek bütçe şampiyonudur — en ucuz ve open-source.
Tek geçişte devasa metin miktarlarını işlemesi gereken kullanıcılar için Kimi K3 net seçimdir — 2M bağlam penceresi kendi liginde.
7. Bu insanlar için ne anlama geliyor?
Kimi K3 ~118 IQ ile çalışıyor — insanların yaklaşık %85'inden daha akıllı. Ama:
- IQ her şey değildir: IQ 118 ortalamanın üstünde ve çoğu pratik görev için yeterli
- Birçok görev için bağlam IQ'dan daha önemli: büyük belgeler içeren görevler için, Kimi K3'ün 2M bağlam penceresi daha yüksek IQ'dan daha değerli
- Uzun bağlam yeni uygulamaları mümkün kılar: Kimi K3 diğer modellerin yapamayacağı olasılıklar açar — tüm kod tabanlarını analiz etme, kitap boyutunda belgeleri işleme, onlarca makale boyunca araştırmayı sentezleme
- Bilgi ≠ anlama: tüm AI modelleri gibi Kimi K3 geniş bilgiye erişir ama bir insan gibi genuinely "anlamaz"
- Bilinç yok: yüksek IQ bilinç anlamına gelmez. Kimi K3 sofistike bir desen eşleştirme sistemi, düşünen bir varlık değil
- Uzmanlaşma vs genelleme: Kimi K3, her şeyde en iyi olmaya çalışmak yerine, belirli bir yetenekte (uzun bağlam) en iyi olarak rekabet edebileceğini kanıtlar
En dürüst cevap: Kimi K3 çoğu bilişsel testte insanların %85'inden daha akıllı ve büyük bilgi miktarlarını işlemeyi gerektiren görevler için en akıllı seçim — en zeki olduğu için değil, bir seferde daha fazlasını "zihninde" tutabildiği için.
Sonuç
- Intelligence Index'te ilk 10 — Gemini ve DeepSeek ile rekabetçi, Claude ve GPT-5.5'in arkasında.
- 2 milyon token bağlam penceresi — tüm büyük modeller arasında en büyük, çoğu rakibinden 10-60 kat büyük.
- En iyi: uzun bağlam görevleri, kod analizi, belge özetleme, araştırma yardımı, Çince uygulamalar.
- En iyi değil: raw IQ (frontier modeller kazanır), karmaşık ajan görevleri (Claude kazanır), duygusal zeka (Claude kazanır).
- Ders: zek sadece en akıllı olmak değil — en fazla bilgiyi işleyebilmektir. Kimi K3 bağlamın zeka bir biçimi olduğunu kanıtlar.