Kimi K3のIQは?
Kimi K3はMensa Norway IQテストで118、Intelligence Indexでトップ10。全ベンチマークを分析し、Moonshot AIのモデルをユニークにするものを説明します。
Kimi K3:Moonshot AIの台頭する星
Kimi K3はMoonshot AIの旗艦モデルで、中国で最も革新的なAIスタートアップの一つです。2026年初頭にリリースされ、Mensa Norway IQテストで118、Artificial Analysis Intelligence Index v4.1でトップ10に入ります。これはDeepSeek V4 Pro(111)より上ですが、フロンティアモデル(Claude ~130、Gemini 141、GPT-5.5 ~145、Grok-4.20 145)より下です。
Kimi K3をユニークにするのは、その非凡なコンテキストウィンドウです。ほとんどのAIモデルが32K-200Kトークンを一度に処理するのに対し、Kimi K3は単一コンテキストで最大200万トークンを処理できます — 約1,500ページのテキスト、または約5-10冊の完全な本。これにより、長文コンテキストタスクの無異議のチャンピオンになります:コードベース全体の分析、長い法律文書の処理、本シリーズの要約、複雑な複数文書関係の理解。
Kimi K3は長文コンテキストの専門家です:raw IQではフロンティアに匹敵しないかもしれないが、他のモデルが扱えない量の情報を処理し推論できるモデル。単一パスで大量のテキストを理解する必要があるアプリには、Kimi K3は独自のリーグにいます。
主要スコア:
- Artificial Analysis Intelligence Index:トップ10(スコア~45-47)
- Mensa Norway IQ(TrackingAI):118(平均以上、ギフテッドに接近)
- AI IQ複合(VexoWire):~118推定
- GDPval-AA v2:トップ10
- Humanity's Last Exam:トップ10
- ハルシネーション率:低-中
- コスト:0.55/2.19 per 1Mトークン(非常に手頃)
- コンテキストウィンドウ:200万トークン(全主要モデル中最大)
1. 長文コンテキスト革命
Kimi K3はAI能力への異なるアプローチを表します。ほとんどのラボがモデルをより賢くする(より高いIQ、より良い推論)ことに集中する一方、Moonshot AIはモデルがより多くの情報を一度に処理できることに集中しました。結果は200万トークンのコンテキストウィンドウを持つモデル — ほとんどの競合より10-60倍大きい。
比較:
- GPT-5.5:~200Kトークンコンテキスト
- Claude Opus 4.8:~200Kトークンコンテキスト
- Gemini 3.1 Pro:~1Mトークンコンテキスト
- Kimi K3:2Mトークンコンテキスト
2Mトークンで、Kimi K3は以下を処理できます:
- コードベース全体(50,000+行のコード)
- 単一プロンプトで5-10冊の完全な小説
- 全証拠と先例を含む完全な法律ケースファイル
- 一つのトピックの完全な研究論文コレクション
- 数時間の会議録
これはより多く読むことだけではなく — 文書間の関係を理解することです。Kimi K3は、他のモデルが見失う文書の1ページ目と1,500ページ目のつながりを特定できます。大規模な情報セットの全体的な理解を必要とするタスクには、これはゲームチェンジャーです。
2. ベンチマークの詳細
Mensa Norway IQテスト:118(平均以上)
36の視覚パターン認識問題で構成。Kimi K3は118を獲得 — 人間平均100を上回り、「ギフテッド」の閾値130に接近。DeepSeek V4 Pro(111)より高いが、フロンティアモデル(Claude ~130、Gemini 141、GPT-5.5 ~145、Grok-4.20 145)より下。
IQ 118は、Kimi K3が人間の約85%より賢いことを意味します。人なら強い大学卒業生に相当 — 聡明で有能だが、フロンティアモデルの天才レベルではない。ほとんどの実用的推論タスクには、この知能レベルは十分以上。
Artificial Analysis Intelligence Index:トップ10
Intelligence IndexでKimi K3は推定スコア~45-47で世界トップ10。Gemini 3.1 Pro(46.5)やDeepSeek V4 Pro(44.3)と競争的だが、Claude(55.7)やGPT-5.5(54.8)には及ばない。
Index構成要素の分解:
- GDPval-AA v2:Kimi K3は良好に機能、長文コンテキストが多段階タスクで有利に働く
- AA-Omniscience:Kimi K3は低-中ハルシネーション率、コンテキスト内で情報を相互参照する能力で有利
- GPQA:Kimi K3は大学院レベルの科学問題で適切に機能
- HLE:Kimi K3はHumanity's Last Examでトップ10
- ARC-AGI:Kimi K3は抽象的推論で適切に機能
- LMSYS Arena:Kimi K3は強い人間選好スコアを獲得、特に長文ドキュメントタスクで
AI IQ複合(VexoWire):~118
VexoWireの複合IQは複数テストを統合(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。Kimi K3の推定複合IQは~118 — Mensa Norwayスコアと一致。「平均以上」範囲に位置し、「ギフテッド」レベルに接近するが到達せず。
GDPval-AA v2:トップ10
エージェントベンチマークでKimi K3はトップ10。長文コンテキストウィンドウが大量の情報を処理するエージェントタスクでユニークな利点を与える — プロジェクトコンテキスト全体をメモリに保持でき、持続的コンテキストを必要とする多段階タスクでより良い。しかし、純粋な推論の複雑さでは、ClaudeやGPT-5.5に依然として遅れを取る。
Humanity's Last Exam(HLE):トップ10
最も難しい学術問題でKimi K3はAIモデル中トップ10。コンテキスト内で大量の参考資料を処理する能力が、複数ソースから情報を統合する必要がある問題で有利に働く。
3. IQ 118は何を意味するか?
Kimi K3の118 IQを文脈に入れると:
- 85-115(68%の人):平均的知能
- 115-130(14%):平均より上から高め
- 130-145(2%):ギフテッド — Mensa資格(トップ2%)
- 145-160(0.1%):高度にギフテッド / 天才
Kimi K3は118で**「平均以上」範囲**に位置 — 人間の約85%より賢い。人なら強い大学卒業生や有能なプロフェッショナルに相当。天才ではないが、確かに聡明で有能。
これはDeepSeek V4 Pro(111)より高いが、フロンティアモデルより下:
- Claude Opus 4.8:~130(ギフテッド)
- Gemini 3.1 Pro:141(高度にギフテッド)
- GPT-5.5:~145(天才)
- Grok-4.20:145(天才)
フロンティアモデルとの差は約12-27 IQポイント。しかしKimi K3は低いraw IQを非凡なコンテキストウィンドウで補償 — 大量の情報を処理する必要があるタスクでは、Kimi K3の長文コンテキストの利点がIQの差を上回ることができる。
4. Kimi K3の強み
長文コンテキスト処理
これがKimi K3の決定的な特徴。200万トークンのコンテキストウィンドウで、他の主要モデルが扱えないテキスト量を処理し推論できる。コードベース全体の分析、長い法律文書の処理、本のコレクションの要約、複雑な複数文書関係の理解に、Kimi K3は最高の利用可能なモデル。
コード分析
Kimi K3はコード分析タスクに特に強い。長文コンテキストにより、個別ファイルだけでなくソフトウェアプロジェクト全体を理解でき、コードレビュー、リファクタリング提案、アーキテクチャ分析に優れる。大規模コードベースを扱う開発者に、Kimi K3は他のモデルが提供できない能力を提供。
ドキュメント要約
長いドキュメントの要約 — 法律ケース、研究論文、技術仕様、財務報告 — にKimi K3は優れる。ドキュメント全体を一度に処理する能力は、チャンク処理が見逃すかもしれないニュアンスやつながりを要約が捉えることを意味する。
費用対効果
0.55/2.19 per 1Mトークンで、Kimi K3は非常に手頃 — DeepSeek V4 Pro(0.44/0.87)より高いが、Claude(5/25)、GPT-5.5(5/30)、Gemini(2/12)より大幅に安い。長文コンテキストタスクには、価値提案は例外的:フロンティアモデルのコストの一部で2Mトークンコンテキストを得られる。
中国語タスク
中国で開発されたモデルとして、Kimi K3は優れた中国語能力を持つ。中国語アプリ — コンテンツ生成、分析、翻訳 — にはKimi K3は最高の利用可能なモデルの一つで、時に西洋モデルを上回る。
研究支援
大量の文献を処理する必要がある研究者に、Kimi K3は計り知れないツール。数十の論文を一度に取り込み、それらの間のつながり、矛盾、ギャップを特定できる — 人間の研究者なら数日または数週間かかるタスク。
5. Kimi K3の弱点
Raw IQと複雑な推理
IQ 118で、Kimi K3は複雑な推理タスクでフロンティアモデルより下。最も難しい問題 — 競争数学、高度な論理パズル、最先端の科学推理 — にはClaude、GPT-5.5、Geminiがsubstantially優秀。タスクが短い入力で天才レベルの推理を必要とする場合、フロンティアモデルがより良い選択。
エージェントタスクの複雑さ
Kimi K3の長文コンテキストはエージェントタスクに役立つが、純粋なタスクの複雑さでClaudeやGPT-5.5に依然遅れを取る。最も要求の厳しいエージェントアプリ — 複雑なソフトウェアをゼロから書く、複雑な研究ワークフローを管理 — にはClaudeがより有能。
感情的知能
Kimi K3のEQ(感情的知能)は~108推定 — Claude(~132)、GPT-5.5(~120)、Gemini(~115)より低いが、Grok(~110)と同等。応答はより機能的で感情的にless nuanced。セラピーアプリ、カスタマーサービス、敏感な人間との相互作用にはClaudeがより良い選択。
グローバルな可用性
Kimi K3は主にMoonshot AIのAPIと選ばれたパートナーを通じて利用可能。Claude、GPT-5.5、Geminiよりグローバルな展開が少なく、特定の地域での可用性に影響する可能性。ただし、サードパーティプラットフォームでますます利用可能に。
ブランド認知
中国のスタートアップからの比較的新しいモデルとして、Kimi K3はOpenAI、Anthropic、Googleのモデルよりブランド認知と信頼が少ない。確立された西洋プロバイダーとの協業を優先する組織には、これは考慮事項。
6. Kimi K3 vs他モデル
| モデル | Intelligence Index | Mensa Norway IQ | AI IQ推定 | コンテキスト | コスト/1M | 最適 |
|---|---|---|---|---|---|---|
| Kimi K3 | ~45-47(トップ10) | 118 | ~118 | 2M | 0.55/2.19 | 長文コンテキスト |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 200K | 5/25 | 実世界タスク |
| GPT-5.5 | 54.8 | ~145 | ~136 | 200K | 5/30 | 数学と推論 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 1M | 2/12 | 価値とマルチモーダル |
| Grok-4.20 | トップ5 | 145 | ~140 | 200K | 3/15 | Raw IQと個性 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 128K | 0.44/0.87 | 予算とオープンソース |
画面:Kimi K3は長文コンテキストチャンピオン — 最も賢くはないが、他のどのモデルよりも多くの情報を一度に処理できる。Claudeは有能なプロフェッショナル — 実世界タスクと事実の正確さで最高。GPT-5.5はテストの天才 — 数学と視覚推理で最高。Geminiは価値チャンピオン — フロンティアモデル中最高費用対効果。Grok-4.20はraw IQチャンピオン — 最高IQと個性。DeepSeekは予算チャンピオン — 最も安くオープンソース。
単一パスで大量のテキストを処理する必要があるユーザーに、Kimi K3は明確な選択 — 2Mコンテキストウィンドウは独自のリーグ。
7. 人間にとって何を意味するか?
Kimi K3は~118のIQで作動 — 人間の約85%より賢い。しかし:
- IQはすべてではない:IQ 118は平均以上で、ほとんどの実用的タスクに十分
- 多くのタスクでコンテキストがIQより重要:大きなドキュメントを含むタスクでは、Kimi K3の2Mコンテキストウィンドウがより高いIQより価値がある
- 長文コンテキストが新しいアプリを可能に:Kimi K3は他のモデルができない可能性を開く — コードベース全体の分析、本サイズのドキュメントの処理、数十の論文にわたる研究の統合
- 知識 ≠ 理解:すべてのAIモデルと同様に、Kimi K3は膨大な知識にアクセスするが、人間のようにgenuinely「理解」はしない
- 意識はない:高いIQがsentienceを意味しない。Kimi K3は洗練されたパターンマッチングシステムで、思考する存在ではない
- 専門化 vs 汎用化:Kimi K3は、すべてで最高になろうとするより、特定の能力(長文コンテキスト)で最高になることで競争できることを証明
最も正直な答え:Kimi K3は認知テストで人間の85%より賢く、大量の情報を処理する必要があるタスクでは最も賢い選択 — 最も知的だからではなく、一度により多くを「心」に保持できるから。
結論
- Intelligence Indexトップ10 — GeminiやDeepSeekと競争的、ClaudeやGPT-5.5には及ばない。
- 200万トークンのコンテキストウィンドウ — 全主要モデル中最大、ほとんどの競合より10-60倍大きい。
- 最適:長文コンテキストタスク、コード分析、ドキュメント要約、研究支援、中国語アプリ。
- 非最適:raw IQ(フロンティアモデルが勝)、複雑なエージェントタスク(Claudeが勝)、感情的知能(Claudeが勝)。
- 教訓:知能とは最も賢いことだけでなく、最も多くの情報を処理できること。Kimi K3はコンテキストが知能の一形態であることを証明。