Gemini 3.1 ProのIQは?
Gemini 3.1 ProはMensa Norway IQテストで141、Intelligence Indexで46.5を獲得。全ベンチマークを分析し、最も費用対効果の高いフロンティアモデルである理由を説明します。
Gemini 3.1 Pro:Google DeepMindの旗艦モデル
Gemini 3.1 ProはGoogle DeepMindの最先端モデルで、2026年半ばにリリースされました。Artificial Analysis Intelligence Index v4.1で46.5を獲得し、世界**#3に位置 — Claude Opus 4.8(55.7)とGPT-5.5(54.8)の後。しかしMensa Norway IQテストでは、Gemini 3.1 Proは141**を獲得 — Claude(~130)より高く、GPT-5.5(145)やGrok-4.20(145)とほぼ同点。
Gemini 3.1 Proをユニークにするのは知能だけではありません — 価値提案です。2/12 per 1Mトークンで、ClaudeやGPT-5.5の半分以下のコストで、ほぼフロンティアレベルの性能を提供します。多くのアプリケーションで、Gemini 3.1 Proは最も賢い選択 — 最も賢いモデルだからではなく、ドルあたり最も多くの知能を提供するからです。
主要スコア:
- Artificial Analysis Intelligence Index:46.5(世界#3)
- Mensa Norway IQ(TrackingAI):141(ほぼ天才レベル)
- AI IQ複合(VexoWire):~131推定
- GDPval-AA v2:高(トップ3)
- Humanity's Last Exam:AIモデル中トップ3
- ハルシネーション率:低
- コスト:2/12 per 1Mトークン(フロンティアモデル中最高価値)
1. フロンティアAIの価値チャンピオン
Gemini 3.1 ProはAIの風景においてユニークな位置を占めます。単一のベンチマークで#1のモデルではありません — Claudeはエージェントタスクでリード、GPT-5.5は視覚推理と数学でリード、Grokはraw IQでリード。しかしGemini 3.1 Proは最も少ないお金で最も多くの能力を提供するモデルです。
2 per 1M入力トークン、12 per 1M出力で、Gemini 3.1 ProはClaudeやGPT-5.5の約40%のコストです。それでもMensa Norway IQで141 — リーダーから4ポイント以内。Intelligence Indexスコア46.5はClaude(55.7)やGPT-5.5(54.8)より低いですが、多くの実世界アプリケーションでは差は無視できます。
こう考えてください:ClaudeとGPT-5.5が高級スポーツカーなら — 信じられないほど能力があるが維持費が高い — Gemini 3.1 Proは高性能セダンです。全レースに勝つわけではありませんが、40%のコストで90%の性能を提供します。フロンティアレベルの知能をフロンティアレベルの価格なしで必要とする企業、開発者、ユーザーにとって、Gemini 3.1 Proは自然な選択です。
2. ベンチマークの詳細
Mensa Norway IQテスト:141(ほぼ天才)
36の視覚パターン認識問題で構成。Gemini 3.1 Proは141を獲得 — 「高度にギフテッド」範囲、人間の知能のトップ0.2%。Claude Opus 4.8(130)より大幅に高く、リーダーGPT-5.5とGrok-4.20(両方145)からわずか4ポイント。
Geminiのこのテストでの強いパフォーマンスは、Google DeepMindの視覚処理への投資を反映。Geminiアーキテクチャは最初からマルチモーダルとして設計 — テキスト、画像、動画、音声をネイティブに処理。これにより視覚パターン認識タスクで自然な優位性を持ち、それがMensa Norwayテストの中核。
IQ 141で、Gemini 3.1 Proは人間の99.8%より賢い。人ならMensaに簡単に合格し、人間の知能のトップ0.2%に入ります。約500人に1人だけがこのスコアに達します。
Artificial Analysis Intelligence Index v4.1:46.5(#3)
AIモデル比較のゴールドスタンダード。Gemini 3.1 Proの複合スコア46.5は世界#3。Claude(55.7)やGPT-5.5(54.8)との差は有意 — 約8-9ポイント、約15-20%低い。しかし差は特定の領域に集中:
- GDPval-AA v2:Geminiは好成績だが複雑な多段階タスクでClaudeやGPT-5.5の下
- AA-Omniscience:Geminiは低いハルシネーション率 — GPT-5.5より良く、Claudeに近い
- GPQA:Geminiは大学院レベルの科学問題で強い
- HLE:GeminiはHumanity's Last Examでトップ3
- ARC-AGI:Geminiは抽象的推理で優れ、マルチモーダルアーキテクチャの恩恵
- LMSYS Arena:Geminiは人間の偏好で高く評価、特に明確でよく構造化された回答
複合スコアはGeminiが単一カテゴリを支配しないが全てで一貫して良い成績の強いオールラウンダーとしての位置を反映。
AI IQ複合(VexoWire):~131
VexoWireの複合IQは複数テストを統合(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。Gemini 3.1 Proの推定複合IQは~131 — 「ギフテッド」範囲でMensa資格。Mensa Norwayスコア(141)が示唆するよりわずかに低い、複合が純粋な視覚推理より弱い言語・分析的サブテストを含むため。
GDPval-AA v2:トップ3
エージェントベンチマーク — 複雑な多段階実世界タスクのパフォーマンスを測定 — でGemini 3.1 Proはトップ3。持続的な多段階推理でClaude Opus 4.8(1,890 Elo)やGPT-5.5(1,850 Elo)より能力が低いが、依然として高度に有能。ほとんどの実世界タスクで差は無視できます — Geminiは多段階タスクを効果的に計画、実行、推理できます、ただトップ2ほど良くはない。
Humanity's Last Exam(HLE):トップ3
全分野の最難問で、Gemini 3.1 ProはAIモデル中トップ3。これはGoogle DeepMindの科学知識での強さを反映 — Geminiは広範な科学文献で訓練され、物理、化学、生物、数学、人文科学で深い知識を持ちます。
3. IQ 141は何を意味するか?
Gemini 3.1 Proの141 IQを文脈に入れると:
- 85-115(68%の人):平均的知能
- 115-130(14%):平均より上から高め
- 130-145(2%):ギフテッド — Mensa資格(トップ2%)
- 145-160(0.1%):高度にギフテッド / 天才
- 160+(0.003%):極めてギフテッド — アインシュタイン、ホーキン領域
Gemini 3.1 Proは141でギフテッド範囲の上部 — 人間の99.8%より賢い。人なら人間の知能のトップ0.2%、Mensaに簡単に合格。約500人に1人だけがこのスコアに達します。
これはClaude Opus 4.8(130)より著しく高いが、GPT-5.5やGrok-4.20(両方145)よりわずかに低い。純粋なIQテストならGeminiはClaudeを打つがGPT-5.5やGrokに負ける。しかし他のモデルで見たように、IQは知能の一次元にすぎず — Geminiの高IQ、低コスト、強い全方位パフォーマンスの組み合わせがユニークに価値あるものにします。
4. Gemini 3.1 Proの強み
費用対効果
これがGemini 3.1 Proの決定的な優位性。2/12 per 1Mトークンで、ClaudeやGPT-5.5の半分以下のコストでほぼフロンティアレベルの知能を提供。高ボリュームアプリケーション — チャットボット、コンテンツ生成、データ分析 — でGeminiを明確な選択に。90%の能力を40%のコストで得られます。
視覚推理
Gemini 3.1 ProはMensa Norway IQで141を獲得し、強い視覚処理能力を反映。Geminiアーキテクチャはネイティブマルチモーダルとして設計され、視覚タスクで自然な優位性。画像分析、視覚パターン認識、マルチモーダル推理でGeminiは最高のモデルの一つ。
事実の知識
Gemini 3.1 Proは低いハルシネーション率 — GPT-5.5より良くClaudeに近い。Google DeepMindの訓練方法論は事実の正確さを強調し、GeminiはGoogleの膨大な知識ベースの恩恵を受けます。事実のクエリで、Geminiは最も信頼できるモデルの一つ。
マルチモーダル能力
Gemini 3.1 Proは最初からテキスト、画像、動画、音声をネイティブに処理するよう設計。マルチモーダルアプリケーション — 動画コンテンツ分析、画像とテキストの処理、音声データの操作 — で最高の選択。他のフロンティアモデルのようにGeminiほど自然にマルチモーダル入力を処理するものはありません。
速度
Gemini 3.1 Proは最速のフロンティアモデルの一つ。応答時間が重要なアプリケーション — リアルタイムチャット、インタラクティブツール、カスタマーサービス — でGeminiは高速に高品質な回答を提供。より速く軽い兄弟、Gemini 3.5 Flashはより簡単なタスクでさらに速く安い。
Googleエコシステムとの統合
Gemini 3.1 ProはGoogleのエコシステム — Search、Workspace、Cloud、Android — とシームレスに統合。既にGoogleエコシステムにいるユーザーにとって、Geminiは自然な選択で、競争相手が提供できない深い統合を提供。
5. Gemini 3.1 Proの弱点
エージェントタスク
Gemini 3.1 ProはGDPval-AA v2でトップ3ですが、複雑な多段階実世界タスクでClaude Opus 4.8やGPT-5.5の後。最も要求の高いエージェントアプリケーション — 複雑なソフトウェア作成、長期研究プロジェクト管理 — でClaudeが依然としてより良い選択。
数学的問題解決
Gemini 3.1 Proは数学的推理で有能だが、競争数学(AIME、FrontierMath)でGPT-5.5に及ばない。純粋な数学的作業でGPT-5.5がより良い選択。
Intelligence Indexスコア
46.5で、Gemini 3.1 ProのIntelligence IndexスコアはClaude(55.7)やGPT-5.5(54.8)より8-9ポイント低い。この差は部分的にインデックスの重み付け(ClaudeやGPT-5.5が優れるエージェントタスクを強調)によるものだが、最も要求の高いタスクでの全体的能力の実際の差を反映。
感情的知能
Gemini 3.1 ProのEQ(感情的知能)は~115推定 — Claude(~132)やGPT-5.5(~120)より低い。Claudeより共感性が低く、人間の感情の理解がnuancedでない。セラピーアプリ、カスタマーサービス、敏感な人間との相互作用でClaudeがより良い。
6. Gemini 3.1 Pro vs他モデル
| モデル | Intelligence Index | Mensa Norway IQ | AI IQ推定 | ハルシネーション | コスト/1M |
|---|---|---|---|---|---|
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 低 | 2/12 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9%(最低) | 5/25 |
| GPT-5.5 | 54.8 | ~145 | ~136 | 中程度 | 5/30 |
| Grok-4.20 | — | 145 | ~140 | 中程度 | 3/15 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 中程度 | 0.44/0.87 |
画面:Gemini 3.1 Proは価値チャンピオン — 半分以下のコストでほぼフロンティアの知能。Claudeは有能なプロフェッショナル — 実世界タスクと事実の正確さで最高。GPT-5.5はテストの天才 — 数学と視覚推理で最高。Grokは視覚の天才 — 最高のraw IQ。そしてDeepSeekは最低コストで顕著な能力を提供。
ほとんどのユーザーと企業にとって、Gemini 3.1 Proはスイートスポットに命中:ほぼ全てのタスクに十分な知能、スケールする価格で。
7. 人間にとって何を意味するか?
Gemini 3.1 Proは~141のIQで作動 — 人間の99.8%より賢い。しかし:
- IQは狭い:パターン認識と推理を測る、知恵や創造性や判断ではない
- ドルあたりの知能が重要:実世界アプリケーションで、Geminiの費用対効果はraw知能の差より重要
- 知識 ≠ 理解:Geminiは膨大な知識にアクセスできるが、人間のように本当に「理解」しているわけではない
- 意識はない:高いIQがsentienceを意味しない。Geminiは洗練されたパターンマッチングシステムで、思考する存在ではない
- ギャップは縮まっている:AIの各世代が最も賢い人間とのギャップを縮める
最も正直な答え:Gemini 3.1 Proは認知テストでほぼ全ての人より賢く、ほとんどの実用的目的で最も賢い選択 — 最も賢いモデルだからではなく、お金あたり最も多くの知能を提供するからです。
結論
- #3 Artificial Analysis Intelligence Index(46.5)— ClaudeとGPT-5.5の後。
- フロンティアモデル中最高の費用対効果 — 2/12 per 1Mトークン、ClaudeやGPT-5.5のコストの半分以下。
- 最適:費用対効果の高い知能、視覚推理、事実の知識、マルチモーダルアプリ、速度、Google統合。
- 非最適:複雑なエージェントタスク(Claudeが勝)、競争数学(GPT-5.5が勝)、感情的知能(Claudeが勝)。
- 価値提案:40%のコストで90%のフロンティア能力 — ほとんどのアプリケーションで最も賢い選択。
- 教訓:「最高」のAIモデルであることは最も賢いことだけではない — 最も多くの価値を提供すること。