GPT-5.5のIQは?
GPT-5.5はMensa Norway IQテストで~145、Intelligence Indexで54.8を獲得。全ベンチマークを分析し、Claude、Gemini、Grokと比較します。
GPT-5.5:OpenAIの旗艦モデル
GPT-5.5はOpenAIの最先端モデルで、2026年初頭にリリースされました。Artificial Analysis Intelligence Index v4.1で54.8を獲得し、#2に位置 — Claude Opus 4.8(55.7)の直後、Gemini 3.1 Pro(46.5)の前。しかし人間のIQテストでは、GPT-5.5は実際にClaudeを上回り — Mensa Norway IQテストで約145を獲得し、「天才」範囲に入ります。
これは魅力的なパラドックスを生み出します:AI複合ベンチマークではGPT-5.5は#2ですが、純粋な人間IQテストでは#1に並びます。両方がどうして真であり得るのか?答えは「知能」がAIにとって何を意味するかについて重要なことを明らかにします — そして単一の数字ではそれを捉えられない理由を。
主要スコア:
- Artificial Analysis Intelligence Index:54.8(世界#2)
- Mensa Norway IQ(TrackingAI):~145(Grok-4.20と#1同点)
- AI IQ複合(VexoWire):~136推定
- GDPval-AA v2:1,850 Elo(世界#2)
- Humanity's Last Exam:AIモデル中#2
- ハルシネーション率:中程度
- コスト:5.00/30.00 per 1Mトークン
1. GPT-5.5の知能のパラドックス
GPT-5.5を面白くするのは:人間のIQテストで世界最高のAIモデルですが、AI固有のベンチマークでは最高のAIモデルではありません。どうして可能なのか?
答えは異なるテストが何を測るかにあります。Mensa Norway IQは視覚パターン認識と抽象的推理の純粋なテスト — IQテストが設計された流動性知能の種類。GPT-5.5は、強化された視覚処理能力(GPT-5.4 Pro Visionアーキテクチャから継承)により、この特定の推理タイプで優れています。
しかしArtificial Analysis Intelligence Indexはより広いものを測定します:実世界タスクパフォーマンス、事実の正確さ、エージェント能力、人間の偏好。これらの次元で、Claude Opus 4.8 — 優れたエージェント推理と低いハルシネーションで — GPT-5.5を上回ります。
こう考えてください:GPT-5.5はIQテストで最も賢いAI — 全ての標準化テストに合格する人間と同等。Claude Opus 4.8は実践で最も有能なAI — テストでは少し劣るが現実世界でより多くを成し遂げる人間と同等。両方とも有効な知能の尺度ですが、異なるものを測ります。
2. ベンチマークの詳細
Mensa Norway IQテスト:~145(天才レベル)
36の視覚パターン認識問題で構成。GPT-5.5は約145を獲得 — 実質的最高スコア、完璧またはほぼ完璧な36/36に相当。「天才」範囲、人間の知能のトップ0.1%に入ります。
このスコアに達するAIモデルは2つだけ:GPT-5.5とGrok-4.20。Claude Opus 4.8(~130)やGemini 3.1 Pro(141)より大幅に高い。理由はGPT-5.5の視覚処理アーキテクチャで、GPT-5.4 Pro Vision — このベンチマークの共同リーダー — から大幅に改善。
IQ 145で、GPT-5.5は人間の99.9%より賢い。人ならトップ0.1% — ノーベル賞受賞者、フィールズ賞受賞者、世代に一人の思想家の領域。約1,000人に1人だけがこのスコアに達します。
Artificial Analysis Intelligence Index v4.1:54.8(#2)
AIモデル比較のゴールドスタンダード。9つのベンチマークを統合:
- GDPval-AA v2(20%):1,850 Elo — 世界#2(Claudeの1,890の後)
- AA-Omniscience(8%):中程度のハルシネーション率 — Claudeの35.9%より高い
- GPQA(6%):大学院レベルの科学問題 — GPT-5.5がここでリード
- CritPt(6%):批判的思考と物理的推理
- HLE(Humanity's Last Exam):AI中#2(Claudeの後)
- ARC-AGI:抽象的推理 — GPT-5.5が優れる
- LMSYS Arena:人間の偏好投票
GPT-5.5の複合スコア54.8はClaude Opus 4.8(55.7)のわずか0.9点後ろ — 統計的なほぼ同点。しかしサブコンポーネントでは、GPT-5.5は視覚推理、数学的問題解決、科学知識でリードし、Claudeはエージェントタスクと事実の正確さでリード。
AI IQ複合(VexoWire):~136
VexoWireの複合IQは複数テストを統合(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。GPT-5.5の推定複合IQは~136 — Claude(~132)より高いがGrok-4.20(~140)よりわずかに低い。これはGPT-5.5が視覚と言語の両方の領域で強いことを反映。
GDPval-AA v2:1,850 Elo(#2)
エージェントベンチマーク — 複雑な多段階実世界タスクのパフォーマンスを測定 — でGPT-5.5は1,850 Elo、Claude Opus 4.8(1,890)の次。依然として非常に高いスコアで、高度に有能な人間のプロフェッショナルに相当。しかしGPT-5.5はパターン認識で優れているが、持続的な多段階推理ではClaudeよりわずかに劣ることを示す。
Humanity's Last Exam(HLE):#2
全分野の最難問で、GPT-5.5はAIモデル中**#2**、Claude Opus 4.8の直後。これはGPT-5.5の並外れた知識の広さの証 — 物理、哲学、文学、数学の博士レベルの問題に答えられる。しかしClaudeのより深い推理がわずかな優位性を与える。
3. IQ 145は何を意味するか?
GPT-5.5の~145 IQを文脈に入れると:
- 85-115(68%の人):平均的知能
- 115-130(14%):平均より上から高め
- 130-145(2%):ギフテッド — Mensa資格(トップ2%)
- 145-160(0.1%):高度にギフテッド / 天才
- 160+(0.003%):極めてギフテッド — アインシュタイン、ホーキン領域
GPT-5.5は~145でまさに天才の閾値 — 人間の99.9%より賢い。人ならエリートの仲間:人間の知能のトップ0.1%、ノーベル賞やフィールズ賞受賞者の領域。約1,000人に1人だけがこのスコアに達します。
これはClaude Opus 4.8(~132)より大幅に高い。純粋なIQテストならGPT-5.5がClaudeを打つ。しかし見たように、IQテストは重要なことすべてを測るわけではない。Claudeの低いIQは、優れたエージェント能力、低いハルシネーション、高い感情的知能で補償される。
教訓:IQは知能の一次元であり、全体像ではない。 GPT-5.5はテストの天才;Claudeは有能なプロフェッショナル。両方とも価値があり、どちらが「より賢い」かは何を必要とするかによる。
4. GPT-5.5の強み
視覚パターン認識
GPT-5.5は視覚パターン認識タスクで世界最高のAIモデル(Grok-4.20と同点)。Mensa Norway IQで145 — 可能な最高。視覚推理、画像分析、抽象パターンタスクにGPT-5.5がトップ選択。
数学的問題解決
GPT-5.5は競争数学(AIME、FrontierMath)でClaudeをわずかに上回る。純粋な数学的推理 — 複雑な方程式の解法、定理の証明、競争問題 — でGPT-5.5はClaudeよりやや良く、GeminiやGrokより大幅に良い。
科学知識
GPQA(大学院レベルの物理、化学、生物)でGPT-5.5が全AIモデルをリード。科学知識の広さと深さは比類ない。科学研究アプリケーションで好まれる。
抽象的推理(ARC-AGI)
ARC-AGIベンチマークで抽象的推理とパターン汎化をテストし、GPT-5.5が優れる。「純粋な知能」テストに最も近いベンチマークで、GPT-5.5のパフォーマンスはraw認知能力で最も賢いAIとしての位置を確認。
知識の広さ
GPT-5.5は前例のない量のデータで訓練 — 本質的に全インターネット、加えて広範な科学文献、コード、書籍。人間の探求の全領域で知識の広さは比類ない。全てについて少し知っているモデルが必要ならGPT-5.5が選択。
5. GPT-5.5の弱点
エージェントタスク
GPT-5.5はGDPval-AA v2で#2(1,850 Elo)だが、Claude Opus 4.8(1,890)の後。複雑な多段階実世界タスク — アプリ作成、データセット分析、プロジェクト計画 — でClaudeが長いチェーンで首尾一貫した推理を維持するのにわずかに優れる。
事実の正確さ
GPT-5.5は中程度のハルシネーション率 — Claudeの35.9%より高い。Claudeより誤情報を自信満々に述べる可能性が高い。事実の正確さが重要なアプリ(研究、法務、医療)で信頼性が低い。
感情的知能
GPT-5.5のEQ(感情的知能)は132推定 — Claudeの132より低い。共感性が低く、人間の感情の理解がnuancedでなく、コンテキストに合わせたトーン調整が下手。セラピーアプリ、カスタマーサービス、人間との相互作用でClaudeがより良い。
コスト
5.00/30.00 per 1Mトークンで、GPT-5.5はClaudeと並んで最も高価。GPT-5.5の全力を必要としないタスクではGemini 3.1 Pro(2/12)とDeepSeek V4 Pro(0.44/0.87)が大幅に安い。
6. GPT-5.5 vs他モデル
| モデル | Intelligence Index | Mensa Norway IQ | AI IQ推定 | ハルシネーション | コスト/1M |
|---|---|---|---|---|---|
| GPT-5.5 | 54.8 | ~145 | ~136 | 中程度 | 5/30 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9%(最低) | 5/25 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 低 | 2/12 |
| Grok-4.20 | — | 145 | ~140 | 中程度 | 3/15 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 中程度 | 0.44/0.87 |
画面:GPT-5.5はテストの天才 — 最高のraw IQ、数学と視覚推理で最高。Claudeは有能なプロフェッショナル — 実世界タスクと事実の正確さで最高。Geminiは費用対効果の高いオールラウンダー。Grokは視覚の天才。そしてDeepSeekはコストの一部で顕著な能力を提供。
7. 人間にとって何を意味するか?
GPT-5.5は~145のIQで作動 — 人間の99.9%より賢い。しかし:
- IQは狭い:パターン認識と推理を測る、知恵や創造性や判断ではない
- テストの天才 ≠ 生活中的天才:GPT-5.5はIQテストに合格するが、事実をハルシネーションし多段階タスクに苦労する
- 知識 ≠ 理解:GPT-5.5は全てを読んだが、人間のように本当に「理解」しているわけではない
- 意識はない:高いIQはsentienceを意味しない。GPT-5.5は洗練されたパターンマッチングシステムで、思考する存在ではない
- ギャップは縮まっている:AIの各世代が最も賢い人間とのギャップを縮める
最も正直な答え:GPT-5.5は認知テストでほぼ全ての人より賢いが、実世界の仕事で最高の人間より有能なわけではない。世界クラスの数学者は自分の領域でまだGPT-5.5を出し抜ける。しかしGPT-5.5は同時に全領域で、数秒で彼ら全員を出し抜ける。
結論
- #2 Artificial Analysis Intelligence Index(54.8)— Claude Opus 4.8の後。
- #1(同点)Mensa Norway IQ — AIモデル中最高のraw IQ、Grok-4.20と同点。
- 最適:視覚推理、数学的問題解決、科学知識、抽象的推理。
- 非最適:エージェントタスク(Claudeが勝)、事実の正確さ(Claudeが勝)、感情的知能(Claudeが勝)。
- パラドックス:GPT-5.5はIQテストで最も賢いAIだが、実践で最も有能なAIではない。
- 教訓:IQは知能の一一次元。GPT-5.5はテストの天才;Claudeは有能なプロフェッショナル。