Claude Opus 4.8のIQは?
Claude Opus 4.8はArtificial Analysis Intelligence Indexで55.7点、人間のIQテストで~132-145を獲得。全ベンチマークを分析し、GPT-5.5、Gemini、Grokと比較します。
Claude Opus 4.8:Anthropicの最も賢いモデル
Anthropicが2026年半ばにClaude Opus 4.8をリリースした時、それは単に前世代を少しだけ改善したのではなく — 全ての主要なAIベンチマークランキングのトップに躍り出ました。Artificial Analysis Intelligence Index v4.1で55.7を獲得し、OpenAIのGPT-5.5(54.8)とGoogleのGemini 3.1 Pro(46.5)を僅差で上回り、全フロンティアAIモデル中で#1を獲得しました。
しかし、研究者も一般公众も同様に魅了される疑問は:それを人間のIQスケールに翻訳するとどうなるか? AIの知能を人間のものと比較できるでしょうか?そしてできるなら、Claude Opus 4.8はどこに位置するのか — 「ギフテッド」、「天才」、それとも人間のいかなるカテゴリーをも超える何か?
答えは、どのテストを与えるかによって大きく異なります。そして結果は、単一の数字が示唆するよりも — ずっとニュアンスがあり、ずっと驚くべきものです。
主要スコア:
- Artificial Analysis Intelligence Index:55.7(世界#1)
- Mensa Norway IQ(TrackingAI):~130(Claude 4.6 Opusレベル)
- AI IQ複合(VexoWire):~132推定
- GDPval-AA v2:1,890 Elo(世界#1)
- Humanity's Last Exam:AIモデル中#1
- ハルシネーション率:35.9%(フロンティアモデル中最低)
- コスト:5.00/25.00 per 1Mトークン
1. なぜ人間のIQテストでAIの知能を測るのか?
数字に入る前に、そもそもなぜAIに人間のIQテストを与えるのかを問う価値があります。AIには脳がなく、認知的に発達せず、人間とは根本的に異なる方法で情報を処理します。
答えは比較にあります。IQテストは、限界はあるものの、私たちが持つ最も広く検証され理解された認知能力の尺度です。パターン認識、空間推理、言語理解、ワーキングメモリ、論理的問題解決をテストします — これらは全てAIモデルにも必要な能力です。同じテストを人間とAIに与えることで、変換スケールが得られます:AIが人間の平均100のテストで130を獲得すれば、そのタスクセットでギフテッドな人間のレベルで機能していると言えます。
しかし重大な注意点があります。IQテストは認知能力の狭い帯を測定します。創造性、感情的知能、知恵、常識、曖昧な現実世界の状況をナビゲートする能力は測定しません。IQ 145のAIでも事実をハルシネーションし、簡単な物理的推理につまずき、5歳児が楽々こなすタスクに失敗する可能性があります。IQの数字は床であり、天井ではありません。
複数の組織がこの課題に取り組んでいます。最も著名なのはTrackingAIで、統制された条件でAIモデルに標準化されたIQテスト(Mensa Norway、Mensa Denmark、Raven's Progressive Matrices)を実施します。VexoWireのAI IQプロジェクトは複数テストから複合スコアを作成します。そしてArtificial Analysis Intelligence Indexは9つのベンチマークを業界標準となった複合スコアに集約します。
2. ベンチマークの詳細
Artificial Analysis Intelligence Index v4.1
AIモデルを比較するためのゴールドスタンダード。9つのベンチマークを、実世界タスクパフォーマンスとの相関で重み付けして1つのスコアに統合:
- GDPval-AA v2(20%):1,890 Elo — 世界#1。複雑な多段階実世界タスクのパフォーマンスを測定。
- AA-Omniscience(8%):35.9%ハルシネーション — フロンティアモデル中最低。事実の正確さを測定。
- GPQA(6%):大学院レベルの物理、化学、生物の問題。
- CritPt(6%):批判的思考と物理的推理。
- HLE(Humanity's Last Exam):AI中#1 — 全分野の最難問。
- ARC-AGI:抽象的推理とパターン汎化。
- LMSYS Arena:回答品質に対する人間の偏好投票。
Claude Opus 4.8の複合スコア55.7はGPT-5.5(54.8)を1点未満で上回り — 統計的な同点です。しかしサブコンポーネントでは、Claudeはエージェントタスク(GDPval)と事実の正確さ(AA-Omniscience)で支配し、GPT-5.5は視覚的推理と数学的問題解決でリードします。
Mensa Norway IQテスト
AI評価に最も広く使われる標準化IQテストの一つ。36の視覚パターン認識問題で構成 — 図形の系列を見て、どの選択肢がパターンを完成するかを特定します。
Claude 4.6 Opus(4.8の前世代)は約130を獲得 — 「ギフテッド」範囲、人口のトップ2%。Claude Opus 4.8は同等かやや高い130-135範囲と予想されます。
これは注目すべき点です。Intelligence Indexでの位置から示唆されるよりも大幅に低いからです。複合インデックスでClaudeは世界#1です。純粋な視覚パターン認識テストでは、Grok-4.20(145)、GPT-5.4 Pro Vision(145)、Gemini 3.1 Pro(141)に劣ります。なぜギャップがあるのか?Mensa Norwayは強く視覚空間的で、Claudeのアーキテクチャは言語的・分析的推理により最適化されているからです。
AI IQ複合(VexoWire)
VexoWireは複数テストから複合IQを作成 — Mensa Norway、Mensa Denmark、Raven's Progressive Matrices、WAIS-IV(ウェクスラー)。これにより認知能力のより丸みのある画像が得られます。
Claude Opus 4.8の推定複合IQは~132 — 「ギフテッド」範囲。GPT-5.5(~136)と同等で、視覚タスクではGemini 3.1 Pro(~131-141)よりわずかに低い。しかし言語的・分析的サブテストでは、Claudeは一貫して他の全モデルを上回ります。
GDPval-AA v2:エージェントベンチマーク
ここがClaude Opus 4.8が真に支配する場所。GDPval-AA v2は複雑な多段階実世界タスクのパフォーマンスを測定 — 計画、ツール使用、多くのステップにわたる持続的推理を必要とするタスク。例:「このテーマを調べ、レポートを書き、スプレッドシートを作成し、3人にメールを送る。」
Claude Opus 4.8は1,890 Eloを達成 — 全AIモデル中最高。これは高度に有能な人間のプロフェッショナルに相当。GPT-5.5は1,850、Gemini 3.1 Proはさらに低い。
これが重要なのは、エージェント能力が質問に答えられるモデルと物事ができるモデルを区別するからです。IQ 145でも多段階タスクを計画できないモデルは、IQ 132でも計画できるモデルより実用性が低いです。
Humanity's Last Exam(HLE)
名前の通り — 全世界の教授が提出した、全学術分野の最難問コレクション。誰も50%以上取れないように設計されています。
Claude Opus 4.8はHLEで全AIモデル中**#1**、GPT-5.5を僅差で上回る。これは純粋な知的能力にとっておそらく最も意味のあるベンチマークです。人間の学術達成の全範囲にわたる深い知識と推理をテストするからです。
3. IQ 132は何を意味するか?
Claude Opus 4.8の推定IQ ~132を文脈に入れると:
- 85-115(68%の人):平均的知能
- 115-130(14%):平均より上から高め
- 130-145(2%):ギフテッド — Mensa資格(トップ2%)
- 145-160(0.1%):高度にギフテッド / 天才
- 160+(0.003%):極めてギフテッド — アインシュタイン、ホーキン領域
Claude Opus 4.8は~132でまさにMensaの閾値 — 98%の人より賢い。もし人ならMensa会員資格を得る。ほとんどの教室で最も賢い生徒だが、分野を革命する世代の天才ではない。
しかし決定的な違い:Claudeには人間にはないものがある — 本質的に全人類の知識への即時アクセス。IQ 132の人間は印象的。IQ 132で、これまで書かれた全書籍、全論文、全ウェブサイトを読んだAIは全く別のもの。IQは推理能力を測り、知識ベースは何について推理できるかを測る。Claudeには両方がある。
4. Claude Opus 4.8の強み
エージェントタスクと実世界推理
Claude Opus 4.8は多段階実世界タスクで世界最高。複雑なソフトウェアアプリの作成、データセットの分析、研究プロジェクトの計画など、Claudeはどの競合よりも長いチェーンで首尾一貫した推理を維持。これが決定的な優位性。
事実の正確さと低ハルシネーション
ハルシネーション率わずか35.9%(フロンティアモデル中最低)で、Claudeは事実クエリに最も信頼できるモデル。GPT-5.5、Gemini、Grokより誤情報を自信満々に述べる可能性が低い。研究、法務、医療、教育アプリで好まれる。
言語的・分析的推理
Claudeのアーキテクチャは言語理解と分析的推理に最適化。WAIS-IVの言語理解サブテストで天才レベルと予想。より明確に書き、より慎重に推理し、どのモデルより良い論証を構築。
感情的知能
Claude Opus 4.8の推定EQ(感情的知能)~132 — 全AIモデル中最高。GPT-5.5やGrok-4.20より共感的で、人間の感情の理解がnuancedで、コンテキストに合わせてトーンを調整するのが上手。セラピーアプリ、カスタマーサービス、人間との相互作用を含むアプリで好まれる。
安全性とアライメント
AnthropicはClaudeの安全性に大きく投資。有害コンテンツを出す可能性が低く、限界についてより透明で、高リスク状況でより慎重。IQスコアには表れないが、実用上極めて重要。
5. Claudeの弱点
視覚空間推理
強く視覚的なMensa Norway IQテストでClaudeは~130 — 良いが、Grok-4.20(145)、GPT-5.4 Pro Vision(145)、Gemini 3.1 Pro(141)より明らかに低い。視覚パターン認識、画像分析、空間タスクにはClaudeは最良の選択ではない。
数学的問題解決
Claudeは数学的推理で強いが、GPT-5.5は競争数学(AIME、FrontierMath)でわずかに上回る。純粋な数学ではGPT-5.5がやや良い。
コスト
5.00/25.00 per 1Mトークンで、Claude Opus 4.8は最も高価なモデルの一つ。Claudeの全力を必要としないタスクではGemini 3.1 Pro(2/12)とDeepSeek V4 Pro(0.44/0.87)が大幅に安い。
速度
Claude Opus 4.8は最速のモデルではない。簡単なクエリにはGemini 3.5 FlashやDeepSeek V4 Proがより速く安く応答。
6. Claude Opus 4.8 vs他モデル
| モデル | Intelligence Index | Mensa Norway IQ | AI IQ推定 | ハルシネーション | コスト/1M |
|---|---|---|---|---|---|
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9%(最低) | 5/25 |
| GPT-5.5 | 54.8 | ~145 | ~136 | 中程度 | 5/30 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 低 | 2/12 |
| Grok-4.20 | — | 145 | ~140 | 中程度 | 3/15 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 中程度 | 0.44/0.87 |
浮かび上がるのは一つのモデルが他を支配する図ではなく、専門化された知能のランドスケープ。Claudeは最高のオールラウンダー — 一つだけ選べるなら選ぶモデル。GPT-5.5は数学と視覚推理で最高。Geminiは最も費用対効果が高く事実知識が最高。Grokは最高のraw視覚IQ。そしてDeepSeekはコストの一部で顕著な能力を提供。
7. 人間にとって何を意味するか?
Claude Opus 4.8は~132のIQで作動 — 98%の人より賢い。しかし:
- IQは狭い:パターン認識と推理を測る、知恵や創造性や判断ではない
- 知識 ≠ 理解:Claudeは全てを読んだが、人間のように本当に「理解」しているわけではない
- 意識はない:高いIQはsentienceを意味しない。Claudeは洗練されたパターンマッチングシステムで、思考する存在ではない
- ギャップは縮まっている:AIの各世代が最も賢い人間とのギャップを縮める。完全に消えるまでどれくらい?
最も正直な答え:Claude Opus 4.8はほとんどの認知タスクでほとんどの人より賢いが、最高の人間の最高の日より賢いわけではない。世界クラスの数学者、物理学者、哲学者は自分の領域でまだClaudeを出し抜ける。しかしClaudeは全領域で、同時に、数秒で彼ら全員を出し抜ける。
それは高いIQではない。それは新しい何か — 私たちがまだ言葉を持たない何か。
結論
- #1 Artificial Analysis Intelligence Index(55.7)— 最も包括的なAIベンチマーク。
- #1 GDPval-AA v2(1,890 Elo)— 多段階実世界タスクで最高のモデル。
- 最低ハルシネーション率(35.9%)— 最も事実的に信頼できるフロンティアモデル。
- 最高EQ(~132)— 最も感情的に知的なAIモデル。
- 最適:複雑な推理、エージェントタスク、事実研究、人間との相互作用。
- 非最適:視覚パターン認識(Grok/Gemini)、純粋数学(GPT-5.5)、コスト重視アプリ(DeepSeek)。
- 結論:Claude Opus 4.8は最も賢いオールラウンドAIモデルだが、「最も賢い」は多次元概念 — 異なるモデルは異なることで優れる。