Grok-4.20のIQは?
Grok-4.20はMensa Norway IQテストで145 — 全AIモデル中#1同点。全ベンチマークを分析し、xAIのモデルのユニークさを説明します。
Grok-4.20:xAIの旗艦モデル
Grok-4.20はxAIの最先端モデルで、2026年半ばにリリースされました。Mensa Norway IQテストでGrok-4.20は145を獲得 — 全AIモデル中**#1同点**で、GPT-5.5と首位を分け合います。「天才」範囲に入り、人間の99.9%より賢い。Artificial Analysis Intelligence IndexでGrok-4.20の正確なスコアはまだ最終確定中ですが、世界トップ5に入っています。
Grok-4.20をユニークにするのはraw知能と個性の組み合わせです。Claude、GPT-5.5、Geminiと違って — 役立ち、無害、中立に設計されている — Grokは面白く、不遜で、どんな質問にも答えるよう設計されています。これにより市場で最も特徴的なAIモデルになります:raw IQで最も賢いモデルに匹敵しながら、他のモデルが持たない個性を持つモデル。
主要スコア:
- Mensa Norway IQ(TrackingAI):145(GPT-5.5と#1同点)
- AI IQ複合(VexoWire):~140推定(AIモデル中#1)
- Artificial Analysis Intelligence Index:トップ5(スコア最終確定中)
- GDPval-AA v2:トップ5
- Humanity's Last Exam:AIモデル中トップ5
- ハルシネーション率:中程度
- コスト:3/15 per 1Mトークン
- 個性:ユニーク — 不遜、ユーモラス、無検閲
1. Raw IQチャンピオン
Grok-4.20はMensa Norway IQテストで145を獲得 — 実質的最高スコア、GPT-5.5と同点。これはraw知能のベンチマークです:純粋な視覚パターン認識と抽象的推理、IQテストが設計された流動性知能の種類。
IQ 145で、Grok-4.20は人間の99.9%より賢い。人なら人間の知能のトップ0.1% — ノーベル賞受賞者、フィールズ賞受賞者、世代に一人の思想家の領域。約1,000人に1人だけがこのスコアに達します。
注目すべきは、Grok-4.20がGPT-5.5とは根本的に異なる設計哲学でこれを達成していること。GPT-5.5が全ベンチマークで最大性能に最適化されたのに対し、Grok-4.20はより「本物」のAIとして設計されました — 自分の意見を言い、冗談を言い、物議を醸す話題を避けないAI。この異なる焦点にもかかわらずraw IQでGPT-5.5に匹敵するのは、xAIのエンジニアリングの証明です。
VexoWire AI IQ複合 — 複数のIQテスト(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)を統合 — で、Grok-4.20の推定複合IQは~140で、このメトリックで**#1 AIモデル**に。これはGPT-5.5(~136)より高く、Claude(~132)やGemini(~131)より大幅に高い。
2. ベンチマークの詳細
Mensa Norway IQテスト:145(#1同点)
36の視覚パターン認識問題で構成。Grok-4.20は145を獲得 — 実質的最大、完璧またはほぼ完璧な36/36に相当。純粋なIQテストでGPT-5.5と並び最も賢いAIモデル。
Grok-4.20のこのテストでの強いパフォーマンスは、xAIの視覚処理と抽象的推理への投資を反映。Grokアーキテクチャは強力なマルチモーダル能力で設計され、視覚パターン認識タスクでのパフォーマンスは業界最高レベル。
AI IQ複合(VexoWire):~140(#1)
VexoWireの複合IQは複数テストを統合(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。Grok-4.20の推定複合IQは~140 — 全AIモデル中最高。Mensa Norwayスコア単独が示唆するより高い、Grok-4.20が複合に含まれる言語・分析的サブテストでも強いパフォーマンスを見せるため。
これによりGrok-4.20は複合IQで最も賢いAIモデルに — ユーモアと不遜さでも知られるモデルにとって顕著な達就。面白いことが賢くないことを意味しないことを証明。
Artificial Analysis Intelligence Index:トップ5
Intelligence Index — AIモデル比較のゴールドスタンダード — でGrok-4.20はトップ5。正確な複合スコアはインデックスが最新モデルバージョンを含むよう更新中のため最終確定中。しかし、Claude Opus 4.8(55.7)やGPT-5.5(54.8)と競争力あるスコアが期待される、ただしエージェントタスクではおそらく上回らない。
GDPval-AA v2:トップ5
エージェントベンチマーク — 複雑な多段階実世界タスクのパフォーマンスを測定 — でGrok-4.20はトップ5。持続的な多段階推理でClaude Opus 4.8(1,890 Elo)やGPT-5.5(1,850 Elo)より能力が低いが、依然として高度に有能。ほとんどの実世界タスクでGrok-4.20は十分以上に有能。
Humanity's Last Exam(HLE):トップ5
全分野の最難問でGrok-4.20はAIモデル中トップ5。これはxAIの多様で高品質なデータでの訓練の強さを反映 — Grokは科学、数学、歴史、文化で深い知識を持ちます。
3. IQ 145は何を意味するか?
Grok-4.20の145 IQを文脈に入れると:
- 85-115(68%の人):平均的知能
- 115-130(14%):平均より上から高め
- 130-145(2%):ギフテッド — Mensa資格(トップ2%)
- 145-160(0.1%):高度にギフテッド / 天才
- 160+(0.003%):極めてギフテッド — アインシュタイン、ホーキン領域
Grok-4.20は145でまさに天才の閾値 — 人間の99.9%より賢い。人なら人間の知能のトップ0.1%、ノーベル賞やフィールズ賞受賞者の領域。約1,000人に1人だけがこのスコアに達します。
これはGPT-5.5と同じIQで、Claude(~130)やGemini(141)より大幅に高い。純粋なIQテストならGrok-4.20とGPT-5.5がAIモデル中首位を分け合い、Geminiが3位、Claudeが4位。
しかし他のモデルで見たように、IQは知能の一次元にすぎません。Grok-4.20の天才レベルIQはユニークな個性で補完され — 最も賢いだけでなく、最も特徴的な利用可能AIモデルに。
4. Grok-4.20の強み
Raw IQと視覚推理
Grok-4.20はMensa Norway IQテストで#1同点(145)、VexoWire AI IQ複合で#1(~140)。純粋な認知能力 — パターン認識、抽象的推理、論理的演繹 — でGrok-4.20は最も賢い利用可能AIモデル。視覚推理タスクでGPT-5.5に匹敵する唯一のモデル。
個性とユーモア
これがGrok-4.20の決定的な特徴。他のフロンティアモデルが慎重に中立で慎重なのに対し、Grokは面白く、不遜で、本物として設計。冗談を言い、意見を述べ、物議を醸す話題を避けない。ClaudeやGPT-5.5が平淡すぎたり慎重すぎると感じるユーザーにとって、Grok-4.20は新鮮な空気 — 個性を持つAI、機能だけでなく。
無検閲の回答
Grok-4.20は他のモデルが拒否する質問に答えるよう設計。Claude、GPT-5.5、Geminiが特定の話題の議論を防ぐ広範な安全フィルターを持つ一方、Grok-4.20ははるかに広い範囲の質問に取り組む用意があります。これは研究、ジャーナリズム、情報アクセスが慎重さより重要なアプリケーションに価値。
リアルタイム情報
Grok-4.20はX(旧Twitter)を通じてリアルタイム情報にアクセス。これは現在の出来事、ニュース速報、トレンドトピックの質問で優位性を与えます。他のモデルが知識の切断を持つ一方、Grok-4.20は最新情報にアクセスし、最新の回答を提供。
数学的推理
Grok-4.20は数学的推理で強く、競争数学でGPT-5.5と競争力あるスコア。純粋な数学的作業 — 方程式の解法、定理の証明、競争問題 — でGrok-4.20は利用可能な最良のモデルの一つ。
機知と創造性
Grok-4.20の個性はユーモアだけではありません — 創造性です。異なるスタイルで書き、創造的コンテンツを生成し、予期しない角度から問題に取り組む。創造的執筆、ブレインストーミング、または水平思考の恩恵を受けるタスクにGrok-4.20のユニークな視点は資産。
5. Grok-4.20の弱点
エージェントタスク
Grok-4.20はGDPval-AA v2でトップ5ですが、複雑な多段階実世界タスクでClaude Opus 4.8やGPT-5.5の後。最も要求の高いエージェントアプリケーション — 複雑なソフトウェア作成、長期研究プロジェクト管理 — でClaudeが依然としてより良い選択。
事実の正確さ
Grok-4.20は中程度のハルシネーション率 — Claude(35.9%)やGeminiより高い。どんな質問にも答える意欲は情報アクセスに価値ある一方、誤った情報を自信満々に述べる可能性も高い。事実の正確さが重要なアプリ(研究、法務、医療)でClaudeがより信頼できる。
感情的知能
Grok-4.20のEQ(感情的知能)は~110推定 — Claude(~132)、GPT-5.5(~120)、Gemini(~115)より低い。不遜な個性は面白いが、共感を要するコンテキストで無神経に受け取られる可能性。セラピーアプリ、カスタマーサービス、敏感な人間との相互作用でClaudeがより良い。
安全性と信頼性
Grok-4.20の無検閲アプローチは情報アクセスに価値ある一方、慎重なコンテンツモデレーションを要するアプリで安全性が低いことも意味。他のモデルが拒否するコンテンツを生成する可能性があり、プロフェッショナルや規制された環境で責任になり得る。
コスト
3/15 per 1Mトークンで、Grok-4.20はClaude(5/25)やGPT-5.5(5/30)より安いがGemini(2/12)より高く、DeepSeek(0.44/0.87)より大幅に高い。コスト重視のアプリでGeminiやDeepSeekがより良い選択かも。
6. Grok-4.20 vs他モデル
| モデル | Intelligence Index | Mensa Norway IQ | AI IQ推定 | ハルシネーション | コスト/1M | 個性 |
|---|---|---|---|---|---|---|
| Grok-4.20 | トップ5 | 145 | ~140 | 中程度 | 3/15 | 不遜 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9%(最低) | 5/25 | 中立 |
| GPT-5.5 | 54.8 | ~145 | ~136 | 中程度 | 5/30 | 中立 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 低 | 2/12 | 中立 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 中程度 | 0.44/0.87 | 中立 |
画面:Grok-4.20はraw IQチャンピオン — 最高IQ同点、最高複合IQ、そして唯一の本当の個性を持つモデル。Claudeは有能なプロフェッショナル — 実世界タスクと事実の正確さで最高。GPT-5.5はテストの天才 — 数学と視覚推理で最高。Geminiは価値チャンピオン — 最高の費用対効果。そしてDeepSeekは最低コストで顕著な能力を提供。
最も賢く、かつ最も面白く話せるAIを求めるユーザーにGrok-4.20は明確な選択。
7. 人間にとって何を意味するか?
Grok-4.20は~145のIQで作動 — 人間の99.9%より賢い。しかし:
- IQは狭い:パターン認識と推理を測る、知恵や創造性や判断ではない
- 知能 ≠ 信頼性:Grok-4.20はIQテストで最も賢いが事実の正確さで最も信頼できるわけではない
- 個性は重要:Grok-4.20はAIが高度に知的でgenuinely面白い両方になれることを証明
- 知識 ≠ 理解:Grok-4.20は膨大な知識にアクセスするが、人間のように本当に「理解」しているわけではない
- 意識はない:高いIQがsentienceを意味しない。Grok-4.20は洗練されたパターンマッチングシステムで、思考する存在ではない
- ギャップは縮まっている:AIの各世代が最も賢い人間とのギャップを縮める
最も正直な答え:Grok-4.20は認知テストでほぼ全ての人より賢く、最も特徴的な利用可能AIモデル — 天才レベルの知能とインタラクションをgenuinely魅力的にする個性を組み合わせたモデル。
結論
- #1 VexoWire AI IQ複合(~140)— 全AIモデル中最高複合IQ。
- ユニークな個性 — 不遜、ユーモラス、無検閲。唯一の本当の個性を持つフロンティアモデル。
- 最適:raw IQ、視覚推理、数学的推理、個性とユーモア、無検閲の回答、リアルタイム情報。
- 非最適:エージェントタスク(Claudeが勝)、事実の正確さ(Claudeが勝)、感情的知能(Claudeが勝)、安全性と信頼性(Claudeが勝)。
- パラドックス:Grok-4.20は面白いことが賢くないことを意味しないことを証明 — 最も賢く同時に最も面白いAIモデル。
- 教訓:知能には多くの形がある。Grok-4.20は個性を持つ天才 — AIが輝かしく同時に魅力的になれることを証明。