Llama 4のIQは?
Llama 4はMensa Norway IQテストで112、Intelligence Indexでトップ15。全ベンチマークを分析し、Metaのオープンソースモデルをユニークにするものを説明します。
Llama 4:Metaのオープンソースチャンピオン
Llama 4はMeta AIの旗艦オープンソースモデルで、Meta AIは世界最大のテクノロジー企業の一つの研究部門です。2026年初頭にリリースされ、Mensa Norway IQテストで112、Artificial Analysis Intelligence Index v4.1でトップ15に入ります。これはDeepSeek V4 Pro(111)より上ですが、Kimi K3(118)、Qwen 3.5(115)、フロンティアモデル(Claude ~130、Gemini 141、GPT-5.5 ~145、Grok-4.20 145)より下です。
Llama 4をユニークにするのはその大規模なオープンソース性です。OpenAI、Anthropic、Googleの閉じたモデルとは異なり、Llama 4のweightsはダウンロードとローカルデプロイに無料で利用可能です。これが数千の派生モデル、fine-tune、アプリケーションの基盤となり — Llama 4を単なるモデルではなく、エコシステム全体にしています。
Llama 4は民衆のモデルです:最も賢くはないかもしれないが、誰もがダウンロード、修正、自分のハードウェアで実行できるモデル。AIインフラの完全な制御を必要とする研究者、スタートアップ、組織に、Llama 4は閉じたモデルにはないものを提供します:自由。
主要スコア:
- Artificial Analysis Intelligence Index:トップ15(スコア~43-44)
- Mensa Norway IQ(TrackingAI):112(平均以上)
- AI IQ複合(VexoWire):~112推定
- GDPval-AA v2:トップ15
- Humanity's Last Exam:トップ15
- ハルシネーション率:中程度
- コスト:無料(自己ホスト)または0.20/0.60 per 1Mトークン(プロバイダ経由)
- パラメータ:405B(最大バリアント)
- オープンソース:はい、weights無料利用可能
- コンテキスト:128Kトークン
1. オープンソース革命
Llama 4はMetaのオープンソースAIへのコミットメントを表します — AIは誰にでもアクセス可能であるべきで、少数の企業に制御されるべきではないという信念。OpenAI、Anthropic、GoogleがモデルをAPIの後ろに保持する一方、Metaは完全なモデルweightsを公開し、誰もがLlama 4をダウンロード、研究、修正、自分のハードウェアにデプロイできるようにします。
これは深い意味を持ちます:
- 民主化:十分なハードウェアがあれば誰でもstate-of-the-art AIモデルを実行できる
- カスタマイズ:開発者は特定ドメイン、言語、タスクにLlama 4をfine-tuneできる
- プライバシー:組織はLlama 4をローカルで実行し、データがインフラから出ないことを保証できる
- イノベーション:研究者はモデルの内部を研究し、新しいブレークスルーをもたらす
- エコシステム:数千の派生モデルがLlama 4上に構築され、豊かなエコシステムを創造
- コスト:自己ホストLlama 4は無料(ハードウェアコストを除く)、大規模で最も安価
Llamaエコシステムには:
- Llama 4 Base:元の事前訓練モデル
- Llama 4 Instruct:指示追従用にfine-tune
- Llama 4 Guard:安全フィルタリングバリアント
- コミュニティfine-tune:数千のドメイン固有バリアント
- 量子化バージョン:コンシューマハードウェアで動く圧縮モデル
- Llama 4 Vision:画像理解を持つマルチモーダルバリアント
他のAIモデルでこれほど豊かなエコシステムを生み出したものはありません。GPT-5.5やClaudeはより賢いかもしれませんが、ブラックボックスです。Llama 4は transparent、修正可能、コミュニティ駆動です。
2. ベンチマークの詳細
Mensa Norway IQテスト:112(平均以上)
36の視覚パターン認識問題で構成。Llama 4は112を獲得 — 人間平均100を上回り、「平均以上」範囲に位置。DeepSeek V4 Pro(111)と比較可能、Qwen 3.5(115)、Kimi K3(118)、フロンティアモデル(Claude ~130、Gemini 141、GPT-5.5 ~145、Grok-4.20 145)より下。
IQ 112は、Llama 4が人間の約79%より賢い — 人間の知能の上位21%を意味します。人なら有能力な大学生や熟練したプロフェッショナルに相当。天才ではないが、確かに聡明で有能。
Artificial Analysis Intelligence Index:トップ15
Intelligence IndexでLlama 4は推定スコア~43-44で世界トップ15。DeepSeek V4 Pro(44.3)と競争的だが、Qwen 3.5(~45-46)、Kimi K3(~45-47)、Gemini(46.5)、フロンティアモデルには及ばない。
Index構成要素の分解:
- GDPval-AA v2:Llama 4は適切に機能、多様なエージェントタスクで大パラメータ数の恩恵を受ける
- AA-Omniscience:Llama 4は中程度のハルシネーション率 — 小さいモデルより良いがClaudeより悪い
- GPQA:Llama 4は大学院レベルの科学問題で適切に機能
- HLE:Llama 4はHumanity's Last Examでトップ15
- ARC-AGI:Llama 4は抽象的推論で適切に機能
- LMSYS Arena:Llama 4は堅実な人間選好スコアを獲得、特にオープンエンドタスクで
AI IQ複合(VexoWire):~112
VexoWireの複合IQは複数テストを統合(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。Llama 4の推定複合IQは~112 — Mensa Norwayスコアと一致。「平均以上」範囲に位置し、人間の約79%より賢い。
GDPval-AA v2:トップ15
エージェントベンチマークでLlama 4はトップ15。大パラメータ数(405B)が substantial な知識と推論能力を与えるが、複雑な多段階タスクではフロンティアモデルに遅れを取る。中程度のエージェントワークロードにLlama 4は有能。
Humanity's Last Exam(HLE):トップ15
最も難しい学術問題でLlama 4はAIモデル中トップ15。Metaの広範な訓練データとモデルの大容量が分野を横断して良いパフォーマンスを助けるが、最も専門化された問題ではフロンティアモデルに及ばない。
3. IQ 112は何を意味するか?
Llama 4の112 IQを文脈に入れると:
- 85-115(68%の人):平均的知能
- 115-130(14%):平均より上から高め
- 130-145(2%):ギフテッド — Mensa資格(トップ2%)
- 145-160(0.1%):高度にギフテッド / 天才
Llama 4は112で**「平均」範囲の上部**に位置 — 人間の約79%より賢い。人なら有能力な大学生や熟練したプロフェッショナルに相当。天才ではないが、確かに聡明で有能。
これはDeepSeek V4 Pro(111)と比較可能だが、他のモデルより下:
- Qwen 3.5:115(平均以上)
- Kimi K3:118(平均以上)
- Claude Opus 4.8:~130(ギフテッド)
- Gemini 3.1 Pro:141(高度にギフテッド)
- GPT-5.5:~145(天才)
- Grok-4.20:145(天才)
フロンティアモデルとの差は約18-30 IQポイント。しかしLlama 4はオープンソース性で補償 — 完全な制御、プライバシー、カスタマイズを必要とするタスクでは、Llama 4の開放性がIQの差を上回ることができる。
4. Llama 4の強み
オープンソースの自由
Llama 4のweightsは無料で利用可能でダウンロードとローカルデプロイが可能。これが決定的な特徴。他のトップティアモデルでこのレベルの開放性を提供するものはありません。AIインフラの完全な制御を必要とする組織に、Llama 4はトップモデルの中で唯一の選択肢。
カスタマイズとfine-tuning
weightsが利用可能なため、開発者は特定ドメイン、言語、タスクにLlama 4をfine-tuneできる。これが数千のコミュニティfine-tuneを生み出した — 医療モデル、法務モデル、プログラミングモデル、クリエイティブライティングモデルなど。閉じたモデルでこのレベルのカスタマイズを提供するものはありません。
プライバシーとデータセキュリティ
Llama 4で、組織は完全に自分のハードウェアでモデルを実行でき、データがインフラから出ないことを保証できる。医療、金融、防衃、その他の敏感な業界にとって、これは重要。サードパーティAPIにデータが送られることはない。
大規模コスト
自己ホストLlama 4は無料(ハードウェアコストを除く)。大規模では、トークンごとのAPI料金を支払うより劇的に安くなる。高推論ボリュームの組織では、ハードウェア投資はすぐに回収される。
コミュニティエコシステム
Llamaエコシステムは比類ない。数千の開発者がツール、fine-tune、量子化、最適化を貢献。このコミュニティ駆動のアプローチは、Llama 4が集体的イノベーションの恩恵を受けることを意味 — 改善はどこからでも来る、Metaだけからではない。
透明性
閉じたモデルとは異なり、Llama 4のアーキテクチャとweightsはtransparent。研究者はモデルがどう機能するかを研究し、バイアスを特定し、失敗を理解し、改善を提案できる。この透明性は科学的進歩と責任あるAI開発に不可欠。
ハードウェア最適化
コミュニティはLlama 4の多数の量子化バージョンを開発し、コンシューマハードウェアで動くようにした — 8-bitから4-bitから2-bitまで。これはデータセンターだけでなく、ハイエンドGPUで有能なAIモデルを実行できることを意味する。
5. Llama 4の弱点
Raw IQと複雑な推理
IQ 112で、Llama 4は複雑な推理タスクでフロンティアモデルより下。最も難しい問題 — 競争数学、高度な論理パズル、最先端の科学推理 — にはClaude、GPT-5.5、Geminiがsubstantially優秀。18-33 IQポイントの差はsignificant。
ハルシネーション率
Llama 4は中程度のハルシネーション率 — 小さいモデルより良いがClaude(35.9%)やGPT-5.5より悪い。事実の正確性が重要なアプリ — 研究、法務、医療 — にはClaudeがより信頼できる。
コンテキストウィンドウ
128Kトークンのコンテキストウィンドウで、Llama 4は適切だが例外的ではない。Kimi K3(2M)、Gemini(1M)、Qwen 3.5(256K)はより大きなコンテキストウィンドウを提供。非常に長いドキュメントを処理する必要があるタスクには、他のモデルがより良い選択。
マルチモーダル能力
Llama 4 Visionは存在するが、そのマルチモーダル能力はQwen 3.5(テキスト、画像、音声、動画)やGemini(テキスト、画像、音声、動画)ほど洗練されていない。堅牢なマルチモーダル理解を必要とするアプリには、Qwen 3.5やGeminiがより良い選択。
感情的知能
Llama 4のEQ(感情的知能)は~105推定 — Claude(~132)、GPT-5.5(~120)、Gemini(~115)、Qwen 3.5(~107)より低いが、DeepSeek(~105)と比較可能。応答はより機能的で感情的にless nuanced。セラピーアプリ、カスタマーサービス、敏感な人間との相互作用にはClaudeがより良い選択。
ハードウェア要件
完全な405Bパラメータモデルは実行にsignificantなハードウェアを必要とする — 推論に複数のハイエンドGPU。量子化バージョンは助かるが、完全な品質でLlama 4を実行するのはハードウェアの面で高価。十分な計算リソースのない組織には、APIベースのモデルがより実用的かもしれない。
安全性とアライメント
Llama 4 Guardは安全フィルタリングのために存在するが、オープンソースの性質は悪意あるアクターが安全対策を除去できることを意味する。Metaはガイドラインを提供するが強制できない。保証された安全性を必要とするアプリには、強制されたガードレールを持つ閉じたモデルがより適切かもしれない。
6. Llama 4 vs他モデル
| モデル | Intelligence Index | Mensa Norway IQ | AI IQ推定 | オープンソース | コスト/1M | コンテキスト | パラメータ |
|---|---|---|---|---|---|---|---|
| Llama 4 | ~43-44(トップ15) | 112 | ~112 | はい(無料) | 無料(自己ホスト) | 128K | 405B |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | いいえ | 5/25 | 200K | 不明 |
| GPT-5.5 | 54.8 | ~145 | ~136 | いいえ | 5/30 | 400K | 不明 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | いいえ | 2/12 | 1M | 不明 |
| Grok-4.20 | トップ5 | 145 | ~140 | いいえ | 3/15 | 256K | 不明 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | はい | 0.44/0.87 | 128K | 不明 |
| Qwen 3.5 | ~45-46(トップ10) | 115 | ~115 | はい | 0.50/1.50 | 256K | 不明 |
| Kimi K3 | ~45-47(トップ10) | 118 | ~118 | いいえ | 0.55/2.19 | 2M | 不明 |
画面:Llama 4はオープンソースチャンピオン — 最も賢くはないが、最もアクセスしやすい。Claudeは有能なプロフェッショナル — 実世界タスクで最高。GPT-5.5はテストの天才 — 数学と視覚推理で最高。Geminiは価値チャンピオン — フロンティアモデル中最高費用対効果。Grok-4.20はraw IQチャンピオン — 最高IQと個性。DeepSeekは予算チャンピオン — 最も安いAPI。Qwen 3.5はオールラウンダー — 最も多才。Kimiは長文コンテキストチャンピオン — 最大コンテキストウィンドウ。
オープンソース、プライバシー、カスタマイズ、大規模コストを必要とする組織に、Llama 4は明確な選択。それは民衆のモデル — 最も賢いではなく、最も自由。
7. 人間にとって何を意味するか?
Llama 4は~112のIQで作動 — 人間の約79%より賢い。しかし:
- IQはすべてではない:IQ 112は平均以上で、ほとんどの実用的タスクに十分
- 多くのアプリで開放性がraw IQより重要:プライバシーに敏感またはカスタマイズ集約的なアプリには、Llama 4の開放性がより高いIQより価値がある
- 自由がイノベーションを可能にする:Llama 4のオープンweightsは閉じたモデルができないイノベーションのエコシステム全体を生み出した
- 透明性が信頼を構築する:モデルの内部を検査できることはブラックボックスができない信頼を構築する
- 知識 ≠ 理解:すべてのAIモデルと同様に、Llama 4は膨大な知識にアクセスするが、人間のようにgenuinely「理解」はしない
- 意識はない:高いIQがsentienceを意味しない。Llama 4は洗練されたパターンマッチングシステムで、思考する存在ではない
- コミュニティが進歩を駆動する:Llamaエコシステムは、オープンな協力が十億ドル規模の閉じたシステムと競争できるモデルを生み出せることを証明する
最も正直な答え:Llama 4は認知テストで人間の79%より賢く、開放性、プライバシー、カスタマイズを必要とするアプリに最も賢い選択 — 最も知的だからではなく、最も自由だから。
結論
- Intelligence Indexトップ15 — DeepSeekと競争的、Qwen 3.5、Kimi、フロンティアモデルには及ばない。
- 完全オープンソース — weightsはダウンロード、研究、ローカルデプロイに無料利用可能。
- 405Bパラメータ — 利用可能な最大のオープンソースモデルの一つ。
- 最適:プライバシーに敏感なアプリ、カスタマイズのニーズ、大規模コスト、研究、自己ホストデプロイ、コミュニティ駆動のイノベーション。
- 非最適:raw IQ(フロンティアモデルが勝)、長文コンテキスト(Kimiが勝)、マルチモーダル(Qwen 3.5やGeminiが勝)、感情的知能(Claudeが勝)、保証された安全性(強制ガードレールを持つ閉じたモデル)。
- 教訓:知能とは最も賢いことだけでなく、最もアクセスしやすいこと。Llama 4はオープンソースAIが十億ドル規模の閉じたシステムと競争できることを証明し、先進的なAIへのアクセスを全員に民主化する。