DeepSeek V4のIQは?
DeepSeek V4 ProはMensa Norway IQテストで111、Intelligence Indexで44.3。全ベンチマークを分析し、最高の予算AIモデルである理由を説明します。
DeepSeek V4 Pro:中国のオープンソースチャンピオン
DeepSeek V4 ProはDeepSeekの旗艦モデルで、低コストと高性能の組み合わせで世界を驚かせた中国のAIラボです。2026年初頭にリリースされ、Mensa Norway IQテストで111、Artificial Analysis Intelligence Index v4.1で44.3を獲得 — 世界トップ10に入りますが、フロンティアモデル(Claude 55.7、GPT-5.5 54.8)には大きく遅れを取ります。
DeepSeek V4 Proをremarkableにするのはraw知能ではなく価格です。0.44/0.87 per 1Mトークンで、Claude(5/25)やGPT-5.5(5/30)の約10分の1、Gemini(2/12)の約5分の1のコストです。Claudeへの1回のクエリの価格で、DeepSeek V4 Proに10回クエリを実行できます。それでも、IQテストで111を獲得 — 人間の約25%より高い。
DeepSeek V4 Proは民衆のAIです:知能のフロンティアで競争しないが、実質無料の価格で能力あるAIを誰にでも提供するモデル。学生、愛好家、中小企業、コスト重視市場の開発者にとって、DeepSeek V4 Proはしばしば唯一の実行可能な選択肢です。
主要スコア:
- Artificial Analysis Intelligence Index:44.3(世界トップ10)
- Mensa Norway IQ(TrackingAI):111(人間平均以上)
- AI IQ複合(VexoWire):~111推定
- GDPval-AA v2:トップ10
- Humanity's Last Exam:トップ10
- ハルシネーション率:中程度
- コスト:0.44/0.87 per 1Mトークン(全主要モデル中最低)
- オープンソース:ローカルデプロイ可能な weights
1. 予算革命
DeepSeek V4 ProはAIランドスケープにおける根本的なシフトを表します:知能の民主化。アメリカのラボ(OpenAI、Anthropic、Google、xAI)がフロンティアで競争する一方 — IQスコアを130から140から145へ押し上げる — DeepSeekは異なる目標に集中しました:能力あるAIを誰にでも手頃にすること。
0.44 per 1M入力トークン、0.87 per 1M出力で、DeepSeek V4 Proは驚くほど安いです。例えば:典型的な本の長さのドキュメント(約100,000トークン)の処理は入力約0.04、出力約0.09です。同じタスクはGeminiで0.50-1.00、ClaudeやGPT-5.5で1.00-3.00かかります。
これは単なる割引ではなく — 異なる製品カテゴリーです。DeepSeek V4 Proは以下にAIをアクセシブルにします:
- 学生:$20/月のサブスクに払えない
- 中小企業:発展途上市場で
- 愛好家と実験者
- 開発者:高ボリュームアプリを構築
- 研究者:限られた予算で大規模データセットを処理
remarkableなのは:DeepSeek V4 Proはgenuinely能力があります。Mensa Norway IQテストで111 — 人間平均100を上回り、人間の約25%より高い。天才ではありませんが、ほとんどの日常タスクに十分なほど賢い:執筆、プログラミング、分析、翻訳、要約。
2. ベンチマークの詳細
Mensa Norway IQテスト:111(平均以上)
36の視覚パターン認識問題で構成。DeepSeek V4 Proは111を獲得 — 人間平均100を上回り、「平均以上」範囲に位置します。人間の約25%より高いですが、フロンティアモデル(Claude ~130、Gemini 141、GPT-5.5 ~145、Grok-4.20 145)には大きく及びません。
IQ 111は、DeepSeek V4 Proが賢い大学生レベルで視覚パターンを認識し抽象的に推理できることを意味します。最も難しいパズルは解けませんが、ほとんどの日常的推理タスクを有能にこなします。
DeepSeek V4 Pro(111)とフロンティアモデル(130-145)の差はsignificant — 約20-35 IQポイント、または約1-2標準偏差。これはフロンティアモデルが純粋な認知テストでsubstantially賢いことを意味します。しかし、天才レベルの推理を必要としないタスク — つまり大多数 — にはDeepSeek V4 Proは十分以上です。
Artificial Analysis Intelligence Index v4.1:44.3(トップ10)
Intelligence IndexでDeepSeek V4 Proは44.3を獲得 — 世界トップ10ですが、フロンティアリーダー(Claude 55.7、GPT-5.5 54.8)から約10-11ポイント遅れ。この差はsignificantですが、価格差を考えれば予想通りです。
Index構成要素の分解:
- GDPval-AA v2:DeepSeekは妥当にスコアするが、複雑な多段階タスクでClaudeやGPT-5.5に遅れを取る
- AA-Omniscience:DeepSeekは中程度のハルシネーション率 — Claudeほど低くないが、ほとんどの用途で許容範囲
- GPQA:DeepSeekは大学院レベルの科学問題で適切に機能
- HLE:DeepSeekはHumanity's Last Examでトップ10
- ARC-AGI:DeepSeekはフロンティアモデルと比較して抽象的推理に苦戦
- LMSYS Arena:DeepSeekはまともな人間選好スコアを獲得、特にプログラミングタスクで
AI IQ複合(VexoWire):~111
VexoWireの複合IQは複数テストを統合(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。DeepSeek V4 Proの推定複合IQは~111 — Mensa Norwayスコアと一致。「平均以上」範囲にしっかり位置し、賢い人間と同等だが天才レベルにははるかに及ばない。
GDPval-AA v2:トップ10
エージェントベンチマークでDeepSeek V4 Proはトップ10。複雑な多段階タスクでClaude(1,890 Elo)やGPT-5.5(1,850 Elo)よりsignificantly能力が低いが、中程度のエージェントワークロードを処理できます。簡単な自動化、基本的なプログラミングタスク、直接的な多段階指示にはDeepSeek V4 Proは有能。
Humanity's Last Exam(HLE):トップ10
最も難しい学術問題でDeepSeek V4 ProはAIモデル中トップ10。これはDeepSeekの学術・科学データでの強力な訓練を反映 — モデルは全分野で幅広い知識を持ちますが、フロンティアモデルの推理の深さには及ばない。
3. IQ 111は何を意味するか?
DeepSeek V4 Proの111 IQを文脈に入れると:
- 85-115(68%の人):平均的知能
- 115-130(14%):平均より上から高め
- 130-145(2%):ギフテッド — Mensa資格(トップ2%)
- 145-160(0.1%):高度にギフテッド / 天才
DeepSeek V4 Proは111で平均範囲の上端に位置 — 人間の約25%より賢いが、「平均以上」の閾値115には完全に届かない。人なら賢い大学生や有能なプロフェッショナルに相当 — 天才ではないが確かに有能。
これはフロンティアモデルより明らかに低い:
- Claude Opus 4.8:~130(ギフテッド)
- Gemini 3.1 Pro:141(高度にギフテッド)
- GPT-5.5:~145(天才)
- Grok-4.20:145(天才)
差はsignificant — 約20-35 IQポイント。しかし重要な質問は:あなたのユースケースに差は重要ですか?ほとんどの日常タスク — メール作成、ドキュメント要約、基本プログラミング、翻訳 — にはIQ 111は十分以上。フロンティアモデルの優位性は最も難しい問題で現れる:複雑な数学的証明、複雑な多段階推理、最先端の研究問題。
4. DeepSeek V4 Proの強み
費用対効果
これがDeepSeek V4 Proの決定的な特徴。0.44/0.87 per 1Mトークンで、圧倒的に最も安い主要AIモデル。高ボリュームアプリ — 何千ものユーザーにサービスするチャットボット、バルクドキュメント処理、大規模データ分析 — にはコスト削減が膨大です。ClaudeやGPT-5.5の1回のクエリの価格で10-30回のDeepSeekクエリを実行できます。
プログラミングと技術タスク
DeepSeek V4 Proはプログラミングタスクに特に強いです。DeepSeekはコード訓練データに大きく投資し、HumanEvalやMBPPなどのベンチマークで良好なパフォーマンス。フロンティア価格を払えないがコーディングアシスタントが必要な開発者に、DeepSeek V4 Proは素晴らしい選択。
オープンソースの可用性
DeepSeek V4 Proの weightsはローカルデプロイに利用可能。これは組織が独自のハードウェアでモデルを実行でき、APIコストを完全に回避しデータをプライベートに保てることを意味します。セキュリティ重視の組織、制限された環境の研究者、完全な制御が必要な開発者にとって、これは大きな利点。
多言語サポート
DeepSeek V4 Proは中国語と英語で広範に訓練され、他の主要言語も強力にサポート。中国語アプリにはDeepSeekは最高のモデルの一つ — しばしば中国語タスクで西洋モデルを上回る。
数学的推理
GPT-5.5レベルではないが、DeepSeek V4 Proは数学的推理で有能。ほとんどの高校・大学レベルの数学問題を解け、算術と代数を確実に処理。日常的な数学タスクには十分以上。
速度
DeepSeek V4 Proは高速 — より小さいサイズと最適化されたアーキテクチャにより、応答を迅速に生成。レイテンシが重要なアプリ — リアルタイムチャット、インタラクティブツール、カスタマーサービス — にはDeepSeek V4 Proはレスポンシブなパフォーマンスを提供。
5. DeepSeek V4 Proの弱点
Raw IQと複雑な推理
IQ 111で、DeepSeek V4 Proは複雑な推理タスクでフロンティアモデルよりsignificantly低い。最も難しい問題 — 競争数学、高度な論理パズル、多段階抽象推理 — にはフロンティアモデルがsubstantially優秀。あなたのタスクが天才レベルの推理を必要とする場合、DeepSeek V4 ProはClaudeやGPT-5.5が成功するところで苦戦する。
エージェントタスク
GDPval-AA v2でDeepSeek V4 Proはトップ10だが、ClaudeやGPT-5.5に大きく遅れを取る。複雑な多段階実世界タスク — 大規模ソフトウェアプロジェクトの作成、研究ワークフローの管理、複雑な計画の実行 — にはDeepSeek V4 Proは信頼性が低い。簡単なエージェントタスクは処理できるが複雑なものには苦戦。
ハルシネーション率
DeepSeek V4 Proは中程度のハルシネーション率 — Claude(35.9%)やGeminiより高い。特にニッチや専門トピックで、誤った情報を自信満々に述べる可能性が高い。事実の正確性が重要なアプリ(研究、法務、医療)にはClaudeがより信頼できる。
感情的知能
DeepSeek V4 ProのEQ(感情的知能)は~105推定 — 全フロンティアモデル(Claude ~132、GPT-5.5 ~120、Gemini ~115、Grok ~110)より低い。応答はより機械的で、人間の感情の理解がless nuanced。セラピーアプリ、カスタマーサービス、敏感な人間との相互作用にはこれは限界。
安全性とアライメント
DeepSeek V4 Proは中国の規制要件に従い、特定の政治的に敏感な質問を拒否する場合があります。これは西洋モデルの安全フィルター(有害コンテンツに焦点)とは異なり、特定のトピックでの有用性に影響する可能性があります。
6. DeepSeek V4 Pro vs他モデル
| モデル | Intelligence Index | Mensa Norway IQ | AI IQ推定 | ハルシネーション | コスト/1M | オープンソース |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 中程度 | 0.44/0.87 | はい |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9%(最低) | 5/25 | いいえ |
| GPT-5.5 | 54.8 | ~145 | ~136 | 中程度 | 5/30 | いいえ |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 低 | 2/12 | いいえ |
| Grok-4.20 | トップ5 | 145 | ~140 | 中程度 | 3/15 | いいえ |
画面:DeepSeek V4 Proは予算チャンピオン — 最も賢くはないが、圧倒的に最も手頃。Claudeは有能なプロフェッショナル — 実世界タスクと事実の正確さで最高。GPT-5.5はテストの天才 — 数学と視覚推理で最高。Geminiは価値チャンピオン — フロンティアモデル中最高費用対効果。Grok-4.20はraw IQチャンピオン — 最高IQとユニークな個性。
最低価格で能力あるAIを求めるユーザーにDeepSeek V4 Proは明確な選択。最も難しい問題でフロンティアモデルに匹敵しないが、日常タスクの90%には十分以上 — わずかなコストで。
7. 人間にとって何を意味するか?
DeepSeek V4 Proは~111のIQで作動 — 人間の約25%より賢い。しかし:
- IQはすべてではない:IQ 111は平均以上で、ほとんどの実用的タスクに十分
- ほとんどの用途でコストがIQより重要:日常アプリでは、DeepSeekの10倍コスト削減がフロンティアモデルとの20-35ポイントIQ差より重要
- オープンソースがイノベーションを可能に:DeepSeekのオープン weightsは研究者と開発者がカスタムソリューションを構築し、特定ドメインにfine-tuneし、ローカルで実行することを可能に
- 知識 ≠ 理解:すべてのAIモデルと同様に、DeepSeekは膨大な知識にアクセスするが、人間のようにgenuinely「理解」はしない
- 意識はない:高いIQがsentienceを意味しない。DeepSeekは洗練されたパターンマッチングシステムで、思考する存在ではない
- AIの民主化:DeepSeek V4 Proは能力あるAIが高価である必要がないことを証明 — 誰にでもアクセシブルにできる
最も正直な答え:DeepSeek V4 Proは認知テストで人間の4分の1より賢く、ほとんどの実用的目的で、最も賢い選択 — 最も知的だからではなく、ドルあたり最大の価値を提供するから。
結論
- 44.3 on Intelligence Index — 世界トップ10だが、フロンティアモデルから~10ポイント遅れ。
- 全主要モデル中最低コスト — 0.44/0.87 per 1Mトークン、ClaudeやGPT-5.5の約10分の1。
- オープンソース — ローカルデプロイ可能な weights、プライバシーとカスタマイズを可能に。
- 最適:コスト重視アプリ、プログラミング、高ボリュームタスク、中国語アプリ、ローカルデプロイ。
- 非最適:複雑な推理(フロンティアモデルが勝)、エージェントタスク(Claudeが勝)、事実の正確さ(Claudeが勝)、感情的知能(Claudeが勝)。
- 教訓:知能とは最も賢いことだけでなく、アクセシブルであること。DeepSeek V4 ProはAIを民主化し、能力ある知能を誰にでも提供。