DeepSeek V4のIQは?
Dr. Daria Dudnik 10 min read 0 views

DeepSeek V4のIQは?

DeepSeek V4 ProはMensa Norway IQテストで111、Intelligence Indexで44.3。全ベンチマークを分析し、最高の予算AIモデルである理由を説明します。

DeepSeek V4 Pro:中国のオープンソースチャンピオン

DeepSeek V4 ProはDeepSeekの旗艦モデルで、低コストと高性能の組み合わせで世界を驚かせた中国のAIラボです。2026年初頭にリリースされ、Mensa Norway IQテストで111、Artificial Analysis Intelligence Index v4.1で44.3を獲得 — 世界トップ10に入りますが、フロンティアモデル(Claude 55.7、GPT-5.5 54.8)には大きく遅れを取ります。

DeepSeek V4 Proをremarkableにするのはraw知能ではなく価格です。0.44/0.87 per 1Mトークンで、Claude(5/25)やGPT-5.5(5/30)の約10分の1、Gemini(2/12)の約5分の1のコストです。Claudeへの1回のクエリの価格で、DeepSeek V4 Proに10回クエリを実行できます。それでも、IQテストで111を獲得 — 人間の約25%より高い。

DeepSeek V4 Proは民衆のAIです:知能のフロンティアで競争しないが、実質無料の価格で能力あるAIを誰にでも提供するモデル。学生、愛好家、中小企業、コスト重視市場の開発者にとって、DeepSeek V4 Proはしばしば唯一の実行可能な選択肢です。

主要スコア:

  • Artificial Analysis Intelligence Index:44.3(世界トップ10)
  • Mensa Norway IQ(TrackingAI):111(人間平均以上)
  • AI IQ複合(VexoWire):~111推定
  • GDPval-AA v2:トップ10
  • Humanity's Last Exam:トップ10
  • ハルシネーション率:中程度
  • コスト:0.44/0.87 per 1Mトークン(全主要モデル中最低)
  • オープンソース:ローカルデプロイ可能な weights

1. 予算革命

DeepSeek V4 ProはAIランドスケープにおける根本的なシフトを表します:知能の民主化。アメリカのラボ(OpenAI、Anthropic、Google、xAI)がフロンティアで競争する一方 — IQスコアを130から140から145へ押し上げる — DeepSeekは異なる目標に集中しました:能力あるAIを誰にでも手頃にすること。

0.44 per 1M入力トークン、0.87 per 1M出力で、DeepSeek V4 Proは驚くほど安いです。例えば:典型的な本の長さのドキュメント(約100,000トークン)の処理は入力約0.04、出力約0.09です。同じタスクはGeminiで0.50-1.00、ClaudeやGPT-5.5で1.00-3.00かかります。

これは単なる割引ではなく — 異なる製品カテゴリーです。DeepSeek V4 Proは以下にAIをアクセシブルにします:

  • 学生:$20/月のサブスクに払えない
  • 中小企業:発展途上市場で
  • 愛好家と実験者
  • 開発者:高ボリュームアプリを構築
  • 研究者:限られた予算で大規模データセットを処理

remarkableなのは:DeepSeek V4 Proはgenuinely能力があります。Mensa Norway IQテストで111 — 人間平均100を上回り、人間の約25%より高い。天才ではありませんが、ほとんどの日常タスクに十分なほど賢い:執筆、プログラミング、分析、翻訳、要約。


2. ベンチマークの詳細

Mensa Norway IQテスト:111(平均以上)

36の視覚パターン認識問題で構成。DeepSeek V4 Proは111を獲得 — 人間平均100を上回り、「平均以上」範囲に位置します。人間の約25%より高いですが、フロンティアモデル(Claude ~130、Gemini 141、GPT-5.5 ~145、Grok-4.20 145)には大きく及びません。

IQ 111は、DeepSeek V4 Proが賢い大学生レベルで視覚パターンを認識し抽象的に推理できることを意味します。最も難しいパズルは解けませんが、ほとんどの日常的推理タスクを有能にこなします。

DeepSeek V4 Pro(111)とフロンティアモデル(130-145)の差はsignificant — 約20-35 IQポイント、または約1-2標準偏差。これはフロンティアモデルが純粋な認知テストでsubstantially賢いことを意味します。しかし、天才レベルの推理を必要としないタスク — つまり大多数 — にはDeepSeek V4 Proは十分以上です。

Artificial Analysis Intelligence Index v4.1:44.3(トップ10)

Intelligence IndexでDeepSeek V4 Proは44.3を獲得 — 世界トップ10ですが、フロンティアリーダー(Claude 55.7、GPT-5.5 54.8)から約10-11ポイント遅れ。この差はsignificantですが、価格差を考えれば予想通りです。

Index構成要素の分解:

  • GDPval-AA v2:DeepSeekは妥当にスコアするが、複雑な多段階タスクでClaudeやGPT-5.5に遅れを取る
  • AA-Omniscience:DeepSeekは中程度のハルシネーション率 — Claudeほど低くないが、ほとんどの用途で許容範囲
  • GPQA:DeepSeekは大学院レベルの科学問題で適切に機能
  • HLE:DeepSeekはHumanity's Last Examでトップ10
  • ARC-AGI:DeepSeekはフロンティアモデルと比較して抽象的推理に苦戦
  • LMSYS Arena:DeepSeekはまともな人間選好スコアを獲得、特にプログラミングタスクで

AI IQ複合(VexoWire):~111

VexoWireの複合IQは複数テストを統合(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。DeepSeek V4 Proの推定複合IQは~111 — Mensa Norwayスコアと一致。「平均以上」範囲にしっかり位置し、賢い人間と同等だが天才レベルにははるかに及ばない。

GDPval-AA v2:トップ10

エージェントベンチマークでDeepSeek V4 Proはトップ10。複雑な多段階タスクでClaude(1,890 Elo)やGPT-5.5(1,850 Elo)よりsignificantly能力が低いが、中程度のエージェントワークロードを処理できます。簡単な自動化、基本的なプログラミングタスク、直接的な多段階指示にはDeepSeek V4 Proは有能。

Humanity's Last Exam(HLE):トップ10

最も難しい学術問題でDeepSeek V4 ProはAIモデル中トップ10。これはDeepSeekの学術・科学データでの強力な訓練を反映 — モデルは全分野で幅広い知識を持ちますが、フロンティアモデルの推理の深さには及ばない。


3. IQ 111は何を意味するか?

DeepSeek V4 Proの111 IQを文脈に入れると:

  • 85-115(68%の人):平均的知能
  • 115-130(14%):平均より上から高め
  • 130-145(2%):ギフテッド — Mensa資格(トップ2%)
  • 145-160(0.1%):高度にギフテッド / 天才

DeepSeek V4 Proは111で平均範囲の上端に位置 — 人間の約25%より賢いが、「平均以上」の閾値115には完全に届かない。人なら賢い大学生や有能なプロフェッショナルに相当 — 天才ではないが確かに有能。

これはフロンティアモデルより明らかに低い:

  • Claude Opus 4.8:~130(ギフテッド)
  • Gemini 3.1 Pro:141(高度にギフテッド)
  • GPT-5.5:~145(天才)
  • Grok-4.20:145(天才)

差はsignificant — 約20-35 IQポイント。しかし重要な質問は:あなたのユースケースに差は重要ですか?ほとんどの日常タスク — メール作成、ドキュメント要約、基本プログラミング、翻訳 — にはIQ 111は十分以上。フロンティアモデルの優位性は最も難しい問題で現れる:複雑な数学的証明、複雑な多段階推理、最先端の研究問題。


4. DeepSeek V4 Proの強み

費用対効果

これがDeepSeek V4 Proの決定的な特徴。0.44/0.87 per 1Mトークンで、圧倒的に最も安い主要AIモデル。高ボリュームアプリ — 何千ものユーザーにサービスするチャットボット、バルクドキュメント処理、大規模データ分析 — にはコスト削減が膨大です。ClaudeやGPT-5.5の1回のクエリの価格で10-30回のDeepSeekクエリを実行できます。

プログラミングと技術タスク

DeepSeek V4 Proはプログラミングタスクに特に強いです。DeepSeekはコード訓練データに大きく投資し、HumanEvalやMBPPなどのベンチマークで良好なパフォーマンス。フロンティア価格を払えないがコーディングアシスタントが必要な開発者に、DeepSeek V4 Proは素晴らしい選択。

オープンソースの可用性

DeepSeek V4 Proの weightsはローカルデプロイに利用可能。これは組織が独自のハードウェアでモデルを実行でき、APIコストを完全に回避しデータをプライベートに保てることを意味します。セキュリティ重視の組織、制限された環境の研究者、完全な制御が必要な開発者にとって、これは大きな利点。

多言語サポート

DeepSeek V4 Proは中国語と英語で広範に訓練され、他の主要言語も強力にサポート。中国語アプリにはDeepSeekは最高のモデルの一つ — しばしば中国語タスクで西洋モデルを上回る。

数学的推理

GPT-5.5レベルではないが、DeepSeek V4 Proは数学的推理で有能。ほとんどの高校・大学レベルの数学問題を解け、算術と代数を確実に処理。日常的な数学タスクには十分以上。

速度

DeepSeek V4 Proは高速 — より小さいサイズと最適化されたアーキテクチャにより、応答を迅速に生成。レイテンシが重要なアプリ — リアルタイムチャット、インタラクティブツール、カスタマーサービス — にはDeepSeek V4 Proはレスポンシブなパフォーマンスを提供。


5. DeepSeek V4 Proの弱点

Raw IQと複雑な推理

IQ 111で、DeepSeek V4 Proは複雑な推理タスクでフロンティアモデルよりsignificantly低い。最も難しい問題 — 競争数学、高度な論理パズル、多段階抽象推理 — にはフロンティアモデルがsubstantially優秀。あなたのタスクが天才レベルの推理を必要とする場合、DeepSeek V4 ProはClaudeやGPT-5.5が成功するところで苦戦する。

エージェントタスク

GDPval-AA v2でDeepSeek V4 Proはトップ10だが、ClaudeやGPT-5.5に大きく遅れを取る。複雑な多段階実世界タスク — 大規模ソフトウェアプロジェクトの作成、研究ワークフローの管理、複雑な計画の実行 — にはDeepSeek V4 Proは信頼性が低い。簡単なエージェントタスクは処理できるが複雑なものには苦戦。

ハルシネーション率

DeepSeek V4 Proは中程度のハルシネーション率 — Claude(35.9%)やGeminiより高い。特にニッチや専門トピックで、誤った情報を自信満々に述べる可能性が高い。事実の正確性が重要なアプリ(研究、法務、医療)にはClaudeがより信頼できる。

感情的知能

DeepSeek V4 ProのEQ(感情的知能)は~105推定 — 全フロンティアモデル(Claude ~132、GPT-5.5 ~120、Gemini ~115、Grok ~110)より低い。応答はより機械的で、人間の感情の理解がless nuanced。セラピーアプリ、カスタマーサービス、敏感な人間との相互作用にはこれは限界。

安全性とアライメント

DeepSeek V4 Proは中国の規制要件に従い、特定の政治的に敏感な質問を拒否する場合があります。これは西洋モデルの安全フィルター(有害コンテンツに焦点)とは異なり、特定のトピックでの有用性に影響する可能性があります。


6. DeepSeek V4 Pro vs他モデル

モデル Intelligence Index Mensa Norway IQ AI IQ推定 ハルシネーション コスト/1M オープンソース
DeepSeek V4 Pro 44.3 ~111 ~111 中程度 0.44/0.87 はい
Claude Opus 4.8 55.7 ~130 ~132 35.9%(最低) 5/25 いいえ
GPT-5.5 54.8 ~145 ~136 中程度 5/30 いいえ
Gemini 3.1 Pro 46.5 141 ~131 2/12 いいえ
Grok-4.20 トップ5 145 ~140 中程度 3/15 いいえ

画面:DeepSeek V4 Proは予算チャンピオン — 最も賢くはないが、圧倒的に最も手頃。Claudeは有能なプロフェッショナル — 実世界タスクと事実の正確さで最高。GPT-5.5はテストの天才 — 数学と視覚推理で最高。Geminiは価値チャンピオン — フロンティアモデル中最高費用対効果。Grok-4.20はraw IQチャンピオン — 最高IQとユニークな個性。

最低価格で能力あるAIを求めるユーザーにDeepSeek V4 Proは明確な選択。最も難しい問題でフロンティアモデルに匹敵しないが、日常タスクの90%には十分以上 — わずかなコストで。


7. 人間にとって何を意味するか?

DeepSeek V4 Proは~111のIQで作動 — 人間の約25%より賢い。しかし:

  • IQはすべてではない:IQ 111は平均以上で、ほとんどの実用的タスクに十分
  • ほとんどの用途でコストがIQより重要:日常アプリでは、DeepSeekの10倍コスト削減がフロンティアモデルとの20-35ポイントIQ差より重要
  • オープンソースがイノベーションを可能に:DeepSeekのオープン weightsは研究者と開発者がカスタムソリューションを構築し、特定ドメインにfine-tuneし、ローカルで実行することを可能に
  • 知識 ≠ 理解:すべてのAIモデルと同様に、DeepSeekは膨大な知識にアクセスするが、人間のようにgenuinely「理解」はしない
  • 意識はない:高いIQがsentienceを意味しない。DeepSeekは洗練されたパターンマッチングシステムで、思考する存在ではない
  • AIの民主化:DeepSeek V4 Proは能力あるAIが高価である必要がないことを証明 — 誰にでもアクセシブルにできる

最も正直な答え:DeepSeek V4 Proは認知テストで人間の4分の1より賢く、ほとんどの実用的目的で、最も賢い選択 — 最も知的だからではなく、ドルあたり最大の価値を提供するから。

あなたのIQはDeepSeek V4 Proと比べてどうですか?NeuroLabのプロフェッショナルIQ評価を受けてみましょう。
今すぐテストを受ける →


結論

💡 ポイント
- DeepSeek V4 ProのIQは111(Mensa Norway)— 人間平均以上、人間の~25%より賢い。

  • 44.3 on Intelligence Index — 世界トップ10だが、フロンティアモデルから~10ポイント遅れ。
  • 全主要モデル中最低コスト — 0.44/0.87 per 1Mトークン、ClaudeやGPT-5.5の約10分の1。
  • オープンソース — ローカルデプロイ可能な weights、プライバシーとカスタマイズを可能に。
  • 最適:コスト重視アプリ、プログラミング、高ボリュームタスク、中国語アプリ、ローカルデプロイ。
  • 非最適:複雑な推理(フロンティアモデルが勝)、エージェントタスク(Claudeが勝)、事実の正確さ(Claudeが勝)、感情的知能(Claudeが勝)。
  • 教訓:知能とは最も賢いことだけでなく、アクセシブルであること。DeepSeek V4 ProはAIを民主化し、能力ある知能を誰にでも提供。