DeepSeek V4的IQ是多少?
Dr. Daria Dudnik 10 min read 0 views

DeepSeek V4的IQ是多少?

DeepSeek V4 Pro在Mensa Norway IQ测试中得分111,在Intelligence Index上得分44.3。我们分析每个基准测试,解释为什么它是最佳预算AI模型。

DeepSeek V4 Pro:中国的开源冠军

DeepSeek V4 Pro是DeepSeek的旗舰模型,这家中国AI实验室以低成本和高性能的组合震惊了世界。2026年初发布,DeepSeek V4 Pro在Mensa Norway IQ测试中得分111,在Artificial Analysis Intelligence Index v4.1上得分44.3 — 位列全球前10,但远落后于前沿模型(Claude 55.7,GPT-5.5 54.8)。

让DeepSeek V4 Pro引人注目的不是其原始智能 — 而是其价格。以0.44/0.87每1M token计算,它的成本约为Claude(5/25)和GPT-5.5(5/30)的10分之一,是Gemini(2/12)的5分之一。以一次Claude查询的价格,你可以执行十次DeepSeek V4 Pro查询。而且,它在IQ测试中得分111 — 高于约25%的人类。

DeepSeek V4 Pro是人民的AI:一个不在智能前沿竞争的模型,但以几乎免费的价格将有能力的人工智能带给每个人。对于学生、爱好者、小企业和对成本敏感市场的开发者,DeepSeek V4 Pro通常是唯一可行的选择。

关键分数:

  • Artificial Analysis Intelligence Index:44.3(全球前10)
  • Mensa Norway IQ(TrackingAI):111(高于人类平均)
  • AI IQ综合(VexoWire):~111估计
  • GDPval-AA v2:前10
  • Humanity's Last Exam:前10
  • 幻觉率:中等
  • 成本:0.44/0.87每1M token(所有主要模型中最低)
  • 开源:权重可用于本地部署

1. 预算革命

DeepSeek V4 Pro代表了AI格局的根本性转变:智能的民主化。当美国实验室(OpenAI、Anthropic、Google、xAI)在前沿竞争 — 将IQ分数从130推到140到145 — DeepSeek专注于一个不同的目标:让有能力的AI对每个人都负担得起。

以每1M输入token 0.44、每1M输出0.87计算,DeepSeek V4 Pro便宜得惊人。为了透视:处理一个典型书籍大小的文档(约100,000 token)大约花费0.04输入和0.09输出。同样的任务用Gemini要0.50-1.00,用Claude或GPT-5.5要1.00-3.00。

这不仅仅是折扣 — 这是不同类别的产品。DeepSeek V4 Pro让AI对以下群体可及:

  • 学生,负担不起$20/月订阅
  • 小企业,在发展中市场
  • 爱好者和实验者
  • 开发者,构建高流量应用
  • 研究者,用有限预算处理海量数据集

而引人注目的是:DeepSeek V4 Pro确实有能力。它在Mensa Norway IQ测试中得分111 — 高于人类平均100,高于约25%的人。它不是天才,但对大多数日常任务足够聪明:写作、编程、分析、翻译、摘要。


2. 基准测试分解

Mensa Norway IQ测试:111(高于平均)

由36道视觉模式识别题组成。DeepSeek V4 Pro得分111 — 高于人类平均100,处于"高于平均"范围。这高于约25%的人类,但远低于前沿模型(Claude ~130,Gemini 141,GPT-5.5 ~145,Grok-4.20 145)。

IQ 111意味着DeepSeek V4 Pro能以相当于聪明大学生的水平识别视觉模式和进行抽象推理。它不会解决最难的谜题,但能胜任大多数日常推理任务。

DeepSeek V4 Pro(111)与前沿模型(130-145)之间的差距显著 — 约20-35 IQ分,或约1-2个标准差。这意味着前沿模型在纯认知测试上明显更聪明。但对于不需要天才级推理的任务 — 即大多数任务 — DeepSeek V4 Pro绰绰有余。

Artificial Analysis Intelligence Index v4.1:44.3(前10)

在Intelligence Index上,DeepSeek V4 Pro得分44.3 — 位列全球前10,但落后前沿领导者(Claude 55.7,GPT-5.5 54.8)约10-11分。这一差距显著但考虑到价格差异是可以预期的。

Index组成部分分解:

  • GDPval-AA v2:DeepSeek得分合理但在复杂多步骤任务上落后于Claude和GPT-5.5
  • AA-Omniscience:DeepSeek有中等的幻觉率 — 不如Claude低,但对大多数用途可接受
  • GPQA:DeepSeek在研究生水平科学问题上表现适当
  • HLE:DeepSeek在Humanity's Last Exam上排名前10
  • ARC-AGI:DeepSeek在前沿模型面前在抽象推理上挣扎
  • LMSYS Arena:DeepSeek获得不错的人类偏好分数,特别是在编程任务上

AI IQ综合(VexoWire):~111

VexoWire的综合IQ结合了多个测试(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。DeepSeek V4 Pro的估计综合IQ为~111 — 与其Mensa Norway分数一致。这将其牢牢放在"高于平均"范围,相当于聪明的人类但远低于天才水平。

GDPval-AA v2:前10

在代理基准上,DeepSeek V4 Pro排名前10。它在复杂多步骤任务上明显不如Claude(1,890 Elo)和GPT-5.5(1,850 Elo),但能处理中等代理工作负载。对于简单自动化、基本编程任务和直接的多步骤指令,DeepSeek V4 Pro是胜任的。

Humanity's Last Exam(HLE):前10

在最难的学术问题上,DeepSeek V4 Pro在AI模型中排名前10。这反映了DeepSeek在学术和科学数据上的强力训练 — 该模型在各个学科拥有广泛知识,即使无法匹敌前沿模型的推理深度。


3. IQ 111意味着什么?

将DeepSeek V4 Pro的111 IQ置于上下文中:

  • 85-115(68%的人):平均智力
  • 115-130(14%):高于平均到较高
  • 130-145(2%):超常 — 符合Mensa资格(前2%)
  • 145-160(0.1%):高度超常 / 天才

DeepSeek V4 Pro以111处于平均范围的上端 — 比约25%的人更聪明,但未完全达到115的"高于平均"门槛。如果它是人,它相当于一个聪明的本科生或有能力的专业人士 — 不是天才,但确实胜任。

这明显低于前沿模型:

  • Claude Opus 4.8:~130(超常)
  • Gemini 3.1 Pro:141(高度超常)
  • GPT-5.5:~145(天才)
  • Grok-4.20:145(天才)

差距显著 — 约20-35 IQ分。但关键问题是:差距对你的用例重要吗?对于大多数日常任务 — 写邮件、总结文档、基本编程、翻译 — IQ 111绰绰有余。前沿模型的优势在最难的问题上显现:复杂数学证明、错综复杂的多步骤推理、前沿研究问题。


4. DeepSeek V4 Pro的优势

性价比

这是DeepSeek V4 Pro的标志性特征。以0.44/0.87每1M token,它是迄今为止最便宜的主要AI模型。对于高流量应用 — 服务数千用户的聊天机器人、批量文档处理、大规模数据分析 — 成本节省巨大。你可以以一次Claude或GPT-5.5查询的价格运行10-30次DeepSeek查询。

编程和技术任务

DeepSeek V4 Pro在编程任务上特别强。DeepSeek在代码训练数据上大量投资,该模型在HumanEval和MBPP等基准上表现良好。对于需要编程助手但负担不起前沿价格的开发者,DeepSeek V4 Pro是极佳选择。

开源可用性

DeepSeek V4 Pro的权重可用于本地部署。这意味着组织可以在自己的硬件上运行模型,完全避免API成本并保持数据私密。对于注重安全的组织、受限环境中的研究者以及需要完全控制的开发者,这是重大优势。

多语言支持

DeepSeek V4 Pro在中文和英文上进行了广泛训练,对其他主要语言也有强力支持。对于中文应用,DeepSeek是最佳可用模型之一 — 有时在中文任务上超越西方模型。

数学推理

虽然不及GPT-5.5水平,DeepSeek V4 Pro在数学推理上是有能力的。它能解决大多数高中和大学水平的数学问题,并可靠地处理算术和代数。对于日常数学任务,绰绰有余。

速度

DeepSeek V4 Pro速度快 — 其较小的大小和优化的架构意味着快速生成响应。对于延迟重要的应用 — 实时聊天、交互式工具、客户服务 — DeepSeek V4 Pro提供响应迅速的性能。


5. DeepSeek V4 Pro的不足

原始IQ和复杂推理

以IQ 111,DeepSeek V4 Pro在复杂推理任务上明显低于前沿模型。对于最难的问题 — 竞赛数学、高级逻辑谜题、多步骤抽象推理 — 前沿模型明显更好。如果你的任务需要天才级推理,DeepSeek V4 Pro会在Claude或GPT-5.5成功的地方挣扎。

代理任务

在GDPval-AA v2上,DeepSeek V4 Pro在前10但远落后于Claude和GPT-5.5。对于复杂的、多步骤的实际任务 — 编写大型软件项目、管理研究流程、执行复杂计划 — DeepSeek V4 Pro不太可靠。它能处理简单的代理任务但在复杂的上面挣扎。

幻觉率

DeepSeek V4 Pro有中等的幻觉率 — 高于Claude(35.9%)和Gemini。它更可能自信地陈述错误信息,特别是在小众或专业主题上。对于事实准确性至关重要的应用(研究、法律、医疗),Claude更可靠。

情感智能

DeepSeek V4 Pro的EQ(情感智能)估计为~105 — 低于所有前沿模型(Claude ~132,GPT-5.5 ~120,Gemini ~115,Grok ~110)。其回答倾向于更机械化,在理解人类情感方面不够细腻。对于治疗应用、客户服务或敏感的人类互动,这是一个局限。

安全和对齐

DeepSeek V4 Pro受中国监管要求约束,这意味着它可能拒绝回答某些政治敏感问题。这不同于西方模型的安全过滤器(专注于有害内容),可能影响其对某些主题的实用性。


6. DeepSeek V4 Pro与其他模型对比

模型 Intelligence Index Mensa Norway IQ AI IQ估计 幻觉 成本/1M 开源
DeepSeek V4 Pro 44.3 ~111 ~111 中等 0.44/0.87
Claude Opus 4.8 55.7 ~130 ~132 35.9%(最低) 5/25
GPT-5.5 54.8 ~145 ~136 中等 5/30
Gemini 3.1 Pro 46.5 141 ~131 2/12
Grok-4.20 前5 145 ~140 中等 3/15

画面:DeepSeek V4 Pro是预算冠军 — 不是最聪明的,但绝对是最低价的。Claude是有能力的专业人士 — 实际任务和事实准确性最好。GPT-5.5是测试天才 — 数学、视觉推理最好。Gemini是价值冠军 — 前沿模型中最佳性价比。Grok-4.20是原始IQ冠军 — 最高IQ加独特个性。

对于需要以最低价格获得有能力AI的用户,DeepSeek V4 Pro是明确选择。它不会在最难的问题上匹敌前沿模型,但对于90%的日常任务,绰绰有余 — 只需一小部分成本。


7. 这对人类意味着什么?

DeepSeek V4 Pro以~111的IQ运作 — 比约25%的人更聪明。但是:

  • IQ不是一切:IQ 111高于平均,对大多数实际任务足够
  • 成本比IQ更重要:对于日常应用,DeepSeek的10倍节省往往比与前沿模型20-35分的IQ差距更重要
  • 开源促进创新:DeepSeek的开放权重允许研究者和开发者构建定制解决方案、针对特定领域微调并本地运行
  • 知识 ≠ 理解:像所有AI模型一样,DeepSeek可以访问大量知识,但不像人类那样真正"理解"
  • 没有意识:高IQ不意味着有感知力。DeepSeek是复杂的模式匹配系统,不是思考的存在
  • AI民主化:DeepSeek V4 Pro证明有能力的AI不必昂贵 — 它可以对每个人都可及

最诚实的答案:DeepSeek V4 Pro在认知测试上比四分之一的人类更聪明,对于大多数实际目的,它是最聪明的选择 — 不是因为它最智能,而是因为它每美元提供最多价值。

您的IQ与DeepSeek V4 Pro相比如何?参加NeuroLab的专业IQ评估。
立即进行测试 →


结论

💡 关键要点
- DeepSeek V4 Pro的IQ为111(Mensa Norway)— 高于人类平均,比~25%的人更聪明。

  • 44.3在Intelligence Index上 — 全球前10,但落后前沿模型~10分。
  • 所有主要模型中最低成本 — 0.44/0.87每1M token,约比Claude或GPT-5.5便宜10倍。
  • 开源 — 权重可用于本地部署,实现隐私和定制。
  • 最适合:成本敏感应用、编程、高流量任务、中文应用、本地部署。
  • 非最适合:复杂推理(前沿模型胜)、代理任务(Claude胜)、事实准确性(Claude胜)、情感智能(Claude胜)。
  • 教训:智能不只是做最聪明的 — 而是做可及的。DeepSeek V4 Pro民主化AI,将有能力的人工智能带给每个人。