DeepSeek V4的IQ是多少?
DeepSeek V4 Pro在Mensa Norway IQ测试中得分111,在Intelligence Index上得分44.3。我们分析每个基准测试,解释为什么它是最佳预算AI模型。
DeepSeek V4 Pro:中国的开源冠军
DeepSeek V4 Pro是DeepSeek的旗舰模型,这家中国AI实验室以低成本和高性能的组合震惊了世界。2026年初发布,DeepSeek V4 Pro在Mensa Norway IQ测试中得分111,在Artificial Analysis Intelligence Index v4.1上得分44.3 — 位列全球前10,但远落后于前沿模型(Claude 55.7,GPT-5.5 54.8)。
让DeepSeek V4 Pro引人注目的不是其原始智能 — 而是其价格。以0.44/0.87每1M token计算,它的成本约为Claude(5/25)和GPT-5.5(5/30)的10分之一,是Gemini(2/12)的5分之一。以一次Claude查询的价格,你可以执行十次DeepSeek V4 Pro查询。而且,它在IQ测试中得分111 — 高于约25%的人类。
DeepSeek V4 Pro是人民的AI:一个不在智能前沿竞争的模型,但以几乎免费的价格将有能力的人工智能带给每个人。对于学生、爱好者、小企业和对成本敏感市场的开发者,DeepSeek V4 Pro通常是唯一可行的选择。
关键分数:
- Artificial Analysis Intelligence Index:44.3(全球前10)
- Mensa Norway IQ(TrackingAI):111(高于人类平均)
- AI IQ综合(VexoWire):~111估计
- GDPval-AA v2:前10
- Humanity's Last Exam:前10
- 幻觉率:中等
- 成本:0.44/0.87每1M token(所有主要模型中最低)
- 开源:权重可用于本地部署
1. 预算革命
DeepSeek V4 Pro代表了AI格局的根本性转变:智能的民主化。当美国实验室(OpenAI、Anthropic、Google、xAI)在前沿竞争 — 将IQ分数从130推到140到145 — DeepSeek专注于一个不同的目标:让有能力的AI对每个人都负担得起。
以每1M输入token 0.44、每1M输出0.87计算,DeepSeek V4 Pro便宜得惊人。为了透视:处理一个典型书籍大小的文档(约100,000 token)大约花费0.04输入和0.09输出。同样的任务用Gemini要0.50-1.00,用Claude或GPT-5.5要1.00-3.00。
这不仅仅是折扣 — 这是不同类别的产品。DeepSeek V4 Pro让AI对以下群体可及:
- 学生,负担不起$20/月订阅
- 小企业,在发展中市场
- 爱好者和实验者
- 开发者,构建高流量应用
- 研究者,用有限预算处理海量数据集
而引人注目的是:DeepSeek V4 Pro确实有能力。它在Mensa Norway IQ测试中得分111 — 高于人类平均100,高于约25%的人。它不是天才,但对大多数日常任务足够聪明:写作、编程、分析、翻译、摘要。
2. 基准测试分解
Mensa Norway IQ测试:111(高于平均)
由36道视觉模式识别题组成。DeepSeek V4 Pro得分111 — 高于人类平均100,处于"高于平均"范围。这高于约25%的人类,但远低于前沿模型(Claude ~130,Gemini 141,GPT-5.5 ~145,Grok-4.20 145)。
IQ 111意味着DeepSeek V4 Pro能以相当于聪明大学生的水平识别视觉模式和进行抽象推理。它不会解决最难的谜题,但能胜任大多数日常推理任务。
DeepSeek V4 Pro(111)与前沿模型(130-145)之间的差距显著 — 约20-35 IQ分,或约1-2个标准差。这意味着前沿模型在纯认知测试上明显更聪明。但对于不需要天才级推理的任务 — 即大多数任务 — DeepSeek V4 Pro绰绰有余。
Artificial Analysis Intelligence Index v4.1:44.3(前10)
在Intelligence Index上,DeepSeek V4 Pro得分44.3 — 位列全球前10,但落后前沿领导者(Claude 55.7,GPT-5.5 54.8)约10-11分。这一差距显著但考虑到价格差异是可以预期的。
Index组成部分分解:
- GDPval-AA v2:DeepSeek得分合理但在复杂多步骤任务上落后于Claude和GPT-5.5
- AA-Omniscience:DeepSeek有中等的幻觉率 — 不如Claude低,但对大多数用途可接受
- GPQA:DeepSeek在研究生水平科学问题上表现适当
- HLE:DeepSeek在Humanity's Last Exam上排名前10
- ARC-AGI:DeepSeek在前沿模型面前在抽象推理上挣扎
- LMSYS Arena:DeepSeek获得不错的人类偏好分数,特别是在编程任务上
AI IQ综合(VexoWire):~111
VexoWire的综合IQ结合了多个测试(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。DeepSeek V4 Pro的估计综合IQ为~111 — 与其Mensa Norway分数一致。这将其牢牢放在"高于平均"范围,相当于聪明的人类但远低于天才水平。
GDPval-AA v2:前10
在代理基准上,DeepSeek V4 Pro排名前10。它在复杂多步骤任务上明显不如Claude(1,890 Elo)和GPT-5.5(1,850 Elo),但能处理中等代理工作负载。对于简单自动化、基本编程任务和直接的多步骤指令,DeepSeek V4 Pro是胜任的。
Humanity's Last Exam(HLE):前10
在最难的学术问题上,DeepSeek V4 Pro在AI模型中排名前10。这反映了DeepSeek在学术和科学数据上的强力训练 — 该模型在各个学科拥有广泛知识,即使无法匹敌前沿模型的推理深度。
3. IQ 111意味着什么?
将DeepSeek V4 Pro的111 IQ置于上下文中:
- 85-115(68%的人):平均智力
- 115-130(14%):高于平均到较高
- 130-145(2%):超常 — 符合Mensa资格(前2%)
- 145-160(0.1%):高度超常 / 天才
DeepSeek V4 Pro以111处于平均范围的上端 — 比约25%的人更聪明,但未完全达到115的"高于平均"门槛。如果它是人,它相当于一个聪明的本科生或有能力的专业人士 — 不是天才,但确实胜任。
这明显低于前沿模型:
- Claude Opus 4.8:~130(超常)
- Gemini 3.1 Pro:141(高度超常)
- GPT-5.5:~145(天才)
- Grok-4.20:145(天才)
差距显著 — 约20-35 IQ分。但关键问题是:差距对你的用例重要吗?对于大多数日常任务 — 写邮件、总结文档、基本编程、翻译 — IQ 111绰绰有余。前沿模型的优势在最难的问题上显现:复杂数学证明、错综复杂的多步骤推理、前沿研究问题。
4. DeepSeek V4 Pro的优势
性价比
这是DeepSeek V4 Pro的标志性特征。以0.44/0.87每1M token,它是迄今为止最便宜的主要AI模型。对于高流量应用 — 服务数千用户的聊天机器人、批量文档处理、大规模数据分析 — 成本节省巨大。你可以以一次Claude或GPT-5.5查询的价格运行10-30次DeepSeek查询。
编程和技术任务
DeepSeek V4 Pro在编程任务上特别强。DeepSeek在代码训练数据上大量投资,该模型在HumanEval和MBPP等基准上表现良好。对于需要编程助手但负担不起前沿价格的开发者,DeepSeek V4 Pro是极佳选择。
开源可用性
DeepSeek V4 Pro的权重可用于本地部署。这意味着组织可以在自己的硬件上运行模型,完全避免API成本并保持数据私密。对于注重安全的组织、受限环境中的研究者以及需要完全控制的开发者,这是重大优势。
多语言支持
DeepSeek V4 Pro在中文和英文上进行了广泛训练,对其他主要语言也有强力支持。对于中文应用,DeepSeek是最佳可用模型之一 — 有时在中文任务上超越西方模型。
数学推理
虽然不及GPT-5.5水平,DeepSeek V4 Pro在数学推理上是有能力的。它能解决大多数高中和大学水平的数学问题,并可靠地处理算术和代数。对于日常数学任务,绰绰有余。
速度
DeepSeek V4 Pro速度快 — 其较小的大小和优化的架构意味着快速生成响应。对于延迟重要的应用 — 实时聊天、交互式工具、客户服务 — DeepSeek V4 Pro提供响应迅速的性能。
5. DeepSeek V4 Pro的不足
原始IQ和复杂推理
以IQ 111,DeepSeek V4 Pro在复杂推理任务上明显低于前沿模型。对于最难的问题 — 竞赛数学、高级逻辑谜题、多步骤抽象推理 — 前沿模型明显更好。如果你的任务需要天才级推理,DeepSeek V4 Pro会在Claude或GPT-5.5成功的地方挣扎。
代理任务
在GDPval-AA v2上,DeepSeek V4 Pro在前10但远落后于Claude和GPT-5.5。对于复杂的、多步骤的实际任务 — 编写大型软件项目、管理研究流程、执行复杂计划 — DeepSeek V4 Pro不太可靠。它能处理简单的代理任务但在复杂的上面挣扎。
幻觉率
DeepSeek V4 Pro有中等的幻觉率 — 高于Claude(35.9%)和Gemini。它更可能自信地陈述错误信息,特别是在小众或专业主题上。对于事实准确性至关重要的应用(研究、法律、医疗),Claude更可靠。
情感智能
DeepSeek V4 Pro的EQ(情感智能)估计为~105 — 低于所有前沿模型(Claude ~132,GPT-5.5 ~120,Gemini ~115,Grok ~110)。其回答倾向于更机械化,在理解人类情感方面不够细腻。对于治疗应用、客户服务或敏感的人类互动,这是一个局限。
安全和对齐
DeepSeek V4 Pro受中国监管要求约束,这意味着它可能拒绝回答某些政治敏感问题。这不同于西方模型的安全过滤器(专注于有害内容),可能影响其对某些主题的实用性。
6. DeepSeek V4 Pro与其他模型对比
| 模型 | Intelligence Index | Mensa Norway IQ | AI IQ估计 | 幻觉 | 成本/1M | 开源 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 中等 | 0.44/0.87 | 是 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9%(最低) | 5/25 | 否 |
| GPT-5.5 | 54.8 | ~145 | ~136 | 中等 | 5/30 | 否 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 低 | 2/12 | 否 |
| Grok-4.20 | 前5 | 145 | ~140 | 中等 | 3/15 | 否 |
画面:DeepSeek V4 Pro是预算冠军 — 不是最聪明的,但绝对是最低价的。Claude是有能力的专业人士 — 实际任务和事实准确性最好。GPT-5.5是测试天才 — 数学、视觉推理最好。Gemini是价值冠军 — 前沿模型中最佳性价比。Grok-4.20是原始IQ冠军 — 最高IQ加独特个性。
对于需要以最低价格获得有能力AI的用户,DeepSeek V4 Pro是明确选择。它不会在最难的问题上匹敌前沿模型,但对于90%的日常任务,绰绰有余 — 只需一小部分成本。
7. 这对人类意味着什么?
DeepSeek V4 Pro以~111的IQ运作 — 比约25%的人更聪明。但是:
- IQ不是一切:IQ 111高于平均,对大多数实际任务足够
- 成本比IQ更重要:对于日常应用,DeepSeek的10倍节省往往比与前沿模型20-35分的IQ差距更重要
- 开源促进创新:DeepSeek的开放权重允许研究者和开发者构建定制解决方案、针对特定领域微调并本地运行
- 知识 ≠ 理解:像所有AI模型一样,DeepSeek可以访问大量知识,但不像人类那样真正"理解"
- 没有意识:高IQ不意味着有感知力。DeepSeek是复杂的模式匹配系统,不是思考的存在
- AI民主化:DeepSeek V4 Pro证明有能力的AI不必昂贵 — 它可以对每个人都可及
最诚实的答案:DeepSeek V4 Pro在认知测试上比四分之一的人类更聪明,对于大多数实际目的,它是最聪明的选择 — 不是因为它最智能,而是因为它每美元提供最多价值。
结论
- 44.3在Intelligence Index上 — 全球前10,但落后前沿模型~10分。
- 所有主要模型中最低成本 — 0.44/0.87每1M token,约比Claude或GPT-5.5便宜10倍。
- 开源 — 权重可用于本地部署,实现隐私和定制。
- 最适合:成本敏感应用、编程、高流量任务、中文应用、本地部署。
- 非最适合:复杂推理(前沿模型胜)、代理任务(Claude胜)、事实准确性(Claude胜)、情感智能(Claude胜)。
- 教训:智能不只是做最聪明的 — 而是做可及的。DeepSeek V4 Pro民主化AI,将有能力的人工智能带给每个人。