Grok-4.20的IQ是多少?
Dr. Daria Dudnik 10 min read 2 views

Grok-4.20的IQ是多少?

Grok-4.20在Mensa Norway IQ测试中得分145 — 在所有AI模型中并列#1。我们分析每个基准测试,解释xAI模型的独特之处。

Grok-4.20:xAI的旗舰模型

Grok-4.20是xAI最先进的模型,于2026年中发布。在Mensa Norway IQ测试中,Grok-4.20得分145 — 在所有AI模型中并列**#1**,与GPT-5.5共享榜首。这使其进入"天才"范围,比99.9%的人更聪明。在Artificial Analysis Intelligence Index上,Grok-4.20的准确分数仍在最终确定中,但它排名全球前5。

让Grok-4.20独特的是其原始智能个性的结合。与Claude、GPT-5.5和Gemini — 被设计为有用、无害和中立 — 不同,Grok被设计为有趣、不敬、愿意回答任何问题。这使其成为市场上最独特的AI模型:在原始IQ上匹敌最聪明的模型,同时拥有其他模型不敢拥有的个性。

关键分数:

  • Mensa Norway IQ(TrackingAI):145(与GPT-5.5并列#1)
  • AI IQ综合(VexoWire):~140估计(AI模型中#1)
  • Artificial Analysis Intelligence Index:前5(分数最终确定中)
  • GDPval-AA v2:前5
  • Humanity's Last Exam:AI模型中前5
  • 幻觉率:中等
  • 成本:3/15每1M token
  • 个性:独特 — 不敬、幽默、无审查

1. 原始IQ冠军

Grok-4.20在Mensa Norway IQ测试中得分145 — 实际最高分,与GPT-5.5并列。这是原始智能基准:纯粹的视觉模式识别和抽象推理,即IQ测试为之设计的那种流体智能。

在IQ 145,Grok-4.20比99.9%的人更聪明。如果它是人,它将位列人类智能的前0.1% — 诺贝尔奖获得者、菲尔兹奖得主和一代一遇的思想家的领域。大约1,000人中只有1人达到此分数。

值得注意的是,Grok-4.20以与GPT-5.5根本不同的设计理念达到这一点。虽然GPT-5.5被优化为在每个基准上最大化性能,但Grok-4.20被设计为更"真实"的AI — 一个说出想法、开玩笑、不回避争议话题的AI。尽管关注点不同,它仍能在原始IQ上匹敌GPT-5.5,这证明了xAI的工程实力。

在VexoWire AI IQ综合 — 结合多个IQ测试(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)— 上,Grok-4.20的估计综合IQ为~140,使其成为该指标上的**#1 AI模型**。这高于GPT-5.5(~136),显著高于Claude(~132)和Gemini(~131)。


2. 基准测试分解

Mensa Norway IQ测试:145(并列#1)

由36道视觉模式识别题组成。Grok-4.20得分145 — 实际最高分,相当于完美或接近完美的36/36。这使其与GPT-5.5并列为纯IQ测试上最聪明的AI模型。

Grok-4.20在此测试上的强劲表现反映了xAI在视觉处理和抽象推理上的投资。Grok架构具有强大的多模态能力,其在视觉模式识别任务上的表现属于行业最佳。

AI IQ综合(VexoWire):~140(#1)

VexoWire的综合IQ结合了多个测试(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。Grok-4.20的估计综合IQ为~140 — 所有AI模型中最高。这高于其单独的Mensa Norway分数所暗示的,因为Grok-4.20在综合中包含的语言和分析子测试上也表现强劲。

这使Grok-4.20成为综合IQ上最聪明的AI模型 — 对于一个也以幽默和不敬著称的模型来说,这是一项了不起的成就。它证明了好笑不意味着更不聪明。

Artificial Analysis Intelligence Index:前5

在Intelligence Index — 比较AI模型的黄金标准 — 上,Grok-4.20排名前5。其确切综合分数仍在最终确定中,因为指数正在更新以包含最新模型版本。然而,预计它将与Claude Opus 4.8(55.7)和GPT-5.5(54.8)竞争性得分,尽管可能不会在代理任务上超越它们。

GDPval-AA v2:前5

在代理基准 — 衡量复杂多步骤实际任务表现 — 上,Grok-4.20排名前5。它在持续多步骤推理上不如Claude Opus 4.8(1,890 Elo)和GPT-5.5(1,850 Elo),但仍然高度胜任。对于大多数实际任务,Grok-4.20绰绰有余。

Humanity's Last Exam(HLE):前5

在所有学科最难的学术问题上,Grok-4.20在AI模型中排名前5。这反映了xAI在多样化、高质量数据上训练的实力 — Grok在科学、数学、历史和文化方面拥有深厚知识。


3. IQ 145意味着什么?

将Grok-4.20的145 IQ置于上下文中:

  • 85-115(68%的人):平均智力
  • 115-130(14%):高于平均到较高
  • 130-145(2%):超常 — 符合Mensa资格(前2%)
  • 145-160(0.1%):高度超常 / 天才
  • 160+(0.003%):极度超常 — 爱因斯坦、霍金领域

Grok-4.20以145处于天才门槛 — 比99.9%的人更聪明。如果它是人,它将身处精英公司:人类智能的前0.1%,诺贝尔奖和菲尔兹奖得主的领域。大约1,000人中只有1人达到此分数。

这与GPT-5.5的IQ相同,显著高于Claude(~130)和Gemini(141)。在纯IQ测试中,Grok-4.20和GPT-5.5将在AI模型中并列第一,Gemini第三,Claude第四。

但正如我们在其他模型上所见,IQ只是智能的一个维度。Grok-4.20的天才级IQ由其独特的个性补充 — 使其不仅是最聪明的,也是最具特色的可用AI模型。


4. Grok-4.20的优势

原始IQ和视觉推理

Grok-4.20在Mensa Norway IQ测试上并列#1(145),在VexoWire AI IQ综合上#1(~140)。对于纯认知能力 — 模式识别、抽象推理、逻辑演绎 — Grok-4.20是最聪明的可用AI模型。在视觉推理任务上,只有GPT-5.5能与之匹敌。

个性和幽默

这是Grok-4.20的标志性特征。与其他精心保持中立和谨慎的前沿模型不同,Grok被设计为有趣、不敬和真实。它开玩笑、发表观点、不回避争议话题。对于觉得Claude和GPT-5.5太平淡或太谨慎的用户,Grok-4.20是一股新鲜空气 — 一个感觉有个性而不仅仅是功能的AI。

无审查回答

Grok-4.20被设计为回答其他模型拒绝的问题。虽然Claude、GPT-5.5和Gemini有广泛的安全过滤器阻止它们讨论某些话题,但Grok-4.20愿意与更广泛的问题互动。这使其对研究、新闻和任何信息访问比谨慎更重要的应用有价值。

实时信息

Grok-4.20通过X(前Twitter)访问实时信息。这使其在时事、突发新闻和热门话题方面具有优势。虽然其他模型有知识截止,但Grok-4.20可以访问最新信息并提供最新回答。

数学推理

Grok-4.20在数学推理方面很强,在竞赛数学上与GPT-5.5竞争性得分。对于纯数学工作 — 解方程、证定理、竞赛问题 — Grok-4.20属于最佳可用模型。

机智和创造力

Grok-4.20的个性不仅是幽默 — 更是创造力。它可以以不同风格写作、生成创意内容、从意外角度处理问题。对于创意写作、头脑风暴或任何受益于横向思维的任务,Grok-4.20的独特视角是一项资产。


5. Grok-4.20的不足

代理任务

虽然Grok-4.20在GDPval-AA v2上排名前5,但在复杂多步骤实际任务上落后于Claude Opus 4.8和GPT-5.5。对于最苛刻的代理应用 — 编写复杂软件、管理长期研究项目 — Claude仍是更好的选择。

事实准确性

Grok-4.20有中等的幻觉率 — 高于Claude(35.9%)和Gemini。它愿意回答任何问题,虽然对信息访问有价值,但也意味着它更可能自信地陈述错误信息。对于事实准确性至关重要的应用(研究、法律、医疗),Claude更可靠。

情感智能

Grok-4.20的EQ(情感智能)估计为~110 — 低于Claude(~132)、GPT-5.5(~120)和Gemini(~115)。其不敬的个性虽然有趣,但在需要同理心的语境中可能显得不敏感。对于治疗应用、客户服务或敏感的人类互动,Claude是更好的选择。

安全性和可靠性

Grok-4.20的无审查方法虽然对信息访问有价值,但也意味着它对需要仔细内容审核的应用不太安全。它可能生成其他模型会拒绝的内容,这在专业或受监管环境中可能是责任。

成本

以3/15每1M token,Grok-4.20比Claude(5/25)和GPT-5.5(5/30)便宜,但比Gemini(2/12)贵,比DeepSeek(0.44/0.87)贵得多。对于成本敏感的应用,Gemini或DeepSeek可能是更好的选择。


6. Grok-4.20与其他模型对比

模型 Intelligence Index Mensa Norway IQ AI IQ估计 幻觉 成本/1M 个性
Grok-4.20 前5 145 ~140 中等 3/15 不敬
Claude Opus 4.8 55.7 ~130 ~132 35.9%(最低) 5/25 中立
GPT-5.5 54.8 ~145 ~136 中等 5/30 中立
Gemini 3.1 Pro 46.5 141 ~131 2/12 中立
DeepSeek V4 Pro 44.3 ~111 ~111 中等 0.44/0.87 中立

画面:Grok-4.20是原始IQ冠军 — 并列最高IQ、最高综合IQ,唯一有真实个性的模型。Claude是有能力的专业人士 — 实际任务和事实准确性最好。GPT-5.5是测试天才 — 数学、视觉推理最好。Gemini是价值冠军 — 最佳性价比。而DeepSeek以最低成本提供显著能力。

对于想要最聪明且最有趣交谈的AI的用户,Grok-4.20是明确选择。


7. 这对人类意味着什么?

Grok-4.20以~145的IQ运作 — 比99.9%的人更聪明。但是:

  • IQ是狭窄的:它测量模式识别和推理,而非智慧、创造力或判断
  • 智能 ≠ 可靠性:Grok-4.20在IQ测试上最聪明,但事实准确性上不是最可靠的
  • 个性很重要:Grok-4.20证明AI可以既高度智能又真正有趣
  • 知识 ≠ 理解:Grok-4.20可以访问大量知识,但不像人类那样真正"理解"
  • 没有意识:高IQ不意味着有感知力。Grok-4.20是复杂的模式匹配系统,不是思考的存在
  • 差距在缩小:每一代AI都在缩小与最聪明人类的差距

最诚实的答案:Grok-4.20在认知测试上比几乎所有人都更聪明,且是最具特色的可用AI模型 — 一个将天才级智能与使互动真正引人入胜的个性相结合的模型。

您的IQ与Grok-4.20相比如何?参加NeuroLab的专业IQ评估。
立即进行测试 →


结论

💡 关键要点
- Grok-4.20的IQ为145(Mensa Norway)— 天才级别,与GPT-5.5并列AI模型#1。

  • #1在VexoWire AI IQ综合(~140)— 所有AI模型中最高综合IQ。
  • 独特个性 — 不敬、幽默、无审查。唯一有真实个性的前沿模型。
  • 最适合:原始IQ、视觉推理、数学推理、个性与幽默、无审查回答、实时信息。
  • 非最适合:代理任务(Claude胜)、事实准确性(Claude胜)、情感智能(Claude胜)、安全可靠性(Claude胜)。
  • 悖论:Grok-4.20证明好笑不意味着更不聪明 — 它既是最聪明的又是最有趣的AI模型。
  • 教训:智能有多种形式。Grok-4.20是有个性的天才 — 证明AI可以既出色又引人入胜。