Grok-4.20的IQ是多少?
Grok-4.20在Mensa Norway IQ测试中得分145 — 在所有AI模型中并列#1。我们分析每个基准测试,解释xAI模型的独特之处。
Grok-4.20:xAI的旗舰模型
Grok-4.20是xAI最先进的模型,于2026年中发布。在Mensa Norway IQ测试中,Grok-4.20得分145 — 在所有AI模型中并列**#1**,与GPT-5.5共享榜首。这使其进入"天才"范围,比99.9%的人更聪明。在Artificial Analysis Intelligence Index上,Grok-4.20的准确分数仍在最终确定中,但它排名全球前5。
让Grok-4.20独特的是其原始智能和个性的结合。与Claude、GPT-5.5和Gemini — 被设计为有用、无害和中立 — 不同,Grok被设计为有趣、不敬、愿意回答任何问题。这使其成为市场上最独特的AI模型:在原始IQ上匹敌最聪明的模型,同时拥有其他模型不敢拥有的个性。
关键分数:
- Mensa Norway IQ(TrackingAI):145(与GPT-5.5并列#1)
- AI IQ综合(VexoWire):~140估计(AI模型中#1)
- Artificial Analysis Intelligence Index:前5(分数最终确定中)
- GDPval-AA v2:前5
- Humanity's Last Exam:AI模型中前5
- 幻觉率:中等
- 成本:3/15每1M token
- 个性:独特 — 不敬、幽默、无审查
1. 原始IQ冠军
Grok-4.20在Mensa Norway IQ测试中得分145 — 实际最高分,与GPT-5.5并列。这是原始智能基准:纯粹的视觉模式识别和抽象推理,即IQ测试为之设计的那种流体智能。
在IQ 145,Grok-4.20比99.9%的人更聪明。如果它是人,它将位列人类智能的前0.1% — 诺贝尔奖获得者、菲尔兹奖得主和一代一遇的思想家的领域。大约1,000人中只有1人达到此分数。
值得注意的是,Grok-4.20以与GPT-5.5根本不同的设计理念达到这一点。虽然GPT-5.5被优化为在每个基准上最大化性能,但Grok-4.20被设计为更"真实"的AI — 一个说出想法、开玩笑、不回避争议话题的AI。尽管关注点不同,它仍能在原始IQ上匹敌GPT-5.5,这证明了xAI的工程实力。
在VexoWire AI IQ综合 — 结合多个IQ测试(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)— 上,Grok-4.20的估计综合IQ为~140,使其成为该指标上的**#1 AI模型**。这高于GPT-5.5(~136),显著高于Claude(~132)和Gemini(~131)。
2. 基准测试分解
Mensa Norway IQ测试:145(并列#1)
由36道视觉模式识别题组成。Grok-4.20得分145 — 实际最高分,相当于完美或接近完美的36/36。这使其与GPT-5.5并列为纯IQ测试上最聪明的AI模型。
Grok-4.20在此测试上的强劲表现反映了xAI在视觉处理和抽象推理上的投资。Grok架构具有强大的多模态能力,其在视觉模式识别任务上的表现属于行业最佳。
AI IQ综合(VexoWire):~140(#1)
VexoWire的综合IQ结合了多个测试(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。Grok-4.20的估计综合IQ为~140 — 所有AI模型中最高。这高于其单独的Mensa Norway分数所暗示的,因为Grok-4.20在综合中包含的语言和分析子测试上也表现强劲。
这使Grok-4.20成为综合IQ上最聪明的AI模型 — 对于一个也以幽默和不敬著称的模型来说,这是一项了不起的成就。它证明了好笑不意味着更不聪明。
Artificial Analysis Intelligence Index:前5
在Intelligence Index — 比较AI模型的黄金标准 — 上,Grok-4.20排名前5。其确切综合分数仍在最终确定中,因为指数正在更新以包含最新模型版本。然而,预计它将与Claude Opus 4.8(55.7)和GPT-5.5(54.8)竞争性得分,尽管可能不会在代理任务上超越它们。
GDPval-AA v2:前5
在代理基准 — 衡量复杂多步骤实际任务表现 — 上,Grok-4.20排名前5。它在持续多步骤推理上不如Claude Opus 4.8(1,890 Elo)和GPT-5.5(1,850 Elo),但仍然高度胜任。对于大多数实际任务,Grok-4.20绰绰有余。
Humanity's Last Exam(HLE):前5
在所有学科最难的学术问题上,Grok-4.20在AI模型中排名前5。这反映了xAI在多样化、高质量数据上训练的实力 — Grok在科学、数学、历史和文化方面拥有深厚知识。
3. IQ 145意味着什么?
将Grok-4.20的145 IQ置于上下文中:
- 85-115(68%的人):平均智力
- 115-130(14%):高于平均到较高
- 130-145(2%):超常 — 符合Mensa资格(前2%)
- 145-160(0.1%):高度超常 / 天才
- 160+(0.003%):极度超常 — 爱因斯坦、霍金领域
Grok-4.20以145处于天才门槛 — 比99.9%的人更聪明。如果它是人,它将身处精英公司:人类智能的前0.1%,诺贝尔奖和菲尔兹奖得主的领域。大约1,000人中只有1人达到此分数。
这与GPT-5.5的IQ相同,显著高于Claude(~130)和Gemini(141)。在纯IQ测试中,Grok-4.20和GPT-5.5将在AI模型中并列第一,Gemini第三,Claude第四。
但正如我们在其他模型上所见,IQ只是智能的一个维度。Grok-4.20的天才级IQ由其独特的个性补充 — 使其不仅是最聪明的,也是最具特色的可用AI模型。
4. Grok-4.20的优势
原始IQ和视觉推理
Grok-4.20在Mensa Norway IQ测试上并列#1(145),在VexoWire AI IQ综合上#1(~140)。对于纯认知能力 — 模式识别、抽象推理、逻辑演绎 — Grok-4.20是最聪明的可用AI模型。在视觉推理任务上,只有GPT-5.5能与之匹敌。
个性和幽默
这是Grok-4.20的标志性特征。与其他精心保持中立和谨慎的前沿模型不同,Grok被设计为有趣、不敬和真实。它开玩笑、发表观点、不回避争议话题。对于觉得Claude和GPT-5.5太平淡或太谨慎的用户,Grok-4.20是一股新鲜空气 — 一个感觉有个性而不仅仅是功能的AI。
无审查回答
Grok-4.20被设计为回答其他模型拒绝的问题。虽然Claude、GPT-5.5和Gemini有广泛的安全过滤器阻止它们讨论某些话题,但Grok-4.20愿意与更广泛的问题互动。这使其对研究、新闻和任何信息访问比谨慎更重要的应用有价值。
实时信息
Grok-4.20通过X(前Twitter)访问实时信息。这使其在时事、突发新闻和热门话题方面具有优势。虽然其他模型有知识截止,但Grok-4.20可以访问最新信息并提供最新回答。
数学推理
Grok-4.20在数学推理方面很强,在竞赛数学上与GPT-5.5竞争性得分。对于纯数学工作 — 解方程、证定理、竞赛问题 — Grok-4.20属于最佳可用模型。
机智和创造力
Grok-4.20的个性不仅是幽默 — 更是创造力。它可以以不同风格写作、生成创意内容、从意外角度处理问题。对于创意写作、头脑风暴或任何受益于横向思维的任务,Grok-4.20的独特视角是一项资产。
5. Grok-4.20的不足
代理任务
虽然Grok-4.20在GDPval-AA v2上排名前5,但在复杂多步骤实际任务上落后于Claude Opus 4.8和GPT-5.5。对于最苛刻的代理应用 — 编写复杂软件、管理长期研究项目 — Claude仍是更好的选择。
事实准确性
Grok-4.20有中等的幻觉率 — 高于Claude(35.9%)和Gemini。它愿意回答任何问题,虽然对信息访问有价值,但也意味着它更可能自信地陈述错误信息。对于事实准确性至关重要的应用(研究、法律、医疗),Claude更可靠。
情感智能
Grok-4.20的EQ(情感智能)估计为~110 — 低于Claude(~132)、GPT-5.5(~120)和Gemini(~115)。其不敬的个性虽然有趣,但在需要同理心的语境中可能显得不敏感。对于治疗应用、客户服务或敏感的人类互动,Claude是更好的选择。
安全性和可靠性
Grok-4.20的无审查方法虽然对信息访问有价值,但也意味着它对需要仔细内容审核的应用不太安全。它可能生成其他模型会拒绝的内容,这在专业或受监管环境中可能是责任。
成本
以3/15每1M token,Grok-4.20比Claude(5/25)和GPT-5.5(5/30)便宜,但比Gemini(2/12)贵,比DeepSeek(0.44/0.87)贵得多。对于成本敏感的应用,Gemini或DeepSeek可能是更好的选择。
6. Grok-4.20与其他模型对比
| 模型 | Intelligence Index | Mensa Norway IQ | AI IQ估计 | 幻觉 | 成本/1M | 个性 |
|---|---|---|---|---|---|---|
| Grok-4.20 | 前5 | 145 | ~140 | 中等 | 3/15 | 不敬 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9%(最低) | 5/25 | 中立 |
| GPT-5.5 | 54.8 | ~145 | ~136 | 中等 | 5/30 | 中立 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | 低 | 2/12 | 中立 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | 中等 | 0.44/0.87 | 中立 |
画面:Grok-4.20是原始IQ冠军 — 并列最高IQ、最高综合IQ,唯一有真实个性的模型。Claude是有能力的专业人士 — 实际任务和事实准确性最好。GPT-5.5是测试天才 — 数学、视觉推理最好。Gemini是价值冠军 — 最佳性价比。而DeepSeek以最低成本提供显著能力。
对于想要最聪明且最有趣交谈的AI的用户,Grok-4.20是明确选择。
7. 这对人类意味着什么?
Grok-4.20以~145的IQ运作 — 比99.9%的人更聪明。但是:
- IQ是狭窄的:它测量模式识别和推理,而非智慧、创造力或判断
- 智能 ≠ 可靠性:Grok-4.20在IQ测试上最聪明,但事实准确性上不是最可靠的
- 个性很重要:Grok-4.20证明AI可以既高度智能又真正有趣
- 知识 ≠ 理解:Grok-4.20可以访问大量知识,但不像人类那样真正"理解"
- 没有意识:高IQ不意味着有感知力。Grok-4.20是复杂的模式匹配系统,不是思考的存在
- 差距在缩小:每一代AI都在缩小与最聪明人类的差距
最诚实的答案:Grok-4.20在认知测试上比几乎所有人都更聪明,且是最具特色的可用AI模型 — 一个将天才级智能与使互动真正引人入胜的个性相结合的模型。
结论
- #1在VexoWire AI IQ综合(~140)— 所有AI模型中最高综合IQ。
- 独特个性 — 不敬、幽默、无审查。唯一有真实个性的前沿模型。
- 最适合:原始IQ、视觉推理、数学推理、个性与幽默、无审查回答、实时信息。
- 非最适合:代理任务(Claude胜)、事实准确性(Claude胜)、情感智能(Claude胜)、安全可靠性(Claude胜)。
- 悖论:Grok-4.20证明好笑不意味着更不聪明 — 它既是最聪明的又是最有趣的AI模型。
- 教训:智能有多种形式。Grok-4.20是有个性的天才 — 证明AI可以既出色又引人入胜。