AI能匹敌埃隆·马斯克吗?LLM与人类的IQ估算
NeuroLab Team 12 min read 0 views

AI能匹敌埃隆·马斯克吗?LLM与人类的IQ估算

GPT-4、Claude和Gemini在真实IQ测试中与埃隆·马斯克等人类相比表现如何?我们分析AI的认知能力、流体推理以及LLM能做什么和不能做什么。

挥之不去的问题

每隔几个月,就会有一个标题走红:"AI通过IQ测试,得分155。"言下之意很清楚:人工智能已经超越了人类天才,埃隆·马斯克们已经过时了。但这有任何真实性吗?

简短回答:没有。更长的回答需要理解IQ测试测量什么、大语言模型(LLM)如何处理信息,以及为什么比较人类和机器智能就像比较潜艇和游泳者。

本文审视实际证据——经过同行评审的LLM认知表现研究、IQ测试的结构以及我们对埃隆·马斯克认知概况的了解——给你一个诚实的答案。

IQ测试实际测量什么

IQ测试不是"聪明程度"的单一衡量。它们评估一个认知能力层级,通常按照**Cattell-Horn-Carroll (CHC)**模型组织:

  • 流体推理(Gf): 无需先前知识解决新问题
  • 结晶智力(Gc): 习得的知识和词汇
  • 定量推理(Gq): 数字模式识别
  • 视觉处理(Gv): 空间和几何推理
  • 工作记忆(Gwm): 在脑中保持和操作信息
  • 处理速度(Gs): 快速认知吞吐

全量表IQ分数聚合这些指标,但概况比数字更重要。两个IQ 130的人可能有完全不同的能力概况——一个可能在言语推理上出色但在空间任务上挣扎,另一个则相反。

155
网上经常归因于埃隆·马斯克的IQ分数——没有原始来源

LLM如何被测试

多项研究已对大语言模型进行了人类IQ测试。最严谨的包括:

Bubeck等人(2023)用WAIS-IV(韦氏量表)测试了GPT-4,发现在言语子测试——词汇、相似性、信息——上表现达到或超过第99百分位,但在需要视觉处理的空间推理任务上挣扎。研究估计GPT-4的"言语IQ"约为155

**Zhu等人(2023)**对多个LLM进行了瑞文渐进矩阵(非言语流体推理)测试。GPT-4得分在第75-90百分位范围内——不错,但远非天才水平。作者指出,LLM通常通过训练数据中的模式匹配而非真正的流体推理来解决矩阵问题。

OpenAI自己的评估(2023-2024)显示GPT-4在SAT言语部分得分163(第99百分位),但数学部分仅710/800——强,但按精英大学标准不算特别突出。

言语错觉:为什么AI分数看起来虚高

核心问题是:IQ测试高度依赖言语,而LLM是在文本上训练的。

WAIS-IV有10个核心子测试。五个主要是言语的:词汇、相似性、信息、理解、算术。对于这些,LLM有巨大优势——它在训练数据中吸收了基本上所有已发表的文本。当被问"时钟和日历之间有什么相似之处?"时,模型不是在推理——它从统计语言模型中检索答案。

这是结晶智力(Gc),不是流体推理。而这正是LLM看起来最令人印象深刻的地方。但结晶智力对现实世界问题解决和创新的预测力最低。它测量你知道什么,而不是你如何思考。

💡 关键区别
LLM在结晶智力(知道事实)方面表现出色,但在流体推理(解决新问题)方面表现参差不齐。IQ测试过度偏重言语/结晶能力,使AI分数看起来高于其实际问题解决能力。

LLM失败之处:马斯克差距

埃隆·马斯克的认知概况——基于他的SAT分数和职业模式——是不对称的:极高的流体推理、卓越的空间能力、强但不精英的言语技能。这正是LLM表现最差的概况。

空间推理(Gv): LLM无法原生处理视觉空间信息。当被要求在脑中旋转3D物体或可视化火箭轨迹时,它们失败或依赖基于文本的变通方法。马斯克在脑中可视化火箭组件及其相互作用的能力——SpaceX的关键因素——没有LLM等价物。

工作记忆操作(Gwm): 虽然LLM有大的上下文窗口,但它们不像人类那样操作工作记忆中的信息。它们匹配模式,不保持和转换心理模型。马斯克同时保持多个工程权衡并在实时中更新它们的能力是一种工作记忆功能,当前AI无法复制。

第一性原理推理: 马斯克的标志性认知策略——将问题分解到基本物理并从那里构建——需要真正的流体推理,不是检索。当LLM尝试第一性原理推理时,它们经常产生听起来合理但逻辑断裂的链条,因为它们在训练示例之间插值而不是从公理推理。

跨领域迁移学习: 马斯克将同一认知工具集应用于火箭、汽车、脑机接口和社交媒体。LLM可以生成关于所有这些领域的文本,但无法像人类专家那样将解决策略从一个领域迁移到另一个。

✓ 优点
  • LLM:庞大的结晶智力(Gc)
  • LLM:快速文本生成和检索
  • LLM:一致、不知疲倦、可扩展
  • LLM:在标准化言语测试上表现强
✗ 缺点
  • LLM:空间推理弱(Gv)
  • LLM:没有真正的工作记忆操作
  • LLM:第一性原理推理经常崩溃
  • LLM:跨领域策略迁移差

基准测试问题

还有一个更深的方法论问题:IQ测试是为人类设计的,不是为机器。

当人类做瑞文渐进矩阵时,他们使用工作记忆、视觉处理和流体推理的组合。当LLM做同样的测试(转换为文本)时,它使用对训练数据的统计模式匹配。这些是根本不同的认知过程,碰巧在特定测试上产生类似输出。

这是古德哈特定律问题:当一个度量成为目标时,它就不再是好的度量。如果我们优化AI在IQ测试上得高分,我们不是在让AI更聪明——我们是在让它更擅长IQ测试。

更诚实的比较会使用旨在区分人类认知和统计模式匹配的测试:

  • 不在训练数据中的新颖物理问题
  • 需要心理模拟的多步空间推理
  • 旨在暴露模式匹配捷径的对抗性问题
  • 在新约束下的实时决策

在这些指标上,当前LLM表现远低于人类专家水平。

数字实际说了什么

让我们具体一些。如果我们比较马斯克的估计认知概况(从SAT转换)和GPT-4的测量表现:

能力 马斯克(估计) GPT-4(测量)
言语/结晶(Gc) ~130-135 ~155+
流体推理(Gf) ~140-145 ~115-125
空间(Gv) ~145+ ~80-90
工作记忆(Gwm) ~135-140 不适用
处理速度(Gs) ~120-130 非常快,但机制不同

画面很清楚:LLM在结晶智力上占主导,但在流体推理、空间能力和工作记忆操作方面显著落后——正是驱动工程创新和企业家问题解决的能力。

2x
GPT-4的估计结晶IQ大约是其估计流体推理IQ的2倍——与马斯克的概况相反

AI能取代埃隆·马斯克的功能吗?

"埃隆·马斯克功能"——作为认知角色,不是个人——包括:

  1. 识别尚未有解决方案的新问题
  2. 在多个技术领域从第一性原理推理
  3. 在信息不完整时做出高风险决策
  4. 实时整合空间、定量和言语推理
  5. 在多年项目中维持努力和专注

当前AI可以协助每一项,但无法执行整合。GPT-4可以帮助编写火箭模拟代码,但无法决定是否建造可重复使用的火箭。它可以分析电池化学数据,但无法可视化新电池设计的热行为。

差距不仅仅在于IQ分数——在于智能的类型。马斯克的价值来自应用于新问题的流体推理,而不是知道事实。LLM恰恰相反:庞大的事实知识但有限的新问题解决。

未来:趋同还是分化?

AI正在快速改进,但改进不均衡。LLM在言语任务上越来越好(它们已经超人类),但空间推理和真正流体推理的进展较慢。最有前景的方法——多模态模型、神经符号架构和具身AI——试图弥合空间和推理差距,但仍远未达到人类专家水平。

诚实的预测:AI将在未来5-10年越来越多地增强人类认知,但"马斯克功能"——创造性整合多种推理类型应用于新工程挑战——在可预见的未来仍将是人类能力。不是因为人类本质上更优越,而是因为所需的智能类型正是当前AI架构挣扎的类型

结论

  • IQ测试分数高估了AI智能,因为IQ测试高度依赖言语,而LLM是在文本上训练的
  • LLM在结晶智力(知道事实)上出色,但在流体推理(解决新问题)上落后
  • 马斯克的认知概况——高流体推理、卓越空间能力——正是AI最弱的地方
  • "AI IQ 155"的标题具有误导性:它测量的是一种不同于驱动实际创新的智能类型
  • AI增强但无法取代定义专家工程认知的推理类型的创造性整合

问题不是AI是否会达到IQ 155。它可能已经达到了——在对创新不重要的子测试上。真正的问题是AI是否会发展出流体、空间和整合推理,使某人能够面对一个无人解决的问题并解决它。这就是马斯克测试。到目前为止,AI未能通过。

GPT-4等大语言模型的IQ是多少?
研究估计GPT-4的言语IQ约为155(WAIS-IV言语子测试),但其在非言语流体推理任务(如瑞文矩阵)上的表现远低——约第75-90百分位。高言语分数反映结晶智力(训练数据检索),不是真正的问题解决能力。
AI能做真正的IQ测试吗?
可以对AI进行IQ测试,但结果不能直接与人类分数比较。IQ测试是为人类认知架构设计的——它们通过LLM不原生使用的模态测量工作记忆、空间处理和流体推理。将视觉空间任务转换为文本改变了任务的本质。
AI比埃隆·马斯克更聪明吗?
在结晶智力指标(事实知识、词汇、信息检索)上,AI超越任何人类。但在流体推理、空间可视化、工作记忆操作和第一性原理问题解决——驱动工程创新的能力——上,当前AI表现远低于人类专家水平。不同类型的智能,不能直接比较。
AI最终会匹敌人类流体推理吗?
当前AI架构(基于transformer的LLM)从根本上优化为训练数据中的模式匹配,不是真正推理。多模态模型和神经符号方法可以弥合一些差距,但空间推理和新问题解决仍是重大挑战。进步可能但时间线不确定——估计从5年到30年以上。
为什么AI的IQ分数看起来这么高?
IQ测试过度偏重言语和结晶能力,这正是LLM由于文本训练而擅长的。一个更重流体推理、空间处理和工作记忆操作的测试会显示低得多的AI分数。"IQ 155"的标题反映了测试设计偏差,不是实际认知优越性。