
AI能匹敌埃隆·马斯克吗?LLM与人类的IQ估算
GPT-4、Claude和Gemini在真实IQ测试中与埃隆·马斯克等人类相比表现如何?我们分析AI的认知能力、流体推理以及LLM能做什么和不能做什么。
挥之不去的问题
每隔几个月,就会有一个标题走红:"AI通过IQ测试,得分155。"言下之意很清楚:人工智能已经超越了人类天才,埃隆·马斯克们已经过时了。但这有任何真实性吗?
简短回答:没有。更长的回答需要理解IQ测试测量什么、大语言模型(LLM)如何处理信息,以及为什么比较人类和机器智能就像比较潜艇和游泳者。
本文审视实际证据——经过同行评审的LLM认知表现研究、IQ测试的结构以及我们对埃隆·马斯克认知概况的了解——给你一个诚实的答案。
IQ测试实际测量什么
IQ测试不是"聪明程度"的单一衡量。它们评估一个认知能力层级,通常按照**Cattell-Horn-Carroll (CHC)**模型组织:
- 流体推理(Gf): 无需先前知识解决新问题
- 结晶智力(Gc): 习得的知识和词汇
- 定量推理(Gq): 数字模式识别
- 视觉处理(Gv): 空间和几何推理
- 工作记忆(Gwm): 在脑中保持和操作信息
- 处理速度(Gs): 快速认知吞吐
全量表IQ分数聚合这些指标,但概况比数字更重要。两个IQ 130的人可能有完全不同的能力概况——一个可能在言语推理上出色但在空间任务上挣扎,另一个则相反。
LLM如何被测试
多项研究已对大语言模型进行了人类IQ测试。最严谨的包括:
Bubeck等人(2023)用WAIS-IV(韦氏量表)测试了GPT-4,发现在言语子测试——词汇、相似性、信息——上表现达到或超过第99百分位,但在需要视觉处理的空间推理任务上挣扎。研究估计GPT-4的"言语IQ"约为155。
**Zhu等人(2023)**对多个LLM进行了瑞文渐进矩阵(非言语流体推理)测试。GPT-4得分在第75-90百分位范围内——不错,但远非天才水平。作者指出,LLM通常通过训练数据中的模式匹配而非真正的流体推理来解决矩阵问题。
OpenAI自己的评估(2023-2024)显示GPT-4在SAT言语部分得分163(第99百分位),但数学部分仅710/800——强,但按精英大学标准不算特别突出。
言语错觉:为什么AI分数看起来虚高
核心问题是:IQ测试高度依赖言语,而LLM是在文本上训练的。
WAIS-IV有10个核心子测试。五个主要是言语的:词汇、相似性、信息、理解、算术。对于这些,LLM有巨大优势——它在训练数据中吸收了基本上所有已发表的文本。当被问"时钟和日历之间有什么相似之处?"时,模型不是在推理——它从统计语言模型中检索答案。
这是结晶智力(Gc),不是流体推理。而这正是LLM看起来最令人印象深刻的地方。但结晶智力对现实世界问题解决和创新的预测力最低。它测量你知道什么,而不是你如何思考。
LLM失败之处:马斯克差距
埃隆·马斯克的认知概况——基于他的SAT分数和职业模式——是不对称的:极高的流体推理、卓越的空间能力、强但不精英的言语技能。这正是LLM表现最差的概况。
空间推理(Gv): LLM无法原生处理视觉空间信息。当被要求在脑中旋转3D物体或可视化火箭轨迹时,它们失败或依赖基于文本的变通方法。马斯克在脑中可视化火箭组件及其相互作用的能力——SpaceX的关键因素——没有LLM等价物。
工作记忆操作(Gwm): 虽然LLM有大的上下文窗口,但它们不像人类那样操作工作记忆中的信息。它们匹配模式,不保持和转换心理模型。马斯克同时保持多个工程权衡并在实时中更新它们的能力是一种工作记忆功能,当前AI无法复制。
第一性原理推理: 马斯克的标志性认知策略——将问题分解到基本物理并从那里构建——需要真正的流体推理,不是检索。当LLM尝试第一性原理推理时,它们经常产生听起来合理但逻辑断裂的链条,因为它们在训练示例之间插值而不是从公理推理。
跨领域迁移学习: 马斯克将同一认知工具集应用于火箭、汽车、脑机接口和社交媒体。LLM可以生成关于所有这些领域的文本,但无法像人类专家那样将解决策略从一个领域迁移到另一个。
- LLM:庞大的结晶智力(Gc)
- LLM:快速文本生成和检索
- LLM:一致、不知疲倦、可扩展
- LLM:在标准化言语测试上表现强
- LLM:空间推理弱(Gv)
- LLM:没有真正的工作记忆操作
- LLM:第一性原理推理经常崩溃
- LLM:跨领域策略迁移差
基准测试问题
还有一个更深的方法论问题:IQ测试是为人类设计的,不是为机器。
当人类做瑞文渐进矩阵时,他们使用工作记忆、视觉处理和流体推理的组合。当LLM做同样的测试(转换为文本)时,它使用对训练数据的统计模式匹配。这些是根本不同的认知过程,碰巧在特定测试上产生类似输出。
这是古德哈特定律问题:当一个度量成为目标时,它就不再是好的度量。如果我们优化AI在IQ测试上得高分,我们不是在让AI更聪明——我们是在让它更擅长IQ测试。
更诚实的比较会使用旨在区分人类认知和统计模式匹配的测试:
- 不在训练数据中的新颖物理问题
- 需要心理模拟的多步空间推理
- 旨在暴露模式匹配捷径的对抗性问题
- 在新约束下的实时决策
在这些指标上,当前LLM表现远低于人类专家水平。
数字实际说了什么
让我们具体一些。如果我们比较马斯克的估计认知概况(从SAT转换)和GPT-4的测量表现:
| 能力 | 马斯克(估计) | GPT-4(测量) |
|---|---|---|
| 言语/结晶(Gc) | ~130-135 | ~155+ |
| 流体推理(Gf) | ~140-145 | ~115-125 |
| 空间(Gv) | ~145+ | ~80-90 |
| 工作记忆(Gwm) | ~135-140 | 不适用 |
| 处理速度(Gs) | ~120-130 | 非常快,但机制不同 |
画面很清楚:LLM在结晶智力上占主导,但在流体推理、空间能力和工作记忆操作方面显著落后——正是驱动工程创新和企业家问题解决的能力。
AI能取代埃隆·马斯克的功能吗?
"埃隆·马斯克功能"——作为认知角色,不是个人——包括:
- 识别尚未有解决方案的新问题
- 在多个技术领域从第一性原理推理
- 在信息不完整时做出高风险决策
- 实时整合空间、定量和言语推理
- 在多年项目中维持努力和专注
当前AI可以协助每一项,但无法执行整合。GPT-4可以帮助编写火箭模拟代码,但无法决定是否建造可重复使用的火箭。它可以分析电池化学数据,但无法可视化新电池设计的热行为。
差距不仅仅在于IQ分数——在于智能的类型。马斯克的价值来自应用于新问题的流体推理,而不是知道事实。LLM恰恰相反:庞大的事实知识但有限的新问题解决。
未来:趋同还是分化?
AI正在快速改进,但改进不均衡。LLM在言语任务上越来越好(它们已经超人类),但空间推理和真正流体推理的进展较慢。最有前景的方法——多模态模型、神经符号架构和具身AI——试图弥合空间和推理差距,但仍远未达到人类专家水平。
诚实的预测:AI将在未来5-10年越来越多地增强人类认知,但"马斯克功能"——创造性整合多种推理类型应用于新工程挑战——在可预见的未来仍将是人类能力。不是因为人类本质上更优越,而是因为所需的智能类型正是当前AI架构挣扎的类型。
结论
- IQ测试分数高估了AI智能,因为IQ测试高度依赖言语,而LLM是在文本上训练的
- LLM在结晶智力(知道事实)上出色,但在流体推理(解决新问题)上落后
- 马斯克的认知概况——高流体推理、卓越空间能力——正是AI最弱的地方
- "AI IQ 155"的标题具有误导性:它测量的是一种不同于驱动实际创新的智能类型
- AI增强但无法取代定义专家工程认知的推理类型的创造性整合
问题不是AI是否会达到IQ 155。它可能已经达到了——在对创新不重要的子测试上。真正的问题是AI是否会发展出流体、空间和整合推理,使某人能够面对一个无人解决的问题并解决它。这就是马斯克测试。到目前为止,AI未能通过。