[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$f329lhd4wnub0f":3,"$f1nan3rxkj2eer":91},{"success":4,"data":5},true,{"id":6,"slug":7,"coverImage":8,"author":9,"viewsCount":10,"createdAt":11,"title":12,"description":13,"lang":14,"contentHtml":15,"readingTime":16,"toc":17},"z8wcdr5vus4cvw8zr3p1ok1r","iq-llama-4","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1526374965328-4f18af581d06?w=1280","Dr. Daria Dudnik",0,"2026-08-01T10:03:59.771Z","Llama 4的IQ是多少？","Llama 4在Mensa Norway IQ测试中得分112，在Intelligence Index上排名前15。我们分析每个基准测试，解释Meta开源模型的独特之处。","zh","\u003Ch2 id=\"llama-4-meta\">Llama 4：Meta的开源冠军\u003C\u002Fh2>\n\u003Cp>Llama 4是Meta AI的旗舰开源模型，Meta AI是全球最大科技公司之一的研究部门。2026年初发布，Llama 4在Mensa Norway IQ测试中得分\u003Cstrong>112\u003C\u002Fstrong>，在Artificial Analysis Intelligence Index v4.1上排名前15。这使其高于DeepSeek V4 Pro（111），但低于Kimi K3（118）、Qwen 3.5（115）和前沿模型（Claude ~130，Gemini 141，GPT-5.5 ~145，Grok-4.20 145）。\u003C\u002Fp>\n\u003Cp>Llama 4的独特之处在于其\u003Cstrong>大规模开源特性\u003C\u002Fstrong>。与OpenAI、Anthropic或Google的闭源模型不同，Llama 4的权重可免费下载和本地部署。这使其成为数千个衍生模型、微调和应用的基础 — 使Llama 4不仅是一个模型，而是一个完整的生态系统。\u003C\u002Fp>\n\u003Cp>Llama 4是\u003Cstrong>人民的模型\u003C\u002Fstrong>：一个可能不是最聪明的模型，但任何人都可以下载、修改并在自己的硬件上运行。对于需要完全控制其AI基础设施的研究人员、初创企业和组织，Llama 4提供了任何闭源模型都无法提供的东西：自由。\u003C\u002Fp>\n\u003Cp>\u003Cstrong>关键分数：\u003C\u002Fstrong>\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>Artificial Analysis Intelligence Index\u003C\u002Fstrong>：前15（分数~43-44）\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Mensa Norway IQ（TrackingAI）\u003C\u002Fstrong>：112（高于平均）\u003C\u002Fli>\n\u003Cli>\u003Cstrong>AI IQ综合（VexoWire）\u003C\u002Fstrong>：~112估计\u003C\u002Fli>\n\u003Cli>\u003Cstrong>GDPval-AA v2\u003C\u002Fstrong>：前15\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Humanity&#39;s Last Exam\u003C\u002Fstrong>：前15\u003C\u002Fli>\n\u003Cli>\u003Cstrong>幻觉率\u003C\u002Fstrong>：中等\u003C\u002Fli>\n\u003Cli>\u003Cstrong>成本\u003C\u002Fstrong>：免费（自托管）或0.20\u002F0.60每1M token（通过提供商）\u003C\u002Fli>\n\u003Cli>\u003Cstrong>参数\u003C\u002Fstrong>：405B（最大变体）\u003C\u002Fli>\n\u003Cli>\u003Cstrong>开源\u003C\u002Fstrong>：是，权重免费提供\u003C\u002Fli>\n\u003Cli>\u003Cstrong>上下文\u003C\u002Fstrong>：128K token\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Chr>\n\u003Ch2 id=\"1\">1. 开源革命\u003C\u002Fh2>\n\u003Cp>Llama 4代表了Meta对开源AI的承诺 — 即AI应该对所有人开放，不应由少数公司控制的信念。当OpenAI、Anthropic和Google将模型保持在API之后时，Meta发布完整的模型权重，允许任何人下载、研究、修改并在自己的硬件上部署Llama 4。\u003C\u002Fp>\n\u003Cp>这具有深远的影响：\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>民主化\u003C\u002Fstrong>：任何拥有足够硬件的人都可以运行最先进的AI模型\u003C\u002Fli>\n\u003Cli>\u003Cstrong>定制化\u003C\u002Fstrong>：开发者可以为特定领域、语言或任务微调Llama 4\u003C\u002Fli>\n\u003Cli>\u003Cstrong>隐私\u003C\u002Fstrong>：组织可以在本地运行Llama 4，确保数据永远不离开其基础设施\u003C\u002Fli>\n\u003Cli>\u003Cstrong>创新\u003C\u002Fstrong>：研究人员可以研究模型内部，带来新的突破\u003C\u002Fli>\n\u003Cli>\u003Cstrong>生态系统\u003C\u002Fstrong>：数千个衍生模型建立在Llama 4之上，创造丰富的生态系统\u003C\u002Fli>\n\u003Cli>\u003Cstrong>成本\u003C\u002Fstrong>：自托管Llama 4免费（除硬件成本外），是大规模下最便宜的选择\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>Llama生态系统包括：\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>Llama 4 Base\u003C\u002Fstrong>：原始预训练模型\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Llama 4 Instruct\u003C\u002Fstrong>：为指令跟随微调\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Llama 4 Guard\u003C\u002Fstrong>：安全过滤变体\u003C\u002Fli>\n\u003Cli>\u003Cstrong>社区微调\u003C\u002Fstrong>：数千个领域特定变体\u003C\u002Fli>\n\u003Cli>\u003Cstrong>量化版本\u003C\u002Fstrong>：在消费硬件上运行的压缩模型\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Llama 4 Vision\u003C\u002Fstrong>：具有图像理解能力的多模态变体\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>没有其他AI模型催生了如此丰富的生态系统。虽然GPT-5.5和Claude可能更聪明，但它们是黑箱。Llama 4是透明的、可修改的、社区驱动的。\u003C\u002Fp>\n\u003Chr>\n\u003Ch2 id=\"2\">2. 基准测试分解\u003C\u002Fh2>\n\u003Ch3 id=\"mensa-norway-iq-112\">Mensa Norway IQ测试：112（高于平均）\u003C\u002Fh3>\n\u003Cp>由36道视觉模式识别题组成。Llama 4得分\u003Cstrong>112\u003C\u002Fstrong> — 高于人类平均100，处于&quot;高于平均&quot;范围。与DeepSeek V4 Pro（111）相当，低于Qwen 3.5（115）、Kimi K3（118）和前沿模型（Claude ~130，Gemini 141，GPT-5.5 ~145，Grok-4.20 145）。\u003C\u002Fp>\n\u003Cp>IQ 112意味着Llama 4比大约79%的人类更聪明 — 人类智力前21%。如果它是人，它相当于一个有能力的大学生或熟练的专业人士。不是天才，但确实聪明且胜任。\u003C\u002Fp>\n\u003Ch3 id=\"artificial-analysis-intelligence-index-15\">Artificial Analysis Intelligence Index：前15\u003C\u002Fh3>\n\u003Cp>在Intelligence Index上，Llama 4以估计分数\u003Cstrong>~43-44\u003C\u002Fstrong>排名全球前15。这使其与DeepSeek V4 Pro（44.3）竞争，但落后于Qwen 3.5（~45-46）、Kimi K3（~45-47）、Gemini（46.5）和前沿模型。\u003C\u002Fp>\n\u003Cp>Index组成部分分解：\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>GDPval-AA v2\u003C\u002Fstrong>：Llama 4表现适当，受益于其大参数量在多样化代理任务中的优势\u003C\u002Fli>\n\u003Cli>\u003Cstrong>AA-Omniscience\u003C\u002Fstrong>：Llama 4有中等幻觉率 — 比小模型好但比Claude差\u003C\u002Fli>\n\u003Cli>\u003Cstrong>GPQA\u003C\u002Fstrong>：Llama 4在研究生水平科学问题上表现合理\u003C\u002Fli>\n\u003Cli>\u003Cstrong>HLE\u003C\u002Fstrong>：Llama 4在Humanity&#39;s Last Exam上排名前15\u003C\u002Fli>\n\u003Cli>\u003Cstrong>ARC-AGI\u003C\u002Fstrong>：Llama 4在抽象推理上表现适当\u003C\u002Fli>\n\u003Cli>\u003Cstrong>LMSYS Arena\u003C\u002Fstrong>：Llama 4获得稳健的人类偏好分数，特别是开放式任务\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch3 id=\"ai-iq-vexowire-112\">AI IQ综合（VexoWire）：~112\u003C\u002Fh3>\n\u003Cp>VexoWire的综合IQ结合了多个测试（Mensa Norway、Mensa Denmark、Raven&#39;s、WAIS-IV）。Llama 4的估计综合IQ为\u003Cstrong>~112\u003C\u002Fstrong> — 与其Mensa Norway分数一致。这将其放在&quot;高于平均&quot;范围，比大约79%的人更聪明。\u003C\u002Fp>\n\u003Ch3 id=\"gdpval-aa-v2-15\">GDPval-AA v2：前15\u003C\u002Fh3>\n\u003Cp>在代理基准上，Llama 4排名前15。其大参数量（405B）赋予其丰富的知识和推理能力，但在复杂多步骤任务上仍落后于前沿模型。对于中等代理工作负载，Llama 4是胜任的。\u003C\u002Fp>\n\u003Ch3 id=\"humanity-s-last-exam-hle-15\">Humanity&#39;s Last Exam（HLE）：前15\u003C\u002Fh3>\n\u003Cp>在最难的学术问题上，Llama 4在AI模型中排名前15。Meta的广泛训练数据和模型的大容量帮助其在各学科中表现良好，尽管在最专业化的问题上无法匹敌前沿模型。\u003C\u002Fp>\n\u003Chr>\n\u003Ch2 id=\"3-iq-112\">3. IQ 112意味着什么？\u003C\u002Fh2>\n\u003Cp>将Llama 4的112 IQ置于上下文中：\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>85-115（68%的人）\u003C\u002Fstrong>：平均智力\u003C\u002Fli>\n\u003Cli>\u003Cstrong>115-130（14%）\u003C\u002Fstrong>：高于平均到较高\u003C\u002Fli>\n\u003Cli>\u003Cstrong>130-145（2%）\u003C\u002Fstrong>：超常 — 符合Mensa资格（前2%）\u003C\u002Fli>\n\u003Cli>\u003Cstrong>145-160（0.1%）\u003C\u002Fstrong>：高度超常 \u002F 天才\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>Llama 4以112处于**&quot;平均&quot;范围的上部** — 比大约79%的人更聪明。如果它是人，它相当于一个有能力的大学生或熟练的专业人士。不是天才，但确实聪明且胜任。\u003C\u002Fp>\n\u003Cp>这与DeepSeek V4 Pro（111）相当，但低于其他模型：\u003C\u002Fp>\n\u003Cul>\n\u003Cli>Qwen 3.5：115（高于平均）\u003C\u002Fli>\n\u003Cli>Kimi K3：118（高于平均）\u003C\u002Fli>\n\u003Cli>Claude Opus 4.8：~130（超常）\u003C\u002Fli>\n\u003Cli>Gemini 3.1 Pro：141（高度超常）\u003C\u002Fli>\n\u003Cli>GPT-5.5：~145（天才）\u003C\u002Fli>\n\u003Cli>Grok-4.20：145（天才）\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>与前沿模型的差距约18-33 IQ分。但Llama 4以其开源特性弥补 — 对于需要完全控制、隐私或定制的应用，Llama 4的开放性可以抵消IQ差距。\u003C\u002Fp>\n\u003Chr>\n\u003Ch2 id=\"4-llama-4\">4. Llama 4的优势\u003C\u002Fh2>\n\u003Ch3>开源自由\u003C\u002Fh3>\n\u003Cp>Llama 4的权重\u003Cstrong>免费提供\u003C\u002Fstrong>下载和本地部署。这是其决定性特征。没有其他顶级模型提供这种程度的开放性。对于需要完全控制其AI基础设施的组织，Llama 4是顶级模型中唯一的选择。\u003C\u002Fp>\n\u003Ch3>定制和微调\u003C\u002Fh3>\n\u003Cp>由于权重可用，开发者可以\u003Cstrong>为特定领域、语言或任务微调Llama 4\u003C\u002Fstrong>。这导致了数千个社区微调 — 医疗模型、法律模型、编程模型、创意写作模型等。没有闭源模型提供这种程度的定制。\u003C\u002Fp>\n\u003Ch3>隐私和数据安全\u003C\u002Fh3>\n\u003Cp>使用Llama 4，组织可以\u003Cstrong>完全在自己的硬件上运行模型\u003C\u002Fstrong>，确保数据永远不离开其基础设施。对于医疗、金融、国防和其他敏感行业，这至关重要。没有数据发送到第三方API。\u003C\u002Fp>\n\u003Ch3>大规模成本\u003C\u002Fh3>\n\u003Cp>自托管Llama 4\u003Cstrong>免费\u003C\u002Fstrong>（除硬件成本外）。在大规模下，这可以比按token付费的API费用便宜得多。对于具有高推理量的组织，硬件投资会快速回本。\u003C\u002Fp>\n\u003Ch3>社区生态系统\u003C\u002Fh3>\n\u003Cp>Llama生态系统无与伦比。数千名开发者贡献工具、微调、量化和优化。这种社区驱动的方法意味着Llama 4受益于集体创新 — 改进来自各处，不仅来自Meta。\u003C\u002Fp>\n\u003Ch3>透明度\u003C\u002Fh3>\n\u003Cp>与闭源模型不同，Llama 4的架构和权重是\u003Cstrong>透明的\u003C\u002Fstrong>。研究人员可以研究模型如何工作、识别偏见、理解失败并提出改进。这种透明度对科学进步和负责任的AI发展至关重要。\u003C\u002Fp>\n\u003Ch3>硬件优化\u003C\u002Fh3>\n\u003Cp>社区开发了 numerous \u003Cstrong>量化版本\u003C\u002Fstrong>的Llama 4，可在消费硬件上运行 — 从8-bit到4-bit到2-bit量化。这意味着你可以在高端GPU上运行有能力的AI模型，而不仅仅在数据中心。\u003C\u002Fp>\n\u003Chr>\n\u003Ch2 id=\"5-llama-4\">5. Llama 4的不足\u003C\u002Fh2>\n\u003Ch3 id=\"iq\">原始IQ和复杂推理\u003C\u002Fh3>\n\u003Cp>以IQ 112，Llama 4在复杂推理任务上低于前沿模型。对于最难的问题 — 竞赛数学、高级逻辑谜题、前沿科学推理 — Claude、GPT-5.5和Gemini明显更好。18-33 IQ分的差距是显著的。\u003C\u002Fp>\n\u003Ch3>幻觉率\u003C\u002Fh3>\n\u003Cp>Llama 4有\u003Cstrong>中等幻觉率\u003C\u002Fstrong> — 比小模型好但比Claude（35.9%）和GPT-5.5差。对于事实准确性至关重要的应用 — 研究、法律、医疗 — Claude更可靠。\u003C\u002Fp>\n\u003Ch3>上下文窗口\u003C\u002Fh3>\n\u003Cp>以128K token的上下文窗口，Llama 4足够但不杰出。Kimi K3（2M）、Gemini（1M）和Qwen 3.5（256K）都提供更大的上下文窗口。对于需要处理超长文档的任务，其他模型是更好的选择。\u003C\u002Fp>\n\u003Ch3>多模态能力\u003C\u002Fh3>\n\u003Cp>虽然Llama 4 Vision存在，但其多模态能力不如Qwen 3.5（文本、图像、音频、视频）或Gemini（文本、图像、音频、视频）成熟。对于需要强大多模态理解的应用，Qwen 3.5或Gemini是更好的选择。\u003C\u002Fp>\n\u003Ch3>情感智能\u003C\u002Fh3>\n\u003Cp>Llama 4的EQ（情感智能）估计为~105 — 低于Claude（~132）、GPT-5.5（~120）、Gemini（~115）和Qwen 3.5（~107），但与DeepSeek（~105）相当。其回答倾向于更功能性，情感上不够细腻。对于治疗应用、客户服务或敏感的人类互动，Claude是更好的选择。\u003C\u002Fp>\n\u003Ch3>硬件要求\u003C\u002Fh3>\n\u003Cp>完整的405B参数模型需要\u003Cstrong>大量硬件\u003C\u002Fstrong>来运行 — 多个高端GPU用于推理。虽然量化版本有帮助，但以完整质量运行Llama 4在硬件方面是昂贵的。对于没有足够计算资源的组织，基于API的模型可能更实用。\u003C\u002Fp>\n\u003Ch3>安全和对齐\u003C\u002Fh3>\n\u003Cp>虽然Llama 4 Guard存在用于安全过滤，但开源性质意味着恶意行为者可以移除安全措施。Meta提供指南但无法强制执行。对于需要保证安全的应用，具有强制护栏的闭源模型可能更合适。\u003C\u002Fp>\n\u003Chr>\n\u003Ch2 id=\"6-llama-4\">6. Llama 4与其他模型对比\u003C\u002Fh2>\n\u003Cdiv class=\"article-table-wrapper\">\u003Ctable>\n\u003Cthead>\n\u003Ctr>\n\u003Cth>模型\u003C\u002Fth>\n\u003Cth>Intelligence Index\u003C\u002Fth>\n\u003Cth>Mensa Norway IQ\u003C\u002Fth>\n\u003Cth>AI IQ估计\u003C\u002Fth>\n\u003Cth>开源\u003C\u002Fth>\n\u003Cth>成本\u002F1M\u003C\u002Fth>\n\u003Cth>上下文\u003C\u002Fth>\n\u003Cth>参数\u003C\u002Fth>\n\u003C\u002Ftr>\n\u003C\u002Fthead>\n\u003Ctbody>\u003Ctr>\n\u003Ctd>Llama 4\u003C\u002Ftd>\n\u003Ctd>~43-44（前15）\u003C\u002Ftd>\n\u003Ctd>112\u003C\u002Ftd>\n\u003Ctd>~112\u003C\u002Ftd>\n\u003Ctd>是（免费）\u003C\u002Ftd>\n\u003Ctd>免费（自托管）\u003C\u002Ftd>\n\u003Ctd>128K\u003C\u002Ftd>\n\u003Ctd>405B\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Claude Opus 4.8\u003C\u002Ftd>\n\u003Ctd>55.7\u003C\u002Ftd>\n\u003Ctd>~130\u003C\u002Ftd>\n\u003Ctd>~132\u003C\u002Ftd>\n\u003Ctd>否\u003C\u002Ftd>\n\u003Ctd>5\u002F25\u003C\u002Ftd>\n\u003Ctd>200K\u003C\u002Ftd>\n\u003Ctd>未知\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>GPT-5.5\u003C\u002Ftd>\n\u003Ctd>54.8\u003C\u002Ftd>\n\u003Ctd>~145\u003C\u002Ftd>\n\u003Ctd>~136\u003C\u002Ftd>\n\u003Ctd>否\u003C\u002Ftd>\n\u003Ctd>5\u002F30\u003C\u002Ftd>\n\u003Ctd>400K\u003C\u002Ftd>\n\u003Ctd>未知\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Gemini 3.1 Pro\u003C\u002Ftd>\n\u003Ctd>46.5\u003C\u002Ftd>\n\u003Ctd>141\u003C\u002Ftd>\n\u003Ctd>~131\u003C\u002Ftd>\n\u003Ctd>否\u003C\u002Ftd>\n\u003Ctd>2\u002F12\u003C\u002Ftd>\n\u003Ctd>1M\u003C\u002Ftd>\n\u003Ctd>未知\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Grok-4.20\u003C\u002Ftd>\n\u003Ctd>前5\u003C\u002Ftd>\n\u003Ctd>145\u003C\u002Ftd>\n\u003Ctd>~140\u003C\u002Ftd>\n\u003Ctd>否\u003C\u002Ftd>\n\u003Ctd>3\u002F15\u003C\u002Ftd>\n\u003Ctd>256K\u003C\u002Ftd>\n\u003Ctd>未知\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>DeepSeek V4 Pro\u003C\u002Ftd>\n\u003Ctd>44.3\u003C\u002Ftd>\n\u003Ctd>~111\u003C\u002Ftd>\n\u003Ctd>~111\u003C\u002Ftd>\n\u003Ctd>是\u003C\u002Ftd>\n\u003Ctd>0.44\u002F0.87\u003C\u002Ftd>\n\u003Ctd>128K\u003C\u002Ftd>\n\u003Ctd>未知\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Qwen 3.5\u003C\u002Ftd>\n\u003Ctd>~45-46（前10）\u003C\u002Ftd>\n\u003Ctd>115\u003C\u002Ftd>\n\u003Ctd>~115\u003C\u002Ftd>\n\u003Ctd>是\u003C\u002Ftd>\n\u003Ctd>0.50\u002F1.50\u003C\u002Ftd>\n\u003Ctd>256K\u003C\u002Ftd>\n\u003Ctd>未知\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Kimi K3\u003C\u002Ftd>\n\u003Ctd>~45-47（前10）\u003C\u002Ftd>\n\u003Ctd>118\u003C\u002Ftd>\n\u003Ctd>~118\u003C\u002Ftd>\n\u003Ctd>否\u003C\u002Ftd>\n\u003Ctd>0.55\u002F2.19\u003C\u002Ftd>\n\u003Ctd>2M\u003C\u002Ftd>\n\u003Ctd>未知\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>画面：Llama 4是\u003Cstrong>开源冠军\u003C\u002Fstrong> — 不是最聪明的，但是最可访问的。Claude是\u003Cstrong>有能力的专业人士\u003C\u002Fstrong> — 实际任务最好。GPT-5.5是\u003Cstrong>测试天才\u003C\u002Fstrong> — 数学、视觉推理最好。Gemini是\u003Cstrong>价值冠军\u003C\u002Fstrong> — 前沿模型中最佳性价比。Grok-4.20是\u003Cstrong>原始IQ冠军\u003C\u002Fstrong> — 最高IQ加个性。DeepSeek是\u003Cstrong>预算冠军\u003C\u002Fstrong> — 最便宜API。Qwen 3.5是\u003Cstrong>全能选手\u003C\u002Fstrong> — 最多功能。Kimi是\u003Cstrong>长上下文冠军\u003C\u002Fstrong> — 最大上下文窗口。\u003C\u002Fp>\n\u003Cp>对于需要开源、隐私、定制或大规模成本的组织，Llama 4是明确选择。它是人民的模型 — 不是最聪明的，但是最自由的。\u003C\u002Fp>\n\u003Chr>\n\u003Ch2 id=\"7\">7. 这对人类意味着什么？\u003C\u002Fh2>\n\u003Cp>Llama 4以~112的IQ运作 — 比大约79%的人更聪明。但是：\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>IQ不是一切\u003C\u002Fstrong>：IQ 112高于平均，对大多数实际任务足够\u003C\u002Fli>\n\u003Cli>\u003Cstrong>对许多应用，开放性比原始IQ更重要\u003C\u002Fstrong>：对于隐私敏感或定制密集的应用，Llama 4的开放性比更高IQ更有价值\u003C\u002Fli>\n\u003Cli>\u003Cstrong>自由促进创新\u003C\u002Fstrong>：Llama 4的开放权重催生了闭源模型无法匹敌的整个创新生态系统\u003C\u002Fli>\n\u003Cli>\u003Cstrong>透明度建立信任\u003C\u002Fstrong>：能够检查模型内部建立了黑箱模型无法建立的信任\u003C\u002Fli>\n\u003Cli>\u003Cstrong>知识 ≠ 理解\u003C\u002Fstrong>：像所有AI模型一样，Llama 4可以访问大量知识，但不像人类那样真正&quot;理解&quot;\u003C\u002Fli>\n\u003Cli>\u003Cstrong>没有意识\u003C\u002Fstrong>：高IQ不意味着有感知力。Llama 4是复杂的模式匹配系统，不是思考的存在\u003C\u002Fli>\n\u003Cli>\u003Cstrong>社区推动进步\u003C\u002Fstrong>：Llama生态系统证明开放合作可以产生与十亿美元闭源系统竞争的模型\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>最诚实的答案：Llama 4在\u003Cstrong>认知测试上比79%的人类更聪明\u003C\u002Fstrong>，对于需要开放性、隐私或定制的应用，它是最聪明的选择 — 不是因为它最智能，而是因为它最自由。\u003C\u002Fp>\n\u003Cp>\n    \u003Cdiv class=\"article-quiz-cta\">\n      \u003Cdiv class=\"article-quiz-cta__text\">您的IQ与Llama 4相比如何？参加NeuroLab的专业IQ评估。\u003C\u002Fdiv>\n      \u003Ca href=\"\u002Fzh\u002Ftests\u002Fiq-standard\" class=\"article-quiz-cta__button\">\n        立即进行测试 →\n      \u003C\u002Fa>\n    \u003C\u002Fdiv>\u003C\u002Fp>\n\u003Chr>\n\u003Ch2>结论\u003C\u002Fh2>\n\u003Cp>\n    \u003Cdiv class=\"article-callout\">\n      \u003Cdiv class=\"article-callout__title\">\n        \u003Cspan class=\"article-callout__icon\">💡\u003C\u002Fspan>\n        关键要点\n      \u003C\u002Fdiv>\n      \u003Cdiv class=\"article-callout__body\">- \u003Cstrong>Llama 4的IQ为112\u003C\u002Fstrong>（Mensa Norway）— 高于平均，比~79%的人更聪明。\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>Intelligence Index前15\u003C\u002Fstrong> — 与DeepSeek竞争，落后于Qwen 3.5、Kimi和前沿模型。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>完全开源\u003C\u002Fstrong> — 权重免费提供下载、研究和本地部署。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>405B参数\u003C\u002Fstrong> — 可用的最大开源模型之一。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>最适合\u003C\u002Fstrong>：隐私敏感应用、定制需求、大规模成本、研究、自托管部署、社区驱动创新。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>非最适合\u003C\u002Fstrong>：原始IQ（前沿模型胜）、长上下文（Kimi胜）、多模态（Qwen 3.5或Gemini胜）、情感智能（Claude胜）、保证安全（具有强制护栏的闭源模型）。\u003C\u002Fli>\n\u003Cli>\u003Cstrong>教训\u003C\u002Fstrong>：智能不只是做最聪明的 — 而是做最可访问的。Llama 4证明开源AI可以与十亿美元闭源系统竞争，为每个人民主化先进AI的访问。\u003C\u002Fdiv>\n    \u003C\u002Fdiv>\u003C\u002Fli>\n\u003C\u002Ful>\n",10,[18,22,25,28,32,35,38,41,44,47,50,53,55,57,59,61,63,65,68,71,73,75,77,79,81,83,86,89],{"id":19,"text":20,"level":21},"llama-4-meta","Llama 4：Meta的开源冠军",2,{"id":23,"text":24,"level":21},"1","1. 开源革命",{"id":26,"text":27,"level":21},"2","2. 基准测试分解",{"id":29,"text":30,"level":31},"mensa-norway-iq-112","Mensa Norway IQ测试：112（高于平均）",3,{"id":33,"text":34,"level":31},"artificial-analysis-intelligence-index-15","Artificial Analysis Intelligence Index：前15",{"id":36,"text":37,"level":31},"ai-iq-vexowire-112","AI IQ综合（VexoWire）：~112",{"id":39,"text":40,"level":31},"gdpval-aa-v2-15","GDPval-AA v2：前15",{"id":42,"text":43,"level":31},"humanity-s-last-exam-hle-15","Humanity's Last Exam（HLE）：前15",{"id":45,"text":46,"level":21},"3-iq-112","3. IQ 112意味着什么？",{"id":48,"text":49,"level":21},"4-llama-4","4. Llama 4的优势",{"id":51,"text":52,"level":31},"","开源自由",{"id":51,"text":54,"level":31},"定制和微调",{"id":51,"text":56,"level":31},"隐私和数据安全",{"id":51,"text":58,"level":31},"大规模成本",{"id":51,"text":60,"level":31},"社区生态系统",{"id":51,"text":62,"level":31},"透明度",{"id":51,"text":64,"level":31},"硬件优化",{"id":66,"text":67,"level":21},"5-llama-4","5. Llama 4的不足",{"id":69,"text":70,"level":31},"iq","原始IQ和复杂推理",{"id":51,"text":72,"level":31},"幻觉率",{"id":51,"text":74,"level":31},"上下文窗口",{"id":51,"text":76,"level":31},"多模态能力",{"id":51,"text":78,"level":31},"情感智能",{"id":51,"text":80,"level":31},"硬件要求",{"id":51,"text":82,"level":31},"安全和对齐",{"id":84,"text":85,"level":21},"6-llama-4","6. Llama 4与其他模型对比",{"id":87,"text":88,"level":21},"7","7. 这对人类意味着什么？",{"id":51,"text":90,"level":21},"结论",{"success":4,"data":92,"pagination":261},[93,101,108,116,117,125,132,139,147,154,161,168,175,182,190,197,204,211,219,226,233,240,247,254],{"id":94,"slug":95,"coverImage":96,"author":9,"viewsCount":10,"createdAt":97,"title":98,"description":99,"lang":14,"readingTime":100},"jy0egbpgrn30am622jy7xfrw","adhd-and-iq","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1507812984078-917231447e3e?w=1280","2026-08-01T10:48:43.940Z","ADHD与IQ：当注意力缺陷隐藏了高智商","ADHD能掩盖高IQ吗？是的。研究表明注意力缺陷可能人为地将IQ测试分数降低10-15分——将天赋异禀的大脑隐藏在注意力不集中背后。",7,{"id":102,"slug":103,"coverImage":104,"author":9,"viewsCount":10,"createdAt":105,"title":106,"description":107,"lang":14,"readingTime":100},"dvlwozf321i8jlk9sfl390k1","online-vs-certified-iq-tests","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1499209974431-9fccce68dc04?w=1280","2026-08-01T10:48:39.869Z","在线IQ测试 vs 认证评估：它们有多准确？","你在免费在线IQ测试中得了140分。但这到底意味着什么？我们比较在线测试与认证评估——结果可能让你惊讶。",{"id":109,"slug":110,"coverImage":111,"author":9,"viewsCount":10,"createdAt":112,"title":113,"description":114,"lang":14,"readingTime":115},"maxnlmh4wqwxjuidbe2cb1jh","iq-above-160","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1454165804606-c3d57bc86b40?w=1280","2026-08-01T10:48:35.909Z","IQ超过160：极端边缘的生活是什么样的","只有三万分之一的人IQ超过160。我们探索人类智力极端边缘的生活——天赋、挣扎和神话。",8,{"id":6,"slug":7,"coverImage":8,"author":9,"viewsCount":10,"createdAt":11,"title":12,"description":13,"lang":14,"readingTime":16},{"id":118,"slug":119,"coverImage":120,"author":9,"viewsCount":121,"createdAt":122,"title":123,"description":124,"lang":14,"readingTime":16},"pxehdebhlpxfs0h5qm2m23e9","iq-qwen-35","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1518186285589-2f7649de83e0?w=1280",1,"2026-08-01T09:41:02.526Z","Qwen 3.5的IQ是多少？","Qwen 3.5在Mensa Norway IQ测试中得分115，在Intelligence Index上排名前10。我们分析每个基准测试，解释阿里巴巴模型的独特之处。",{"id":126,"slug":127,"coverImage":128,"author":9,"viewsCount":21,"createdAt":129,"title":130,"description":131,"lang":14,"readingTime":16},"st1nxd9ef5blcslk68p83pj1","iq-kimi-k3","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1620712943524-bccbe725b837?w=1280","2026-08-01T09:32:03.531Z","Kimi K3的IQ是多少？","Kimi K3在Mensa Norway IQ测试中得分118，在Intelligence Index上排名前10。我们分析每个基准测试，解释Moonshot AI模型的独特之处。",{"id":133,"slug":134,"coverImage":135,"author":9,"viewsCount":10,"createdAt":136,"title":137,"description":138,"lang":14,"readingTime":16},"u65iu8mijuzx0t4g1981phue","iq-deepseek-v4","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1677372139014-394e5b51f79b?w=1280","2026-08-01T09:23:30.326Z","DeepSeek V4的IQ是多少？","DeepSeek V4 Pro在Mensa Norway IQ测试中得分111，在Intelligence Index上得分44.3。我们分析每个基准测试，解释为什么它是最佳预算AI模型。",{"id":140,"slug":141,"coverImage":142,"author":9,"viewsCount":143,"createdAt":144,"title":145,"description":146,"lang":14,"readingTime":16},"lci1u8drubje01qwq1vah01m","iq-grok-420","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1635776062127-d379b0ba009b?w=1280",6,"2026-07-31T20:30:00.249Z","Grok-4.20的IQ是多少？","Grok-4.20在Mensa Norway IQ测试中得分145 — 在所有AI模型中并列#1。我们分析每个基准测试，解释xAI模型的独特之处。",{"id":148,"slug":149,"coverImage":150,"author":9,"viewsCount":21,"createdAt":151,"title":152,"description":153,"lang":14,"readingTime":16},"n32qvrqd1er095jgz98qg73l","iq-gemini-31-pro","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1591488320449-011701bb6704?w=1280","2026-07-31T20:06:42.239Z","Gemini 3.1 Pro的IQ是多少？","Gemini 3.1 Pro在Mensa Norway IQ测试中得分141，在Intelligence Index上得分46.5。我们分析每个基准测试，解释为什么它是最具性价比的前沿模型。",{"id":155,"slug":156,"coverImage":157,"author":9,"viewsCount":121,"createdAt":158,"title":159,"description":160,"lang":14,"readingTime":16},"jl69290gswdg1wrb5oy6iiyo","iq-gpt-55","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1620712943543-bcc4688e7485?w=1280","2026-07-31T19:59:37.899Z","GPT-5.5的IQ是多少？","GPT-5.5在Mensa Norway IQ测试中得分~145，在Intelligence Index上得分54.8。我们分析每个基准测试，并与Claude、Gemini和Grok进行比较。",{"id":162,"slug":163,"coverImage":164,"author":9,"viewsCount":121,"createdAt":165,"title":166,"description":167,"lang":14,"readingTime":16},"fmyy2tdkvdmffu6n9y5npc5c","iq-claude-opus-48","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1677442136019-21780ecad995?w=1280","2026-07-31T19:53:48.504Z","Claude Opus 4.8 的 IQ 是多少？","Claude Opus 4.8以55.7领跑Artificial Analysis Intelligence Index，在人类IQ测试中得分~132-145。我们分析每个基准测试，并与GPT-5.5、Gemini和Grok进行比较。",{"id":169,"slug":170,"coverImage":171,"author":9,"viewsCount":10,"createdAt":172,"title":173,"description":174,"lang":14,"readingTime":115},"mhlz1hmh5ez4vs6loftlxd06","fasting-cognitive-performance","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1490645935441-5b6c2cc1e5e1?w=1280","2026-07-30T18:27:49.514Z","禁食能改善认知表现吗？","从间歇性禁食到酮体：我们回顾禁食是否能让头脑敏锐、提高专注力或实际上损害认知的证据。科学可能会让你惊讶。",{"id":176,"slug":177,"coverImage":178,"author":9,"viewsCount":21,"createdAt":179,"title":180,"description":181,"lang":14,"readingTime":16},"fentmgsgc3lq034m2nk53ol4","wechsler-iq-test-subtests","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1494256997604-668ec142f5d2?w=1280","2026-07-30T18:18:40.059Z","韦氏IQ测试：每个子测试真正测量什么","WAIS和WISC是世界上使用最广泛的IQ测试。我们分解每个子测试，它真正测量什么，以及分数如何转化为实际认知能力。",{"id":183,"slug":184,"coverImage":185,"author":9,"viewsCount":10,"createdAt":186,"title":187,"description":188,"lang":14,"readingTime":189},"wlwyq33ezei7c22edclwpyvo","lead-fluoride-iq-loss","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1581093577124-a6f4b6e3a5e1?w=1280","2026-07-30T18:07:23.917Z","铅、氟化物与IQ下降：环境证据","环境毒素真的能降低你的IQ吗？我们回顾了铅暴露、氟化物和认知衰退的最强研究——区分严肃科学与耸人听闻。",9,{"id":191,"slug":192,"coverImage":193,"author":9,"viewsCount":31,"createdAt":194,"title":195,"description":196,"lang":14,"readingTime":115},"ue16gxaun3lus9vml8imf6ci","iq-changes-during-pregnancy","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1559750178-961c031777fe?w=1280","2026-07-29T18:48:12.309Z","怀孕期间的IQ变化：研究发现","怀孕真的会缩小你的大脑吗？我们回顾了母性认知的神经科学——从\"孕期大脑\"到持久的结构变化——区分事实与神话。",{"id":198,"slug":199,"coverImage":200,"author":9,"viewsCount":121,"createdAt":201,"title":202,"description":203,"lang":14,"readingTime":189},"zd0sfdazkyai41s0kh639ohl","does-bilingualism-raise-iq","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1523050854058-8f908275853f?w=1280","2026-07-29T18:33:17.515Z","说两种语言真的能提高你的IQ吗？","双语优势已争论数十年。我们回顾了关于双语主义和认知能力的最有力研究，区分真实效果与夸大。",{"id":205,"slug":206,"coverImage":207,"author":9,"viewsCount":31,"createdAt":208,"title":209,"description":210,"lang":14,"readingTime":189},"s0hko69oudyziplx2q04ab9q","gifted-kids-peaked-early-childhood-iq-fades","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1503454537195-1dc81782b6d3?w=1280","2026-07-29T18:17:25.535Z","早慧儿童的IQ为何会消退：天赋的衰退现象","为什么许多神童长大后变得平凡？我们研究早期IQ峰值、\"回归平均\"效应，以及真正预测成年成功的因素。",{"id":212,"slug":213,"coverImage":214,"author":9,"viewsCount":215,"createdAt":216,"title":217,"description":218,"lang":14,"readingTime":115},"s7x75o02kixj2u43gw4ah5pa","olfactory-processing-speed-cognitive-marker","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1542838132-92c53300287c?w=1280",5,"2026-07-28T20:40:48.167Z","嗅觉处理速度作为认知标志","你识别气味的速度能否预测你的认知能力？我们检验了将嗅觉处理速度与智商、记忆力和神经退行性疾病风险联系起来的惊人研究。",{"id":220,"slug":221,"coverImage":222,"author":9,"viewsCount":21,"createdAt":223,"title":224,"description":225,"lang":14,"readingTime":189},"v1qq1yz082k72zzynk0qv2yh","do-musicians-have-higher-iqs","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1520006510097-3d64427f3f98?w=1280","2026-07-28T20:29:23.744Z","音乐家的智商更高吗？研究结论","音乐家更聪明的观念广为流传——但科学是否支持这一点？我们综述了10项关于音乐训练、智商和认知能力的关键研究，以区分事实与虚构。",{"id":227,"slug":228,"coverImage":229,"author":9,"viewsCount":31,"createdAt":230,"title":231,"description":232,"lang":14,"readingTime":189},"xam91ejelkjg23x2z9skt9vm","are-night-owls-smarter","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1518837695005-2083093ee35b?w=1280","2026-07-28T19:50:50.159Z","夜猫子更聪明吗？昼夜节律型与认知表现","夜猫子比早起鸟更聪明的观点很流行——但研究实际上显示了什么？我们考察了昼夜节律型、智商和认知表现的证据。",{"id":234,"slug":235,"coverImage":236,"author":9,"viewsCount":215,"createdAt":237,"title":238,"description":239,"lang":14,"readingTime":189},"hpakkt3uv7frkkhj2el6fvm1","does-high-iq-make-you-rich","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1579621970795-87facc2f976d?w=1280","2026-07-28T19:41:02.722Z","高智商能让你变富吗？12项研究综述","智商与收入之间的相关性是真实的，但出人意料地弱。我们综述了12项关键研究，以理解为什么高智商不能保证财富——以及什么真正预测了财务成功。",{"id":241,"slug":242,"coverImage":243,"author":9,"viewsCount":215,"createdAt":244,"title":245,"description":246,"lang":14,"readingTime":189},"b5ct19s9mfso606wcppcp79o","iq-test-scores-in-prison-populations","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1497366216548-37526070297c?w=1280","2026-07-28T18:32:32.833Z","监狱人口中的智商测试分数：研究显示了什么","研究一致发现，监狱人口在智商测试中的得分低于一般公众——平均低约10-12分。但原因远比\"罪犯更不聪明\"复杂得多。本文审视了证据、混淆因素以及数据的真正含义。",{"id":248,"slug":249,"coverImage":250,"author":9,"viewsCount":143,"createdAt":251,"title":252,"description":253,"lang":14,"readingTime":16},"zjjd6y8yfcydy6y02c9xa2yf","which-country-has-the-highest-average-iq","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1526129313847-8d262a6b1f0d?w=1280","2026-07-28T18:03:42.307Z","哪个国家平均智商最高（以及为什么数据一团糟）","每隔几个月，就会有新标题宣布新加坡、香港或韩国拥有世界最高智商。但 behind 这些排名隐藏着方法论问题、文化偏见和过时数据的纠缠。本文揭示了研究实际显示的内容——以及不显示的内容。",{"id":255,"slug":256,"coverImage":257,"author":9,"viewsCount":143,"createdAt":258,"title":259,"description":260,"lang":14,"readingTime":189},"nxfpaqozmm0dpaytyy2cjixv","why-your-iq-test-score-changes-over-time","https:\u002F\u002Fimages.unsplash.com\u002Fphoto-1499750310107-5fef28a66643?w=1280","2026-07-28T17:37:12.789Z","为什么你的智商测试分数会随时间变化","你的智商分数不是刻在脑子里的固定数字。研究表明，智商分数在一生中可以显著变化——有时变化20分或更多。本指南解释了驱动这些变化的因素及其对你的意义。",{"page":121,"pageSize":262,"pageCount":31,"total":263},24,49]