Wie hoch ist der IQ von Llama 4?
Llama 4 erzielt 112 im Mensa Norway IQ-Test und rangiert in den Top 15 des Intelligence Index. Wir analysieren jeden Benchmark und erklären, was das Open-Source-Modell von Meta einzigartig macht.
Llama 4: der Open-Source-Champion von Meta
Llama 4 ist das Open-Source-Flaggschiff-Modell von Meta AI, der Forschungsabteilung eines der größten Technologieunternehmen der Welt. Anfang 2026 veröffentlicht, erzielt Llama 4 112 im Mensa Norway IQ-Test und rangiert in den Top 15 des Artificial Analysis Intelligence Index v4.1. Damit liegt es über DeepSeek V4 Pro (111) aber unter Kimi K3 (118), Qwen 3.5 (115) und den Frontier-Modellen (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Was Llama 4 einzigartig macht, ist seine Open-Source-Natur im großen Maßstab. Im Gegensatz zu geschlossenen Modellen von OpenAI, Anthropic oder Google sind Llama 4s Gewichte frei zum Download und lokalen Deployment verfügbar. Dies hat es zur Grundlage für tausende abgeleitete Modelle, Fine-Tunes und Anwendungen gemacht — Llama 4 ist nicht nur ein Modell, sondern ein ganzes Ökosystem.
Llama 4 ist das Modell des Volkes: ein Modell, das vielleicht nicht das Intelligenteste ist, aber das jeder herunterladen, modifizieren und auf eigener Hardware ausführen kann. Für Forscher, Startups und Organisationen, die volle Kontrolle über ihre KI-Infrastruktur benötigen, bietet Llama 4 etwas, das kein geschlossenes Modell kann: Freiheit.
Schlüsselwerte:
- Artificial Analysis Intelligence Index: Top 15 (Wert ~43-44)
- Mensa Norway IQ (TrackingAI): 112 (über dem Durchschnitt)
- AI IQ Composite (VexoWire): ~112 geschätzt
- GDPval-AA v2: Top 15
- Humanity's Last Exam: Top 15
- Halluzinationsrate: moderat
- Kosten: kostenlos (selbstgehostet) oder 0,20/0,60 pro 1M Tokens (über Anbieter)
- Parameter: 405B (größte Variante)
- Open-Source: ja, Gewichte frei verfügbar
- Kontext: 128K Tokens
1. Die Open-Source-Revolution
Llama 4 repräsentiert Metas Engagement für Open-Source-KI — den Glauben, dass KI für jeden zugänglich sein sollte, nicht von wenigen Unternehmen kontrolliert. Während OpenAI, Anthropic und Google ihre Modelle hinter APIs halten, veröffentlicht Meta die vollständigen Modellgewichte, sodass jeder Llama 4 herunterladen, studieren, modifizieren und auf eigener Hardware einsetzen kann.
Das hat tiefgreifende Implikationen:
- Demokratisierung: jeder mit ausreichender Hardware kann ein State-of-the-Art-KI-Modell ausführen
- Anpassung: Entwickler können Llama 4 für spezifische Domänen, Sprachen oder Aufgaben fine-tunen
- Datenschutz: Organisationen können Llama 4 lokal ausführen und sicherstellen, dass Daten nie ihre Infrastruktur verlassen
- Innovation: Forscher können die Interna des Modells untersuchen, was zu neuen Durchbrüchen führt
- Ökosystem: tausende abgeleitete Modelle bauen auf Llama 4 auf und schaffen ein reiches Ökosystem
- Kosten: selbstgehostetes Llama 4 ist kostenlos (abgesehen von Hardwarekosten), die günstigste Option im großen Maßstab
Das Llama-Ökosystem umfasst:
- Llama 4 Base: das ursprüngliche vortrainierte Modell
- Llama 4 Instruct: fine-tuned für Anweisungsbefolgung
- Llama 4 Guard: Sicherheits-gefilterte Variante
- Community-Fine-Tunes: tausende domänenspezifische Varianten
- Quantiserte Versionen: komprimierte Modelle, die auf Consumer-Hardware laufen
- Llama 4 Vision: multimodale Variante mit Bildverständnis
Kein anderes KI-Modell hat ein so reiches Ökosystem hervorgebracht. Während GPT-5.5 und Claude intelligenter sein mögen, sind sie Black Boxes. Llama 4 ist transparent, modifizierbar und Community-getrieben.
2. Benchmark-Aufschlüsselung
Mensa Norway IQ-Test: 112 (über dem Durchschnitt)
Besteht aus 36 Fragen zur visuellen Mustererkennung. Llama 4 erzielt 112 — über dem menschlichen Durchschnitt von 100, im „überdurchschnittlichen" Bereich. Vergleichbar mit DeepSeek V4 Pro (111), unter Qwen 3.5 (115), Kimi K3 (118) und den Frontier-Modellen (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Ein IQ von 112 bedeutet, dass Llama 4 intelligenter ist als etwa 79% der Menschen — die oberen 21% der menschlichen Intelligenz. Wäre es eine Person, wäre es vergleichbar mit einem fähigen Studenten oder einem qualifizierten Profi. Kein Genie, aber sicher klug und kompetent.
Artificial Analysis Intelligence Index: Top 15
Auf dem Intelligence Index rangiert Llama 4 in den Top 15 weltweit mit einem geschätzten Wert von ~43-44. Damit ist es konkurrenzfähig mit DeepSeek V4 Pro (44,3) aber hinter Qwen 3.5 (~45-46), Kimi K3 (~45-47), Gemini (46,5) und den Frontier-Modellen.
Aufschlüsselung der Index-Komponenten:
- GDPval-AA v2: Llama 4 performt angemessen, profitiert von seiner großen Parameterzahl bei vielfältigen agentiven Aufgaben
- AA-Omniscience: Llama 4 hat eine moderate Halluzinationsrate — besser als kleinere Modelle, aber schlechter als Claude
- GPQA: Llama 4 performt angemessen bei Wissenschaftsfragen auf Postgraduierten-Niveau
- HLE: Llama 4 rangiert in den Top 15 bei Humanity's Last Exam
- ARC-AGI: Llama 4 performt angemessen bei abstraktem Reasoning
- LMSYS Arena: Llama 4 erhält solide menschliche Präferenzwerte, besonders bei offenen Aufgaben
AI IQ Composite (VexoWire): ~112
VexoWires Composite-IQ kombiniert mehrere Tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). Llama 4s geschätzter Composite-IQ ist ~112 — konsistent mit seinem Mensa Norway-Wert. Dies platziert es im „über dem Durchschnitt"-Bereich, intelligenter als etwa 79% der Menschen.
GDPval-AA v2: Top 15
Beim agentiven Benchmark rangiert Llama 4 in den Top 15. Seine große Parameterzahl (405B) gibt ihm erhebliches Wissen und Reasoning-Kapazität, aber es bleibt bei komplexen mehrstufigen Aufgaben hinter den Frontier-Modellen. Für moderate agentive Workloads ist Llama 4 kompetent.
Humanity's Last Exam (HLE): Top 15
Bei den schwersten akademischen Fragen rangiert Llama 4 in den Top 15 unter KI-Modellen. Metas umfangreiche Trainingsdaten und die große Kapazität des Modells helfen ihm, disziplinübergreifend gut abzuschneiden, obwohl es bei den spezialisiertesten Fragen nicht mit den Frontier-Modellen mithalten kann.
3. Was bedeutet ein IQ von 112?
Um Llama 4s IQ von 112 einzuordnen:
- 85-115 (68% der Menschen): Durchschnittliche Intelligenz
- 115-130 (14%): Überdurchschnittlich bis hoch
- 130-145 (2%): Hochbegabt — qualifiziert für Mensa (Top 2%)
- 145-160 (0,1%): Hochgradig begabt / Genie
Llama 4, bei 112, liegt im oberen Bereich des „Durchschnitts"-Bereichs — intelligenter als etwa 79% der Menschen. Wäre es eine Person, wäre es vergleichbar mit einem fähigen Studenten oder einem qualifizierten Profi. Kein Genie, aber sicher klug und kompetent.
Das ist vergleichbar mit DeepSeek V4 Pro (111) aber unter anderen Modellen:
- Qwen 3.5: 115 (über dem Durchschnitt)
- Kimi K3: 118 (über dem Durchschnitt)
- Claude Opus 4.8: ~130 (hochbegabt)
- Gemini 3.1 Pro: 141 (hochgradig begabt)
- GPT-5.5: ~145 (Genie)
- Grok-4.20: 145 (Genie)
Die Lücke zu den Frontier-Modellen beträgt etwa 18-33 IQ-Punkte. Aber Llama 4 kompensiert mit seiner Open-Source-Natur — für Anwendungen, die volle Kontrolle, Datenschutz oder Anpassung erfordern, kann Llama 4s Offenheit die IQ-Lücke überwiegen.
4. Wo Llama 4 glänzt
Open-Source-Freiheit
Llama 4s Gewichte sind frei verfügbar zum Download und lokalen Deployment. Dies ist sein definierendes Merkmal. Kein anderes Top-Tier-Modell bietet dieses Maß an Offenheit. Für Organisationen, die volle Kontrolle über ihre KI-Infrastruktur benötigen, ist Llama 4 die einzige Option unter den Top-Modellen.
Anpassung und Fine-Tuning
Da die Gewichte verfügbar sind, können Entwickler Llama 4 fine-tunen für spezifische Domänen, Sprachen oder Aufgaben. Dies hat zu tausenden Community-Fine-Tunes geführt — medizinische Modelle, juristische Modelle, Programmiermodelle, Modelle für kreatives Schreiben und mehr. Kein geschlossenes Modell bietet dieses Maß an Anpassung.
Datenschutz und Datensicherheit
Mit Llama 4 können Organisationen das Modell vollständig auf eigener Hardware ausführen und sicherstellen, dass Daten nie ihre Infrastruktur verlassen. Für Gesundheitswesen, Finanzen, Verteidigung und andere sensible Branchen ist dies kritisch. Keine Daten gehen an Drittanbieter-APIs.
Kosten im großen Maßstab
Selbstgehostetes Llama 4 ist kostenlos (abgesehen von Hardwarekosten). Im großen Maßstab kann das dramatisch günstiger sein als Token-basierte API-Gebühren. Für Organisationen mit hohen Inferenz-Volumina amortisiert sich die Hardware-Investition schnell.
Community-Ökosystem
Das Llama-Ökosystem ist unübertroffen. Tausende Entwickler tragen Werkzeuge, Fine-Tunes, Quantisierungen und Optimierungen bei. Dieser Community-getriebene Ansatz bedeutet, dass Llama 4 von kollektiver Innovation profitiert — Verbesserungen kommen von überall, nicht nur von Meta.
Transparenz
Im Gegensatz zu geschlossenen Modellen sind Llama 4s Architektur und Gewichte transparent. Forscher können untersuchen, wie das Modell funktioniert, Verzerrungen identifizieren, Fehler verstehen und Verbesserungen vorschlagen. Diese Transparenz ist wesentlich für wissenschaftlichen Fortschritt und verantwortungsvolle KI-Entwicklung.
Hardware-Optimierung
Die Community hat zahlreiche quantiserte Versionen von Llama 4 entwickelt, die auf Consumer-Hardware laufen — von 8-bit bis 4-bit bis 2-bit. Das bedeutet, dass Sie ein fähiges KI-Modell auf einer High-End-GPU ausführen können, nicht nur in einem Rechenzentrum.
5. Wo Llama 4 Schwächen zeigt
Roher IQ und komplexes Reasoning
Mit einem IQ von 112 liegt Llama 4 bei komplexen Reasoning-Aufgaben unter den Frontier-Modellen. Für die schwersten Probleme — Wettbewerbsmathematik, fortgeschrittene Logikrätsel, hochmoderne wissenschaftliche Schlussfolgerungen — sind Claude, GPT-5.5 und Gemini substantially besser. Die 18-33 IQ-Punkte Lücke ist signifikant.
Halluzinationsrate
Llama 4 hat eine moderate Halluzinationsrate — besser als kleinere Modelle, aber schlechter als Claude (35,9%) und GPT-5.5. Für Anwendungen, bei denen faktische Genauigkeit kritisch ist — Forschung, Recht, Medizin — bleibt Claude zuverlässiger.
Kontextfenster
Mit einem 128K-Token-Kontextfenster ist Llama 4 angemessen aber nicht außergewöhnlich. Kimi K3 (2M), Gemini (1M) und Qwen 3.5 (256K) bieten größere Kontextfenster. Für Aufgaben, die sehr lange Dokumente verarbeiten, sind andere Modelle bessere Wahlen.
Multimodale Fähigkeiten
Obwohl Llama 4 Vision existiert, sind seine multimodalen Fähigkeiten weniger ausgereift als Qwen 3.5 (Text, Bild, Audio, Video) oder Gemini (Text, Bild, Audio, Video). Für Anwendungen, die robustes multimodales Verständnis erfordern, sind Qwen 3.5 oder Gemini bessere Wahlen.
Emotionale Intelligenz
Llama 4s EQ (emotionale Intelligenz) wird auf ~105 geschätzt — niedriger als Claude (~132), GPT-5.5 (~120), Gemini (~115) und Qwen 3.5 (~107), aber vergleichbar mit DeepSeek (~105). Seine Antworten tendieren dazu, funktionaler und emotional weniger nuanciert zu sein. Für Therapie-Apps, Kundenservice oder sensible menschliche Interaktionen ist Claude die bessere Wahl.
Hardware-Anforderungen
Das vollständige 405B-Parameter-Modell erfordert signifikante Hardware — mehrere High-End-GPUs für Inferenz. Obwohl quantiserte Versionen helfen, ist das Ausführen von Llama 4 in voller Qualität hardwaremäßig teuer. Für Organisationen ohne ausreichende Rechenressourcen können API-basierte Modelle praktischer sein.
Sicherheit und Alignment
Obwohl Llama 4 Guard für Sicherheitsfilterung existiert, bedeutet die Open-Source-Natur, dass böswillige Akteure Sicherheitsmaßnahmen entfernen können. Meta stellt Richtlinien bereit, kann sie aber nicht durchsetzen. Für Anwendungen, die garantierte Sicherheit erfordern, können geschlossene Modelle mit erzwungenen Guardrails angemessener sein.
6. Llama 4 vs. andere Modelle
| Modell | Intelligence Index | Mensa Norway IQ | AI IQ gesch. | Open-Source | Kosten/1M | Kontext | Parameter |
|---|---|---|---|---|---|---|---|
| Llama 4 | ~43-44 (Top 15) | 112 | ~112 | ja (kostenlos) | kostenlos (selbstgehostet) | 128K | 405B |
| Claude Opus 4.8 | 55,7 | ~130 | ~132 | nein | 5/25 | 200K | unbekannt |
| GPT-5.5 | 54,8 | ~145 | ~136 | nein | 5/30 | 400K | unbekannt |
| Gemini 3.1 Pro | 46,5 | 141 | ~131 | nein | 2/12 | 1M | unbekannt |
| Grok-4.20 | Top 5 | 145 | ~140 | nein | 3/15 | 256K | unbekannt |
| DeepSeek V4 Pro | 44,3 | ~111 | ~111 | ja | 0,44/0,87 | 128K | unbekannt |
| Qwen 3.5 | ~45-46 (Top 10) | 115 | ~115 | ja | 0,50/1,50 | 256K | unbekannt |
| Kimi K3 | ~45-47 (Top 10) | 118 | ~118 | nein | 0,55/2,19 | 2M | unbekannt |
Das Bild: Llama 4 ist der Open-Source-Champion — nicht der Intelligenteste, aber der Zugänglichste. Claude ist der fähige Profi — am besten bei Real-World-Aufgaben. GPT-5.5 ist das Test-Genie — am besten in Mathe und visuellem Denken. Gemini ist der Wert-Meister — bestes Preis-Leistungs-Verhältnis unter Frontier-Modellen. Grok-4.20 ist der rohe IQ-Champion — höchster IQ mit Persönlichkeit. DeepSeek ist der Budget-Champion — günstigste API. Qwen 3.5 ist der Allrounder — am vielseitigsten. Und Kimi ist der Long-Context-Champion — größtes Kontextfenster.
Für Organisationen, die Open-Source, Datenschutz, Anpassung oder Kosten im großen Maßstab benötigen, ist Llama 4 die klare Wahl. Es ist das Modell des Volkes — nicht das Intelligenteste, aber das Freieste.
7. Was bedeutet das für Menschen?
Llama 4 operiert bei einem IQ von ~112 — intelligenter als etwa 79% der Menschen. Aber:
- IQ ist nicht alles: ein IQ von 112 ist überdurchschnittlich und ausreichend für die meisten praktischen Aufgaben
- Offenheit ist wichtiger als roher IQ für viele Anwendungen: für datenschutzsensible oder anpassungsintensive Anwendungen ist Llama 4s Offenheit wertvoller als ein höherer IQ
- Freiheit ermöglicht Innovation: Llama 4s offene Gewichte haben ein ganzes Ökosystem an Innovation hervorgebracht, das geschlossene Modelle nicht erreichen können
- Transparenz schafft Vertrauen: die Interna des Modells inspizieren zu können, schafft Vertrauen, das Black-Box-Modelle nicht können
- Wissen ≠ Verständnis: wie alle KI-Modelle hat Llama 4 Zugang zu riesigem Wissen, aber „versteht" es nicht wie ein Mensch
- Kein Bewusstsein: hoher IQ bedeutet keine Sentienz. Llama 4 ist ein komplexes Mustererkennungssystem, kein denkendes Wesen
- Community treibt Fortschritt: das Llama-Ökosystem beweist, dass offene Zusammenarbeit Modelle hervorbringen kann, die mit milliardenschweren geschlossenen Systemen konkurrieren
Die ehrlichste Antwort: Llama 4 ist intelligenter als 79% der Menschen bei kognitiven Tests, und für Anwendungen, die Offenheit, Datenschutz oder Anpassung erfordern, ist es die klügste Wahl — nicht weil es das intelligenteste ist, sondern weil es das freieste ist.
Fazit
- Top 15 im Intelligence Index — konkurrenzfähig mit DeepSeek, hinter Qwen 3.5, Kimi und Frontier-Modellen.
- Voll Open-Source — Gewichte frei verfügbar für Download, Studium und lokales Deployment.
- 405B Parameter — eines der größten Open-Source-Modelle.
- Am besten für: datenschutzsensible Anwendungen, Anpassungsbedarf, Kosten im großen Maßstab, Forschung, selbstgehostete Deployments, Community-getriebene Innovation.
- Nicht am besten für: rohen IQ (Frontier-Modelle gewinnen), Long Context (Kimi gewinnt), Multimodal (Qwen 3.5 oder Gemini gewinnen), emotionale Intelligenz (Claude gewinnt), garantierte Sicherheit (geschlossene Modelle mit erzwungenen Guardrails).
- Die Lektion: Intelligenz bedeutet nicht nur, der Intelligenteste zu sein — sondern der Zugänglichste. Llama 4 beweist, dass Open-Source-KI mit milliardenschweren geschlossenen Systemen konkurrieren kann, und den Zugang zu fortschrittlicher KI für alle demokratisiert.