Wie hoch ist der IQ von DeepSeek V4?
DeepSeek V4 Pro erzielt 111 im Mensa Norway IQ-Test und 44,3 im Intelligence Index. Wir analysieren jeden Benchmark und erklären, warum es das beste Budget-KI-Modell ist.
DeepSeek V4 Pro: Chinas Open-Source-Champion
DeepSeek V4 Pro ist das Flaggschiff-Modell von DeepSeek, dem chinesischen KI-Labor, das die Welt mit seiner Kombination aus niedrigen Kosten und hoher Leistung überrascht hat. Anfang 2026 veröffentlicht, erzielt DeepSeek V4 Pro 111 im Mensa Norway IQ-Test und 44,3 auf dem Artificial Analysis Intelligence Index v4.1 — weltweit in den Top 10, aber deutlich hinter den Frontier-Modellen (Claude mit 55,7, GPT-5.5 mit 54,8).
Was DeepSeek V4 Pro bemerkenswert macht, ist nicht seine rohe Intelligenz — es ist sein Preis. Bei 0,44/0,87 pro 1M Tokens kostet es etwa 10x weniger als Claude (5/25) und GPT-5.5 (5/30), und 5x weniger als Gemini (2/12). Für den Preis einer einzigen Abfrage bei Claude könnten Sie zehn Abfragen bei DeepSeek V4 Pro durchführen. Und dennoch erzielt es 111 in einem IQ-Test — höher als etwa 25% der Menschen.
DeepSeek V4 Pro ist die Volks-KI: ein Modell, das nicht an der Front der Intelligenz konkurriert, aber fähige KI zu jedem zu einem Preis bringt, der praktisch kostenlos ist. Für Studenten, Hobbyisten, kleine Unternehmen und Entwickler in kostenempfindlichen Märkten ist DeepSeek V4 Pro oft die einzige tragfähige Option.
Schlüsselwerte:
- Artificial Analysis Intelligence Index: 44,3 (Top 10 weltweit)
- Mensa Norway IQ (TrackingAI): 111 (über dem menschlichen Durchschnitt)
- AI IQ Composite (VexoWire): ~111 geschätzt
- GDPval-AA v2: Top 10
- Humanity's Last Exam: Top 10
- Halluzinationsrate: moderat
- Kosten: 0,44/0,87 pro 1M Tokens (am niedrigsten unter allen großen Modellen)
- Open-Source: Gewichte für lokalen Einsatz verfügbar
1. Die Budget-Revolution
DeepSeek V4 Pro repräsentiert einen fundamentalen Wandel in der KI-Landschaft: die Demokratisierung von Intelligenz. Während amerikanische Labore (OpenAI, Anthropic, Google, xAI) an der Front konkurrieren — IQ-Werte von 130 auf 140 auf 145 treibend — hat sich DeepSeek auf ein anderes Ziel konzentriert: fähige KI für jeden erschwinglich zu machen.
Bei 0,44 pro 1M Eingabe-Tokens und0,87 pro 1M Ausgabe ist DeepSeek V4 Pro erstaunlich günstig. Um es in Perspektive zu setzen: Die Verarbeitung eines typischen buchlängen Dokuments (ca. 100.000 Tokens) kostet etwa 0,04 Eingabe und0,09 Ausgabe. Dieselbe Aufgabe würde 0,50-1,00 mit Gemini, 1,00-3,00 mit Claude oder GPT-5.5 kosten.
Das ist nicht nur ein Rabatt — es ist eine andere Produktkategorie. DeepSeek V4 Pro macht KI zugänglich für:
- Studenten, die sich keine $20/Monat-Abonnements leisten können
- Kleine Unternehmen in Entwicklungsmärkten
- Hobbyisten und Tüftler
- Entwickler, die hochvolumige Anwendungen bauen
- Forscher, die massive Datensätze mit begrenzten Budgets verarbeiten
Und das Bemerkenswerte ist: DeepSeek V4 Pro ist genuinely fähig. Es erzielt 111 im Mensa Norway IQ-Test — über dem menschlichen Durchschnitt von 100 und höher als etwa 25% der Menschen. Es ist kein Genie, aber intelligent genug für die meisten Alltagsaufgaben: Schreiben, Programmieren, Analysieren, Übersetzen, Zusammenfassen.
2. Benchmark-Aufschlüsselung
Mensa Norway IQ-Test: 111 (über dem Durchschnitt)
Besteht aus 36 Fragen zur visuellen Mustererkennung. DeepSeek V4 Pro erzielt 111 — über dem menschlichen Durchschnitt von 100, im „überdurchschnittlichen" Bereich. Das ist höher als etwa 25% der Menschen, aber deutlich unter den Frontier-Modellen (Claude ~130, Gemini 141, GPT-5.5 ~145, Grok-4.20 145).
Ein IQ von 111 bedeutet, dass DeepSeek V4 Pro visuelle Muster erkennen und abstrakt denken kann auf einem Niveau vergleichbar mit einem klugen Studenten. Es löst nicht die schwersten Rätsel, aber bewältigt die meisten Alltags-Reasoning-Aufgaben kompetent.
Die Lücke zwischen DeepSeek V4 Pro (111) und den Frontier-Modellen (130-145) ist signifikant — etwa 20-35 IQ-Punkte, oder rund 1-2 Standardabweichungen. Das bedeutet, dass die Frontier-Modelle bei reinen kognitiven Tests substantially intelligenter sind. Aber für Aufgaben, die kein Genie-Level-Reasoning erfordern — was die meisten sind — ist DeepSeek V4 Pro mehr als ausreichend.
Artificial Analysis Intelligence Index v4.1: 44,3 (Top 10)
Auf dem Intelligence Index erzielt DeepSeek V4 Pro 44,3 — weltweit in den Top 10, aber etwa 10-11 Punkte hinter den Frontier-Führern (Claude 55,7, GPT-5.5 54,8). Diese Lücke ist signifikant, aber angesichts des Preisunterschieds erwartet.
Aufschlüsselung der Index-Komponenten:
- GDPval-AA v2: DeepSeek punktet angemessen, bleibt aber hinter Claude und GPT-5.5 bei komplexen mehrstufigen Aufgaben
- AA-Omniscience: DeepSeek hat eine moderate Halluzinationsrate — nicht so niedrig wie Claude, aber akzeptabel für die meisten Anwendungen
- GPQA: DeepSeek performt adäquat bei Wissenschaftsfragen auf Postgraduierten-Niveau
- HLE: DeepSeek rangiert in den Top 10 bei Humanity's Last Exam
- ARC-AGI: DeepSeek hat Schwierigkeiten mit abstraktem Reasoning verglichen mit Frontier-Modellen
- LMSYS Arena: DeepSeek erhält anständige menschliche Präferenzwerte, besonders bei Programmieraufgaben
AI IQ Composite (VexoWire): ~111
VexoWires Composite-IQ kombiniert mehrere Tests (Mensa Norway, Mensa Denmark, Raven's, WAIS-IV). DeepSeek V4 Pros geschätzter Composite-IQ ist ~111 — konsistent mit seinem Mensa Norway-Wert. Dies platziert es fest im „überdurchschnittlichen" Bereich, vergleichbar mit einem klugen Menschen, aber deutlich unter Genie-Niveau.
GDPval-AA v2: Top 10
Beim agentischen Benchmark rangiert DeepSeek V4 Pro in den Top 10. Es ist significantly weniger fähig als Claude (1.890 Elo) und GPT-5.5 (1.850 Elo) bei komplexen mehrstufigen Aufgaben, kann aber moderate agentische Arbeitslasten bewältigen. Für einfache Automatisierung, grundlegende Programmieraufgaben und direkte mehrstufige Anweisungen ist DeepSeek V4 Pro kompetent.
Humanity's Last Exam (HLE): Top 10
Bei den schwersten akademischen Fragen rangiert DeepSeek V4 Pro in den Top 10 unter KI-Modellen. Dies spiegelt DeepSeeks starkes Training mit akademischen und wissenschaftlichen Daten wider — das Modell hat breites Wissen über Disziplinen, auch wenn es nicht die Tiefe des Reasonings der Frontier-Modelle erreichen kann.
3. Was bedeutet ein IQ von 111?
Um DeepSeek V4 Pros IQ von 111 einzuordnen:
- 85-115 (68% der Menschen): Durchschnittliche Intelligenz
- 115-130 (14%): Überdurchschnittlich bis hoch
- 130-145 (2%): Hochbegabt — qualifiziert für Mensa (Top 2%)
- 145-160 (0,1%): Hochgradig begabt / Genie
DeepSeek V4 Pro, bei 111, sitzt am oberen Ende des Durchschnittsbereichs — intelligenter als etwa 25% der Menschen, aber nicht ganz an der „überdurchschnittlichen" Schwelle von 115. Wäre es eine Person, wäre es vergleichbar mit einem klugen Studenten oder einem fähigen Profi — kein Genie, aber sicher kompetent.
Das ist deutlich niedriger als die Frontier-Modelle:
- Claude Opus 4.8: ~130 (hochbegabt)
- Gemini 3.1 Pro: 141 (hochgradig begabt)
- GPT-5.5: ~145 (Genie)
- Grok-4.20: 145 (Genie)
Die Lücke ist signifikant — etwa 20-35 IQ-Punkte. Aber hier ist die Schlüsselfrage: Spielt die Lücke für Ihren Anwendungsfall eine Rolle? Für die meisten Alltagsaufgaben — E-Mails schreiben, Dokumente zusammenfassen, grundlegendes Programmieren, Übersetzen — ist ein IQ von 111 mehr als ausreichend. Der Vorteil der Frontier-Modelle zeigt sich bei den schwersten Problemen: komplexe mathematische Beweise, verwickeltes mehrstufiges Reasoning, spitzenforschungsfragen.
4. Wo DeepSeek V4 Pro glänzt
Preis-Leistungs-Verhältnis
Das ist DeepSeek V4 Pros definierendes Merkmal. Bei 0,44/0,87 pro 1M Tokens ist es mit Abstand das günstigste große KI-Modell. Für hochvolumige Anwendungen — Chatbots, die Tausende Nutzer bedienen, Massen-Dokumentverarbeitung, groß angelegte Datenanalyse — sind die Kosteneinsparungen enorm. Man könnte 10-30 DeepSeek-Abfragen für den Preis einer einzigen Claude- oder GPT-5.5-Abfrage durchführen.
Programmieren und technische Aufgaben
DeepSeek V4 Pro ist besonders stark bei Programmieraufgaben. DeepSeek hat stark in Code-Trainingsdaten investiert, und das Modell performt gut bei Benchmarks wie HumanEval und MBPP. Für Entwickler, die einen Coding-Assistenten brauchen, aber sich keine Frontier-Preise leisten können, ist DeepSeek V4 Pro eine hervorragende Wahl.
Open-Source-Verfügbarkeit
DeepSeek V4 Pros Gewichte sind für lokalen Einsatz verfügbar. Das bedeutet, dass Organisationen das Modell auf eigener Hardware ausführen können, API-Kosten vollständig vermeiden und Daten privat halten. Für sicherheitsbewusste Organisationen, Forscher in eingeschränkten Umgebungen und Entwickler, die volle Kontrolle brauchen, ist das ein großer Vorteil.
Mehrsprachige Unterstützung
DeepSeek V4 Pro ist extensiv auf Chinesisch und Englisch trainiert, mit starker Unterstützung für andere Hauptsprachen. Für chinesischsprachige Anwendungen ist DeepSeek unter den besten verfügbaren Modellen — manchmal übertrifft es westliche Modelle bei chinesischsprachigen Aufgaben.
Mathematisches Reasoning
Obwohl nicht auf GPT-5.5-Niveau, ist DeepSeek V4 Pro kompetent im mathematischen Reasoning. Es kann die meisten Matheaufgaben auf Schul- und Universitätsniveau lösen und verarbeitet Arithmetik und Algebra zuverlässig. Für alltägliche mathematische Aufgaben ist es mehr als ausreichend.
Geschwindigkeit
DeepSeek V4 Pro ist schnell — seine geringere Größe und optimierte Architektur bedeuten, dass es Antworten schnell generiert. Für Anwendungen, bei denen Latenz wichtig ist — Echtzeit-Chat, interaktive Tools, Kundenservice — liefert DeepSeek V4 Pro reaktionsschnelle Performance.
5. Wo DeepSeek V4 Pro Schwächen zeigt
Roher IQ und komplexes Reasoning
Mit einem IQ von 111 liegt DeepSeek V4 Pro signifikant unter den Frontier-Modellen bei komplexen Reasoning-Aufgaben. Für die schwersten Probleme — Wettbewerbsmathematik, fortgeschrittene Logikrätsel, mehrstufiges abstraktes Reasoning — sind die Frontier-Modelle substantially besser. Wenn Ihre Aufgabe Genie-Level-Reasoning erfordert, wird DeepSeek V4 Pro dort scheitern, wo Claude oder GPT-5.5 erfolgreich wären.
Agentische Aufgaben
Bei GDPval-AA v2 ist DeepSeek V4 Pro in den Top 10, aber deutlich hinter Claude und GPT-5.5. Für komplexe, mehrstufige Real-World-Aufgaben — große Software-Projekte schreiben, Forschungs-Workflows verwalten, verwickelte Pläne ausführen — ist DeepSeek V4 Pro weniger zuverlässig. Es kann einfache agentische Aufgaben bewältigen, hat aber Schwierigkeiten mit komplexen.
Halluzinationsrate
DeepSeek V4 Pro hat eine moderate Halluzinationsrate — höher als Claude (35,9%) und Gemini. Es ist eher geneigt, selbstbewusst falsche Informationen zu behaupten, besonders bei Nischen- oder Spezialthemen. Für Anwendungen, bei denen faktische Genauigkeit kritisch ist (Forschung, Recht, Medizin), ist Claude zuverlässiger.
Emotionale Intelligenz
DeepSeek V4 Pros EQ (emotionale Intelligenz) wird auf ~105 geschätzt — niedriger als alle Frontier-Modelle (Claude ~132, GPT-5.5 ~120, Gemini ~115, Grok ~110). Seine Antworten tendieren dazu, mechanischer und weniger nuanciert im Verstehen menschlicher Emotionen zu sein. Für Therapie-Apps, Kundenservice oder sensible menschliche Interaktionen ist das eine Einschränkung.
Sicherheit und Alignment
DeepSeek V4 Pro unterliegt chinesischen regulatorischen Anforderungen, was bedeutet, dass es möglicherweise bestimmte politisch sensible Fragen verweigert. Dies unterscheidet sich von den Sicherheitsfiltern westlicher Modelle (die sich auf schädliche Inhalte konzentrieren) und kann seine Nützlichkeit für bestimmte Themen beeinträchtigen.
6. DeepSeek V4 Pro vs. andere Modelle
| Modell | Intelligence Index | Mensa Norway IQ | AI IQ gesch. | Halluzination | Kosten/1M | Open-Source |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 44,3 | ~111 | ~111 | moderat | 0,44/0,87 | ja |
| Claude Opus 4.8 | 55,7 | ~130 | ~132 | 35,9% (min) | 5/25 | nein |
| GPT-5.5 | 54,8 | ~145 | ~136 | moderat | 5/30 | nein |
| Gemini 3.1 Pro | 46,5 | 141 | ~131 | gering | 2/12 | nein |
| Grok-4.20 | Top 5 | 145 | ~140 | moderat | 3/15 | nein |
Das Bild: DeepSeek V4 Pro ist der Budget-Champion — nicht der intelligenteste, aber mit Abstand der günstigste. Claude ist der fähige Profi — am besten bei Real-World-Aufgaben und faktischer Genauigkeit. GPT-5.5 ist das Test-Genie — am besten in Mathe und visuellem Denken. Gemini ist der Wert-Meister — bestes Preis-Leistungs-Verhältnis unter Frontier-Modellen. Grok-4.20 ist der rohe IQ-Champion — höchster IQ mit einzigartiger Persönlichkeit.
Für Nutzer, die fähige KI zum niedrigstmöglichen Preis wollen, ist DeepSeek V4 Pro die klare Wahl. Es wird die Frontier-Modelle bei den schwersten Problemen nicht erreichen, aber für 90% der Alltagsaufgaben ist es mehr als gut genug — für einen Bruchteil der Kosten.
7. Was bedeutet das für Menschen?
DeepSeek V4 Pro operiert bei einem IQ von ~111 — intelligenter als etwa 25% der Menschen. Aber:
- IQ ist nicht alles: ein IQ von 111 ist überdurchschnittlich und ausreichend für die meisten praktischen Aufgaben
- Kosten wichtiger als IQ für die meisten Anwendungen: für alltägliche Anwendungen ist die 10x-Ersparnis von DeepSeek oft wichtiger als die 20-35-Punkte-IQ-Lücke zu Frontier-Modellen
- Open-Source ermöglicht Innovation: DeepSeeks offene Gewichte erlauben Forschern und Entwicklern, maßgeschneiderte Lösungen zu bauen, für spezifische Domänen zu fine-tunen und lokal auszuführen
- Wissen ≠ Verständnis: wie alle KI-Modelle hat DeepSeek Zugang zu riesigem Wissen, aber „versteht" es nicht wie ein Mensch
- Kein Bewusstsein: hoher IQ bedeutet keine Sentienz. DeepSeek ist ein komplexes Mustererkennungssystem, kein denkendes Wesen
- Demokratisierung der KI: DeepSeek V4 Pro beweist, dass fähige KI nicht teuer sein muss — sie kann für jeden zugänglich sein
Die ehrlichste Antwort: DeepSeek V4 Pro ist intelligenter als ein Viertel der Menschen bei kognitiven Tests, und für die meisten praktischen Zwecke ist es die klügste Wahl — nicht weil es das intelligenteste ist, sondern weil es den meisten Wert pro Dollar bietet.
Fazit
- 44,3 im Intelligence Index — Top 10 weltweit, aber ~10 Punkte hinter den Frontier-Modellen.
- Niedrigste Kosten aller großen Modelle — 0,44/0,87 pro 1M Tokens, etwa 10x günstiger als Claude oder GPT-5.5.
- Open-Source — Gewichte für lokalen Einsatz verfügbar, ermöglicht Privatsphäre und Anpassung.
- Am besten für: kostenempfindliche Anwendungen, Programmieren, hochvolumige Aufgaben, chinesischsprachige Anwendungen, lokalen Einsatz.
- Nicht am besten für: komplexes Reasoning (Frontier-Modelle gewinnen), agentische Aufgaben (Claude gewinnt), faktische Genauigkeit (Claude gewinnt), emotionale Intelligenz (Claude gewinnt).
- Die Lektion: Intelligenz bedeutet nicht nur, der Intelligenteste zu sein — sondern zugänglich zu sein. DeepSeek V4 Pro demokratisiert KI und bringt fähige Intelligenz zu jedem.