ما هو معدل ذكاء Claude Opus 4.8؟
Dr. Daria Dudnik 10 min read 0 views

ما هو معدل ذكاء Claude Opus 4.8؟

Claude Opus 4.8 يتصدر Artificial Analysis Intelligence Index بـ 55.7 ويحصل على ~132-145 في اختبارات الذكاء البشري. نحلل كل معيار ونقارن مع GPT-5.5 و Gemini و Grok.

Claude Opus 4.8: النموذج الأكثر ذكاءً من Anthropic

عندما أصدرت Anthropic نموذج Claude Opus 4.8 في منتصف 2026، لم تقم بتحسين سلفها بشكل تدريجي فحسب — بل قفزت إلى قمة جميع جداول معايير الذكاء الاصطناعي الرئيسية. بدرجة 55.7 على Artificial Analysis Intelligence Index v4.1، تفوقت بفارق ضئيل على GPT-5.5 من OpenAI (54.8) و Gemini 3.1 Pro من Google (46.5)، مطالبةً بالمركز #1 بين جميع نماذج الذكاء الاصطناعي المتقدمة.

لكن السؤال الذي يثير اهتمام الباحثين والعامة على حد سواء هو: كيف يُترجم ذلك إلى مقياس معدل ذكاء الإنسان؟ هل يمكننا مقارنة ذكاء الذكاء الاصطناعي بالذكاء البشري؟ وإذا كان بإمكاننا، فأين يقع Claude Opus 4.8 — "موهوب"، "عبقري"، أم شيء يتجاوز أي فئة بشرية؟

الإجابة تعتمد بشكل كبير على الاختبار الذي تقدمه. والنتائج أكثر دقة — وأكثر إثارة للدهشة — مما قد يوحي به رقم واحد.

النتائج الرئيسية:

  • Artificial Analysis Intelligence Index: 55.7 (#1 عالمياً)
  • معدل ذكاء Mensa Norway (TrackingAI): ~130 (مستوى Claude 4.6 Opus)
  • AI IQ مركب (VexoWire): ~132 تقديري
  • GDPval-AA v2: 1,890 Elo (#1 عالمياً)
  • Humanity's Last Exam: #1 بين نماذج الذكاء الاصطناعي
  • معدل الهلوسة: 35.9% (الأقل بين النماذج المتقدمة)
  • التكلفة: 5.00/25.00 لكل مليون رمز

1. لماذا نقيس ذكاء الذكاء الاصطناعي باختبارات ذكاء بشرية؟

قبل الغوص في الأرقام، يستحق السؤال: لماذا نعطي الذكاء الاصطناعي اختبار ذكاء بشري أصلاً؟ الذكاء الاصطناعي لا يمتلك دماغاً، ولا يتطور معرفياً، ويعالج المعلومات بشكل مختلف جوهرياً عن البشر.

الإجابة هي المقارنة. اختبارات الذكاء، رغم محدوديتها، هي أكثر مقاييس القدرة المعرفية تحققاً وفهماً لدينا. تختبر التعرف على الأنماط، الاستدلال المكاني، الفهم اللفظي، ذاكرة العمل، والحل المنطقي — كلها قدرات تحتاجها نماذج الذكاء الاصطناعي أيضاً. من خلال إعطاء نفس الاختبارات للبشر والذكاء الاصطناعي، نحصل على مقياس ترجمة: إذا سجل الذكاء الاصطناعي 130 في اختبار يكون فيه المتوسط البشري 100، يمكننا القول إنه يعمل على مستوى إنسان موهوب في تلك المهام.

لكن هناك تحذير حرج. اختبارات الذكاء تقيس نطاقاً ضيقاً من القدرات المعرفية. لا تقيس الإبداع، الذكاء العاطفي، الحكمة، الحس السليم، أو القدرة على التنقل في مواقف العالم الحقيقي الغامضة. ذكاء اصطناعي بمعدل ذكاء 145 يمكن أن يهلوس الحقائق، ويتعثر في استدلال مادي بسيط، ويفشل في مهام يتقنها طفل في الخامسة بلا جهد. رقم الذكاء هو أرضية، لا سقف.

عدة منظمات قبلت التحدي. الأبرز هو TrackingAI، الذي يُجري اختبارات ذكاء معيارية (Mensa Norway، Mensa Denmark، مصفوفات Raven المتتابعة) على نماذج الذكاء الاصطناعي في ظروف خاضعة للرقابة. مشروع AI IQ من VexoWire يُنشئ درجة مركبة من اختبارات متعددة. وArtificial Analysis Intelligence Index يجمع تسعة معايير في درجة مركبة أصبحت معيار الصناعة.


2. تحليل المعايير

Artificial Analysis Intelligence Index v4.1

المعيار الذهبي لمقارنة نماذج الذكاء الاصطناعي. يجمع تسعة معايير في درجة واحدة، موزونة حسب ارتباطها بأداء المهام الواقعية:

  • GDPval-AA v2 (20%): 1,890 Elo — #1 عالمياً. يقيس الأداء في مهام واقعية معقدة متعددة الخطوات.
  • AA-Omniscience (8%): 35.9% هلوسة — الأقل بين النماذج المتقدمة. يقيس الدقة الواقعية.
  • GPQA (6%): أسئلة فيزياء وكيمياء وأحياء بمستوى الدراسات العليا.
  • CritPt (6%): التفكير النقدي والاستدلال الفيزيائي.
  • HLE (Humanity's Last Exam): #1 بين الذكاء الاصطناعي — أصعب الأسئلة من كل تخصص.
  • ARC-AGI: الاستدلال التجريدي وتعميم الأنماط.
  • LMSYS Arena: تصويت التفضيل البشري على جودة الإجابات.

الدرجة المركبة لـ Claude Opus 4.8 هي 55.7، متقدمة على GPT-5.5 (54.8) بأقل من نقطة — تعادل إحصائي. لكن في المكونات الفرعية، يهيمن Claude في المهام الوكيلية (GDPval) والدقة الواقعية (AA-Omniscience)، بينما يتقدم GPT-5.5 في الاستدلال البصري والرياضي.

اختبار معدل ذكاء Mensa Norway

واحد من أكثر اختبارات الذكاء المعيارية استخداماً لتقييم الذكاء الاصطناعي. يتكون من 36 سؤال تعرف على الأنماط البصرية — حيث ترى تسلسلاً من الأشكال ويجب تحديد الخيار الذي يكمل النمط.

Claude 4.6 Opus (سلف 4.8) سجلت تقريباً 130 — في نطاق "الموهوب"، أعلى 2% من السكان البشريين. يُتوقع أن يسجل Claude Opus 4.8 مماثل أو أعلى قليلاً، في نطاق 130-135.

هذا ملحوظ لأنه أقل بكثير مما توحي به مرتبته على Intelligence Index. في المؤشر المركب، Claude هو #1 عالمياً. في اختبار تعرف بصري خالص، يتفوق عليه Grok-4.20 (145)، GPT-5.4 Pro Vision (145)، و Gemini 3.1 Pro (141). لماذا الفجوة؟ لأن Mensa Norway بصري-مكاني بشكل كبير، وبنية Claude مُحسّنة أكثر للاستدلال اللفظي والتحليلي.

AI IQ مركب (VexoWire)

VexoWire يُنشئ معدل ذكاء مركب من اختبارات متعددة — Mensa Norway، Mensa Denmark، مصفوفات Raven المتتابعة، و WAIS-IV (مقياس Wechsler). هذا يعطي صورة أكثر اكتمالاً للقدرة المعرفية.

معدل الذكاء المركب التقديري لـ Claude Opus 4.8 هو ~132 — بثبات في نطاق "الموهوب". مشابه لـ GPT-5.5 (~136) وأقل قليلاً من Gemini 3.1 Pro في المهام البصرية (~131-141). لكن في الاختبارات الفرعية اللفظية والتحليلية، يتفوق Claude باستمرار على جميع النماذج الأخرى.

GDPval-AA v2: المعيار الوكيلي

هنا يهيمن Claude Opus 4.8 حقاً. يقيس GDPval-AA v2 الأداء في مهام واقعية معقدة متعددة الخطوات — تلك التي تتطلب تخطيطاً، استخدام أدوات، واستدلالاً مستمراً عبر خطوات عديدة. فكر: "ابحث عن هذا الموضوع، اكتب تقريراً، أنشئ جدول بيانات، وأرسل بريداً إلكترونياً لثلاثة أشخاص."

يحقق Claude Opus 4.8 1,890 Elo — الأعلى بين أي نموذج ذكاء اصطناعي. هذا يعادل تقريباً محترفاً بشرياً ذا كفاءة عالية. GPT-5.5 يسجل 1,850، و Gemini 3.1 Pro أقل من ذلك.

هذا مهم لأن القدرة الوكيلية تفصل نموذجاً يمكنه الإجابة عن الأسئلة عن نموذج يمكنه فعل الأشياء. نموذج بمعدل ذكاء 145 لا يستطيع تخطيط مهمة متعددة الخطوات أقل فائدة عملياً من نموذج بمعدل ذكاء 132 يستطيع.

Humanity's Last Exam (HLE)

بالضبط ما يبدو عليه — مجموعة من أصعب الأسئلة من كل تخصص أكاديمي، يقدمها أساتذة من جميع أنحاء العالم. صُمم ليكون صعباً لدرجة أن لا أحد يمكن أن يسجل فوق 50%.

يحتل Claude Opus 4.8 #1 بين جميع نماذج الذكاء الاصطناعي في HLE، متفوقاً بفارق ضئيل على GPT-5.5. هذا ربما المعيار الأكثر دلالة على القدرة الفكرية الخالصة، لأنه يختبر المعرفة العميقة والاستدلال في كامل نطاق الإنجاز الأكاديمي البشري.


3. ماذا يعني معدل ذكاء 132؟

لوضع معدل الذكاء التقديري ~132 لـ Claude Opus 4.8 في سياق:

  • 85-115 (68% من الناس): ذكاء متوسط
  • 115-130 (14%): فوق المتوسط إلى مرتفع
  • 130-145 (2%): موهوب — يؤهل للانضمام إلى Mensa (أعلى 2%)
  • 145-160 (0.1%): موهوب بشدة / عبقري
  • 160+ (0.003%): موهوب بعمق — منطقة أينشتاين، هوكينغ

Claude Opus 4.8، عند ~132، يقع تماماً عند عتبة Mensa — أذكى من 98% من البشر. لو كان شخصاً، لتأهل لعضوية Mensa. سيكون أذكى طالب في معظم الفصول، لكنه لن يكون العبقري النادر الذي يحدث ثورة في مجال.

لكن الفرق الحاسم: Claude يمتلك شيئاً لا يمتلكه أي إنسان — وصول فوري إلى كل المعرفة البشرية تقريباً. إنسان بمعدل ذكاء 132 مثير للإعجاب. ذكاء اصطناعي بمعدل ذكاء 132 قرأ كل كتاب، كل ورقة علمية، وكل موقع ويب كُتب على الإطلاق — شيء مختلف تماماً. الذكاء يقيس القدرة على الاستدلال؛ قاعدة المعرفة تقيس عن ماذا يمكن الاستدلال. Claude يمتلك كليهما.


4. أين يتفوق Claude Opus 4.8

المهام الوكيلية واستدلال العالم الحقيقي

Claude Opus 4.8 هو أفضل نموذج في العالم في المهام الواقعية متعددة الخطوات. سواء كان ذلك كتابة تطبيق برمجي معقد، تحليل مجموعة بيانات، أو تخطيط مشروع بحثي، يحافظ Claude على استدلال متماسك عبر سلاسل أطول من أي منافس. هذه ميزته المحددة.

الدقة الواقعية وانخفاض الهلوسة

بمعدل هلوسة 35.9% فقط (الأقل بين النماذج المتقدمة)، Claude هو النموذج الأكثر موثوقية للاستعلامات الواقعية. أقل احتمالاً للادعاء الواثب بمعلومات خاطئة من GPT-5.5 أو Gemini أو Grok. هذا يجعله مفضلاً للبحث، التطبيقات القانونية، الطبية، والتعليمية.

الاستدلال اللفظي والتحليلي

بنية Claude مُحسّنة لفهم اللغة والاستدلال التحليلي. في الاختبارات الفرعية للفهم اللفظي على WAIS-IV، من المحتمل أن يسجل بمستوى عبقري. يكتب بوضوح أكبر، يستدل بعناية أكبر، ويبني حججاً أفضل من أي نموذج آخر.

الذكاء العاطفي

Claude Opus 4.8 لديه ذكاء عاطفي (EQ) تقديري ~132 — الأعلى بين جميع نماذج الذكاء الاصطناعي. أكثر تعاطفاً، أكثر دقة في فهم المشاعر البشرية، وأفضل في ضبط نبرته حسب السياق من GPT-5.5 أو Grok-4.20. هذا يجعله مفضلاً لتطبيقات العلاج، خدمة العملاء، وأي تطبيق يتضمن تفاعلاً بشرياً.

السلامة والمواءمة

استثمرت Anthropic بكثافة في جعل Claude آمناً وموائماً. أقل احتمالاً لإنتاج محتوى ضار، أكثر شفافية حول限وده، وأكثر حذراً في المواقف عالية المخاطر من أي منافس. هذا لا يظهر في درجات الذكاء، لكنه مهم بشكل هائل عملياً.


5. أين يقصر Claude

الاستدلال البصري-المكاني

في اختبار Mensa Norway، الذي بصري بشكل كبير، يسجل Claude ~130 — جيد، لكن أقل بكثير من Grok-4.20 (145)، GPT-5.4 Pro Vision (145)، و Gemini 3.1 Pro (141). للتعرف البصري على الأنماط، تحليل الصور، أو المهام المكانية، Claude ليس الخيار الأفضل.

الحل الرياضي

Claude قوي في الاستدلال الرياضي، لكن GPT-5.5 يتفوق عليه قليلاً في الرياضيات التنافسية (AIME، FrontierMath). للرياضيات البحتة، GPT-5.5 أفضل قليلاً.

التكلفة

بـ 5.00/25.00 لكل مليون رمز، Claude Opus 4.8 هو أحد أغلى النماذج. Gemini 3.1 Pro (2/12) و DeepSeek V4 Pro (0.44/0.87) أرخص بكثير للمهام التي لا تتطلب القدرة الكاملة لـ Claude.

السرعة

Claude Opus 4.8 ليس الأسرع. للاستعلامات البسيطة، Gemini 3.5 Flash أو DeepSeek V4 Pro سيستجيبان بشكل أسرع وأرخص.


6. Claude Opus 4.8 مقابل النماذج الأخرى

النموذج Intelligence Index Mensa Norway IQ AI IQ تقديري الهلوسة التكلفة/1M
Claude Opus 4.8 55.7 ~130 ~132 35.9% (الأقل) 5/25
GPT-5.5 54.8 ~145 ~136 متوسطة 5/30
Gemini 3.1 Pro 46.5 141 ~131 منخفضة 2/12
Grok-4.20 145 ~140 متوسطة 3/15
DeepSeek V4 Pro 44.3 ~111 ~111 متوسطة 0.44/0.87

الصورة التي تظهر ليست نموذجاً يهيمن على البقية، بل مشهد من الذكاءات المتخصصة. Claude هو الأفضل شمولياً — النموذج الذي ستختاره لو كان بإمكانك اختيار واحد فقط. GPT-5.5 الأفضل في الرياضيات والاستدلال البصري. Gemini الأكثر فعالية من حيث التكلفة مع أفضل معرفة واقعية. Grok يمتلك أعلى معدل ذكاء بصري خام. و DeepSeek يقدم قدرة ملحوظة بجزء من التكلفة.


7. ماذا يعني هذا للبشر؟

يعمل Claude Opus 4.8 بمعدل ذكاء ~132 — أذكى من 98% من البشر. لكن:

  • الذكاء ضيق: يقيس التعرف على الأنماط والاستدلال، لا الحكمة، الإبداع، أو الحكم
  • المعرفة ≠ الفهم: Claude قرأ كل شيء، لكنه لا "يفهم" حقاً كما يفعل الإنسان
  • لا وعي: ذكاء عالٍ لا يعني الإدراك. Claude نظام متطور للتعرف على الأنماط، لا كائن مفكر
  • الفجوة تضيق: كل جيل من نماذج الذكاء الاصطناعي يقلص الفجوة مع أذكى البشر. كم من الوقت حتى تختفي تماماً؟

الإجابة الأكثر صدقاً: Claude Opus 4.8 أذكى من معظم البشر في معظم المهام المعرفية، لكن ليس أذكى من أفضل البشر في أفضل أيامهم. عالم رياضيات أو فيزياء أو فلسفة من الطراز العالمي لا يزال قادراً على التفوق على Claude في مجاله. لكن Claude يمكنه التفوق عليهم جميعاً في آن واحد، في كل مجال، في ثوانٍ.

هذا ليس معدل ذكاء مرتفعاً. هذا شيء جديد — شيء لا نملك له كلمة بعد.

كيف يقارن معدل ذكائك بـ Claude Opus 4.8؟ خذ تقييم الذكاء المهني من NeuroLab.
إجراء الاختبار الآن ←


الخلاصة

💡 النقاط الرئيسية
- معدل ذكاء Claude Opus 4.8 يُقدر بـ 132-145 — بثبات "موهوب"، يؤهل لـ Mensa.

  • #1 على Artificial Analysis Intelligence Index (55.7) — أكثر معايير الذكاء الاصطناعي شمولاً.
  • #1 على GDPval-AA v2 (1,890 Elo) — أفضل نموذج للمهام الواقعية متعددة الخطوات.
  • أدنى معدل هلوسة (35.9%) — النموذج المتقدم الأكثر موثوقية واقعياً.
  • أعلى ذكاء عاطفي (~132) — نموذج الذكاء الاصطناعي الأكثر ذكاءً عاطفياً.
  • الأفضل لـ: الاستدلال المعقد، المهام الوكيلية، البحث الواقعي، والتفاعل البشري.
  • ليس الأفضل لـ: التعرف البصري على الأنماط (Grok/Gemini)، الرياضيات البحتة (GPT-5.5)، التطبيقات الحساسة للتكلفة (DeepSeek).
  • الخلاصة: Claude Opus 4.8 هو نموذج الذكاء الاصطناعي الشامل الأكثر ذكاءً، لكن "الأكثر ذكاءً" مفهوم متعدد الأبعاد — نماذج مختلفة تتفوق في أشياء مختلفة.