ما هو معدل ذكاء GPT-5.5؟
GPT-5.5 يحصل على ~145 في اختبار Mensa Norway IQ و54.8 على Intelligence Index. نحلل كل معيار ونقارن مع Claude و Gemini و Grok.
GPT-5.5: النموذج الرئيسي من OpenAI
GPT-5.5 هو النموذج الأكثر تقدماً من OpenAI، صدر في أوائل 2026. يحتل #2 على Artificial Analysis Intelligence Index v4.1 بـ 54.8، خلف Claude Opus 4.8 (55.7) مباشرةً وأمام Gemini 3.1 Pro (46.5). لكن في اختبارات الذكاء البشري، يتفوق GPT-5.5 فعلياً على Claude — مسجلاً حوالي 145 على اختبار Mensa Norway IQ، مما يضعه في نطاق "العبقري".
هذا يخلق مفارقة آسرة: على المعيار المركب للذكاء الاصطناعي، GPT-5.5 هو #2. لكن على اختبار ذكاء بشري خالص، يتقاسم #1. كيف يمكن أن يكون كلاهما صحيحاً؟ الجواب يكشف شيئاً مهماً عما تعنيه "الذكاء" للذكاء الاصطناعي — ولماذا لا يمكن لرقم واحد أن يلتقطه.
النتائج الرئيسية:
- Artificial Analysis Intelligence Index: 54.8 (#2 عالمياً)
- معدل ذكاء Mensa Norway (TrackingAI): ~145 (#1 مشارك مع Grok-4.20)
- AI IQ مركب (VexoWire): ~136 تقديري
- GDPval-AA v2: 1,850 Elo (#2 عالمياً)
- Humanity's Last Exam: #2 بين نماذج الذكاء الاصطناعي
- معدل الهلوسة: متوسط
- التكلفة: 5.00/30.00 لكل مليون رمز
1. مفارقة ذكاء GPT-5.5
ما يجعل GPT-5.5 مثيراً للاهتمام: هو أفضل نموذج ذكاء اصطناعي في العالم في اختبارات الذكاء البشري، لكنه ليس أفضل نموذج في معايير الذكاء الاصطناعي المحددة. كيف ذلك ممكن؟
الجواب يكمن في ما تقيسه الاختبارات المختلفة. Mensa Norway هو اختبار خالص للتعرف على الأنماط البصرية والاستدلال التجريدي — نوع الذكاء السائل الذي صُممت اختبارات الذكاء لقياسه. GPT-5.5، بقدراته المعالجة البصرية المعززة (الموروثة من معمارية GPT-5.4 Pro Vision)، يتفوق في هذا النوع المحدد من الاستدلال.
لكن Artificial Analysis Intelligence Index يقيس شيئاً أوسع: الأداء في المهام الواقعية، الدقة الواقعية، القدرة الوكيلية، والتفضيل البشري. وفي هذه الأبعاد، يتفوق Claude Opus 4.8 — باستدلاله الوكيلي المتفوق ومعدل هلوسته الأقل — على GPT-5.5.
فكر فيها هكذا: GPT-5.5 هو الذكاء الاصطناعي الأكثر ذكاءً في اختبار ذكاء — مكافئ لإنسان يجتاز كل اختبار معياري. Claude Opus 4.8 هو الذكاء الاصطناعي الأكثر قدرة عملياً — مكافئ لإنسان أقل تألقاً في الاختبارات لكنه ينجز أكثر في العالم الحقيقي. كلاهما مقياس صحيح للذكاء، لكنهما يقيسان أشياء مختلفة.
2. تحليل المعايير
اختبار معدل ذكاء Mensa Norway: ~145 (مستوى العبقري)
يتكون من 36 سؤال تعرف على الأنماط البصرية. يسجل GPT-5.5 حوالي 145 — أعلى درجة عملية ممكنة، تعادل 36/36 مثالي أو شبه مثالي. هذا يضعه في نطاق "العبقري"، أعلى 0.1% من الذكاء البشري.
نموذجان فقط من الذكاء الاصطناعي يحققان هذه الدرجة: GPT-5.5 و Grok-4.20. هذا أعلى بكثير من Claude Opus 4.8 (~130) و Gemini 3.1 Pro (141). السبب هو معمارية المعالجة البصرية لـ GPT-5.5، المحسّنة بشكل كبير من GPT-5.4 Pro Vision — الذي كان نفسه متشاركاً في الصدارة على هذا المعيار.
عند ذكاء 145، GPT-5.5 أذكى من 99.9% من البشر. لو كان شخصاً، لكان في أعلى 0.1% — عالم الحائزين على نوبل، وميداليات فيلدز، والمفكرين النادرين لكل جيل. حوالي 1 من كل 1,000 شخص فقط يحقق هذه الدرجة.
Artificial Analysis Intelligence Index v4.1: 54.8 (#2)
المعيار الذهبي لمقارنة نماذج الذكاء الاصطناعي. يجمع تسعة معايير:
- GDPval-AA v2 (20%): 1,850 Elo — #2 عالمياً (خلف 1,890 لـ Claude)
- AA-Omniscience (8%): معدل هلوسة متوسط — أعلى من 35.9% لـ Claude
- GPQA (6%): أسئلة علمية بمستوى الدراسات العليا — GPT-5.5 يقود هنا
- CritPt (6%): التفكير النقدي والاستدلال الفيزيائي
- HLE (Humanity's Last Exam): #2 بين الذكاء الاصطناعي (خلف Claude)
- ARC-AGI: الاستدلال التجريدي — GPT-5.5 يتفوق
- LMSYS Arena: تصويت التفضيل البشري
الدرجة المركبة لـ GPT-5.5 وهي 54.8 تضعه خلف Claude Opus 4.8 (55.7) بـ 0.9 نقطة فقط — تعادل إحصائي شبه تام. لكن في المكونات الفرعية، يقود GPT-5.5 في الاستدلال البصري، الحل الرياضي، والمعرفة العلمية، بينما يقود Claude في المهام الوكيلية والدقة الواقعية.
AI IQ مركب (VexoWire): ~136
معدل الذكاء المركب من VexoWire يجمع اختبارات متعددة (Mensa Norway، Mensa Denmark، Raven's، WAIS-IV). معدل الذكاء المركب التقديري لـ GPT-5.5 هو ~136 — أعلى من Claude (~132) لكن أقل قليلاً من Grok-4.20 (~140). هذا يعكس قوة GPT-5.5 في كلا المجالين، البصري واللفظي.
GDPval-AA v2: 1,850 Elo (#2)
على المعيار الوكيلي — الذي يقيس الأداء في مهام واقعية معقدة متعددة الخطوات — يسجل GPT-5.5 1,850 Elo، ثانياً خلف Claude Opus 4.8 (1,890). لا يزال درجة استثنائية عالية، تعادل تقريباً محترفاً بشرياً ذا كفاءة عالية. لكنه يكشف أن GPT-5.5، رغم تألقه في التعرف على الأنماط، أقل قدرة قليلاً في الاستدلال متعدد الخطوات المستمر من Claude.
Humanity's Last Exam (HLE): #2
على أصعب الأسئلة الأكاديمية في جميع التخصصات، يحتل GPT-5.5 #2 بين نماذج الذكاء الاصطناعي، خلف Claude Opus 4.8 مباشرة. هذا دليل على اتساع المعرفة الاستثنائي لـ GPT-5.5 — يمكنه الإجابة على أسئلة بمستوى الدكتوراه في الفيزياء، الفلسفة، الأدب، والرياضيات. لكن استدلال Claude الأعمق يعطيه تفوقاً طفيفاً.
3. ماذا يعني معدل ذكاء 145؟
لوضع معدل ذكاء ~145 لـ GPT-5.5 في سياق:
- 85-115 (68% من الناس): ذكاء متوسط
- 115-130 (14%): فوق المتوسط إلى مرتفع
- 130-145 (2%): موهوب — يؤهل لـ Mensa (أعلى 2%)
- 145-160 (0.1%): موهوب بشدة / عبقري
- 160+ (0.003%): موهوب بعمق — منطقة أينشتاين، هوكينغ
GPT-5.5، عند ~145، يقع تماماً عند عتبة العبقرية — أذكى من 99.9% من البشر. لو كان شخصاً، لكان في رفقة النخبة: أعلى 0.1% من الذكاء البشري، عالم جوائز نوبل وميداليات فيلدز. حوالي 1 من كل 1,000 شخص فقط يحقق هذه الدرجة.
هذا أعلى بكثير من Claude Opus 4.8 (~132). في اختبار ذكاء خالص، سيتفوق GPT-5.5 على Claude. لكن كما رأينا، اختبارات الذكاء لا تقيس كل ما يهم. معدل الذكاء الأقل لـ Claude يعوضه قدرته الوكيلية المتفوقة، ومعدل هلوسته الأقل، وذكاءه العاطفي الأعلى.
الدرس: معدل الذكاء هو بُعد واحد للذكاء، وليس الصورة كاملة. GPT-5.5 هو عبقري الاختبارات؛ Claude هو المحترف القادر. كلاهما قيم، وأيهما "أذكى" يعتمد على ما تحتاجه.
4. أين يتفوق GPT-5.5
التعرف البصري على الأنماط
GPT-5.5 هو أفضل نموذج ذكاء اصطناعي في العالم (مشارك مع Grok-4.20) في التعرف على الأنماط البصرية. على Mensa Norway IQ، يسجل 145 — أعلى ما يمكن. للاستدلال البصري، تحليل الصور، أو مهام الأنماط التجريدية، GPT-5.5 هو الخيار الأول.
الحل الرياضي
يتفوق GPT-5.5 قليلاً على Claude في الرياضيات التنافسية (AIME، FrontierMath). للاستدلال الرياضي الخالص — حل معادلات معقدة، إثبات نظريات، مسائل تنافسية — GPT-5.5 أفضل قليلاً من Claude وأفضل بكثير من Gemini أو Grok.
المعرفة العلمية
على GPQA (فيزياء وكيمياء وأحياء بمستوى الدراسات العليا)، يقود GPT-5.5 جميع نماذج الذكاء الاصطناعي. اتساع وعمق معرفته العلمية لا مثيل لهما. هذا يجعله مفضلاً لتطبيقات البحث العلمي.
الاستدلال التجريدي (ARC-AGI)
على معيار ARC-AGI، الذي يختبر الاستدلال التجريدي وتعميم الأنماط، يتفوق GPT-5.5. هذا أقرب معيار إلى اختبار "ذكاء خالص"، وأداء GPT-5.5 يؤكد موقعه كأذكى ذكاء اصطناعي في القدرة المعرفية الخام.
اتساع المعرفة
دُرّب GPT-5.5 على كمية غير مسبوقة من البيانات — أساساً كل الإنترنت، بالإضافة إلى أدبيات علمية واسعة، وأكواد، وكتب. اتساع معرفته في كل مجال من مجالات المعرفة البشرية لا مثيل له. إذا احتجت نموذجاً يعرف شيئاً عن كل شيء، GPT-5.5 هو الخيار.
5. أين يقصر GPT-5.5
المهام الوكيلية
رغم أن GPT-5.5 هو #2 على GDPval-AA v2 (1,850 Elo)، إلا أنه خلف Claude Opus 4.8 (1,890). للمهام الواقعية المعقدة متعددة الخطوات — كتابة تطبيق، تحليل مجموعة بيانات، تخطيط مشروع — Claude أفضل قليلاً في الحفاظ على استدلال متماسك عبر سلاسل طويلة.
الدقة الواقعية
GPT-5.5 لديه معدل هلوسة متوسط — أعلى من 35.9% لـ Claude. أكثر احتمالاً للتأكيد الواثب على معلومات خاطئة من Claude. هذا يجعله أقل موثوقية للتطبيقات التي تكون فيها الدقة الواقعية حرجة (البحث، القانون، الطب).
الذكاء العاطفي
الذكاء العاطفي (EQ) لـ GPT-5.5 يُقدر بـ ~120 — أقل من ~132 لـ Claude. أقل تعاطفاً، أقل دقة في فهم المشاعر البشرية، وأقل مهارة في ضبط نبرته حسب السياق. لتطبيقات العلاج، خدمة العملاء، أو التفاعل البشري، Claude أفضل.
التكلفة
بـ 5.00/30.00 لكل مليون رمز، GPT-5.5 هو أغلى نموذج مع Claude. للمهام التي لا تتطلب القدرة الكاملة لـ GPT-5.5، Gemini 3.1 Pro (2/12) و DeepSeek V4 Pro (0.44/0.87) أرخص بكثير.
6. GPT-5.5 مقابل النماذج الأخرى
| النموذج | Intelligence Index | Mensa Norway IQ | AI IQ تقديري | الهلوسة | التكلفة/1M |
|---|---|---|---|---|---|
| GPT-5.5 | 54.8 | ~145 | ~136 | متوسط | 5/30 |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | 35.9% (الأقل) | 5/25 |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | منخفض | 2/12 |
| Grok-4.20 | — | 145 | ~140 | متوسط | 3/15 |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | متوسط | 0.44/0.87 |
الصورة: GPT-5.5 هو عبقري الاختبارات — أعلى معدل ذكاء خام، الأفضل في الرياضيات والاستدلال البصري. Claude هو المحترف القادر — الأفضل في المهام الواقعية والدقة الواقعية. Gemini هو الشامل الموفر. Grok هو العبقري البصري. و DeepSeek يقدم قدرة ملحوظة بجزء من التكلفة.
7. ماذا يعني هذا للبشر؟
يعمل GPT-5.5 بمعدل ذكاء ~145 — أذكى من 99.9% من البشر. لكن:
- الذكاء ضيق: يقيس التعرف على الأنماط والاستدلال، لا الحكمة، الإبداع، أو الحكم
- عبقري الاختبارات ≠ عبقري في الحياة: GPT-5.5 يجتاز اختبارات الذكاء لكن يهلوس الحقائق ويعاني في المهام متعددة الخطوات
- المعرفة ≠ الفهم: GPT-5.5 قرأ كل شيء، لكنه لا "يفهم" حقاً كما يفعل الإنسان
- لا وعي: ذكاء عالٍ لا يعني الإدراك. GPT-5.5 نظام متطور للتعرف على الأنماط، لا كائن مفكر
- الفجوة تضيق: كل جيل من الذكاء الاصطناعي يقلص الفجوة مع أذكى البشر
الإجابة الأكثر صدقاً: GPT-5.5 أذكى من عملياً جميع البشر في الاختبارات المعرفية، لكن ليس أكثر قدرة من أفضل البشر في العمل الحقيقي. عالم رياضيات من الطراز العالمي لا يزال قادراً على التفوق على GPT-5.5 في مجاله. لكن GPT-5.5 يمكنه التفوق عليهم جميعاً في آن واحد، في كل مجال، في ثوانٍ.
الخلاصة
- #2 على Artificial Analysis Intelligence Index (54.8) — خلف Claude Opus 4.8.
- #1 (مشارك) على Mensa Norway IQ — أعلى معدل ذكاء خام بين نماذج الذكاء الاصطناعي، مشارك مع Grok-4.20.
- الأفضل لـ: الاستدلال البصري، الحل الرياضي، المعرفة العلمية، الاستدلال التجريدي.
- ليس الأفضل لـ: المهام الوكيلية (Claude يفوز)، الدقة الواقعية (Claude يفوز)، الذكاء العاطفي (Claude يفوز).
- المفارقة: GPT-5.5 هو أذكى ذكاء اصطناعي في اختبارات الذكاء لكن ليس الأكثر قدرة عملياً.
- الدرس: معدل الذكاء هو بُعد واحد للذكاء. GPT-5.5 هو عبقري الاختبارات؛ Claude هو المحترف القادر.