رئيس مجلس الإدارة
منذر الخلالي
رئيس التحرير
أحمد رفعت

3 أشياء يتفوق فيها "ChatGPT" على "Gemini".. تعرف عليها

 ChatGPT و Gemini
"ChatGPT" و "Gemini"

يوجد عشرات الآلاف من منتجات الذكاء الاصطناعي المختلفة، مع أن معظمنا لم يسمع إلا بالقليل منها، إلا إن مقارنة اثنين من أكبر أنظمة الذكاء الاصطناعي - ChatGPT و Gemini - ليست بالأمر الهين، فالأمور تتغير بشكل سريع، في ديسمبر 2025، كان الناس يتساءلون عما إذا كانت OpenAI تخسر سباق الذكاء الاصطناعي، ثم بعد ذلك، أطلقت ChatGPT-5.2 وعادت لتتصدر قوائم المتصدرين. 

 

وفقا لموقع "slashgear"، توجد معايير قياس متنوعة تختبر أنظمة الذكاء الاصطناعي في مجالات مثل الاستدلال والمنطق وحل المشكلات، وفي السطور التالية سنتناول ثلاثة من أهم هذه المعايير التي يُظهر فيها ChatGPT أداءً جيدًا.

 

الإجابة عن أسئلة عملية صعبة 

أول معيار هو اختبار GPQA Diamond، صُمم هذا الاختبار لقياس مهارات التفكير المنطقي على مستوى الدكتوراه في الفيزياء والكيمياء والأحياء، يرمز GPQA إلى "أسئلة وأجوبة قابلة للبحث عبر جوجل"، يوجد اختبار عادي واختبار "Diamond" الذي يحتوي على أسئلة بالغة الصعوبة، وكونها قابلة للبحث عبر جوجل يعني أنها ليست مجرد أسئلة ذات إجابة بسيطة يمكن البحث عنها، بل تتطلب مهارات تفكير منطقي معقدة. 

 

يحقق كل من ChatGPT وGemini نتائج مرتفعة في الاختبار، مع تفوق ChatGPT بفارق أقل من 1%، حيث سجل GPT-5.2 نسبة 92.4% مقابل 91.9% لـ Gemini 3 Pro.

 

حل مشاكل البرمجة في العالم الحقيقي

بغض النظر عن رأيك في برمجة الذكاء الاصطناعي والمخاطر الأمنية التي تنطوي عليها، فإن القدرة على إصلاح الأخطاء وحل مشكلات البرمجيات الأخرى تُعد مهارة أساسية لأنظمة الذكاء الاصطناعي الحديثة، تأتي معايير SWE-Bench بأنواع مختلفة، مع إصدارات متعددة مصممة لاختبار جوانب مختلفة من هندسة البرمجيات، الإصدار الذي يتفوق فيه ChatGPT على منافسيه هو  SWE-Bench Pro.

يقيّم برنامج SWE-Bench Pro قدرة نظام الذكاء الاصطناعي على حل مهام هندسة برمجيات حقيقية مستمدة من مشكلات فعلية على منصة GitHub للمطورين، تتطلب كل مهمة فهم قاعدة بيانات غير مألوفة، وتفسير الغرض من تقرير الخطأ، وإجراء التعديلات المناسبة، وتقديم حل عملي، مجموعة البيانات الخاصة غير متاحة للعامة، مما يجعل الأمر أكثر صعوبة من مجموعة البيانات العامة.

 

تُظهر النتائج أن ChatGPT-5.2 حل حوالي 24% من المشكلات، بينما لم يحل Gemini سوى 18% منها، وإذا بدت هذه الأرقام غير مُرضية، فذلك لأن هذا الاختبار هو الأصعب في اختبارات SWE-Bench، في اختبارات قياس الأداء البرمجية الأبسط، تُصلح أنظمة الذكاء الاصطناعي حوالي 75% من المشكلات، وللمقارنة، فقد حل البشر جميع تحديات هندسة مجموعات البيانات الخاصة هذه، ويُعد وجود حل معروف وفعال أحد معايير كل مهمة في الاختبار، لذا، لا يزال أمام الذكاء الاصطناعي طريق طويل ليقطعه قبل أن يُضاهي مهارات خبراء هندسة البرمجيات البشريين.


حل الألغاز البصرية المجردة

هناك معيار لاختبار هذا النوع من الاستدلال البصري البديهي، تم ابتكار اختبار ARC-AGI الأصلي في عام 2019، قبل ظهور نماذج التعلم المحدود (LLMs)، وكان مصممًا "لقياس شكل من أشكال الذكاء السائل العام الشبيه بالذكاء البشري"، أما ARC-AGI-2 فهو نسخة محدثة أُطلقت في مارس 2025، وهو مصمم لتقييم قدرة الذكاء الاصطناعي على تطبيق الاستدلال المجرد على تحديات غير مألوفة، يحتاج الذكاء الاصطناعي إلى استخلاص نمط أساسي من عدد قليل من الأمثلة، ثم تطبيقه بشكل صحيح على مثال جديد، غالبًا ما تتطلب هذه المهام تحديد جوانب المشكلة ذات الصلة وتجاهل أي عوامل تشتيت، والأهم من ذلك، أن هذا شيء يتقنه البشر عمومًا، بينما لا يزال الذكاء الاصطناعي يكافح لإيجاد الإجابة الصحيحة. 

 

في اختبار ARC-AGI-2، حقق ChatGPT-5.2 Pro نسبة 54.2%، وظهر Gemini عدة مرات في القائمة، حققت نسخة محسنة منه نسبة 54%، بينما حقق Gemini 3 Deep Think نسبة 45.1%، مع ذلك، لم يحقق Gemini 3 Pro سوى 31.1%، وهي نسبة أقل بكثير من ChatGPT، هذا النموذج مشابه لـ ChatGPT-5.2 Pro.

تم نسخ الرابط
برنامج في المساء مع قصواء