رئيس مجلس الإدارة
منذر الخلالي
رئيس التحرير
أحمد رفعت

دراسة تزعم: قدرات الذكاء الاصطناعي مبالغ فيها بسبب الاختبارات الخاطئة

الذكاء الاصطناعي
الذكاء الاصطناعي

زعمت دراسة جديدة أن الأساليب المستخدمة لتقييم قدرات أنظمة الذكاء الاصطناعي مبالغ فيها خاصة في تقييم الأداء، وتفتقر إلى الدقة العلمية.

وتقول الدراسة، إن عددًا كبيرًا من معايير المستوى الأعلى تفشل في تحديد ما تهدف إلى اختباره على وجه التحديد، وإعادة استخدام البيانات وطرق الاختبار من معايير موجودة مسبقًا، ونادرًا ما تستخدم أساليب إحصائية موثوقة لمقارنة النتائج بين النماذج.

وفقا لموقع “nbcnews”، قامت الدراسة، التي أجراها باحثون في معهد أكسفورد للإنترنت بالشراكة مع أكثر من ثلاثين باحثًا من مؤسسات أخرى، بفحص 445 اختبارًا رائدًا للذكاء الاصطناعي، تسمى معايير القياس، والتي تُستخدم غالبًا لقياس أداء نماذج الذكاء الاصطناعي عبر مجموعة متنوعة من مجالات الموضوع.

الاختبارات الأساسية قد تكون خاطئة

 

يستخدم مطورو وباحثو الذكاء الاصطناعي هذه المعايير لتقييم قدرات النماذج والترويج للتقدم التقني ، ويستندون إليها لتقديم ادعاءات حول مواضيع تتراوح من أداء هندسة البرمجيات إلى القدرة على التفكير المجرد، مع ذلك، تزعم الورقة البحثية، أن هذه الاختبارات الأساسية قد لا تكون موثوقة، وتشكك في صحة العديد من نتائج المعايير.

يقول آدم مهدي، وهو باحث بارز في معهد أكسفورد للإنترنت ومؤلف رئيسي للدراسة، إن هذه المعايير قد تكون مضللة بشكل مثير للقلق: "عندما نطلب من نماذج الذكاء الاصطناعي أداء مهام معينة، فإننا غالبًا ما نقيس مفاهيم أو مفاهيم مختلفة تمامًا عما نهدف إلى قياسه".

واتفق أندرو بين، الباحث في معهد أكسفورد للإنترنت والمؤلف الرئيسي الآخر للدراسة، على أن المعايير ذات السمعة الطيبة غالبًا ما تكون موضع ثقة عمياء وتستحق المزيد من التدقيق.

 

قال بين: "يجب أن نأخذ الأمر بحذر شديد عندما نسمع عبارات مثل "نموذج يحصل على درجة الدكتوراه في الذكاء". لسنا متأكدين من أن هذه القياسات تُجرى بكفاءة عالية".

 

وتقيس بعض المعايير التي تم فحصها في التحليل مهارات محددة، مثل قدرات اللغة الروسية أو العربية، في حين تقيس معايير أخرى قدرات أكثر عمومية، مثل التفكير المكاني والتعلم المستمر.

 

صلاحية البناء

 

كانت إحدى المسائل الجوهرية التي واجهها المؤلفون هي ما إذا كان معيار التقييم يُمثل اختبارًا جيدًا للظاهرة الواقعية التي يهدف إلى قياسها، أو ما يُطلق عليه المؤلفون "صلاحية البناء"، فبدلًا من اختبار نموذج على سلسلة لا نهاية لها من الأسئلة لتقييم قدرته على التحدث باللغة الروسية، على سبيل المثال، يقيس أحد معايير التقييم التي تمت مراجعتها في الدراسة أداء النموذج في تسع مهام مختلفة، مثل الإجابة على أسئلة بنعم أو لا باستخدام معلومات مستمدة من ويكيبيديا باللغة الروسية.

 

ومع ذلك، فإن ما يقرب من نصف المعايير التي تمت دراستها في الدراسة فشلت في تحديد المفاهيم التي تدعي قياسها بشكل واضح، مما يلقي بظلال من الشك على قدرة المعايير على تقديم معلومات مفيدة حول نماذج الذكاء الاصطناعي التي يتم اختبارها.

 

على سبيل المثال، يعرض المؤلفون في الدراسة معيارًا شائعًا للذكاء الاصطناعي يُسمى Grade School Math 8K (GSM8K)، والذي يقيس الأداء في مجموعة من أسئلة الرياضيات الأساسية، غالبًا ما يشير المراقبون إلى قوائم المتصدرين في معيار GSM8K لإظهار قدرة نماذج الذكاء الاصطناعي العالية على التفكير الرياضي الأساسي، وتشير وثائق المعيار إلى أنه "مفيد لاختبار قدرة التفكير غير الرسمي لنماذج اللغات الكبيرة".

 


قال بين بأن قياس المفاهيم الغامضة، مثل التفكير المنطقي، يتطلب تقييم مجموعة فرعية من المهام، وأن هذا الاختيار سيكون بالضرورة غير كامل، وقال: "هناك العديد من العناصر المتغيرة في هذه التقييمات، وتحقيقها جميعًا يتطلب التوازن، لكن هذه الورقة البحثية تدعو إلى وضع معايير مرجعية تُحدد بوضوح ما تهدف إلى قياسه".

 

وأضاف بين: "فيما يتعلق بمفاهيم مثل عدم الإضرار أو الاستدلال، فإن الناس في كثير من الأحيان يستخدمون الكلمة فقط لاختيار شيء يقع بالقرب من الفئة التي يمكنهم قياسها ويقولون، "رائع، لقد قمت بقياسه الآن"،".

 

في العام الماضي، دعا باحثون من شركة الذكاء الاصطناعي Anthropic إلى زيادة الاختبارات الإحصائية لتحديد ما إذا كان أداء النموذج على معيار محدد أظهر بالفعل فرقًا في القدرات أم أنه كان مجرد نتيجة محظوظة بالنظر إلى المهام والأسئلة المدرجة في المعيار.

وفي محاولة لزيادة فائدة ودقة المعايير المرجعية، اقترحت عدة مجموعات بحثية مؤخراً سلسلة جديدة من الاختبارات التي تقيس بشكل أفضل أداء النماذج في العالم الحقيقي في المهام ذات المغزى الاقتصادي.

 

في أواخر سبتمبر، أصدرت OpenAI سلسلة جديدة من الاختبارات لتقييم أداء الذكاء الاصطناعي في المهام المطلوبة لـ 44 مهنة مختلفة، في محاولة لتعزيز مزاعم قدراته في العالم الواقعي، على سبيل المثال، تقيس الاختبارات قدرة الذكاء الاصطناعي على تصحيح التناقضات في فواتير العملاء وجداول بيانات Excel لوظيفة محلل مبيعات افتراضية، أو قدرة الذكاء الاصطناعي على إنشاء جدول إنتاج كامل لتصوير فيديو مدته 60 ثانية لمنتج فيديو افتراضي.

تم نسخ الرابط
برنامج في المساء مع قصواء