رئيس مجلس الإدارة
منذر الخلالي
رئيس التحرير
أحمد رفعت

لأول مرة.. روبوت يقرأ الوجوه ويتحدث بالعربية والصينية مثل البشر|فيديو

روبوت
روبوت

نجح باحثون في تطوير نظام متقدم يمكّن الروبوتات ذات الملامح البشرية من مزامنة حركات الشفاه مع الكلام المنطوق بدقة عالية، مع القدرة على استباق تعابير الوجه قبل اكتمالها، في خطوة تقرّب الروبوتات أكثر من السلوك الإنساني الطبيعي.

 

ووفق فريق بحثي من جامعة كولومبيا، يعتمد النظام الجديد على نموذج عكسي محسَّن قادر على توليد أوامر الحركة بسرعة تفوق النماذج التقليدية بنحو خمس مرات، ما يسمح باستجابات آنية شبه فورية، تحاكي التفاعل البشري المباشر بدل التقليد المتأخر الذي يميز معظم الروبوتات الحالية.

ونتج عن اختبارات أُجريت على أكثر من 45 مشاركاً تفوق النظام الجديد على خمسة نماذج معتمدة حالياً، محققاً أعلى مستويات التطابق بين حركة فم الروبوت والنماذج المرجعية المثالية، وفق ما أورده موقع «إنترستنغ إنجنيرنغ».

 

تعدد لغوي دون تدريب مسبق

 

وأبرز جوانب هذا الابتكار يتمثل في قدرته على التعميم اللغوي، إذ لم يقتصر أداؤه على لغة واحدة، فقد أظهر النظام كفاءة عالية في مزامنة الشفاه عبر لغات متعددة، من بينها العربية والفرنسية والصينية، حتى عندما لم تكن هذه اللغات ضمن بيانات التدريب الأصلية.

 

وأكد الباحثون أن الإطار الجديد قادر على توليد حركات شفاه واقعية عبر 11 لغة غير إنجليزية ذات أنظمة صوتية مختلفة، ما يفتح آفاقاً واسعة لاستخدام الروبوتات في التعليم، وخدمات الدعم الاجتماعي، ورعاية المسنين، مع التأكيد على ضرورة التعامل الأخلاقي والحذر مع هذه القدرات المتقدمة.

من التفاعل المتأخر إلى الاستجابة الاستباقية

 

معظم الروبوتات الحالية تعاني من تأخر في الاستجابة، حيث تحاكي تعابير الوجه بعد حدوثها، ما يمنح التواصل طابعاً آلياً مصطنعاً، في المقابل، يركز النظام الجديد على التنبؤ بالتعبيرات قبل اكتمالها، وهو عنصر أساسي لبناء تفاعل طبيعي يعزز الثقة، خاصة في الابتسامات وتعابير الوجه الاجتماعية.

 

«إيمو».. وجه آلي أكثر تعبيراً

 

وفي هذا الإطار، قدّم الباحثون روبوتاً وجهياً متطوراً يحمل اسم «إيمو»، يُعد نسخة محسّنة من المنصة السابقة «إيفا». وتم تزويده بـ 26 مشغّلاً حركياً تتيح إنتاج تعابير غير متناظرة، مقارنة بـ10 فقط في النموذج السابق.

 

الروبوت يعتمد على نظام مغناطيسي مباشر لتشكيل جلد مرن قابل للاستبدال، إضافة إلى كاميرات RGB عالية الدقة مدمجة في العينين، تمنحه قدرة متقدمة على الإدراك البصري اللحظي.

 

سرعة قياسية ودقة تنبؤية

وتم تدريب النموذج التنبؤي على 970 مقطع فيديو، ويعمل بسرعة تصل إلى 650 إطاراً في الثانية، بينما ينفّذ النموذج العكسي أوامر الحركة بسرعة 8000 إطار في الثانية، ما يسمح بتوليد التعابير خلال 0.002 ثانية فقط. ونجح النظام في التنبؤ الصحيح بتفعيل التعابير في أكثر من 72% من الحالات.

 

وبالرغم من التحديات الثقافية المرتبطة باختلاف أنماط التعبير بين المجتمعات، يرى الباحثون أن الانتقال من تقليد التعابير إلى استباقها يمثل خطوة حاسمة نحو روبوتات اجتماعية أكثر فهماً وواقعية.

تم نسخ الرابط
برنامج في المساء مع قصواء