أحدث الدراسات عن استنساخ الصوت بالذكاء الاصطناعي.. تقدم علمي مقابل انتهاك الخصوصية
أحدثت تقنيات استنساخ الصوت بالذكاء الاصطناعي طفرة غير مسبوقة، وأصبح بالإمكان توليد أصوات تكاد تطابق البشر بكل تفاصيلها الدقيقة، من النبرة إلى الانفعال وحتى التنفس الطبيعي.
ورغم أن هذه الثورة التكنولوجية فتحت آفاقًا جديدة في التعليم والإعلام والترفيه، فإنها أثارت في المقابل أسئلة جوهرية حول الخصوصية، والأمان الرقمي، وحدود التضليل الصوتي.
وفي هذا السياق رصد «إيجبتك EgyptKE» أحدث الدراسات الدولية التي تناولت ظاهرة استنساخ الصوت بالذكاء الاصطناعي من زوايا علمية وتقنية متقدمة..
الناس غير مجهزين لاكتشاف الأصوات المستنسخة
جامعة كاليفورنيا في بيركلي (UC Berkeley)
أجرت جامعة كاليفورنيا في بيركلي UC Berkeley دراسة بعنوان du: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes (الناس غير مجهزين جيدًا لاكتشاف الأصوات المستنسخة بالذكاء الاصطناعي)، ونشرتها في مجلة Scientific Reports عام 2025.
وعرضت على عينة الدراسة تسجيلات أصلية وأخرى مستنسخة بالذكاء الاصطناعي، وكانت النتيجة أن 20٪ فقط نجحوا في التمييز بينها.
وتوصلت إلى أن البشر غالبًا ما يكونون غير قادرين على التمييز بين الصوت البشري الحقيقي والصوت المستنسخ.
وخلصت إلى أن هناك حاجة ملحة لتطوير أدوات كشف متقدمة، وأنه لا يمكن الاعتماد على التقييم البشري وحده في التحقق من الأصوات المستنسخة.
وأوصت الدراسة بالاستفادة من هذا الاكتشاف للباحثين والمؤسسات الإعلامية في تحسين أنظمة الكشف وحماية الهوية الصوتية للأفراد.

الأصوات المستنسخة واقعية لكنها ليست «فائقة الواقعية» بعد
جامعة كوين ماري - لندن
ركزت الدراسة، التي أجرتها جامعة كوين ماري بعنوان Voice clones sound realistic but not (yet) hyperrealistic (الأصوات المستنسخة تبدو واقعية، لكنها ليست (بعد) واقعية مفرطة)، ونشرتها في مجلة PLOS One بتاريخ 24 سبتمبر 2025، على مستوى المطابقة الدقيقة للصوت البشري، وأظهرت نتائجها أن بعض الأصوات المستنسخة بالذكاء الاصطناعي يمكن أن تكون أكثر وضوحًا وهيمنة من الأصوات الأصلية البشرية، وخلصت الدراسة إلى أن هذا الاكتشاف يفتح المجال لتطبيقات إعلامية وتعليمية أكثر فاعلية، وأنه رغم هذه الفرص، إلا أن ما توصلت إليه يزيد من مخاطر التضليل الصوتي، خاصة في المواد الإعلامية الحسَّاسة.

أستطيع سماعك": تدريب ذكي لكشف الأصوات المزيفة
جامعات كولومبيا، واشنطن، نيويورك، روتجرز، وبنسلفانيا بالتعاون مع جامعة سنغافورة الوطنية وهونغ كونغ للعلوم والتكنولوجيا
هذه الدراسة وترجمتها (أستطيع سماعك: تدريب انتقائي قوي لاكتشاف الصوت المزيف) من إعداد مجموعة كبيرة من الباحثين من جامعات كولومبيا، وواشنطن، ونيويورك، وروتجرز، وجامعة ولاية بنسلفانيا صدرت عام 2024 عن جامعة سنغافورة الوطنية بالتعاون مع جامعة هونغ كونغ للعلوم والتكنولوجيا.
وهدفت إلى اكتشاف الأصوات المستنسخة بدقة عالية حتى في الضوضاء أو عمل تعديلات صوتية، من خلال تطوير خوارزميات قادرة على تحقيق هذا الهدف.
وركزت على تحسين تقنيات الكشف عن التزييف الصوتي العميق باستخدام أساليب تدريبية متقدمة، وقدم الباحثون مجموعة بيانات صوتية جديدة تُدعى DeepFakeVox-HQ، وكانت تضم 1.3 مليون عينة صوتية، منها 270,000 تزييف صوتي عالي الجودة.
وطور الباحثون طريقة تدريب جديدة تُسمَّى Frequency-Selective Adversarial Training، لتحسين القدرة على اكتشاف التزييف الصوتي باستخدام مكونات التردد العالي.
وتوصلت النتائج إلى أن هذه الطريقة أدت إلى تحسين التحقق من مدى صحة الصوت بنسبة 33% على العينات النظيفة، و29.3% على العينات الملوثة؛ مما يؤدي لحماية المستمع من التضليل.
إنكيدو": حماية الخصوصية الصوتية بالتشويش الذكي
جامعة شيكاغو وجامعة إلينوي في أوربانا شامبين
في هذه الدراسة بعنوان Enkidu: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice، وترجمتها (إنكيدو: تشويش ترددي شامل لحماية الخصوصية الصوتية في الوقت الفعلي ضد الأصوات المزيفة بالذكاء الاصطناعي) التي أجراها فريق مشترك من جامعة شيكاغو إلينوي في أوربانا شامبين، ونُشرت على منصة arXiv في يوليو 2025، اخترع الفريق البحثي نظاما أطلق عليه Enkidu، يعتمد على تشويش صوتي ذكي غير مسموع للبشر؛ لمنع أنظمة الذكاء الاصطناعي من استنساخ الصوت الأصلي أو استغلاله، دون أن يكون للتشويش أي تأثير على جودة الصوت الطبيعي.
وهذا النظام يتيح للأفراد استخدام أصواتهم دون خوف من استنساخها أو استغلالها في سياقات غير قانونية، كما ركزت الدراسة على مقارنة وضوح الأصوات المستنسخة مقابل الأصوات البشرية في ظروف الضوضاء، وأظهرت النتائج أن الأصوات المستنسخة تكون أسهل في الفهم من الصوت الأصلي في البيئات المزدحمة أو عالية الضوضاء.
وتتيح هذه الدراسة إمكانية توظيف الأصوات المستنسخة في دعم ضعاف السمع، والتعليم عن بُعد، أو أي نظام يعتمد على وضوح الصوت في بيئة صاخبة.
الخلاصة
من خلال الدراسات السابقة يتبين أن استنساخ الصوت بالذكاء الاصطناعي أصبح تقنية متقدمة للغاية، قادرة على إنتاج أصوات شبه مطابقة للبشر مع جميع خصائص النبرة والتعبير.
ورغم أنها كانت تمثل مخاطر أخلاقية وقانونية تتعلق بالخصوصية والتضليل، إلا أن الدراسات حوَّلتها إلى فرص واعدة في عديد من المجالات، ومنها الإعلام، التعليم، والترفيه، لكنها ترفع في الوقت نفسه.
وما تزال هناك حاجة ملحة لتطوير أدوات كشف وحماية صوتية متقدمة، كالتدريب على ميزات التردد العالي، وإضافة تشويش صوتي ذكي للحماية من الاستنساخ غير المشروع.
وتؤكد هذه الدراسات أن العالم على أعتاب ثورة صوتية رقمية بشقيها الإيجابي والسلبي؛ لذا يتوجب تحقيق توازن دقيق بين الابتكار وحماية خصوصية وهوية الإنسان.
_______
المصادر:
- جامعة كاليفورنيا في بيركلي (UC Berkeley)، دراسة بعنوان "People are poorly equipped to detect AI-powered voice clones"، منشورة في مجلة Scientific Reports عام 2025.
- جامعة كوين ماري – لندن (Queen Mary University of London)، دراسة بعنوان "I Can Hear You: Selective Robust Training for Deepfake Audio Detection"، منشورة في PLOS One عام 2025.
- جامعة سنغافورة الوطنية (NUS) بالتعاون مع جامعة هونغ كونغ للعلوم والتكنولوجيا، دراسة بعنوان "Enkid: Protecting Voice Privacy against Deepfake Threats"، 2024.
- جامعة شيكاغو وجامعة إلينوي، دراسة بعنوان "DU: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes"، منشورة على منصة arXiv عام 2025.



