«إنفيديا» العالمية تستعين باللهجات السعودية في مشروعها »Nemotron 3.5 ASR«
مكة - الرياض2 دقائق للقراءة

حجم الخط
كشفت شركة «إنفيديا» الأمريكية، الرائدة عالميا في تقنيات الحوسبة والذكاء الاصطناعي، أنها اعتمدت على مجموعة البيانات الصوتية السعودية «صدى» التي أطلقتها الهيئة السعودية للبيانات والذكاء الاصطناعي «سدايا» بالتعاون مع هيئة الإذاعة والتلفزيون، لتدريب نموذجها للتعرف الآلي على الكلام «Nemotron 3.5 ASR»، ما أسهم في خفض أخطائه في فهم اللهجات السعودية إلى النصف تقريبا، وذلك في دراسة تقنية نشرتها عبر مدونتها الرسمية للمطورين.
وأوضحت الشركة أن النموذج، الذي يدعم التفريغ النصي اللحظي لنحو 40 لغة ولهجة من بينها العربية، كان يخطئ قبل التدريب في نحو 55 كلمة من كل 100 كلمة من اللهجة السعودية، فيما تراجع معدل الخطأ إلى نحو 30 كلمة فقط بعد تدريبه على نحو 133.7 ساعة من الكلام باللهجتين النجدية والحجازية من بيانات «صدى».
ولم يقتصر التحسن على اللهجتين المستهدفتين، إذ انخفض معدل الخطأ على كامل بيانات «صدى» بمختلف لهجاتها من 58.8% إلى 35.6%، وتراجعت نسبة الأخطاء على مستوى الحروف من 31.6% إلى 12.2%، دون أن ينعكس ذلك سلبا على أداء النموذج في اللغة الإنجليزية أو العربية الفصحى، بل تحسن أداؤه فيهما أيضا، في حين لم يستغرق التدريب سوى نحو 4 ساعات ونصف الساعة على وحدتي معالجة رسومية.
وبينت «إنفيديا» أن النموذج المطور مهيأ للعمل في التطبيقات التفاعلية الفورية، إذ يمكن تشغيله بزمن استجابة يبدأ من 80 جزءا من الثانية، ما يجعله مناسبا لبناء المساعدات الصوتية الذكية ووكلاء المحادثة والترجمة النصية الحية للبث، إلى جانب تفريغ أرشيفات مراكز الاتصال والمحتوى الإعلامي والاجتماعات، كما أتاحت للمطورين الأدوات والخطوات اللازمة لإعادة تنفيذ التجربة وتطبيق المنهجية نفسها على لغات أخرى.
وقد أطلقت الهيئة السعودية للبيانات والذكاء الاصطناعي «سدايا» مجموعة بيانات «صدى» بالتعاون مع هيئة الإذاعة والتلفزيون عبر منصة «Kaggle» العالمية لعلوم البيانات، لتكون متاحة للباحثين والمطورين حول العالم.
وتضم المجموعة نحو 667 ساعة صوتية مع تفريغها النصي باللغة العربية، تشكل اللهجات السعودية معظمها، منها أكثر من 600 ساعة وفرتها هيئة الإذاعة والتلفزيون من أكثر من 57 برنامجا ومسلسلا تلفزيونيا بمختلف اللهجات المحلية، وتولت «سدايا» تفريغها وتجهيزها للتدريب والمعالجة الآلية، مع تخصيص 20 ساعة للاختبار والتحقق، فيما تغطي البيانات أكثر من 10 لهجات، وتشمل ما يزيد على 125 ألف مقطع صوتي مصنف وفق لهجة المتحدث، وهو ما مكن فريق «إنفيديا» من انتقاء المقاطع النجدية والحجازية بدقة لتدريب نموذجه.
