انتقل إلى المحتوى

الذكاء الصوتي

كيف يفهم الذكاء الاصطناعي الصوتي اللهجات العربية في المكالمات الهاتفية

لماذا تصعب اللهجات العربية على التعرف الآلي على الكلام في المكالمات، وكيف تتعامل معها أنظمة الذكاء الاصطناعي الصوتية، وكيف تختبر أي مزوّد على تسجيلات مكالماتك.

فريق رنينآخر تحديث ٧ أكتوبر ٢٠٢٦مدة القراءة ٧ د

نادرًا ما يتحدث المتصل السعودي مع مركز الاتصال بالعربية الفصحى؛ فهو يتكلم بلهجته النجدية أو الحجازية أو غيرها من اللهجات الخليجية، ويستخدم كلمة إنجليزية لاسم منتج أو رسالة خطأ، ويملي رقم هويته، وكثيرًا ما يفعل ذلك من سيارته عبر خط هاتفي. وعلى الوكيل الصوتي أن يفهم ذلك كله قبل أن ينجز أي طلب.

وتكشف المقاييس المنشورة حجم التحدي: ففي لوحة الصدارة المفتوحة للتعرف على الكلام العربي (Open Universal Arabic ASR Leaderboard)، بلغ معدل خطأ الكلمات WER (نسبة الكلمات التي يخطئ النظام في تفريغها) لأفضل نموذج مفتوح المصدر ١٩٫٢٣٪ على الفصحى في مجموعة البيانات السعودية SADA، بينما ارتفع إلى ٣٦٫٣٤٪ في اللهجة النجدية و٤٨٫٢٣٪ في الخليجية من المجموعة نفسها. يشرح هذا المقال أسباب الفجوة، وكيف تقلّصها الأنظمة الحديثة، وكيف تختبر أي مزوّد على مكالماتك أنت.

أهم النقاط

اللهجة، والخلط بين العربية والإنجليزية، والأرقام، وجودة صوت الهاتف؛ كل منها يضيف أخطاء، وتتراكم هذه الأخطاء معًا. ولا تعكس النتائج المنشورة على كلام البث أو القراءة دقةَ النظام في مكالماتك. والاختبار الموثوق هو عينة من تسجيلاتك تُقيَّم حسب اللهجة، وحسب دقة التفاصيل الحرجة مثل أرقام الهوية، وحسب إنجاز المهمة، لا بمعدل خطأ الكلمات وحده.

لماذا تصعب اللهجات العربية على أنظمة التعرف على الكلام

بيانات التدريب تميل إلى الفصحى

معظم الكلام العربي المفرَّغ نصيًا مصدره نشرات الأخبار والبث بالفصحى. ويشير مؤلفو لوحة الصدارة إلى أن أكثر من ٧٠٪ من عينات مجموعة MGB-2 الشائعة الاستخدام بالفصحى، ويربطون تراجع الأداء في اللهجات بعدم توازن توزيع اللهجات في معظم البيانات العامة. ويصل جانيبيكوف وزملاؤه إلى نتيجة مماثلة: الأنظمة الحالية تغطي أساسًا الفصحى وعددًا قليلًا من اللهجات الغنية بالبيانات.

التنوع اللغوي (بيانات اختبار SADA)معدل خطأ الكلمات لأفضل نموذج مفتوح
العربية الفصحى١٩٫٢٣٪
النجدية٣٦٫٣٤٪
الحجازية٣٦٫٩٦٪
المصرية٤٠٫٩٧٪
الخليجية٤٨٫٢٣٪

هذه الأرقام مأخوذة من صوت برامج تلفزيونية لا من مكالمات هاتفية، ومن نماذج مفتوحة المصدر لا من أنظمة تجارية؛ فهي تبيّن اتجاه الفجوة، لا دقة مزوّد بعينه.

الأصوات تتغير من لهجة إلى أخرى

ينطق الحرف الواحد بطرق مختلفة بحسب المنطقة. وتصف دراسة منشورة في مجلة جامعة الملك سعود كيف تُنطق القاف في اللهجة النجدية [g] (كالجيم القاهرية)، وكيف قد تتحول في اللهجة القصيمية إلى [dz] في سياقات صوتية معينة. كما تُكتب العربية عادة دون حركات، وتعد ورقة لوحة الصدارة غياب التشكيل في النص المكتوب من الصعوبات الأساسية. والنموذج المدرَّب أساسًا على نطق الفصحى يسمع هذه الأنماط المنتظمة كأنها كلمات أخرى.

المفردات والإملاء يختلفان

تختلف الكلمات اليومية مثل «أبغى» و«الحين» و«بكم» من منطقة إلى أخرى، ولا يوجد إملاء موحد للهجات. وتوثّق مجموعة بيانات Casablanca، التي تغطي ثماني لهجات، هذا التنوع في المفردات. ولأن الكلمة العامية الواحدة قد تُكتب بأكثر من طريقة، يشير حامد وزملاؤه إلى أن معدلي خطأ الكلمات والحروف وحدهما لا يكفيان لتقييم نص بلا إملاء معياري.

الخلط بين العربية والإنجليزية

يمزج المتصلون العربية والإنجليزية في الجملة الواحدة، مثل «أبغى ألغي الـ subscription»، خاصة في أسماء المنتجات والمصطلحات التقنية والمسميات الوظيفية. ويذكر مسح لأبحاث معالجة العربية المختلطة لغويًا أن الخلط بين العربية والإنجليزية ملحوظ في عدة دول منها المملكة، ويورد معدلات خطأ للكلمات تتراوح بين ٢٤٫٨٪ و٥٣٫٨٪ في مجموعات الكلام العربي المختلط. فالنموذج أحادي اللغة يواجه نظامين صوتيين وخطين مختلفين في عبارة واحدة.

الأرقام والأسماء والتواريخ

أكثر ما يحتاجه مركز الاتصال هو الأصعب: أرقام الهوية الوطنية والإقامة، وأرقام الجوال، وأرقام الآيبان IBAN (رقم الحساب المصرفي الدولي)، وأرقام الطلبات، والمبالغ، والتواريخ الهجرية والميلادية، وأسماء الأشخاص. فالمتصلون يجمّعون الأرقام بطرق مختلفة، ويخلطون بين الأعداد العربية والإنجليزية، وينطقون الاسم الواحد بأكثر من صيغة. ورقم واحد خاطئ يُفشل البحث عن السجل حتى لو بدا معدل الخطأ العام مقبولًا.

جودة صوت الهاتف

المكالمات الهاتفية ضيقة النطاق، إذ يُعيَّن الصوت فيها بنحو ٨ كيلوهرتز، بينما تُدرَّب نماذج كثيرة على صوت بتردد ١٦ كيلوهرتز. ويشير باحثون في المعهد الهندي للتكنولوجيا في مدراس إلى أن النماذج واسعة النطاق لا تؤدي جيدًا على الكلام ضيق النطاق، وأن البيانات الهاتفية المفرَّغة نادرة. ويضيف مكبر الصوت وضجيج الطريق والضغط وفقدان الحزم أخطاء فوق أخطاء اللهجة.

كيف تتعامل أنظمة الذكاء الاصطناعي الصوتية الحديثة مع اللهجات

  • بيانات لهجية أكثر: أعدّ المركز الوطني للذكاء الاصطناعي في الهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا) بالتعاون مع هيئة الإذاعة والتلفزيون مجموعة SADA، وتضم نحو ٦٦٧ ساعة من أكثر من ٥٧ برنامجًا تلفزيونيًا. وتغطي مجموعة ADI17 نحو ٣٠٠٠ ساعة من ١٧ دولة، وتضيف Casablanca ثماني لهجات مع وسوم للخلط اللغوي.
  • نموذج واحد للهجات واللغات: أظهر تشودري وزملاؤه أن نموذجًا واحدًا مدرَّبًا على العربية والإنجليزية والفرنسية تفوّق على أفضل الأنظمة أحادية اللغة المخصصة للهجات وللكلام المختلط. ونشر جانيبيكوف وزملاؤه نماذج تغطي ١٧ دولة عربية، بما فيها الكلام المختلط.
  • تحديد اللهجة: مصنّفات مدرَّبة على بيانات مثل ADI17 تتعرف على لهجة المتصل، فيكيّف النظام التعرف على الكلام ويرد باللهجة نفسها.
  • التكيف مع الهاتف: التدريب على صوت ضيق النطاق، كما في التدريب المسبق المراعي للقناة، يقلّص الفجوة بين نماذج ١٦ كيلوهرتز ومكالمات ٨ كيلوهرتز.
  • السياق والتأكيد: قوائم مفردات المجال (أسماء المنتجات والفروع والأدوية) توجّه التعرف، ونموذج لغوي يفهم النية رغم الأخطاء الطفيفة في التفريغ، وتُعاد التفاصيل الحرجة على المتصل للتأكيد قبل أي إجراء.

ما الذي يجب قياسه غير معدل خطأ الكلمات

المقياسما يكشفهما يجب الانتباه له
معدل خطأ الكلمات لكل لهجة وقناةدقة التفريغ لكل فئة من المتصليناختلاف الإملاء يرفعه؛ وحّد الكتابة أولًا
دقة البيانات الحرجةصحة أرقام الهوية والأرقام والتواريخ والأسماء حرفيًارقم واحد خاطئ يعني فشلًا
دقة فهم النيةهل فهم الوكيل الطلبقد تكون مرتفعة مع معدل خطأ متوسط
إنجاز المهمةهل أُنجز الطلب من بدايته إلى نهايتهيحتاج إلى مكالمات فعلية أو محاكاة
لهجة الردهل يطابق الرد لهجة المتصليقيّمها مستمعون من أهل اللهجة

كيف تختبر مزوّدًا على تسجيلات مكالماتك

  1. كوّن عينة متنوعة: اختر مكالمات حقيقية تغطي اللهجات الرئيسة لعملائك، والفئات العمرية، والجوال والهاتف الثابت، والبيئات الهادئة والصاخبة، والمكالمات التي تتخللها كلمات إنجليزية. بضع مئات من المكالمات المختارة بعناية أفيد من آلاف المكالمات النظيفة.
  2. تعامل مع البيانات نظاميًا: لا تشارك إلا التسجيلات المسموح بمشاركتها، وبموجب اتفاقية معالجة بيانات. راجع دليلنا عن نظام حماية البيانات الشخصية وتسجيل المكالمات.
  3. أعدّ نصوصًا مرجعية: يفرّغ متحدثون أصليون المكالمات وفق دليل كتابة مكتوب يحدد إملاء الكلمات العامية وطريقة كتابة الأرقام والكلمات الإنجليزية، وإلا قاست النتائج خلافات إملائية لا أخطاء فهم.
  4. قيّم كل شريحة على حدة: احسب معدل خطأ الكلمات لكل لهجة وقناة، ودقة البيانات الحرجة، ودقة فهم النية، فالمتوسطات تخفي الشرائح الضعيفة.
  5. أجرِ مكالمات حية: يتصل موظفون من مناطق مختلفة بخط تجريبي بطلبات مكتوبة وأخرى حرة، تشمل الخلط اللغوي وطلب التحدث إلى موظف.
  6. قيّم الردود: يحكم مستمعون من أهل اللهجة على صحة الردود وطبيعيتها ومطابقتها للهجة المتصل، وعلى توقيت تحويل المكالمة إلى الموظفين.
  7. اتفق على الحدود المقبولة مسبقًا، ثم ابدأ تجربة على خط واحد قبل التوسع.

ولمعرفة الفرق بين هذه الأنظمة والقوائم الصوتية التقليدية راجع الوكيل الصوتي الذكي مقابل الرد الآلي التفاعلي IVR، وللصورة الكاملة راجع الدليل الشامل لوكلاء الصوت الذكية في مراكز الاتصال السعودية.

كيف يتعامل رنين مع اللهجات العربية

يفهم رنين العربية الفصحى واللهجات الخليجية والمصرية والشامية والمغاربية، إضافة إلى الإنجليزية، بما في ذلك الجمل التي تمزج العربية والإنجليزية، ويرد بلهجة المتصل. وتُخفى أرقام البطاقات والهويات تلقائيًا في النصوص والتسجيلات المستضافة في مراكز بيانات داخل المملكة. ويستطيع المتصل طلب التحدث إلى موظف في أي وقت. ونقدّم العرض التجريبي على تسجيلات مكالماتك أنت، لتطبّق منهجية الاختبار السابقة قبل أي التزام. اطلب عرضًا تجريبيًا.

الأسئلة الشائعة

هل يفهم الذكاء الاصطناعي اللهجة السعودية في المكالمات الهاتفية؟

نعم، الأنظمة المدرَّبة على بيانات لهجية وهاتفية قادرة على ذلك، لكن الدقة تتفاوت بحسب اللهجة وجودة الصوت ومجال العمل، لذا اختبرها على مكالماتك قبل اتخاذ القرار.

ما معدل خطأ الكلمات المقبول في التعرف على الكلام العربي؟

لا يوجد حد عام. ففي مركز الاتصال تهم دقة الأرقام والأسماء وفهم النية أكثر من معدل خطأ الكلمات، لذا حدّد الأهداف لكل حالة استخدام.

هل يربك خلط العربية بالإنجليزية أنظمة الذكاء الاصطناعي الصوتية؟

هو أصعب على النماذج أحادية اللغة، أما النماذج المدرَّبة على الكلام المختلط فتتعامل معه بصورة أفضل، لذا أدرج مكالمات مختلطة في أي اختبار.

المصادر

  1. arXiv: وانغ والحمود والقريشي، لوحة الصدارة المفتوحة للتعرف على الكلام العربي
  2. IEEE DataPort: مجموعة البيانات الصوتية السعودية SADA
  3. arXiv: جانيبيكوف وآخرون، تغطية اللهجات والتعميم في التعرف على الكلام العربي
  4. مجلة جامعة الملك سعود: الرجيعي، أثر العوامل الاجتماعية في التغير الصوتي في اللهجة النجدية
  5. arXiv: طلافحة وآخرون، Casablanca: بيانات ونماذج للتعرف على الكلام العربي متعدد اللهجات
  6. arXiv: حامد وآخرون، مسح لأبحاث معالجة العربية المختلطة لغويًا
  7. arXiv: سوكاديا وأوميش، التدريب المسبق المراعي للقناة للتعرف على الكلام الهاتفي
  8. MIT CSAIL: مجموعة بيانات تحديد اللهجات العربية في ١٧ دولة ADI17
  9. ISCA Interspeech ٢٠٢١: تشودري وآخرون، استراتيجية متعددة اللغات للتعرف على الكلام العربي اللهجي المختلط

اسمع رنين على مكالماتك أنت

احجز عرضًا تجريبيًا ونشغّل رنين على عيّنة من تسجيلات مكالماتك، ثم نحدد الباقة معك.

مقالات ذات صلة

كل المقالات