Accurate and fast recurrent neural network solution for the automatic diacritization of Arabic text
العناوين الأخرى
حل دقيق و سريع لوضع الحركات المميزة على نصوص اللغة العربية باستخدام الشبكات العصبية المتكررة
المؤلفون المشاركون
Abandah, Ghayth A.
Abd al-Karim, Asma
المصدر
Jordanian Journal of Computetrs and Information Technology
العدد
المجلد 6، العدد 2 (30 يونيو/حزيران 2020)، ص ص. 103-121، 19ص.
الناشر
جامعة الأميرة سمية للتكنولوجيا
تاريخ النشر
2020-06-30
دولة النشر
الأردن
عدد الصفحات
19
التخصصات الرئيسية
تكنولوجيا المعلومات وعلم الحاسوب
الملخص EN
Arabic is mostly written now without its diacritics (short vowels).
Adding these diacritics decreases reading ambiguity among other benefits.
This work aims to develop a fast and accurate machine learning solution to diacritize Arabic text automatically.
This paper uses long short-term memory (LSTM) recurrent neural networks to diacritize Arabic text.
Intensive experiments are performed to evaluate proposed alternative design and data encoding options towards a fast and accurate solution.
Our experiments involve investigating and handling problems in sequence lengths, proposing and evaluating alternative encodings of the diacritized output sequences and tuning and evaluating neural network options including architecture, network size and hyper-parameters.
This paper recommends a solution that can be fast trained on a large dataset and uses four bidirectional LSTM layers to predict the diacritics of the input sequence of Arabic letters.
This solution achieves a diacritization error rate of 2.46% on the LDC ATB3 dataset benchmark and 1.97% on the larger new Tashkeela dataset.
This latter rate is 47% improvement over the best-published previous result.
نمط استشهاد جمعية علماء النفس الأمريكية (APA)
Abandah, Ghayth A.& Abd al-Karim, Asma. 2020. Accurate and fast recurrent neural network solution for the automatic diacritization of Arabic text. Jordanian Journal of Computetrs and Information Technology،Vol. 6, no. 2, pp.103-121.
https://search.emarefa.net/detail/BIM-1416227
نمط استشهاد الجمعية الأمريكية للغات الحديثة (MLA)
Abandah, Ghayth A.& Abd al-Karim, Asma. Accurate and fast recurrent neural network solution for the automatic diacritization of Arabic text. Jordanian Journal of Computetrs and Information Technology Vol. 6, no. 2 (Jun. 2020), pp.103-121.
https://search.emarefa.net/detail/BIM-1416227
نمط استشهاد الجمعية الطبية الأمريكية (AMA)
Abandah, Ghayth A.& Abd al-Karim, Asma. Accurate and fast recurrent neural network solution for the automatic diacritization of Arabic text. Jordanian Journal of Computetrs and Information Technology. 2020. Vol. 6, no. 2, pp.103-121.
https://search.emarefa.net/detail/BIM-1416227
نوع البيانات
مقالات
لغة النص
الإنجليزية
الملاحظات
Includes bibliographical references : p. 119-121
رقم السجل
BIM-1416227
قاعدة معامل التأثير والاستشهادات المرجعية العربي "ارسيف Arcif"
أضخم قاعدة بيانات عربية للاستشهادات المرجعية للمجلات العلمية المحكمة الصادرة في العالم العربي
تقوم هذه الخدمة بالتحقق من التشابه أو الانتحال في الأبحاث والمقالات العلمية والأطروحات الجامعية والكتب والأبحاث باللغة العربية، وتحديد درجة التشابه أو أصالة الأعمال البحثية وحماية ملكيتها الفكرية. تعرف اكثر