نفس الحروف الثلاثة: ع ل م
ثلاث قراءات مختلفة، ولا فرق بينها على الصفحة دون الحركات.
بحثٌ في تقنيات اللغة العربية · DiacriticS
اللغة العربية
تشكيل · العلامات التي تحمل المعنى
داياكريتِكس
ضبط دقيق لنموذج لغوي لاستعادة الحركات العربية المفقودة، بتقييم صارم على معيار صُمم ليقاوم الحفظ والتلوث.
مرّر الصفحة لتعود الحركات إلى مواضعها.
عمل فني: نص عربي مُشكَّل بخط أميري
01 · الفكرة
تُنشر العربية غالبًا بلا حركات: الحروف الساكنة والحروف المدّية فقط، بينما تُحذف الحركات القصيرة وعلامات الإعراب. هيكل واحد من الحروف قد يخفي كلمات مختلفة تمامًا في المعنى.
نفس الحروف الثلاثة: ع ل م
ثلاث قراءات مختلفة، ولا فرق بينها على الصفحة دون الحركات.
التشكيل خطوة تمهيدية لأنظمة تحويل النص إلى كلام، والترجمة الآلية، واستخراج المعلومات: أنظمة تحتاج نطقًا واحدًا واضحًا لا شبكة من الاحتمالات.
المعايير السابقة كانت تعاني من تسرّب البيانات: تداخل بين بيانات التدريب والاختبار، وميل نحو الفصحى التراثية أو المعاصرة فقط، مما ضخّم دقّة النتائج المُعلنة.
02 · فريق دياكريتيكس
أربعة باحثين يجمعون بين معالجة اللغة العربية والتعلم الآلي متعدد اللغات والهندسة العملية لجعل النص العربي أوضح وأسهل في القراءة والدراسة والاستخدام.
مرشد · كاوست
باحث دكتوراه في كاوست يهتم بالتعلم العميق متعدد الوسائط، ووصف الصور العاطفي، والنمذجة متعددة الثقافات. يحمل خبرات بحثية من كاوست وجامعة تارتو ومدينة زويل، ويستمتع بالسباحة وكرة السلة خارج المختبر.
طالب ذكاء اصطناعي وتعلم آلي · قائد الفريق · جامعة الإمام عبدالرحمن بن فيصل
طالب متقدم في الذكاء الاصطناعي والتعلم الآلي، يركز على التعلم العميق والرؤية الحاسوبية. تشمل أعماله LAR-U-Net لإزالة تشويش الصور، وتطبيق VisionFit لتحليل الوضعية، وضبط نماذج لغوية مفتوحة لتشكيل العربية، كما قاد أكثر من 30 فعالية تقنية في نادي CCSIT.
طالب هندسة برمجيات · جامعة الملك فهد للبترول والمعادن
طالب هندسة برمجيات في جامعة الملك فهد ومتعلّم للذكاء الاصطناعي والتعلم الآلي في أكاديمية كاوست. يطوّر برمجيات عملية بلغة بايثون و++C وجافا، ويضيف للمشروع فضول خريج موهبة ومنظوراً هندسياً عملياً.
طالب هندسة كهربائية وحاسبات · جامعة الملك عبدالعزيز
طالب هندسة كهربائية وهندسة حاسبات في جامعة الملك عبدالعزيز. يجمع بين الأساس الهندسي والتحليلي القوي وتقنيات التعلم العميق، مما يضيف للمشروع منظور التكامل بين الأجهزة والبرمجيات والحلول الهندسية التحليلية.
03 · المنهجية
فاصل صارم بين ما يتعلّم منه النموذج وما يُقيَّم عليه. خمس مراحل متسلسلة.
النسخة المنقّحة من مدونة تشكيلة: أسلوب تشكيل موحّد، وعيّنات من 50 إلى 60 كلمة، ولا يكاد يبقى نص ناقص التشكيل. وحُذف كل مثال يتداخل مع مجموعة اختبار Fadel حتى انخفض التداخل إلى 0.4%: وهو الفاصل بين التدريب والاختبار الذي يقوم عليه المشروع. 1,042,698 مثالًا بنحو 53 مليون كلمة.
1,200 فقرة، نصفها بالفصحى المعاصرة ونصفها بالعربية التراثية: 600 فقرة معاصرة من 40 إلى 50 كلمة (454 من مقالات مختارة و146 من ويكي الأخبار) راجعها خبيران مستقلان، و600 فقرة تراثية من مجموعة اختبار Fadel. والنصف المعاصر شُكِّل داخليًا ولم يُنشر مُشكَّلًا، فلم يطّلع عليه أي نموذج.
يُقيَّم أحد عشر نموذجًا مفتوح الأوزان دون أي تدريب مسبق، لبناء خط أساس صادق قبل أي ضبط دقيق.
يُكيَّف أفضل نموذج مرشّح على بيانات تشكيلة المنظّفة باستخدام LoRA فقط: دون QLoRA ودون إعادة تدريب كامل الأوزان. ثم يُعاد التدريب على 10% و30% و50% من البيانات، لقياس التحسّن مقابل حجم البيانات المستخدم.
تُحسب معدلات خطأ الحركات والكلمات مع علامات الإعراب النهائية وبدونها، ثم تُقارن بين نصوص الفصحى التراثية والمعاصرة لتحديد مصدر الأخطاء.
مقياسان رئيسيان
DER= الحركات الخاطئة ÷ إجمالي الحروف المُشكَّلة × 100
WER= الكلمات التي بها خطأ حركة واحد فأكثر ÷ إجمالي الكلمات × 100
04 · نتائج خط الأساس
نتائج دون تدريب مسبق لاثني عشر نموذجًا مفتوح الأوزان، قبل أي ضبط دقيق. كل رقم هو متوسط نصفَي المعيار: الفصحى المعاصرة والعربية التراثية. ونمطان يتكرران في كل الفئات.
المتوسط (الفصحى المعاصرة + التراثية) · معيار SadeedDiac-25 · الأقل أفضل
| النموذج | DERبالإعراب | WERبالإعراب | DERبدون الإعراب | WERبدون الإعراب |
|---|---|---|---|---|
| Flan-T5-Tashkeel-Small | 4.10 | 11.86 | 3.61 | 7.88 |
| gemma-4-E4B-it | 4.18 | 9.96 | 3.80 | 6.78 |
| Tashkeel-350M-v2 | 6.33 | 15.28 | 5.64 | 10.40 |
| Fine-Tashkeel | 17.91 | 22.61 | 17.73 | 20.35 |
| Fanar-1-9B-Instruct | 26.14 | 31.48 | 26.35 | 28.81 |
| Glonor-ByT5-Arabic | 33.62 | 50.68 | 33.22 | 44.77 |
| Qwen3.5-9B | 39.78 | 59.44 | 41.92 | 55.69 |
| gemma-3-1b-pt-10k-diacritization | 50.25 | 55.81 | 50.66 | 52.95 |
| Qwen3.5-4B | 58.29 | 79.00 | 59.43 | 75.22 |
| aya-expanse-8b | 66.55 | 85.78 | 67.08 | 84.04 |
| Moonlight-16B-A3B-Instruct | 86.60 | 99.01 | 87.10 | 98.84 |
| Qwen3.5-0.8B | 92.18 | 99.67 | 92.41 | 99.62 |
الإعراب = علامات الإعراب في أواخر الجمل. كل رقم هو متوسط نصفَي المعيار: الفصحى المعاصرة والعربية التراثية، مرتّبة حسب معدل خطأ الحركات مع الإعراب.
النتيجة الأولى
يرتفع معدّل الخطأ لدى جميع النماذج عند الحركة الأخيرة الدالة على الإعراب مقارنة بحركات داخل الكلمة، أوضح دليل على أن هذه النماذج تتقن التهجئة المحلية أكثر من تحليل التركيب النحوي للجملة كاملة.
النتيجة الثانية
ترتفع معدّلات الخطأ بشكل ملحوظ عند الانتقال من نصوص الفصحى المعاصرة إلى نصوص العربية التراثية: دليل على أن التوازن بين المجالات في بيانات التدريب، لا مجرد زيادة حجمها، هو ما يُضيّق الفجوة.
05 · الضبط الدقيق
جرى ضبط النموذجين بحجم أربعة مليارات معامل بطريقة LoRA تحت ظروف متطابقة على شرائح متداخلة من بيانات التدريب، بحيث تقع شريحة 10٪ داخل 30٪ وهذه داخل 50٪. والاختلاف الوحيد هو حجم البيانات والبنية الأساسية.
بعد الضبط الدقيق بطريقة LoRA · معيار SadeedDiac-25 · الأقل أفضل
| النموذج / حجم بيانات التدريب | DERبالإعراب | WERبالإعراب | DERبدون الإعراب | WERبدون الإعراب |
|---|---|---|---|---|
| gemma-4-E4B-it zero-shot | 4.18 | 9.96 | 3.80 | 6.78 |
| gemma-4-E4B-it 10% | 3.15 | 7.28 | 2.68 | 4.47 |
| gemma-4-E4B-it 30% | 2.98 | 6.82 | 2.54 | 4.12 |
| gemma-4-E4B-it 50% | 2.81 | 6.54 | 2.38 | 3.96 |
| Qwen3.5-4B zero-shot | 58.29 | 79.00 | 59.43 | 75.22 |
| Qwen3.5-4B 10% | 7.07 | 11.74 | 6.94 | 8.74 |
| Qwen3.5-4B 30% | 5.27 | 9.28 | 5.03 | 6.54 |
| Qwen3.5-4B 50% | 4.38 | 8.18 | 4.07 | 5.57 |
مُحوّل LoRA برتبة 16، وحجم دفعة فعّال 96، ودورة تدريب واحدة، وإحماء بنسبة 5٪، وبذرة عشوائية 42، على مجموعات متداخلة من بيانات سديد تشكيلة. يتفوّق جيما في كل النسب، لكن الفارق يضيق من 54.1 نقطة إلى 1.6.
نموذج Qwen3.5-0.8B صغير بما يكفي لتدريبه بالكامل، وهو الموضع الوحيد في هذه الدراسة الذي يمكن فيه عزل أثر أسلوب الضبط. فنقطة الانطلاق والبيانات وصيغة التوجيه متطابقة تمامًا، ولا يتغيّر سوى نسبة الأوزان المسموح لها بالتغيّر.
Qwen3.5-0.8B · أسلوب الضبط · الأقل أفضل
| النموذج / حجم بيانات التدريب | DERبالإعراب | WERبالإعراب | DERبدون الإعراب | WERبدون الإعراب |
|---|---|---|---|---|
| Zero-shot no training | 92.18 | 99.67 | 92.41 | 99.62 |
| LoRA rank 16, full corpus | 3.60 | 8.28 | 3.15 | 4.98 |
| Full fine-tuning all weights, full corpus | 3.06 | 7.34 | 2.58 | 4.12 |
يتفوّق الضبط الكامل بفارق 0.54 نقطة فقط. وهذا الفارق الضيّق هو النتيجة نفسها: إذ يستعيد مُحوّل LoRA برتبة 16 نحو 94٪ من فائدة تحديث كل الأوزان. وقد قُيّمت تجربة LoRA على المعيار وحده.
النتيجة الثالثة
ينخفض نموذج Qwen3.5-4B من 58.29٪ إلى 4.38٪، و51.2 نقطة من أصل 54 تتحقق من عُشر البيانات الأول وحده. أما Gemma 4 E4B-it فيبدأ من 4.18٪، أي أقل مما ينتهي إليه Qwen، ويصل إلى 2.81٪.
النتيجة الرابعة
يصل نموذج بحجم 0.8 مليار معامل مُدرَّب بالكامل إلى 3.06٪، متفوّقًا على نموذج بأربعة مليارات معامل جرى ضبطه بطريقة LoRA على نصف البيانات، وبخُمس عدد المعاملات. فنسبة الأوزان القابلة للتغيّر أهم من حجم النموذج.
06 · المصادر
A. Abbad et al. · github.com/abjadai/catt · 2023
F. Author et al. · 2024
S. Author et al. · 2025
M. Author et al. · 2024
T. Author et al. · 2024
M. Cherradi & H. El Mahajer · Knowledge and Decision Systems with Applications · 2025
مِنَ التَّقْرِيرِ إِلَى التَّجْرِبَةِ
تعرض الواجهة سلوك المنتج، بينما تُبقي طبقة الخادم مفاتيح النموذج بعيدًا عن المتصفح.
جَرِّبِ النَّمُوذَجَ