NLLB-200 — النموذج اللي بيترجم ٢٠٠ لغة (وفيهم لهجتنا!)
نموذج Meta المفتوح اللي بيترجم مباشرة بين ٢٠٠ لغة — ليش اللغات قليلة الموارد مهمة، وكيف دخلت الفصحى وثماني لهجات عربية (منها الفلسطينية) القائمة.
NLLB-200 — النموذج اللي بيترجم ٢٠٠ لغة (وفيهم لهجتنا!)
لو لغتك الأم إنجليزي، الإنترنت كله مفتوح قدامك. بس في ناس لغتهم الأم لغة بيحكيها ملايين — زي الهوسا أو الأمهرية أو حتى لهجات عربية كاملة — وأنظمة الترجمة لسنين طويلة كانت بتتعامل معهم كأنهم مش موجودين. سنة ٢٠٢٢، فريق Meta AI قرر يواجه المشكلة بمشروع اسمه حرفياً: No Language Left Behind — «ما في لغة بتنترك». والنتيجة نموذج واحد مفتوح المصدر بيترجم بين ٢٠٠ لغة. وأحلى إشي بالقصة؟ لهجتنا وحدة منهم.
ليش بنحتاجه: مشكلة اللغات «قليلة الموارد»
بالجزء الأول من السلسلة شفنا إنه أنظمة الترجمة الحديثة بتتعلم من ملايين الجمل المترجمة. طيب شو بصير مع لغة ما إلها ويكيبيديا كبيرة، ولا صحافة رقمية، ولا كتب ممسوحة؟ هاي اللغات بيسموها low-resource languages — لغات قليلة الموارد. مش لأنها أقل قيمة، بس لأن نصوصها الرقمية قليلة، فالنموذج ما عنده شو ياكل.
النتيجة كانت فجوة عالمية: ترجمة ممتازة لعشرات اللغات الغنية بالبيانات، وترجمة سيئة (أو ولا إشي أصلاً) لمئات اللغات اللي بيحكيها مليارات البشر.
شو هو NLLB-200؟
نموذج ترجمة أطلقته Meta AI بتموز ٢٠٢٢، بيترجم مباشرة بين أي زوج من ٢٠٠ لغة — يعني حوالي ٤٠ ألف اتجاه ترجمة، مش بس «من وإلى الإنجليزي». وفوق هيك، الفريق فتح المصدر: النموذج، والبيانات، وأدوات التقييم، كلهم متاحين للباحثين. وبعدها بسنتين، البحث انتشر بمجلة Nature — وهاد بحد ذاته مؤشر على وزنه العلمي.
عشان يقيسوا الجودة بشكل عادل، بنوا كمان FLORES-200: مقياس فيه نفس الجمل مترجمة احترافياً لكل الـ ٢٠٠ لغة — فبتقدر تقارن أداء أي لغة بأي لغة.
وين العربي من كل هاد؟ 🇵🇸
هون الجزء اللي بيهمنا: NLLB-200 ما اكتفى بـ«العربية» كصنف واحد. قائمة لغاته فيها الفصحى وثماني لهجات عربية كمان: المصرية، المغربية، التونسية، العراقية، النجدية، اليمنية (التعزية-العدنية)، الشامية الشمالية (سوريا ولبنان)… والشامية الجنوبية — يعني الفلسطينية والأردنية.
إذا قرأت مقالتنا عن ليش الـ AI بيفهم الفصحى وبيضيع باللهجة، بتعرف قديش هاد الاعتراف مهم: أول ما اللهجة بتصير «لغة» رسمية بنموذج عالمي، بيصير إلها بيانات ومقياس وأداء بينقاس — وبتطلع من منطقة الإهمال.
كيف اشتغلوا؟ ثلاث أفكار ذكية
- تنقيب الويب عن جمل متوازية: بدل ما يستنوا حدا يترجم، استخدموا نظام بيمثّل معنى الجملة برقم (embeddings متعددة اللغات) — فجملة إنجليزية بموقع، وترجمتها الأصلية بموقع تاني، بيتلاقوا لأن معناهم متقارب رياضياً. هيك جمعوا ملايين أزواج الجمل للغات المهملة.
- نموذج «خبراء» ضخم بس موفّر: المعمارية من نوع Mixture of Experts (MoE) — النموذج الكامل حجمه حوالي ٥٤ مليار معامل، بس لكل جملة بيشتغل جزء صغير منه بس. زي مستشفى كبير: كل الأقسام موجودة، بس حالتك بتروح للقسم المختص، مش لكل الأطباء.
- نسخة مضغوطة للناس العاديين: بالـ distillation (تقطير المعرفة) عصروا النموذج الضخم بنسخ صغيرة — أشهرها نسخة الـ ٦٠٠ مليون معامل على Hugging Face اللي بتشتغل على أجهزة عادية.
مثال محسوس: جربه بنفسك هلقيت
افتح صفحة النموذج المضغوط على Hugging Face، وجرب تترجم جملة من العربي لأي لغة بتخطر ببالك — سواحيلية؟ آيسلندية؟ بنغالية؟ نفس النموذج، مباشرة، بدون ما يمر عالإنجليزي. وإذا حابب تروح خطوة أبعد، النسخة المضغوطة بتقدر تشغلها محلياً على جهازك — زي ما شرحنا بمقالة تشغيل نموذج ذكاء اصطناعي محلي.
أخطاء وسوء فهم شائع
- «٢٠٠ لغة يعني نفس الجودة للكل»: لأ — اللغات الغنية بالبيانات لسا أقوى. الإنجاز إنه اللغات المهملة صارت مقبولة ومفيدة بدل معدومة، مش إنها ساوت الإنجليزي.
- «خلص، ما عاد في داعي للمترجمين»: للفهم العام والاستخدام اليومي، الترجمة الآلية كافية غالباً. للعقود القانونية والطب والأدب؟ الغلطة كلفتها عالية والنموذج بيغلط بثقة — البشر لسا أساسيين.
- «نموذج الترجمة بيحل مشكلة اللهجات نهائياً»: وجود لهجتنا بالقائمة خطوة كبيرة، بس البيانات اللهجية لسا قليلة والجودة متفاوتة — الطريق طويل، والمهم إنه صار في طريق أصلاً.
خلاصة سريعة
- NLLB-200 نموذج مفتوح المصدر من Meta بيترجم مباشرة بين ٢٠٠ لغة — بما فيها لغات كانت شبه منسية رقمياً.
- العربي داخل بقوة: الفصحى وثماني لهجات، من بينها الشامية الجنوبية (الفلسطينية والأردنية).
- السر: تنقيب ذكي عن جمل متوازية + معمارية خبراء ضخمة + نسخ مضغوطة بتشتغل بأي مكان.
- الجودة متفاوتة بين اللغات — بس الفجوة بلشت تضيق فعلياً.
كمّل رحلتك من هون
- فاتك الجزء الأول؟ ارجعله: الترجمة الآلية — من القواعد للـ Neural
- ليش اللهجات صعبة عالنماذج أصلاً؟ ليش الـ AI بيفهم الفصحى وبيضيع باللهجة؟
- بدك تشغل نماذج على جهازك؟ تشغيل نموذج ذكاء اصطناعي محلي بدون إنترنت
- مصطلح مش واضح؟ افتح قاموس «شو يعني؟»
المصادر
- No Language Left Behind: Scaling Human-Centered Machine Translation — الورقة البحثية (2022)
- إعلان Meta AI عن NLLB-200
- Scaling neural machine translation to 200 languages — مجلة Nature (2024)
- قائمة لغات FLORES-200 — بما فيها اللهجات العربية
- النموذج المضغوط nllb-200-distilled-600M على Hugging Face
- الرسم التوضيحي: من إعداد «شو في AI؟»
📘 مصطلحات وردت بالمقالة
📖 كل أجزاء السلسلة (2)
- الترجمة الآلية — من القواعد للـ Neural
- NLLB-200 — النموذج اللي بيترجم ٢٠٠ لغة (وفيهم لهجتنا!) (هون إنتِ)