📚 تعلّم

خليط الخبراء MoE: مش كل النموذج بيشتغل

خليط الخبراء بيقسّم النموذج داخلياً لخبراء وموجّه بيفعّل ١-٢ منهم مع كل توكن؛ فالنموذج ضخم بالمعرفة خفيف بالتشغيل — والوفر بالحساب مش بالذاكرة.

خليط الخبراء (MoE): مش كل النموذج بيشتغل

بتقرا خبر عن نموذج جديد وبتلاقي جملة غريبة: «٦٧ مليار معامل، بيشتغل منها ٣٧ مليار بس». طيب وين راحوا الباقي؟ وليش يبنوا إشي وما يستخدموه كله؟ الجواب هو خليط الخبراء (Mixture of Experts) — الفكرة الهندسية اللي خلّت نماذج قوية كتير تصير أسرع وأرخص، ولحدّ إنه بعضها صار متاح مجاناً.

الجواب المختصر

بدل ما يشتغل النموذج كله على كل سؤال، بينقسم داخلياً لـ«خبراء» متخصّصين — و«موجّه» (Router) بيقرّر مين منهم يشتغل على سؤالك. فالنموذج ضخم بالمعرفة، خفيف بالتشغيل: سرعة أعلى وكلفة أقل بجودة قريبة من نموذج كامل بنفس الحجم.

كيف يشتغل خليط الخبراء: الموجّه بيوقّظ خبيرين بس
كيف يشتغل خليط الخبراء: الموجّه بيوقّظ خبيرين بس

🤔 ليش احتاجوا هالفكرة؟

النموذج اللغوي العادي — اللي بينسمّى Dense يعني «كثيف» — بيمرّر كل كلمة على كل معاملاته. يعني لو النموذج ٧٠ مليار معامل، سؤالك «كم الساعة؟» بيشغّل السبعين مليار كلهم.

والمشكلة إنه:

  • أكبر = أذكى (تقريباً) — فالكل بده يكبّر.
  • بس أكبر = أبطأ وأغلى بكل سؤال — والكلفة بتصير خانقة.

فالسؤال صار: كيف نكبّر معرفة النموذج بلا ما نكبّر كلفة كل سؤال؟

🏥 التشبيه: مستشفى فيه ٦٤ اختصاصي

تخيّل مستشفى فيه ٦٤ اختصاصي — قلب، عيون، عظام، جلدية، أطفال…

الطريقة الكثيفة (Dense): كل مريض بيدخل، بيحضروا كل الـ٦٤ سوا ويناقشوا حالته. النتيجة ممتازة، بس تخيّل الوقت والكلفة على وجع سنان.

طريقة خليط الخبراء: في موظف استقبال (هو الـRouter) بيسمع الشكوى وبيحوّلك لـاتنين مناسبين بس. الباقي بيضلّوا بمكاتبهم.

النتيجة: خبرة المستشفى كلها موجودة، بس كلفة الزيارة الوحدة = اتنين مش ٦٤.

⚙️ كيف بيشتغل فعلياً؟

١. النموذج مقسوم لخبراء

جوّا طبقات النموذج، فيه مجموعات منفصلة من المعاملات (٨ · ٣٢ · ١٢٨ حسب التصميم) اسمها experts — خبراء.

٢. الموجّه (Router) بيوزّع

مع كل توكن داخل، شبكة صغيرة بتعطي درجة لكل خبير، وبتفعّل الأعلى درجة (عادةً ١-٢ خبير).

٣. النتيجة بتنجمع

مخرجات الخبراء المفعّلين بتتجمّع مرجّحة — والباقي ما اشتغلوا أصلاً، فما كلّفوا إشي.

🎯 نقطة مهمة: الخبراء مش مواضيع

هون بيصير أكبر سوء فهم. ما في خبير اسمه «الطب» وخبير اسمه «الشعر» — التقسيم ما حدا صمّمه يدوياً، طلع لحاله أثناء التدريب. التخصّصات اللي بتطلع غالباً أدقّ وأغرب من التصنيف البشري (نمط لغوي معيّن، بنية جملة، نوع رموز). التشبيه بالمستشفى بيوضّح الفكرة — بس التقسيم الحقيقي ما بيشبه أقسام المستشفى.

📊 «٦٧ مليار، بيشتغل منها ٣٧» — شو يعني؟

هلقيت الجملة صارت واضحة:

  • الإجمالي (Total): كل معرفة النموذج — وهاد اللي لازم يتحمّل بالذاكرة كله.
  • النشط (Active): اللي فعلاً بيشتغل مع كل توكن — وهاد اللي بيحدّد السرعة والكلفة.

فالنموذج بيفكّر بسرعة نموذج صغير، وبيعرف زي نموذج كبير.

⚠️ التنازل — مش ببلاش

  • 🧠 الذاكرة كاملة مطلوبة: لازم كل الخبراء يكونوا محمّلين، حتى النايمين. فالنموذج خفيف بالحساب، مش خفيف بالذاكرة — وهاد بيمنع تشغيل نماذج MoE كبيرة على جهاز عادي.
  • 🚦 توجيه غلط = جواب أضعف: لو الموجّه اختار خبير مش مناسب، النتيجة أضعف — من غير ما تعرف ليش.
  • ⚖️ اختلال التوازن: بالتدريب، ممكن خبراء يصيروا «مشاهير» وياخدوا كل الشغل والباقي يضلّوا فاضيين. بيتعالج بتقنيات موازنة حمل بالتدريب، بس بيضل تحدي هندسي.
  • 🔧 تعقيد بالتدريب: MoE أصعب بالتدريب والضبط من نموذج كثيف بنفس الحجم.

💡 ليش هالموضوع بيهمّك إنت؟

حتى لو ما بتبني نماذج:

  • بيفسّرلك ليش نماذج قوية صارت مجانية أو رخيصة: كلفة التشغيل انخفضت، فالشركات قدرت تفتحها للناس.
  • بيفسّرلك مقارنات الأرقام: نموذج «٤٠٠ مليار» MoE مش أثقل تشغيلاً بالضرورة من «٧٠ مليار» كثيف — قارن النشط، مش الإجمالي.
  • بيفسّرلك ليش نموذج ممتاز بشغلة وضعيف بشغلة قريبة منها: أحياناً السبب توجيه، مش نقص معرفة.
  • ولو بتشغّل نموذج محلياً: لا تنخدع بـ«النشط الصغير» — الذاكرة المطلوبة بتتحدّد بالإجمالي.

أخطاء وسوء فهم شائع

  • «كل خبير نموذج مستقل»: لأ — الخبراء جوّا نفس النموذج ومدرّبين سوا، مش نماذج منفصلة انحطّوا جنب بعض.
  • «الخبير متخصّص بمجال زي الطب»: التخصّص طلع لحاله وغالباً بأنماط تقنية مش مجالات بشرية.
  • «MoE يعني النموذج أضعف»: لأ — بيوصل لجودة قريبة من كثيف بنفس الحجم بجزء من كلفة التشغيل؛ ولهيك أغلب النماذج الكبيرة الحديثة بتستخدمه.
  • «يعني بيحتاج ذاكرة أقل»: العكس بالنسبة للحجم — بيحتاج ذاكرة تكفي كل الخبراء. الوفر بالحساب والسرعة مش بالذاكرة.
  • «فكرة جديدة طلعت مع النماذج الحديثة»: الفكرة موجودة من التسعينات — اللي تغيّر إنه صارت عملية على مستوى النماذج الضخمة.

خلاصة سريعة

  • MoE = النموذج مقسوم لخبراء، وموجّه بيفعّل ١-٢ منهم بس مع كل توكن.
  • إجمالي المعاملات = المعرفة والذاكرة · النشط = السرعة والكلفة.
  • التخصّصات بتطلع لحالها أثناء التدريب — مش مصمّمة يدوياً ولا حسب المجالات.
  • الوفر بالحساب مش بالذاكرة — كل الخبراء لازم يكونوا محمّلين.
  • عند مقارنة النماذج: قارن النشط مع الكثيف، والإجمالي مع الذاكرة.

أسئلة بتوصلنا كتير

  • ما هو خليط الخبراء MoE في الذكاء الاصطناعي؟ هو تصميم يقسّم النموذج داخلياً إلى مجموعات من المعاملات تسمّى «خبراء»، ويستخدم شبكة موجّهة (Router) لتفعيل واحد أو اثنين منها فقط مع كل توكن بدل تشغيل النموذج كاملاً.
  • لماذا يقال إن النموذج فيه ٦٧ مليار معامل يعمل منها ٣٧ ملياراً؟ لأن الرقم الأول هو إجمالي المعاملات الذي يحدّد المعرفة والذاكرة المطلوبة، والثاني هو المعاملات النشطة فعلياً مع كل توكن والتي تحدّد السرعة والتكلفة.
  • هل يوفّر MoE في الذاكرة؟ لا — يجب تحميل جميع الخبراء في الذاكرة حتى غير المفعّلين منهم؛ التوفير يكون في الحساب والسرعة والتكلفة لكل استعلام، لا في حجم الذاكرة المطلوبة.
  • What is Mixture of Experts (in Arabic)? بالعربي «خليط الخبراء» — بنية تقسّم النموذج لخبراء متخصّصين ويختار موجّه من يعمل منهم مع كل توكن، فيصبح النموذج ضخماً بالمعرفة وخفيفاً في التشغيل.
  • هل يتخصّص كل خبير في مجال معيّن مثل الطب أو البرمجة؟ ليس بالضرورة — التخصّص ينشأ تلقائياً أثناء التدريب ولا يصمّمه أحد يدوياً، وغالباً يرتبط بأنماط لغوية وتقنية دقيقة أكثر من ارتباطه بمجالات بشرية واضحة.

كمّل رحلتك من هون

المصادر

شوف فيديوهات شرح على يوتيوب عن «mixture of experts MoE router active parameters explained»

📘 مصطلحات وردت بالمقالة

Mixture of Experts (MoE) خليط الخبراء — بنية تقسّم النموذج لخبراء ويُفعَّل قليل منهم لكل توكن
Router الموجّه — شبكة صغيرة تقرّر أي الخبراء يعالج كل توكن
Active Parameters المعاملات النشطة — الجزء الذي يعمل فعلياً مع كل توكن ويحدّد السرعة والتكلفة