📖 تدريب النماذج بكفاءة · جزء 2

PEFT — ليش ما بندرّب كل النموذج؟

جمّد النموذج ودرّب أقل من ١٪ من أوزانه — فكرة PEFT اللي خلّت تخصيص النماذج بمتناول الجميع، وليش بتكفي.

PEFT — ليش ما بندرّب كل النموذج؟

بالجزء الأول من هالسلسلة عرفنا شو يعني Fine-Tuning: بناخد نموذج مدرَّب مسبقاً وبنكمّل تدريبه على بياناتنا عشان يتخصص. بس في مشكلة كنا مأجلينها: النماذج الحديثة فيها مليارات الأوزان — وتدريبها كلها بدو ذاكرة وعتاد بعشرات آلاف الدولارات. فإجا السؤال الذكي اللي غيّر المجال: وليش نلمس كل الأوزان أصلاً؟

الفكرة ببساطة

PEFT اختصار Parameter-Efficient Fine-Tuning — «الضبط الموفّر بالمعاملات». بدل ما ندرّب المليارات كلها، بنجمّد النموذج الأصلي زي ما هو، وبندرّب جزء صغير جداً — عادةً أقل من ١٪ من الأوزان.

التشبيه: عندك بيت جاهز ومرتّب (النموذج المدرَّب مسبقاً). عشان يناسب عيلتك، مش لازم تهده وتبنيه من جديد — بتضيف غرفة صغيرة وبتعدّل المطبخ. البيت الأصلي محفوظ، والتعديل صغير ومقصود.

مقارنة: التدريب الكامل بيدرّب كل الأوزان، وPEFT بيجمّد النموذج وبيدرّب جزء صغير
مقارنة: التدريب الكامل بيدرّب كل الأوزان، وPEFT بيجمّد النموذج وبيدرّب جزء صغير

شو بنكسب من هيك؟

  • ذاكرة أقل بكتير: ما بنحتاج نحفظ معلومات التدريب (gradients وغيرها) لكل الأوزان — بس للجزء الصغير. الفرق بيخلي تدريب كان بدو خادم ضخم يمشي على GPU وحدة.
  • ملف صغير لكل مهمة: ناتج التدريب مش نسخة جديدة كاملة من النموذج (عشرات الغيغابايت) — بس «الإضافة» المدرَّبة (ميغابايتات). بتقدر تحتفظ بعشرات التخصصات كملفات صغيرة على نفس النموذج الأصلي.
  • أمان من النسيان: لما بتدرّب كل الأوزان بقوة، النموذج ممكن «ينسى» قدراته العامة. لما الأصل مجمّد، هالخطر بيقل كتير.
  • تجارب أسرع وأرخص: بتقدر تجرّب وتغلط وتعيد — الكلفة صارت بمتناول باحث لحاله، مش بس شركة.

طيب كيف بنختار «الجزء الصغير» اللي بيتدرّب؟

هون بتتفرع عيلة PEFT — في كذا طريقة، وكلها متوفرة جاهزة بمكتبة PEFT من Hugging Face اللي صارت المعيار العملي بالمجال:

  • Adapters: طبقات صغيرة بتنحشر بين طبقات النموذج وبتتدرّب لحالها.
  • Prompt/Prefix Tuning: بدل تعديل النموذج، بنتعلم «مقدمة» رقمية بتنحط قبل المدخل وبتوجه سلوكه.
  • LoRA: نجمة العيلة بلا منازع — مصفوفات صغيرة بتنضاف جنب الأوزان الأصلية. إلها الجزء الجاي كامل، لأنها اللي رح تلاقيها بكل مكان.

أخطاء وسوء فهم شائع

  • «PEFT نسخة رخيصة وأضعف»: بكتير مهام، أداء PEFT بيقارب التدريب الكامل — الفرق بالكلفة هائل والفرق بالنتيجة غالباً صغير. هاد مش تنازل، هاد ذكاء.
  • «بتحتاج بيانات أقل»: PEFT بيوفّر عتاد، مش بيانات — جودة وكمية أمثلة التدريب لسّا بتحكم النتيجة.
  • «خلص، ما عاد في داعي للتدريب الكامل»: للتخصصات العميقة جداً أو تغيير سلوك النموذج جذرياً، التدريب الكامل (أو شبه الكامل) بيظل إله مكانه — PEFT بيغطي الغالبية العظمى من الحالات العملية، مش كلها.

خلاصة سريعة

  • PEFT = جمّد النموذج، درّب أقل من ١٪ — نفس الهدف بجزء بسيط من الكلفة.
  • المكاسب: ذاكرة أقل، ملفات تخصص صغيرة، خطر نسيان أقل، وتجارب بمتناول الجميع.
  • عيلة كاملة من الطرق، وأشهرها وأنجحها LoRA — موضوع الجزء الجاي.

كمّل رحلتك من هون

المصادر

شوفي فيديوهات شرح على يوتيوب عن «parameter efficient fine tuning PEFT explained»

📘 مصطلحات وردت بالمقالة

PEFT
Adapters
📖 كل أجزاء السلسلة (4)
  1. ما هو Fine-Tuning وكيف يغيّر سلوك النماذج؟
  2. PEFT — ليش ما بندرّب كل النموذج؟ (هون إنتِ)
  3. LoRA — الطبقات الصغيرة الذكية
  4. Quantization وQLoRA — ختام رحلة التدريب الموفّر