PEFT — ليش ما بندرّب كل النموذج؟
جمّد النموذج ودرّب أقل من ١٪ من أوزانه — فكرة PEFT اللي خلّت تخصيص النماذج بمتناول الجميع، وليش بتكفي.
PEFT — ليش ما بندرّب كل النموذج؟
بالجزء الأول من هالسلسلة عرفنا شو يعني Fine-Tuning: بناخد نموذج مدرَّب مسبقاً وبنكمّل تدريبه على بياناتنا عشان يتخصص. بس في مشكلة كنا مأجلينها: النماذج الحديثة فيها مليارات الأوزان — وتدريبها كلها بدو ذاكرة وعتاد بعشرات آلاف الدولارات. فإجا السؤال الذكي اللي غيّر المجال: وليش نلمس كل الأوزان أصلاً؟
الفكرة ببساطة
PEFT اختصار Parameter-Efficient Fine-Tuning — «الضبط الموفّر بالمعاملات». بدل ما ندرّب المليارات كلها، بنجمّد النموذج الأصلي زي ما هو، وبندرّب جزء صغير جداً — عادةً أقل من ١٪ من الأوزان.
التشبيه: عندك بيت جاهز ومرتّب (النموذج المدرَّب مسبقاً). عشان يناسب عيلتك، مش لازم تهده وتبنيه من جديد — بتضيف غرفة صغيرة وبتعدّل المطبخ. البيت الأصلي محفوظ، والتعديل صغير ومقصود.
شو بنكسب من هيك؟
- ذاكرة أقل بكتير: ما بنحتاج نحفظ معلومات التدريب (gradients وغيرها) لكل الأوزان — بس للجزء الصغير. الفرق بيخلي تدريب كان بدو خادم ضخم يمشي على GPU وحدة.
- ملف صغير لكل مهمة: ناتج التدريب مش نسخة جديدة كاملة من النموذج (عشرات الغيغابايت) — بس «الإضافة» المدرَّبة (ميغابايتات). بتقدر تحتفظ بعشرات التخصصات كملفات صغيرة على نفس النموذج الأصلي.
- أمان من النسيان: لما بتدرّب كل الأوزان بقوة، النموذج ممكن «ينسى» قدراته العامة. لما الأصل مجمّد، هالخطر بيقل كتير.
- تجارب أسرع وأرخص: بتقدر تجرّب وتغلط وتعيد — الكلفة صارت بمتناول باحث لحاله، مش بس شركة.
طيب كيف بنختار «الجزء الصغير» اللي بيتدرّب؟
هون بتتفرع عيلة PEFT — في كذا طريقة، وكلها متوفرة جاهزة بمكتبة PEFT من Hugging Face اللي صارت المعيار العملي بالمجال:
- Adapters: طبقات صغيرة بتنحشر بين طبقات النموذج وبتتدرّب لحالها.
- Prompt/Prefix Tuning: بدل تعديل النموذج، بنتعلم «مقدمة» رقمية بتنحط قبل المدخل وبتوجه سلوكه.
- LoRA: نجمة العيلة بلا منازع — مصفوفات صغيرة بتنضاف جنب الأوزان الأصلية. إلها الجزء الجاي كامل، لأنها اللي رح تلاقيها بكل مكان.
أخطاء وسوء فهم شائع
- «PEFT نسخة رخيصة وأضعف»: بكتير مهام، أداء PEFT بيقارب التدريب الكامل — الفرق بالكلفة هائل والفرق بالنتيجة غالباً صغير. هاد مش تنازل، هاد ذكاء.
- «بتحتاج بيانات أقل»: PEFT بيوفّر عتاد، مش بيانات — جودة وكمية أمثلة التدريب لسّا بتحكم النتيجة.
- «خلص، ما عاد في داعي للتدريب الكامل»: للتخصصات العميقة جداً أو تغيير سلوك النموذج جذرياً، التدريب الكامل (أو شبه الكامل) بيظل إله مكانه — PEFT بيغطي الغالبية العظمى من الحالات العملية، مش كلها.
خلاصة سريعة
- PEFT = جمّد النموذج، درّب أقل من ١٪ — نفس الهدف بجزء بسيط من الكلفة.
- المكاسب: ذاكرة أقل، ملفات تخصص صغيرة، خطر نسيان أقل، وتجارب بمتناول الجميع.
- عيلة كاملة من الطرق، وأشهرها وأنجحها LoRA — موضوع الجزء الجاي.
كمّل رحلتك من هون
- ما قريت الجزء الأول؟ شو يعني Fine-Tuning أصلاً؟
- الجزء الجاي: LoRA — الورقة الشفافة فوق الخريطة (بيظهر بقائمة السلسلة تحت)
- مصطلح مش واضح؟ افتح قاموس «شو يعني؟»
المصادر
- توثيق مكتبة PEFT الرسمي — Hugging Face
- الرسم التوضيحي: من إعداد «شو في AI؟»
📘 مصطلحات وردت بالمقالة
📖 كل أجزاء السلسلة (4)
- ما هو Fine-Tuning وكيف يغيّر سلوك النماذج؟
- PEFT — ليش ما بندرّب كل النموذج؟ (هون إنتِ)
- LoRA — الطبقات الصغيرة الذكية
- Quantization وQLoRA — ختام رحلة التدريب الموفّر