Quantization وQLoRA — ختام رحلة التدريب الموفّر
اضغط النموذج لـ 4-bit وحط LoRA فوقه: كيف QLoRA خلّت تدريب النماذج العملاقة ممكن على GPU وحدة — وخريطة «متى تستخدم شو» للسلسلة كلها.
Quantization وQLoRA — ختام رحلة التدريب الموفّر
وصلنا لآخر قطعة بالأحجية. تعلمنا شو يعني Fine-Tuning، وعرفنا إنه PEFT بيدرّب جزء صغير بس، وإنه LoRA بتعمل هاد بمصفوفات صغيرة أنيقة. بس ضلت مشكلة وحدة عنيدة: حتى لو الأوزان مجمّدة، النموذج الكبير لازم الذاكرة تستوعبه عشان يشتغل أصلاً — والنماذج الضخمة أكبر من ذاكرة أي GPU عادية. الحل الأخير بالسلسلة: نضغط النموذج نفسه.
Quantization — ضغط الأرقام
كل وزن بالنموذج رقم مخزّن بدقة معينة — عادةً 16-bit (تخيلها رقم بكسور عشرية كتيرة). فكرة الـ quantization («التكميم»): نخزّن نفس الأرقام بدقة أقل — 8-bit أو حتى 4-bit — فيصير حجم النموذج بالذاكرة ربع اللي كان، تقريباً.
التشبيه المألوف: ضغط الصورة. لما بتبعتي صورة عالواتساب، بتنضغط — بتخسر شوية دقة ما بتلاحظيها بعينك، وبتكسب حجم أصغر بكتير. نفس المنطق: النموذج المضغوط بيخسر دقة رقمية بسيطة، وأداؤه العملي بيضل قريب جداً من الأصل.
QLoRA — الجمعة المباركة بين الفكرتين
سنة 2023، ورقة QLoRA جمعت القطعتين بذكاء:
- اضغط النموذج لـ 4-bit (Quantization) — هلقيت بتستوعبه ذاكرة GPU وحدة.
- جمّده وحط فوقه LoRA — الإضافات الصغيرة بتتدرّب بدقة عادية.
النتيجة اللي كانت خيال قبلها: تدريب نماذج بعشرات مليارات الأوزان على GPU وحدة مستهلك — بجودة قريبة جداً من التدريب الكامل. هاي الورقة تحديداً فتحت الباب لموجة النماذج المفتوحة المخصصة اللي بتشوفيها بكل مكان: فجأة صار طالب دكتوراه أو هاوي عنده جهاز ألعاب قادر يخصص نموذج ضخم لمهمته.
الصورة الكاملة: متى أستخدم شو؟
خلينا نسكّر السلسلة بالخريطة العملية:
- بدك النموذج يجاوب من معلوماتك المتجددة؟ ← RAG — بدون أي تدريب.
- بدك تغيّري أسلوبه أو تخصصيه بمجال؟ ← Fine-tuning، وعملياً: LoRA عبر مكتبة PEFT.
- النموذج كبير والعتاد متواضع؟ ← QLoRA — اضغط وبعدها درّب.
- مشروع عملاق بموارد عملاقة وبدك أقصى جودة؟ ← التدريب الكامل بيظل خيار — بس اسألي حالك أول إذا اللي فوق بيكفي (غالباً بيكفي).
أخطاء وسوء فهم شائع
- «الضغط بيدمّر الجودة»: الانخفاض عادةً صغير بشكل مفاجئ — وورقة QLoRA نفسها أثبتت إنه التدريب فوق نموذج 4-bit بيقارب جودة 16-bit. جرّبي قبل ما تحكمي.
- «الـ 4-bit للتدريب بس»: الضغط بيستخدم كمان لتشغيل النماذج عالأجهزة العادية — هو نفس السر ورا النماذج المحلية على جهازك.
- «QLoRA بديل عن فهم البيانات»: العتاد صار أرخص، بس القاعدة الذهبية ما تغيرت: بيانات تدريب سيئة = نموذج سيء، مهما كانت الطريقة ذكية.
خلاصة السلسلة كلها بأربع أسطر
- Fine-tuning: بنكمّل تدريب نموذج جاهز عشان يتخصص.
- PEFT: بس ليش ندرّب الكل؟ جمّد ودرّب أقل من ١٪.
- LoRA: الطريقة الأنجح — مصفوفات صغيرة زي ورقة شفافة فوق الخريطة.
- QLoRA: اضغط النموذج لـ 4-bit وحط LoRA فوقه — تخصيص العمالقة صار بمتناول الجميع.
كمّل رحلتك من هون
- طبّقي الفكرة بالبيت: الذكاء الاصطناعي المحلي — شغّل نموذج على جهازك
- البديل الخالي من التدريب: RAG — النموذج بيجيب من مصادرك
- تسريع بلا مساس بالجودة: فك الترميز التخميني
- طريقة تصغير مختلفة: تقطير المعرفة
- مصطلح مش واضح؟ افتح قاموس «شو يعني؟»
المصادر
- ورقة QLoRA — Dettmers et al., 2023 (arXiv:2305.14314)
- ورقة LoRA الأصلية (arXiv:2106.09685) · توثيق مكتبة PEFT — Hugging Face
- الرسم التوضيحي: من إعداد «شو في AI؟»
📘 مصطلحات وردت بالمقالة
📖 كل أجزاء السلسلة (4)
- ما هو Fine-Tuning وكيف يغيّر سلوك النماذج؟
- PEFT — ليش ما بندرّب كل النموذج؟
- LoRA — الطبقات الصغيرة الذكية
- Quantization وQLoRA — ختام رحلة التدريب الموفّر (هون إنتِ)