📚 تعلّم

أنواع نماذج الذكاء الاصطناعي: الفرق بين LLM و VLM و MoE و 8 نماذج أخرى

تعرف على أهم 8 مسميات لنماذج الذكاء الاصطناعي، وفهم إشي كل نموذج بيعمل وعشان أي مشكلة بنستخدمه.

مش بس LLM!

الكل بيحكي عن الـ LLM — بس أول ما تسمع MoE وVLM وSLM بتحس حالك ضايع بين الاختصارات؟ إنت مش لحالك. الحلو بالموضوع إنه هالمسميات مش أسماء عشوائية: كل وحدة انبنت عشان تحل مشكلة مختلفة تماماً. بهالمقالة رح نمشي عليهم واحد واحد، وبآخرها رح تعرف أي نوع بيناسب أي مهمة.

ليش بنحتاجه؟

تخيل إنك بدّك تبني تطبيق يترجم نص، أو يحدد أشياء بالصورة، أو حتى يخطط لحركة روبوت. إذا ما عرفت أي نوع نموذج يشتغل مع هالمشكلة، ممكن تختار أداة غير مناسبة وتضيع وقت وموارد. هالأنهاع بتعطينا خريطة واضحة للاختيار الصح.

شو كل نوع وشو بيعمل؟

  • LLM (Large Language Model) — نموذج لغة كبير مبني على transformer. بيستقبل تسلسل من الـ tokens (كلمات أو رموز) وبيولد نص جديد بناءً على الاحتمالات. مثال: GPT, Claude, Gemini.
  • LCM (Large Concept Model) — فكرة بحثية من Meta. بدلاً من التركيز على الـ token، بيفهم المفهوم أو الجملة ككل باستخدام SONAR embeddings. لسّا ما انتشر كتير بس بيحمل وعود لتوليد محتوى أعمق.
  • LAM (Large Action Model) — نماذج بتنفّذ أفعال، مش بس نص. فيها إدراك، فهم نية، تخطيط، وذاكرة، وبتستعمل لتشغيل agents (وكلاء) قادرين على اتخاذ قرارات — عندنا مقالة كاملة عن الوكلاء.
  • MoE (Mixture of Experts) — معمارية فيها مجموعة من الخبراء المتخصصين وrouter بيفعّل 2‑3 خبراء لكل token. هالطريقة بتعطي قدرة نموذج ضخمة بتكلفة أقل. مثال مؤكد: Mixtral.
  • VLM (Vision‑Language Model) — بيضم مشفر للصور وآخر للنص، وبيشارك مساحة تمثيلية مشتركة. بيسمح للكمبيوتر يفهم الصورة والنص سوا. أمثلة: GPT‑4o, LLaVA.
  • SLM (Small Language Model) — نماذج لغة صغيرة مضغوطة ومـquantized، تشتغل على اللابتوب أو الموبايل. مثال: Phi‑3, Gemma, Mistral 7B.
  • MLM (Masked Language Model) — أسلوب تدريب بيخفي كلمات داخل الجملة وبيطلب من النموذج يتوقعها. بيعتمد على انتباه ثنائي الاتجاه. النموذج الكلاسيكي هو BERT، ولا زال يُستَخدم للبحث والتصنيف.
  • SAM (Segment Anything Model) — بياخد صورة وprompt (نص أو نقطة) وبيطلع segmentation mask لأي جسم بالصورة. من Meta، وبيستخدم لتقسيم الصور بدقة.

مثال محسوس

بدّك تبني تطبيق لتعليم الأطفال القراءة من خلال صور. أول خطوة، تستعمل VLM لتوليد وصف نصي للصورة. بعدين، إذا بدك تبرز كلمة معينة بالصورة، تستعمل SAM لتقسيم الكلمة وتلوينها. إذا التطبيق بحاجة لتفاعل حواري مع الطفل، بتضيف LLM لتوليد أسئلة وإجابات. إذا بدك تشغل التطبيق على هاتف الطفل، ممكن تختار SLM لتقليل استهلاك الموارد.

أخطاء وسوء فهم شائع

  • التصنيف: ناس كتير بيخلطوا بين نوع النموذج (LLM, VLM, SLM, SAM) والمعمارية (MoE) أو أسلوب التدريب (MLM). الحقيقة إنه كل فئة بتشير لشي مختلف؛ مش صح نحطهم كلهم تحت نفس السقف — بس هيك انتشرت بالسوشال ميديا.
  • الإشاعات: في إشاعة إنه GPT‑4 مبني على MoE. ما في أي تأكيد رسمي من OpenAI عليها — عشان هيك ذكرنا Mixtral كمثال مؤكد ومفتوح المصدر.
  • التركيز على الاسم: مش لازم تحفظ كل المسميات. المهم تفهم إنه لكل مشكلة نوع نموذج بيناسبها، وتعرف تسأل السؤال الصح: «شو المشكلة اللي بدي أحلها؟»

خلاصة سريعة

  • LLM: توليد نص كبير، مناسب للحوارات والكتابة.
  • LCM: تركيز على المفهوم، لبحوث الفهم العميق.
  • LAM: تنفيذ أفعال وتخطيط، للـ agents.
  • MoE: معمارية خبراء متعددة لتقليل التكلفة.
  • VLM: دمج رؤية ولغة، لتطبيقات الصورة‑نص.
  • SLM: نماذج صغيرة للهواتف والأجهزة القليلة الموارد.
  • MLM: تدريب بإخفاء كلمات، أساس الفهم الثنائي الاتجاه.
  • SAM: تقسيم أي جسم بالصورة، لتطبيقات التحليل البصري.

الزبدة: افهم شو بتحل كل عيلة من هالنماذج، والأسماء بتيجي لحالها.

كمّل رحلتك من هون

شوفي فيديوهات شرح على يوتيوب عن «different types of AI models tutorial»

📘 مصطلحات وردت بالمقالة

LLM Large Language Model — نموذج لغة كبير يولّد نص باستخدام transformer
LCM Large Concept Model — نموذج يركز على فهم المفهوم الكامل للجملة
LAM Large Action Model — نموذج يدمج الإدراك والنية والتخطيط لتنفيذ أفعال
MoE Mixture of Experts — معمارية تجمع خبراء متخصصين وتفعل عدد قليل منهم لكل token
VLM Vision-Language Model — نموذج يجمع بين معالجة الصور والنص في تمثيل مشترك
SLM Small Language Model — نموذج لغة صغير مضغوط ومـquantized لتشغيل على الأجهزة المحدودة
MLM Masked Language Model — أسلوب تدريب يخفي كلمات داخل الجملة لتوقعها
SAM Segment Anything Model — نموذج يحدد أقسام أي جسم بالصورة بناءً على prompt
transformer معمارية شبكة عصبية تعتمد على آلية الانتباه لمعالجة تسلسل البيانات
embeddings تمثيلات رقمية للكلمات أو المفاهيم تُستخدم لتقريب المعاني
router آلية داخل MoE تختار الخبراء الأنسب لكل token