Benchmark — البنشمارك
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
كل شركة بتقول «نموذجنا الأول» — طيب الأول على شو؟
كل ما ينزل نموذج جديد بتشوف جداول وأرقام و«تفوّقنا على المنافسين». بس مين بيحدّد هالأرقام؟ وهل تصدّقها؟
هالمصطلحات بتعطيك أدوات تقرأ أي ادّعاء بعين ناقدة — وترتيبها هون بيمشي من «شو هو الاختبار» لـ«كيف بينغشّ فيه».
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
وأشهر اختبار بتشوف اسمه بالجداول:
مجموعة بيانات بتقيس معرفة النموذج عبر أسئلة من مجالات مختلفة، متل الرياضيات والعلوم. بنستعملها لنقيم قدرة النموذج على الفهم العام.
ووين بتتنشر النتايج:
جدول ترتيب بيظهر أيّ النماذج والفرق هي الأفضل في اختبارات معينة - زي جدول الدوري بتاع الرياضة بس للذكاء الاصطناعي.
بس الاختبار الموحّد جزء من صورة أوسع:
evaluation يعني عملية اختبار النموذج وقياس أدائه، بدنا نعرف إذا النموذج شغّال صح ولا لا.
وأبسط مقياس — وأكترهم تضليلاً:
مقياس بيقيس نسبة الإجابات الصحيحة من إجمالي الأسئلة، عشان نعرف قديش النموذج دقيق
ولهيك بيستخدموا مقياساً أعدل:
مقياس بنستخدمه عشان نحكم على أداء النموذج بشكل متوازن، لأنه يدمج دقة التنبؤات مع نسبة اللي النموذج اكتشفها من الأشياء الصحيحة.
وأول طريقة بينخدع فيها التقييم:
هاد إشي بيصير لما النموذج يحفظ بيانات التدريب بشكل مبالغ فيه وبيفشل مع بيانات جديدة، يعني زي طالب حفظ الأسئلة بس مش فاهم المادة، بنسمع عنه كتير عشان هو من أكبر مشاكل تدريب النماذج.
وأخطرها على مصداقية الأرقام المنشورة:
يعني لما البيانات اللي تعلّمنا عليها النموذج تتكرر في بيانات الاختبار، فالنموذج بيعطيك نتايج مزيفة. مش بدنا هيدا عشان ما بتعكس الواقع الحقيقي.
ولهيك في تقييم من نوع تاني تماماً:
يعني فريق من الخبراء بيحاولوا بقصد انهم يكسروا ويخترقوا النظام لإيجاد ثغرات وضعفيات فيه. احنا بنعملها عشان نتأكد إن نماذج الذكاء الاصطناعي بتاعتنا آمنة وما فيها مشاكل قبل ما نطلقها للناس.