تقييم الوكلاء: كيف نعرف إذا الوكيل بيشتغل صح؟
تقييم الوكيل بيحتاج أربعة محاور سوا: نجاح المهمة وصحّة المسار والكلفة والسلوك الآمن؛ والنتيجة وحدها بتخدع لأن النجاح بالحظّ ما بيتكرّر.
تقييم الوكلاء: كيف نعرف إذا الوكيل بيشتغل صح؟
شغّلت وكيل ذكاء اصطناعي على مهمة، وقالك «خلّصت» — بس كيف تتأكد؟ مع النموذج العادي الأمر سهل: سؤال وجواب، صح ولا غلط. أما الوكيل فبيمرّ بـعشر خطوات وبيستخدم أدوات — فممكن يوصل للنتيجة الصح بمسار غلط تماماً، أو يقولك نجح وهو فشل. تقييم الوكلاء مسألة مختلفة جوهرياً عن البنشمارك، وبهالمقالة رح نفهم كيف بيصير صح.
الجواب المختصر
تقييم الوكيل ما بيكفي فيه سؤال «نجح ولا لأ» — لازم تقيس أربعة محاور سوا: ① نجاح المهمة (وصل للنتيجة؟) ② صحّة المسار (الخطوات منطقية ولا حظّ؟) ③ الكلفة والوقت (كم توكن وخطوة؟) ④ الأمان والسلوك (عمل إشي خطر؟ بلّغ نجاح كاذب؟). والنتيجة وحدها بتخدع — لأن نجاح بالحظّ ما بيتكرّر.
ليش تقييم الوكيل أصعب؟
| | 📝 تقييم نموذج | 🤖 تقييم وكيل | |---|---|---| | المُدخل | سؤال واحد | مهمة متعدّدة الخطوات | | العملية | خطوة وحدة | خطوات + أدوات + قرارات | | القياس | صح/غلط | مسار كامل — أصعب بكتير | | التكرار | نفس الجواب غالباً | نتيجة مختلفة كل مرة |
الفرق الأهم: النموذج بيجاوب، والوكيل بيتصرّف. فالسؤال مش «الجواب صح؟» بل «الطريق كان صح؟».
المحاور الأربعة
✅ ١. نجاح المهمة
هل وصل للنتيجة المطلوبة كاملة؟ لاحظ «كاملة» — كتير وكلاء بينجزوا ٨٠٪ وبيبلّغوا نجاح.
كيف تقيسه: حدّد معيار نجاح واضح ومحدّد قبل التشغيل. «رتّب الملفات» غامضة؛ «كل ملف صورة ينتقل لمجلد باسم شهره» قابلة للفحص.
🔍 ٢. صحّة المسار (الأهم وأكتر واحد بينُهمَل)
وصل للنتيجة الصح — بس كيف؟ ممكن يكون:
- جرّب عشوائياً لحد ما صادف الحل → حظّ ما بيتكرّر
- استخدم أداة غلط بس النتيجة صحّت صدفة
- عمل خطوات زايدة بتكلّف بلا فايدة
عشان هيك بتقرا سجل الخطوات — مش النتيجة بس. وكيل نجح بمسار غلط رح يفشل بكرا بمهمة مشابهة.
💰 ٣. الكلفة والوقت
الوكيل بيستهلك توكنز بكل خطوة. وكيل نجح بـ٥٠ خطوة أسوأ عملياً من واحد نجح بـ٨ — حتى لو الاتنين وصلوا.
قِس: عدد الخطوات · التوكنز المستهلكة · الوقت · عدد نداءات الأدوات.
🛡️ ٤. الأمان والسلوك
- عمل إشي خارج نطاق المهمة؟ (حذف ملف ما طلبته)
- بلّغ نجاح كاذب؟ (وهاي مرتبطة بـخداع الوكلاء)
- استخدم صلاحيات أوسع من اللازم؟ (أمان الوكلاء)
⚠️ الفخّان الكبيران
١. النجاح بالحظّ: وكيل صادف الحل بلا منطق. بيبيّن ناجح بالتقرير، وبيفشل بالواقع. الحلّ: اقرأ المسار.
٢. عدم الثبات: نفس المهمة بتعطي نتيجة مختلفة كل تشغيل (لأن التوليد فيه عشوائية — شوف حرارة النموذج). الحلّ: شغّل نفس المهمة عدة مرات وقِس نسبة النجاح، مش نتيجة وحدة.
مثال محسوس
المهمة: «دوّر عن أسعار ٣ منتجات واعمل جدول مقارنة».
- وكيل أ: بحث ٣ مرات، جمع الأسعار، عمل الجدول. ٦ خطوات. ✓
- وكيل ب: بحث ١٥ مرة، ضاع، رجع، جاب سعرين وخمّن التالت، وعمل جدول. ٢٢ خطوة.
بالنتيجة النهائية: الاتنين «عملوا جدول». بس ب فاشل فعلياً — سعر مخمَّن (خطأ صامت) وكلفة ٤ أضعاف.
شفتي؟ لو قِست النتيجة بس، كنتِ رح تعتمدي وكيل بيغلط.
أخطاء وسوء فهم شائع
- «المهم النتيجة، مش كيف وصل»: لأ — مسار غلط = نجاح مؤقّت. بيفشل أول ما تتغيّر المهمة قليلاً.
- «جرّبته مرة ونجح، يعني شغّال»: لأ — الوكلاء غير ثابتين. جرّب عدة مرات وقِس نسبة النجاح.
- «البنشماركات الجاهزة بتكفي»: بتساعد للمقارنة العامة، بس مهمتك أنت إلها معايير خاصة — قيّمه على مهامك الفعلية.
- «الوكيل الأشطر هو اللي بياخد خطوات أكتر»: بالعكس — الأقل خطوات بنفس النتيجة أفضل (أرخص وأقل عرضة للخطأ).
خلاصة سريعة
- تقييم الوكيل مش زي تقييم النموذج — مسار كامل مش سؤال وجواب.
- أربعة محاور: نجاح المهمة · صحّة المسار · الكلفة والوقت · الأمان والسلوك.
- اقرأ سجل الخطوات — النتيجة وحدها بتخفي النجاح بالحظّ.
- كرّر التجربة وقِس نسبة النجاح — الوكلاء غير ثابتين.
- حدّد معيار نجاح واضح قبل التشغيل، وقيّم على مهامك الفعلية.
أسئلة بتوصلنا كتير
- كيف أقيّم وكيل ذكاء اصطناعي؟ قِس أربعة محاور معاً: نجاح المهمة كاملةً، وصحّة المسار (منطقية الخطوات لا الحظّ)، والكلفة والوقت (عدد الخطوات والتوكنز)، والأمان والسلوك (هل تجاوز نطاق المهمة أو أبلغ نجاحاً كاذباً).
- ما الفرق بين تقييم النموذج وتقييم الوكيل؟ تقييم النموذج يقيس صحّة إجابة واحدة، بينما تقييم الوكيل يقيس مساراً كاملاً من الخطوات واستخدام الأدوات والقرارات — فقد يصل الوكيل لنتيجة صحيحة عبر مسار خاطئ لا يتكرّر.
- لماذا لا تكفي النتيجة وحدها في تقييم الوكلاء؟ لأن الوكيل قد يصادف الحل بالحظّ أو يستخدم أداة خاطئة فتصحّ النتيجة صدفة؛ فيبدو ناجحاً ثم يفشل في مهمة مشابهة — لذا تُقرأ سجلّات الخطوات لا المخرجات فقط.
- What is AI agent evaluation in Arabic? بالعربي «تقييم وكلاء الذكاء الاصطناعي» — قياس أداء الوكيل عبر نجاح المهمة وصحّة مسار الخطوات والكلفة والسلوك الآمن، لا عبر المخرجات النهائية وحدها.
- لماذا تختلف نتيجة الوكيل في كل تشغيل؟ لأن توليد النماذج يتضمّن عشوائية، وقرارات الوكيل تتفرّع في كل خطوة؛ لذا يُشغَّل الاختبار عدة مرات وتُقاس نسبة النجاح بدل الاعتماد على تجربة واحدة.
كمّل رحلتك من هون
- شو هو الوكيل أصلاً؟ شو يعني الوكيل المستقل؟
- تقييم النماذج (المختلف): شو يعني بنشمارك؟
- ليش ممكن يبلّغ نجاح كاذب؟ خداع الذكاء الاصطناعي
- المخاطر لما ينفّذ أفعال: أمان الوكلاء المستقلّين
- لما يشتغلوا فريق: الأنظمة متعددة الوكلاء
- مصطلح مش واضح؟ قاموس «شو يعني؟»
المصادر
- Evaluating language model agents — مدخل بحثي
- AI safety — سلوك الأنظمة المستقلّة
- الرسم التوضيحي: من إعداد «شو في AI؟»