#1
DeepSearch-World: وكيل بحث عميق يتعلم من تجاربه
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
الفريق قدم إطار عمل اسمه DeepSearch-Evolve لتدريب وكلاء ويب يقدروا يتعلموا من خبراتهم بدون ما يحتاجوا معلمين ثابتين. البيئة اللي استعملوها، DeepSearch-World، deterministic وبتسمح بالتحقق من التقدم، والتفكير المرتكز على الواقع، واسترجاع الأخطاء، وتحتوي على 420 ألف سؤال متعدد الخطوات. العملية بتشتغل على توليد مسارات، تصفيتها، خلط البيانات، وتدريب النموذج بشكل متكرر، وبدون ما يستندوا لنماذج أقوى من قبل. النتيجة إن النموذج 9B وصل نسب 31.2% على BrowseComp، 61.5% على GAIA، و93.4% على HotpotQA، وبيظهر إن البيئة القابلة للتحقق بتساعد الوكلاء يتطوروا ذاتيًا على مهام البحث الطويلة.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء يتعلموا ويتقوّى من تجاربهم، فبصيروا أقدر على حل أسئلة ويب معقّدة بدون ما نحتاج نجهّز لهم بيانات ضخمة مسبقة.
🌱 شو إلك منها؟
تخيل إنو برنامج على الإنترنت بيقدر يتعلم من أخطاؤه ويصير أحسن كل ما يستخدمه أحد، مثل ما بنتعلم من أخطائنا بالطبخ. هالشي يعني إنو محركات البحث أو المساعدين الرقميين رح يصيروا أذكى ويعطوا إجابات أدق، وبتشوف هالتحسين وانت تستخدم تطبيقات البحث أو الأسئلة على الإنترنت.