#1
إطلاق MLLMs لاكتشاف التفاعل الإنساني-الشيئي بدون تدريب
Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild
الفريق اللي من Ting Lei وزملاؤه قدموا AgentHOI، إطار بدون تدريب بيستغل قدرات الفاونديشن مودلز المتعددة الوسائط لتحديد التفاعل بين الإنسان والشيء. بدل ما يدرّبوا مصنّفات للتفاعل، بيستخدموا وحدات رؤية متناسقة مع بعضها لتوليد استنتاجات دلالية ومكانية. بضيفوا آليتين: Context-aware Multi-round Reasoning لتطوير الفرضيات بشكل تدريجي، وMultifaceted Interaction Localization لتوليد أوصاف دقيقة بتدمج الدلالات، المكان، والمظهر. التجارب بتبيّن إنو AgentHOI بيتفوّق على الطرق المشرفة حتى بدون ما يتدرّب على بيانات HOI.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج الرؤية تشتغل بذكاء أكتر ببيئات حقيقية من غير ما نحتاج نجهّز بيانات تدريب ضخمة.
🌱 شو إلك منها؟
بتقدر هالتقنية تخلّي التطبيقات اللي بتتعامل مع الصور، مثل التطبيقات الأمنية أو المساعدة بالمنزل، تفهم أكتر شو عم يصير بين الناس والأغراض حواليهم. يعني إذا كان في كاميرا بتحاول تتعرف على شخص عم يفتح باب أو عم يرفع صندوق، هالنظام رح يحدد الفعل والشيء بدقة. هالشي ممكن ينعكس على خدمات المراقبة أو الروبوتات المنزلية لتكون أذكى وتساعدنا بصورة أوضح.