#1
TOPS: تحسين كفاءة الـ MLLM عبر تقليم الرموز البصرية
TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
الفريق قدم طريقة جديدة لتقليل عدد الرموز البصرية بالـ MLLMs من غير ما يحتاجوا يدربوا نموذج جديد. الطريقة، اللي سماوها TOPS، بتبني ما يسموه Token Optimal Preservation Sets وبتعتمد على ثلاث مبادئ أساسية: صلة المهمة، تغطية المعلومات، وتنوع الدلالات. هالنهج ما بيحتاج تعديل على النموذج الأصلي، وبيشتغل مع أي MLLM. التجارب على 7 نماذج خلفية و14 benchmark أظهرت إنه TOPS يقدر يشيل أكثر من ¾ من الرموز مع الحفاظ أو حتى تحسين الأداء.
ليش بتهمّك؟: لأنه تقليل الرموز البصرية بيقلل استهلاك الطاقة وبيسرّع استجابة الـ MLLM، وهاد مهم لتطبيقات الوقت الحقيقي.
🌱 شو إلك منها؟
بتخيلوا إنه هالتقنية بتخلي التطبيقات اللي بتستخدم الصور والنصوص تشتغل أسرع، زي المساعدات الذكية على الموبايل أو أدوات الترجمة الفورية. يعني بدل ما الجهاز يشتغل ببطء مع كل صورة، بيقلل عدد العناصر اللي لازم يحسبها، وبيصير الردّ أسرع وأقل استهلاك للبطارية. ممكن تلاحظوا هالشي إذا استعملتوا تطبيقات تصوير ذكية ولا أدوات تعديل صور تعتمد على الذكاء الاصطناعي.