#1
Light-Omni: فهم الفيديو بالوكيل بذاكرة طويلة
Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
الفريق اللي أسس Light-Omni قدم إطار وكيل متعدد الوسائط بيشتغل بنظام رد فعل سريع. بيستعمل حالتين سياقية: حالة عالمية بتجمع الذاكرة المتقطعة بنص موجز، وحالة كامنة بتولد الأوامر وتخلق تمثيلات استرجاعية، كل هاد بتمرير واحد بس. هالتصميم بقلل من الحاجة للتفكير المتكرر، فبيصير أسرع بـ12.1 مرة وبيحافظ على الذاكرة أكتر بـ2.6 مرة مقارنةً بـM3-Agent، وكمان بيزيد الدقة بـ2.4٪ على مجموعات اختبار الفيديو.
ليش بتهمّك؟: هالطريقة بتخلّي أنظمة الفيديو تتصرف بذكاء وبسرعة أكبر، فبتقّص من استهلاك الوقت والموارد.
🌱 شو إلك منها؟
تخيل إنك عم تتفرج على مسلسل طويل والبرنامج يقدر يذكرلك أحداث الحلقة الأولى ويتفاعل معاك فوراً، بدون ما يبطّئ. هالنظام بيخلي تطبيقات الفيديو مثل الترجمة الفورية أو المساعدة الذكية أسرع وأدق. ممكن تشوف تأثيره بأدوات المشاهدة أو التطبيقات اللي بتتعلم من الفيديوهات لتقترحلك محتوى.