📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 11 يوليو — نماذج أخف وفيديو من موبايلك

أسبوعي مكثّف 📅 2026-07-11
هلقيت هالأسبوع تركيز واضح على تحسين كفاءة النماذج وتوسيع قدراتها المتعددة الوسائط. فريقين قدموا طرق لتقليل الاختصارات المدفوعة بالأشياء وتوليد فيديوهات سينمائية على الموبايل، وهالشي بيظهر إننا بننتقل من نماذج ضخمة لبدائل خفيفة وعملية. كمان ظهر معيار UniClawBench لتقييم الوكلاء النشطين بمهارات عالمية، وSOLAR بيعيد تعريف سياسات الكاش للـ Retrieval Buffers. بهالسياق، مقالة الأسبوع «مش بس ChatGPT: الذكاء الاصطناعي حوالينا بكل مكان!» بتأكد إن الذكاء الاصطناعي صار جزء من كل إشي من موبايلك لسيارتك، وأداة الأسبوع NotebookLM بتسهل علينا تلخيص محاضراتنا وملفاتنا بسرعة. هالاتجاهات كلها بتعكس رغبة المجتمع البحثي إنه يخلّي الذكاء الاصطناعي أكتر فاعلية ومتوفر للناس.
#1

ليش ما بفتح الدرج؟ تقليل الاختصارات المدفوعة بالأشياء في التعرف على الأفعال المركبة بدون تدريب

Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
الفريق قدم طريقة جديدة لتقليل الاختصارات اللي بتستغل وجود الشيء لتحديد الفعل، بدل ما يعتمدوا على الإشارة الزمنية للحركة. حطوا تشخيصات بتقيس هالاختصارات ولاحظوا إن النماذج الحالية بتتدرب على أنماط التوافر بين الفعل والشيء وبتتغافل عن إشارات الفعل. الحل اللي اقترحوه اسمه RCORE، فيه جزئين: تنظيم أول بيساعد النموذج يتعلم تركيبات ما شافها قبل ويعامل الأنماط الشائعة كعينات سلبية، والجزء الثاني بيركّز على حساسية الترتيب الزمني ليتعلم تمثيلات فعلية مدعومة بالوقت. التجارب على مجموعات Sth-com و EK100-com بيّنت إن الطريقة بتقلل الاختصارات وبتحسّن التعميم على تركيبات جديدة.
ليش بتهمّك؟: هالطريقة بتخلي الأنظمة اللي تتعرف على الأفعال تكون أدق وتفهم الحركة مش بس الشيء الموجود، فبتقلل الأخطاء في تطبيقات الحياة الواقعية.
zero-shot action recognition compositional learning computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

CineMobile: توليد فيديو سينمائي على الموبايل

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation
الفريق قدم CineMobile لتوليد فيديوهات سينمائية من صورة مباشرة على الأجهزة المحمولة. استخدموا ثلاث استراتيجيات: أولاً تقليم موجه بالـdistillation لتصغير حجم النموذج، ثانياً تحويل النموذج المضغوط لمولد بأربع خطوات عبر دمج diffusion distillation مع الـreinforcement learning، وثالثاً تقنية hybrid post‑training quantization لتقليل حجم الذاكرة لأقل من 1 GB. النتائج أظهرت تسريع 40× مقارنةً بالنموذج الأصلي مع جودة بصرية مقاربة، وتوليد فيديو 49‑فريم بدقة 480p بوقت خطوة 0.6 ثانية على GPU و20 ثانية على معالج موبايل MediaTek Dimensity 8400 Ultimate.
ليش بتهمّك؟: هالطريقة بتخلّي إنشاء فيديوهات سينمائية على الموبايل صاير سريع وعملية، يعني ما بدنا ننتظر ساعات لتوليد مشهد من صورة وحدة.
diffusion video generation mobile compression computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

UniClawBench: معيار شامل للوكيل النشط على مهام العالم الحقيقي

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
فريق Chen وزملاؤه قدموا UniClawBench، أول معيار بيركّز على قدرات الوكلاء النشطين بخمس مهارات أساسية: Skill Usage، Exploration، Long-Context Reasoning، Multimodal Understanding، وCross-Platform Coordination. صمموا 400 مهمة ثنائية اللغة من واقع الحياة، وبيقييموا الوكلاء داخل حاويات Docker مباشرةً بخطوات تفصيلية. كمان حطّوا نظام تقييم حلقي فيه وكيل منفّذ، وكيل مشرف مخفي، وكيل مستخدم لتقليد ردود فعل بشرية متعددة الجولات بدون ما ينعرف معيار التقييم. النتائج بتفرجي كيف قدرات النموذج الأساسي وتصميم إطار الوكيل بيتفاعلوا سوا لتحدد الأداء.
ليش بتهمّك؟: هالمعيار بيساعد الباحثين يحددوا بالضبط وين الوكلاء بيفشلوا ويطوّروا أدوات أذكى وأقوى للمهام اليومية.
benchmark agents multimodal evaluation LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

Canvas360: تحسين توليد البانوراما داخل السياق بالوعي الهندسي

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining
الفريق قدم Canvas360، إطار من مرحلتين لتوليد بانوراما داخل السياق. بيجمع بين pretraining واعٍ للجيومتري و fine‑tuning مخصوص للمهام، وبنوا Canvas360Dataset فيه مليون عينة بانورامية عالية الجودة لتطبيقات نقل الأسلوب، الاستكمال، التوسيع، والتعديل. على مستوى النموذج، Canvas360 بيحسّن توليد النص‑إلى‑بانوراما عبر توليد عمق موازٍ، velocity circular padding، وregularization بخسارة التشابه، لتعلم تمثيلات جيو‑مترية وتفاصيل التشوه. كمان بيوفر إطار موحد يدعم مهام متعددة عن طريق concatenation على مستوى التوكن، ويتفوّق على الطرق السابقة خاصةً على مقياس FAED.
ليش بتهمّك؟: هالطريقة بتخلّي توليد صور 360° من النصوص أدق وأكتر تماسك، وبتفتح فرص لتطبيقات واقعية أسرع.
panorama generation geometry-aware dataset computer-vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

لما سياسات الكاش التقليدية بتقع: SOLAR للـ Retrieval Buffers

When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers
الفريق Sun وزملاؤه بيّنوا إنه سياسات الكاش القديمة زي LRU وLFU ما بتشتغل كويس مع مخازن التجارب اللي بتعتمد على التشابه الدلالي. اقترحوا SOLAR، إطار تعلمي بيحدّد وقت التعديل بناءً على تراكم الندم (regret) وبياخد قرارات الإزالة عبر تعلم بايزي أونلاين من ردود الفعل الضمنية. أثبتوا إنه SOLAR بيوصل لنسبة تنافسية ثابتة ≤3، يعني ما بيصير أسوأ بكتير من أي طريقة تانية مهما كان حجم الكاش. التجارب على مجموعتي بيانات MemoryBench-Full أظهرت تحسين نسبته بين 5% و75% مقارنةً بـ FIFO.
ليش بتهمّك؟: هالطريقة بتخلّي وكلاء LLM يقدروا يسترجعوا تجاربهم بدقة أكبر وبسرعة، فبيقللوا الأخطاء ويزيدوا الإنتاجية.
retrieval caching LLM online-learning algorithms hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

عالم لا نهائي وتفاعلات مرنة – LingBot-World 2.0

Infinite Worlds with Versatile Interactions
فريق الباحثين قدموا LingBot-World‑Infinity، نسخة مطوّرة من LingBot-World فيها أربع ترقيات أساسية. أولاً، النموذج صار يقدر يتفاعل بلا حدود زمنية وبنفس جودة الإخراج بفضل أسلوب causal pretraining. ثانياً، سوّوا نسخة سريعة بتستجيب بسرعة كافية لتشغيل فيديو 720p بـ60 fps. ثالثاً، زادوا تنوّع الأفعال والسيناريوهات النصية، من الهجوم والرمي للسهام للسحر وإطلاق النار. رابعاً، دمجوا وكيل‑طيار يخطط سلوك الشخصيات ووكيل‑مخرج يخلق عناصر بيئية جديدة، مع واجهة تسمح لعدة لاعبين يشاركون بنفس الوقت، وكل هالشي بيشتغل على GPU واحد بفضل نموذج 1.3B خفيف جنب النموذج الأساسي 14B.
ليش بتهمّك؟: هالورقة بتفتح باب لعوالم تفاعلية غير محدودة وبسرعة تشغيل تناسب التطبيقات الواقعية مثل الألعاب والتعليم الافتراضي.
world modeling agents simulation LLM multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

لما الـ Structured Sparse AutoEncoder (S^2AE) بيفهم المفاهيم عبر الصور والكلام

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities
الفريق قدم طريقة جديدة اسمها Structured Sparse AutoEncoder (S^2AE) لتقوية التفسيرات الميكانيكية بالنماذج اللي بتشتغل على الصور والنصوص. بيجمعوا بَقَع الصورة حسب تشابه انتباه الـ Transformer والقرب المكاني، وبضيفوا تنظيم نادر منظم يخلّي كل خلية مخفية تتخصص بمفهوم واضح ومتماسك داخل كل مجموعة. التجربة على نموذج Qwen2.5-VL-7B-Instruct ورّجت تحسين 6.06% بالـ mIoU وكمان تقليل الـ l0 norm بنسبة 60.81% مع الحفاظ على جودة إعادة البناء فوق 99% من الـ Explained Variance. كمان بيظهر إن الـ S^2AE بيزيد من تماسك المفاهيم عبر الوحدتين البصرية واللغوية، يعني الخلايا بتصير أحادية المعنى أكتر.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج الرؤية-اللغة تفهم وتفصل المفاهيم بشكل أدق، وهذا بيفتح باب تحسين التطبيقات اللي بتعتمد على الفهم المتعدد للوسائط.
multimodal autoencoder sparsity interpretability vision-language arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

LLM كمعلم: تعديل الـ Prompt حسب السياسة لتدريب RL غير قابل للتحقق

LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
الفريق قدم طريقة جديدة تخلي الـ LLM ما يكون بس حكيم، بل يصير معلم كمان. بيستعمل الـ LLM لمقارنة نتايج الـ policy وتكتشف الـ prompts اللي ما فيها تحدي، وبعدين يضيف قيود بسيطة لتقوي الصعوبة خطوة بخطوة. هالطريقة بتخلي صعوبة التدريب تتماشى مع قدرة الـ policy بدون ما نحتاج جداول صعوبة خارجية. التجارب على ثلاث Benchmarks معقدة أظهرت تفوق واضح على الطرق القديمة اللي ما بتراعي السياسة.
ليش بتهمّك؟: لأنها بتحل مشكلة عدم توافق صعوبة الـ prompts مع قدرة النموذج، وبتعطي إشارة مكافأة أوضح لتدريب أقوى.
LLM reinforcement learning prompt adaptation instruction following AI tutoring hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

OpenCoF: توليد فيديو لتدريب التفكير عبر الإطارات

OpenCoF: Learning to Reason Through Video Generation
الفريق قدم OpenCoF، إطار عمل فيه مجموعة بيانات OpenCoF-17K فيها 11 عيلة من المهمات، وجابوا نموذج Wan‑CoF مدرب خصيصًا لتوليد فيديوهات بتعكس التفكير عبر سلسلة من الإطارات (Chain‑of‑Frame). النموذج بيستفيد من إشارات بصرية ونصية لتجميع معلومات منخفضة المستوى وعالية المستوى، وبيظهر تحسن واضح على أربع benchmarks مقارنةً بالbaseline Wan2.2‑I2V‑A14B. كمان الباحثين فحصوا كيف بتأثر هالإشارات بعمق النموذج وخطوات التنقية والمساحة والزمان.
ليش بتهمّك؟: الورقة بتبين إنه تدريب نماذج توليد الفيديو على إشارات زمنية متنوعة بيقوي قدرتها على التفكير المتسلسل، وهاد مهم لتطبيقات تتطلب قرارات موثوقة.
video generation reasoning dataset model multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

ARDY: توليد حركة بشرية تفاعلية بدقة عالية

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation
الفريق قدم ARDY، إطار توليد حركة 3D بيشتغل بشكل مباشر وبسرعة لتطبيقات التفاعل. بيستخدم تمثيل هجين بين خصائص الجذر وembedding للجسم، وبيستفيد من transformer denoiser ذات مرحلتين لتوليد الحركة بناءً على أوامر نصية لحظية وقيود كينمائية مرنة. النموذج تدرب على مجموعة ضخمة من بيانات التقاط الحركة، وبيظهر جودة حركة عالية وقدرة على الالتزام بالقيود على benchmark HumanML3D وBones Rigplay. كمان عرضوا ديمو تفاعلي يخلّي المستخدم يتحكم بالحركة عبر النص أو الفأرة ولوحة المفاتيح.
ليش بتهمّك؟: هالورقة بتخلّي توليد حركات بشرية واقعية وسريعة للأنظمة التفاعلية، يعني ممكن نستخدمها بألعاب أو روبوتات بتتحرك بطبيعية أكتر.
motion generation diffusion interactive human animation ARDY arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

اختيار نموذج اللغة وقت الاختبار مع مراعاة الميزانية

Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models
هالورقة بتطرح فكرة اختيار نموذج اللغة وقت الاختبار مع مراعاة ميزانية محددة. الباحث تشن بيقترح سياسة RoR اللي بتوزّع كل وحدة ميزانية بين إعادة العينة وإعادة التوجيه عشان تعظّم الدقة المتوقعة. التجارب على مجموعة من 11 نموذج مفتوح الوزن بأربع بنشمارك بتظهر إنه السياسة بتوصل لأفضل توازن بين الكلفة والجودة مقارنةً بالبدائل، خاصةً على بنشمارك متنوع. كمان بيّنوا إنه الفائدة بتقلّ إذا كان المتحقق ضعيف.
ليش بتهمّك؟: هالطريقة بتخلّي خدمات LLM تعطي إجابات أدق بدون ما يصرفوا ميزانية زايدة.
LLM model selection budget-aware test-time routing arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

وكيل متعدد الوسائط بهيكلة معرفية للفهم والتوليد

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
الفريق قدم وكيل متعدد الوسائط بهيكلة معرفية بيخزن المعلومات البصرية بذاكرة بصرية حلقيّة وبيسترجعها حسب الحاجة. الوكيل فيه ثلاث مكوّنات: Perceptual Abstraction Engine لتجريد المشاهد، Cognitive Retrieval Engine لاسترجاع الذاكرة عبر الأدوار، وMultimodal Executive Controller لتخطيط المهام واتخاذ القرار. كمان بنوا محرك سيناريو موحد يولّد محادثات متعددة الأدوار مع توضيحات استرجاع دقيقة، وخلقوا benchmark جديد لتقييم القدرة على تذكر المشاهد على مدار 20 دور. النموذج 8B حقق 91.4% دقة استرجاع بأقل نصف زمن الاستدلال مقارنة بالنماذج الكبيرة.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء يشتغلوا بحوارات طويلة بدون ما يبطئوا أو يضيعوا تفاصيل الصور.
multimodal memory agent benchmark retrieval arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | 11 يوليو — 20 ابتكار AI
📚 كل الأعداد