📡 أحدث عدد

شو في AI؟ | 11 يوليو — 20 ابتكار AI

يومي 📅 2026-07-11
سلام 👋 هلقيت هالعدد من النشرة بيغطي 20 دراسة حديثة بالذكاء الاصطناعي، من توليد الفيديو بالموبايل لحتى وكلاء متعدد الوسائط. بدنا نعرضلكم أهم الابتكارات بهالمنطقة بدون مبالغة.
#1

ليش ما بفتح الدرج؟ تقليل الاختصارات المدفوعة بالأشياء في التعرف على الأفعال المركبة بدون تدريب

Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
الفريق قدم طريقة جديدة لتقليل الاختصارات اللي بتستغل وجود الشيء لتحديد الفعل، بدل ما يعتمدوا على الإشارة الزمنية للحركة. حطوا تشخيصات بتقيس هالاختصارات ولاحظوا إن النماذج الحالية بتتدرب على أنماط التوافر بين الفعل والشيء وبتتغافل عن إشارات الفعل. الحل اللي اقترحوه اسمه RCORE، فيه جزئين: تنظيم أول بيساعد النموذج يتعلم تركيبات ما شافها قبل ويعامل الأنماط الشائعة كعينات سلبية، والجزء الثاني بيركّز على حساسية الترتيب الزمني ليتعلم تمثيلات فعلية مدعومة بالوقت. التجارب على مجموعات Sth-com و EK100-com بيّنت إن الطريقة بتقلل الاختصارات وبتحسّن التعميم على تركيبات جديدة.
ليش بتهمّك؟: هالطريقة بتخلي الأنظمة اللي تتعرف على الأفعال تكون أدق وتفهم الحركة مش بس الشيء الموجود، فبتقلل الأخطاء في تطبيقات الحياة الواقعية.
🌱 شو إلك منها؟
تخيل كاميرا أمان بتحاول تميّز إذا حدا عم يفتح باب أو بيقفل، بس إذا كان الباب هو الشيء الوحيد اللي بتعرفه، ممكن تخطئ وتقول إنه يفتح غير موجود. الطريقة الجديدة بتخلي الكاميرا تركز على الحركة نفسها، مش بس على الشيء، فبتعطيك تنبؤات أدق. رح تشوف هالتحسينات بأجهزة المراقبة أو التطبيقات اللي تساعد ذوي الإعاقة بحركة أيديهم.
zero-shot action recognition compositional learning computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

CineMobile: توليد فيديو سينمائي على الموبايل

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation
الفريق قدم CineMobile لتوليد فيديوهات سينمائية من صورة مباشرة على الأجهزة المحمولة. استخدموا ثلاث استراتيجيات: أولاً تقليم موجه بالـdistillation لتصغير حجم النموذج، ثانياً تحويل النموذج المضغوط لمولد بأربع خطوات عبر دمج diffusion distillation مع الـreinforcement learning، وثالثاً تقنية hybrid post‑training quantization لتقليل حجم الذاكرة لأقل من 1 GB. النتائج أظهرت تسريع 40× مقارنةً بالنموذج الأصلي مع جودة بصرية مقاربة، وتوليد فيديو 49‑فريم بدقة 480p بوقت خطوة 0.6 ثانية على GPU و20 ثانية على معالج موبايل MediaTek Dimensity 8400 Ultimate.
ليش بتهمّك؟: هالطريقة بتخلّي إنشاء فيديوهات سينمائية على الموبايل صاير سريع وعملية، يعني ما بدنا ننتظر ساعات لتوليد مشهد من صورة وحدة.
🌱 شو إلك منها؟
بتقدر تاخد صورة من موبايلك وتحوّلها لفيديو قصير متحرك زي ما بنشوف بأفلام الأكشن، مثلاً تأثير bullet‑time أو dolly‑zoom، بدون ما تحتاج كمبيوتر قوي. هالشي بيظهر بتطبيقات التعديل على الفيديو اللي بتستعملها يوميًا، مثل الفلاتر المتقدمة أو أدوات القص القصير على السوشيال ميديا.
diffusion video generation mobile compression computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

UniClawBench: معيار شامل للوكيل النشط على مهام العالم الحقيقي

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
فريق Chen وزملاؤه قدموا UniClawBench، أول معيار بيركّز على قدرات الوكلاء النشطين بخمس مهارات أساسية: Skill Usage، Exploration، Long-Context Reasoning، Multimodal Understanding، وCross-Platform Coordination. صمموا 400 مهمة ثنائية اللغة من واقع الحياة، وبيقييموا الوكلاء داخل حاويات Docker مباشرةً بخطوات تفصيلية. كمان حطّوا نظام تقييم حلقي فيه وكيل منفّذ، وكيل مشرف مخفي، وكيل مستخدم لتقليد ردود فعل بشرية متعددة الجولات بدون ما ينعرف معيار التقييم. النتائج بتفرجي كيف قدرات النموذج الأساسي وتصميم إطار الوكيل بيتفاعلوا سوا لتحدد الأداء.
ليش بتهمّك؟: هالمعيار بيساعد الباحثين يحددوا بالضبط وين الوكلاء بيفشلوا ويطوّروا أدوات أذكى وأقوى للمهام اليومية.
🌱 شو إلك منها؟
تخيل إنه المساعد الصوتي عندك يقدر يتعامل مع تطبيقات متعددة مثل حجز موعد أو طلب طعام بدون ما تحتاج تشرح كل خطوة. هالمعيار بيخلّي هالتقنية تتدرّب على مواقف حقيقية، فبالمستقبل رح تشوف مساعدات أكتر فاعلية وسهولة. ممكن تلاقي هالتطورات بأجهزة الهواتف أو الخدمات الذكية اللي بتستعملها كل يوم.
benchmark agents multimodal evaluation LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

Canvas360: تحسين توليد البانوراما داخل السياق بالوعي الهندسي

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining
الفريق قدم Canvas360، إطار من مرحلتين لتوليد بانوراما داخل السياق. بيجمع بين pretraining واعٍ للجيومتري و fine‑tuning مخصوص للمهام، وبنوا Canvas360Dataset فيه مليون عينة بانورامية عالية الجودة لتطبيقات نقل الأسلوب، الاستكمال، التوسيع، والتعديل. على مستوى النموذج، Canvas360 بيحسّن توليد النص‑إلى‑بانوراما عبر توليد عمق موازٍ، velocity circular padding، وregularization بخسارة التشابه، لتعلم تمثيلات جيو‑مترية وتفاصيل التشوه. كمان بيوفر إطار موحد يدعم مهام متعددة عن طريق concatenation على مستوى التوكن، ويتفوّق على الطرق السابقة خاصةً على مقياس FAED.
ليش بتهمّك؟: هالطريقة بتخلّي توليد صور 360° من النصوص أدق وأكتر تماسك، وبتفتح فرص لتطبيقات واقعية أسرع.
🌱 شو إلك منها؟
تخيّل إنك تكتب وصف بسيط لمكان وتطلع لك صورة بانورامية كاملة، كأنك بتتفرج على مشهد من كل الجهات على هاتفك. هالشي بيسهّل على الناس تصمم ديكورات داخلية أو تتخيل رحلات افتراضية بدون ما يحتاجوا خبرة بالتصميم. ممكن تشوف هالتقنية بالمستقبل على تطبيقات الواقع المعزز أو ألعاب الفيديو.
panorama generation geometry-aware dataset computer-vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

لما سياسات الكاش التقليدية بتقع: SOLAR للـ Retrieval Buffers

When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers
الفريق Sun وزملاؤه بيّنوا إنه سياسات الكاش القديمة زي LRU وLFU ما بتشتغل كويس مع مخازن التجارب اللي بتعتمد على التشابه الدلالي. اقترحوا SOLAR، إطار تعلمي بيحدّد وقت التعديل بناءً على تراكم الندم (regret) وبياخد قرارات الإزالة عبر تعلم بايزي أونلاين من ردود الفعل الضمنية. أثبتوا إنه SOLAR بيوصل لنسبة تنافسية ثابتة ≤3، يعني ما بيصير أسوأ بكتير من أي طريقة تانية مهما كان حجم الكاش. التجارب على مجموعتي بيانات MemoryBench-Full أظهرت تحسين نسبته بين 5% و75% مقارنةً بـ FIFO.
ليش بتهمّك؟: هالطريقة بتخلّي وكلاء LLM يقدروا يسترجعوا تجاربهم بدقة أكبر وبسرعة، فبيقللوا الأخطاء ويزيدوا الإنتاجية.
🌱 شو إلك منها؟
تخيل إنك عندك خزانة لتخزين أغراضك، والطرق القديمة بتنظّمها حسب الوقت أو عدد الاستخدام، بس ما بتفكر إذا هالأغراض متشابهة أو لا. SOLAR بيقترح ترتّبها حسب تشابهها الفعلي، فبتلاقي اللي بتحتاجه أسرع. هالشي ممكن تشوفه في تطبيقات المساعدين الذكيين اللي يذكروا لك معلومات سابقة بدقة أكبر، مثل المساعدات الصوتية أو أدوات الدردشة.
retrieval caching LLM online-learning algorithms hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

عالم لا نهائي وتفاعلات مرنة – LingBot-World 2.0

Infinite Worlds with Versatile Interactions
فريق الباحثين قدموا LingBot-World‑Infinity، نسخة مطوّرة من LingBot-World فيها أربع ترقيات أساسية. أولاً، النموذج صار يقدر يتفاعل بلا حدود زمنية وبنفس جودة الإخراج بفضل أسلوب causal pretraining. ثانياً، سوّوا نسخة سريعة بتستجيب بسرعة كافية لتشغيل فيديو 720p بـ60 fps. ثالثاً، زادوا تنوّع الأفعال والسيناريوهات النصية، من الهجوم والرمي للسهام للسحر وإطلاق النار. رابعاً، دمجوا وكيل‑طيار يخطط سلوك الشخصيات ووكيل‑مخرج يخلق عناصر بيئية جديدة، مع واجهة تسمح لعدة لاعبين يشاركون بنفس الوقت، وكل هالشي بيشتغل على GPU واحد بفضل نموذج 1.3B خفيف جنب النموذج الأساسي 14B.
ليش بتهمّك؟: هالورقة بتفتح باب لعوالم تفاعلية غير محدودة وبسرعة تشغيل تناسب التطبيقات الواقعية مثل الألعاب والتعليم الافتراضي.
🌱 شو إلك منها؟
تخيّل لعبة فيديو فيها شخصيتك تقدر تتصرف بحرية، من القتال للسحر، وكل هالشي بيصير لحظيًا على جهازك. هالنظام بيخلّي التجربة أكتر واقعية وممتعة، وبيقدر أي حدا يشارك مع أصدقائه بنفس الوقت. ممكن تشوف هالتقنية بالمستقبل بألعاب أو تطبيقات تعليمية على الإنترنت.
world modeling agents simulation LLM multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

لما الـ Structured Sparse AutoEncoder (S^2AE) بيفهم المفاهيم عبر الصور والكلام

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities
الفريق قدم طريقة جديدة اسمها Structured Sparse AutoEncoder (S^2AE) لتقوية التفسيرات الميكانيكية بالنماذج اللي بتشتغل على الصور والنصوص. بيجمعوا بَقَع الصورة حسب تشابه انتباه الـ Transformer والقرب المكاني، وبضيفوا تنظيم نادر منظم يخلّي كل خلية مخفية تتخصص بمفهوم واضح ومتماسك داخل كل مجموعة. التجربة على نموذج Qwen2.5-VL-7B-Instruct ورّجت تحسين 6.06% بالـ mIoU وكمان تقليل الـ l0 norm بنسبة 60.81% مع الحفاظ على جودة إعادة البناء فوق 99% من الـ Explained Variance. كمان بيظهر إن الـ S^2AE بيزيد من تماسك المفاهيم عبر الوحدتين البصرية واللغوية، يعني الخلايا بتصير أحادية المعنى أكتر.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج الرؤية-اللغة تفهم وتفصل المفاهيم بشكل أدق، وهذا بيفتح باب تحسين التطبيقات اللي بتعتمد على الفهم المتعدد للوسائط.
🌱 شو إلك منها؟
تخيل إنه برنامج يقدر يربط بين صورة وكلام بشكل أوضح، مثلاً يلقط صورة للقط ويعرف إنه القطة عم تلعب بكرّة، وبنفس الوقت يكتب جملة توصف هالمشهد بدقة. هالتحسين بيخلي محركات البحث أو التطبيقات الذكية تعطيك نتائج أقرب للواقع وتقلل الأخطاء. رح تشوف الفرق إذا استخدمت تطبيقات ترجمة الصور أو أدوات المساعدة البصرية على موبايلك.
multimodal autoencoder sparsity interpretability vision-language arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

LLM كمعلم: تعديل الـ Prompt حسب السياسة لتدريب RL غير قابل للتحقق

LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
الفريق قدم طريقة جديدة تخلي الـ LLM ما يكون بس حكيم، بل يصير معلم كمان. بيستعمل الـ LLM لمقارنة نتايج الـ policy وتكتشف الـ prompts اللي ما فيها تحدي، وبعدين يضيف قيود بسيطة لتقوي الصعوبة خطوة بخطوة. هالطريقة بتخلي صعوبة التدريب تتماشى مع قدرة الـ policy بدون ما نحتاج جداول صعوبة خارجية. التجارب على ثلاث Benchmarks معقدة أظهرت تفوق واضح على الطرق القديمة اللي ما بتراعي السياسة.
ليش بتهمّك؟: لأنها بتحل مشكلة عدم توافق صعوبة الـ prompts مع قدرة النموذج، وبتعطي إشارة مكافأة أوضح لتدريب أقوى.
🌱 شو إلك منها؟
تخيل إنك عم تتعلم شي جديد ومعلمك يضيف لك أسئلة صعبة شوي مع كل خطوة، لحتى ما تضلّ على نفس المستوى. هالطريقة بتعمل هيك مع الذكاء الاصطناعي، فبتخلي البرنامج يتطور أسرع. ممكن تشوف النتيجة بأدوات التعليم الذكي أو التطبيقات اللي تعتمد على تعليم تلقائي.
LLM reinforcement learning prompt adaptation instruction following AI tutoring hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

OpenCoF: توليد فيديو لتدريب التفكير عبر الإطارات

OpenCoF: Learning to Reason Through Video Generation
الفريق قدم OpenCoF، إطار عمل فيه مجموعة بيانات OpenCoF-17K فيها 11 عيلة من المهمات، وجابوا نموذج Wan‑CoF مدرب خصيصًا لتوليد فيديوهات بتعكس التفكير عبر سلسلة من الإطارات (Chain‑of‑Frame). النموذج بيستفيد من إشارات بصرية ونصية لتجميع معلومات منخفضة المستوى وعالية المستوى، وبيظهر تحسن واضح على أربع benchmarks مقارنةً بالbaseline Wan2.2‑I2V‑A14B. كمان الباحثين فحصوا كيف بتأثر هالإشارات بعمق النموذج وخطوات التنقية والمساحة والزمان.
ليش بتهمّك؟: الورقة بتبين إنه تدريب نماذج توليد الفيديو على إشارات زمنية متنوعة بيقوي قدرتها على التفكير المتسلسل، وهاد مهم لتطبيقات تتطلب قرارات موثوقة.
🌱 شو إلك منها؟
تخيل إنك تشوف فيديو يشرح خطوة خطوة حل مشكلة، مش بس صور متقطعة. هالتقنية بتخلي الفيديوهات تتصرف كأنها عم تفكر وتستنتج، فممكن تستفيد منها في تعليم الأطفال أو شرح إجراءات طبية بطريقة أسهل. ممكن تلاقيها قريبًا بأدوات التعليم عن بُعد أو التطبيقات اللي بتساعدك تحل مشاكل يومية بالفيديو.
video generation reasoning dataset model multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

ARDY: توليد حركة بشرية تفاعلية بدقة عالية

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation
الفريق قدم ARDY، إطار توليد حركة 3D بيشتغل بشكل مباشر وبسرعة لتطبيقات التفاعل. بيستخدم تمثيل هجين بين خصائص الجذر وembedding للجسم، وبيستفيد من transformer denoiser ذات مرحلتين لتوليد الحركة بناءً على أوامر نصية لحظية وقيود كينمائية مرنة. النموذج تدرب على مجموعة ضخمة من بيانات التقاط الحركة، وبيظهر جودة حركة عالية وقدرة على الالتزام بالقيود على benchmark HumanML3D وBones Rigplay. كمان عرضوا ديمو تفاعلي يخلّي المستخدم يتحكم بالحركة عبر النص أو الفأرة ولوحة المفاتيح.
ليش بتهمّك؟: هالورقة بتخلّي توليد حركات بشرية واقعية وسريعة للأنظمة التفاعلية، يعني ممكن نستخدمها بألعاب أو روبوتات بتتحرك بطبيعية أكتر.
🌱 شو إلك منها؟
تخيل إنك عم تلعب لعبة أو تتعامل مع روبوت وبتقدر تقول له "امشي بسرعة" أو "قف عند هالنقطة"، وهو يطبق الحركة فورًا وبشكل طبيعي. الفكرة زي ما بنحكي مع صديق بنص الرسائل، بس هون بنحكي مع شخصية ثلاثية الأبعاد. ممكن تشوف هالتقنية بالمستقبل بألعاب الفيديو أو تطبيقات الواقع الافتراضي اللي بتستجيب لأوامرك النصية مباشرة.
motion generation diffusion interactive human animation ARDY arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

اختيار نموذج اللغة وقت الاختبار مع مراعاة الميزانية

Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models
هالورقة بتطرح فكرة اختيار نموذج اللغة وقت الاختبار مع مراعاة ميزانية محددة. الباحث تشن بيقترح سياسة RoR اللي بتوزّع كل وحدة ميزانية بين إعادة العينة وإعادة التوجيه عشان تعظّم الدقة المتوقعة. التجارب على مجموعة من 11 نموذج مفتوح الوزن بأربع بنشمارك بتظهر إنه السياسة بتوصل لأفضل توازن بين الكلفة والجودة مقارنةً بالبدائل، خاصةً على بنشمارك متنوع. كمان بيّنوا إنه الفائدة بتقلّ إذا كان المتحقق ضعيف.
ليش بتهمّك؟: هالطريقة بتخلّي خدمات LLM تعطي إجابات أدق بدون ما يصرفوا ميزانية زايدة.
🌱 شو إلك منها؟
تخيل إنك عم تسأل شات بوت وجوابه مش واضح، النظام بيقدر يراجع الجواب أو يغيّر النموذج اللي بيجاوب، وكل هالشي ضمن ميزانية محددة، فبتحصل على إجابة أحسن بدون ما تدفع أكتر. زي ما بتجرب أكتر من مطعم قبل ما تختار، بس المرة هادي على الإنترنت. هالشي ممكن تشوفه بخدمات الدردشة أو المساعدين الرقميين اللي بتحكي إنه جودة الردود صارت أعلى.
LLM model selection budget-aware test-time routing arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

وكيل متعدد الوسائط بهيكلة معرفية للفهم والتوليد

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
الفريق قدم وكيل متعدد الوسائط بهيكلة معرفية بيخزن المعلومات البصرية بذاكرة بصرية حلقيّة وبيسترجعها حسب الحاجة. الوكيل فيه ثلاث مكوّنات: Perceptual Abstraction Engine لتجريد المشاهد، Cognitive Retrieval Engine لاسترجاع الذاكرة عبر الأدوار، وMultimodal Executive Controller لتخطيط المهام واتخاذ القرار. كمان بنوا محرك سيناريو موحد يولّد محادثات متعددة الأدوار مع توضيحات استرجاع دقيقة، وخلقوا benchmark جديد لتقييم القدرة على تذكر المشاهد على مدار 20 دور. النموذج 8B حقق 91.4% دقة استرجاع بأقل نصف زمن الاستدلال مقارنة بالنماذج الكبيرة.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء يشتغلوا بحوارات طويلة بدون ما يبطئوا أو يضيعوا تفاصيل الصور.
🌱 شو إلك منها؟
تخيّل إنك تحكي مع برنامج يقدر يتذكر كل الصور اللي شفتها خلال محادثة طويلة، ويقدر يضيف أو يغيّر صور حسب طلبك بسرعة. هالشي بيساعدك لما تحتاج تعديل صور في شغل أو تصميم بدون تكرار رفع الصور كل مرة. ممكن تشوف هالقدرة بأدوات تعديل الصور أو مساعدات التصميم اللي بتستخدم الذاكرة.
multimodal memory agent benchmark retrieval arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

UP: تحسين غير محدود لتفادي معضلة الاستكشاف‑الثبات بالـ RL

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma
الفريق قدم طريقة جديدة اسمها Unbounded Positive Asymmetric Optimization أو UP، بتخلّي خوارزميات الـ RL تقدر تستكشف أكتر من غير ما تتعرّض لعدم الاستقرار. الفكرة إنه بستخدموا stop‑gradient لتثبّت السياسة الحالية، وبعطوا الـ gradients الإيجابية حرية ما فيها clipping، بينما يظلوا يطبقوا clipping للـ gradients السلبية لتجنّب الفوضى. الطريقة شغّالة على مستويات مختلفة من التحديث، من مستوى الكلمة (GRPO, DAPO) للعبارة الكاملة (GSPO). التجارب أظهرت إنه UP بتحسّن قدرة الاستكشاف وبترفع دقة الاستدلال عبر نماذج مختلفة وتطبيقات متعددة.
ليش بتهمّك؟: لأنّ UP بيخلّي نماذج اللغة تتعلم أسرع وأكتر دقة بدون ما يطيحوا بسبب تقلبات التدريب، وهذا بيفتح باب لتطبيقات أذكى وأقوى للـ LLMs.
🌱 شو إلك منها؟
تخيّل إنّ برنامج دردشة يقدر يجرب أفكار جديدة ويستكشف حلول مختلفة من غير ما يطيح أو يوقف فجأة، مثل طالب بيجرب حلول كتيرة قبل ما يختار الأنسب. هالطريقة بتخلي الذكاء الاصطناعي يشتغل بثقة أكبر، وبتظهر أكتر في الخدمات اللي بنستعملها يوميًا مثل المساعدات الصوتية أو تطبيقات الترجمة.
reinforcement learning LLM optimization exploration hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

PaperPilot: بحث علمي متعدد الجولات مع تدفق عمل قابل للتعديل

Multi-Turn Agentic Scientific Literature Search via Workflow Induction
الفريق قدم PaperPilot، وكيل بحث علمي بيشتغل على أكتر من جولة. بيحوّل الاستعلام مع ورقة مرجعية إلى DAG من عمليات البحث مثل keyword search، توسيع الاستشهادات، تصفية، ترتيب، واستخراج دليل. المستخدم يقدر يعطي ملاحظات لتعديل الاستعلام أو تدفق العمل، والنظام يتعلم من هالملاحظات عبر supervised imitation وتفضيل التحسين. التجارب أظهرت إن PaperPilot-9B رفع Hit@5 من 58.0 إلى 77.0، وقلل الأخطاء لدرجة الصفر.
ليش بتهمّك؟: هالطريقة بتخلّي البحث العلمي أسرع وأكثر تحكم، خصوصاً للباحثين اللي بدهم يحددوا استراتيجيتهم بدقة.
🌱 شو إلك منها؟
تخيّل إنك عم تدور على مقالات لتكتب بحثك، وبدال ما تكتب كل استفسار من جديد، البرنامج بيساعدك يركّب خطوات البحث ويعدلها حسب ملاحظاتك. يعني زي ما بتلعب بلعبة تركيب قطع، كل خطوة بتضيفها أو تشيلها بسهولة. هالشي ممكن تشوفه بأدوات البحث الأكاديمي اللي رح تصير أذكى وتوفر وقتك.
agent literature search workflow multi-turn evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

PointDiT: تقدير الهندسة من صورة وحدة بالـ Diffusion

PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation
الفريق قدم نموذج Diffusion Transformer بسيط مبني على ViT، بيشتغل مباشرة على قطع خريطة النقاط الثلاثية الأبعاد من الصورة وبيستفيد من توكنات الصورة اللي جهّزها DINOv3 المدرب مسبقاً. التدريب صار من الصفر بدون ما نحتاج محولات لتشفير خريطة النقاط، فبنتفادى التعقيدات الكبيرة للمعمارية والهياكل الضائعة. بالرغم من بساطته، النموذج بيتفوق على أساليب الـ latent diffusion المعقّدة وبيعطي تفاصيل هندسية أنقى، خصوصاً بالمناطق الصعبة مثل الأجسام الشفافة.
ليش بتهمّك؟: بيسهل بناء نماذج ثلاثية الأبعاد من صورة وحدة وبجودة أعلى، وبيقلل الجهد الهندسي اللازم لتصميم الأنظمة.
🌱 شو إلك منها؟
مع هالطريقة، تطبيقات الهواتف تقدر تحوّل صورة واحدة إلى نموذج ثلاثي الأبعاد واضح، مثل لما تصوّر كوب زجاجي وتشوفه كأنه مجسم حقيقي. هالشي بيساعدك تحط الأثاث بالبيت أو تعمل شخصيات افتراضية بدقة أكبر. رح تلاقي هالتقنية ضمن تطبيقات الواقع المعزز والـ AR اللي بنستعملها يومياً.
diffusion 3D reconstruction vision transformer geometry hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

إختبار الجينات للأفكار العلمية: فكرة جديدة لتقييم سلالات البحث

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation
الفريق بقيادة Yifan Zhou قدموا IG-Bench، مجموعة قياس جديدة بتختبر قدرة الأنظمة الذكية على تتبع سلالات الأفكار العلمية وتوليد اقتراحات جديدة مبنية على هالسلالة. كل ورقة أو اقتراح بنمثله بمجموعة من كائنات Idea Genome المدعومة بالأدلة، وبنرتّبها عبر GenomeDiff لتوضح الوراثة، التحوّرات، والإدخالات الجديدة. الاختبار فيه جزأين: IG-Exam لتقييم الفهم المغلق للسلالة، وIG-Arena لتقييم توليد اقتراحات جديدة بتتبع السلالة. التجارب على 14 LLM أظهرت إن أقوى نظام وصل لـ27.3% دقة بس، يعني لسه في كتير شغل لتطوير هالقدرة.
ليش بتهمّك؟: هالورقة بتفرجي كيف إنّ الذكاء الاصطناعي لسا ما بيقدر يلاحق تعقيد سلالات الأفكار العلمية، وهاد مهم لتطوير أنظمة بحثية أذكى.
🌱 شو إلك منها؟
تخيل إنه برنامج بيساعدك تكتب بحث علمي يقدر يعرّف لك شو الأفكار اللي جت منين وشو الجديد اللي ممكن تضيفه، زي ما بنشوف شجر العيلة. هالشي بيسهّل على الباحثين يلاقوا فجوات بالمعرفة ويقترحوا حلول مبتكرة. ممكن تشوف هالتقنية تنضم لأدوات كتابة الأبحاث أو منصات البحث على الإنترنت قريباً.
benchmark lineage scientific reasoning LLM generation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

AUTOPILOT VQA: تقييم نماذج الرؤية‑اللغة لفهم حوادث الداشكام

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding
الفريق اللي اسمه Siddharth Damodharan وزملاؤه قدموا benchmark جديد اسمه AUTOPILOT‑VQA لتقييم قدرة نماذج الرؤية‑اللغة على فهم الحوادث الواقعية من فيديوهات الداشكام. الأسئلة بالمجموعة مصممة لتغطي ظروف الطقس، الإضاءة، بيئة المرور، حالة الطريق، العلامات، والكيانات المتورطة، وحتى إذا كان ممكن نتفادى الحادث. النموذج لازم يجاوب على أسئلة grounded عن خصائص المشهد والسياق الزمني للحادث، مش بس يحدد الأشياء. هالbenchmark رح يخلّي الباحثين يطوّروا نماذج أكثر أمان وتفسير للقيادة الذاتية.
ليش بتهمّك؟: هالورقة بتعطي معيار واضح لنقّيم إذا نماذج الذكاء الاصطناعي فعلاً بتفهم وتتفادى مواقف خطر على الطريق.
🌱 شو إلك منها؟
تخيل إنه سيارتك تقدر تحكي لك ليه توقّفت فجأة بسبب زحمة أو مطر غزير، وتساعدك تتجنّب خطر قبل ما يصير. الفكرة زي ما بنشوف تطبيقات المساعد الصوتي، بس هالمرة بتركّز على السلامة على الطريق. ممكن تشوف هالتقنية بالمستقبل بخرائط الملاحة أو أنظمة المساعدة للقيادة.
VQA autonomous driving benchmark multimodal safety arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

RL بعد التدريب يبني استراتيجيات تفكير تركيبي

RL Post-Training Builds Compositional Reasoning Strategies
الفريق Abdulsalam و Patel و Saxe درسوا إذا كان الـRL بعد التدريب بس بيقوّي المهارات البسيطة اللي موجودة بالنموذج الأساسي، أو إذا بيقدر يركّب هالمهارات ليصنع استراتيجيات أعلى. استخدموا بيئة rewrite‑grammar واضحة، وعلموا Transformer على سلاسل تحويل رموز بسيطة، وبعدها درّبوا الـRL على مهمة reasoning مع مكافأة نهائية ثنائية. الـRL قدر يحل مشاكل ما قدر النموذج الأصلي يحلها حتى مع عدد كبير من التجارب، بينما طريقة rejection fine‑tuning تحسّن بالبداية بس بتوقف. التحليل بيظهر إن الـRL يغيّر الكفاءات الأولية بخطوات: يقوّي التخفيضات الأولية، بعدين يكتشف إجراءات مركبة إما متسلسلة أو موازية، ويستعملها مرّات كثيرة.
ليش بتهمّك؟: النتيجة بتورّج إن الـRL ممكن يرفع قدرات النماذج اللغوية لتفكير تركيبي أقوى من مجرد تحسين عشوائي.
🌱 شو إلك منها؟
تخيل إنك عم تتعلم شغلة جديدة، أول شي بتتقوى الأساسيات، وبعدين بتجمعها لتعمل شغلة معقّدة بسهولة. هالطريقة بتخلي التطبيقات اللي تعتمد على الذكاء الاصطناعي، مثل المساعدات الصوتية أو أدوات الكتابة، يقدروا يحلّوا أسئلة أو يكتبوا نصوص أكتر تعقيدًا بدون ما تحتاجوا لتدريب ضخم كل مرة. يعني رح تشوف تحسين واضح بقدرة البرامج على الفهم والتعامل مع مشاكل معقّدة بشكل أسرع وأسهل.
reinforcement-learning compositionality language-models transformer reasoning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

GIFT: تحسين نقل الـ Gradient بدقة منخفضة للـ LLM

GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining
الفريق قدم طريقة جديدة اسمها GIFT لتقليل حجم التواصل بين الأجهزة أثناء تدريب نماذج اللغة الكبيرة. الفكرة إنه بيحوّلوا الـ gradients لمجال قريب من المتساوية (near‑isotropic) قبل ما يضغطوها بصيغ FP8 أو NVFP4، فبيصير التشويه أقل. التجربة على موديلات Llama-300M وLlama-600M ورّجت إنه التدريب صار أسرع بحوالي 7.6% وعلى نفس الوقت بتحافظ على جودة النتائج بالمقارنة مع الضغط التقليدي.
ليش بتهمّك؟: هالطريقة بتخفّف عبء التواصل بالـ gradient، فبتقلّل وقت تدريب الـ LLM وبتخلّي النماذج الكبيرة تصير أقرب للواقع بأسرع وقت.
🌱 شو إلك منها؟
تخيّل إنك عم تحزم شغلاتك للسفر وتلاقي طريقة جديدة لتقليل حجم الشنطة بدون ما تفقد أي شي مهم، هيك بالضبط GIFT بيقلل حجم البيانات اللي لازم تننقل بين الأجهزة. هالتحسين يعني إنه الخدمات الذكية مثل المساعدات الصوتية أو الترجمة رح تصير أسرع وتستجيب أسرع. إذا بتستعمل أي تطبيق مبني على نماذج لغة كبيرة، رح تلاحظ الفرق بالسرعة والفعالية.
low-precision gradient compression LLM training efficiency arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

MuseBench: اختبار الفهم الإبداعي للموديلات المتعددة الوسائط

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs
المؤلفين قدموا MuseBench، بنشمارك جديد بيقيس قدرة الموديلات الكبيرة المتعددة الوسائط على الفهم العميق للمعنى الفني. بيضم 4,016 سؤال من السينما، الفنون البصرية، المسرح، وألعاب الفيديو، وبيختبر إذا الموديل بيقدر يفسّر نوايا الفنان مش بس يتعرف على المشهد. التقييم الصفر‑شوت على 28 موديل بيظهر إن أحسن موديل وصل لـ48.29% بس، بينما الخبراء البشر يوصلوا لـ87.18%
ليش بتهمّك؟: الموضوع مهم لأنه بيفتح باب لتطوير موديلات تفهم الفن وتقدر تساعد الفنانين والباحثين يفسّروا الأعمال الإبداعية
🌱 شو إلك منها؟
لو عندك تطبيق بيشرح لك أفلام أو لوحات، هالتقنية ممكن تخليك تفهم ليش الفنان اختار هاللون أو هاللقطة، زي ما بنحكي لصحابنا. مثلاً، برنامج يشرحلك مشهد فيلم ويقول لك ليه بيخوف أو بيفرح. هالشي ممكن تصادفه بأدوات توصية الأفلام أو تطبيقات تعليمية
multimodal benchmark arts evaluation language-models hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 10
💡 مفاهيم 8
Zero-Shot Compositional Action Recognition
تقنية بتخلي النموذج يتعرف على أفعال جديدة ما شافها قبل، عن طريق تجميع مكونات أفعال معروفة.
Temporal Order Regularization
الـ Temporal Order Regularization طريقة بنضيفها لتدريب الموديلات عشان تحافظ على ترتيب الأحداث عبر الزمن، بنقلل الأخطاء اللي بتصير بسبب خلط التسلسل.
distillation
تقنية بنأخذ فيها نموذج ذكاء اصطناعي كبير وقوي ونعلّم نموذج أصغر يحاكيه، عشان نحصل على أداء شبه نفس الشي بحجم أقلّ وسرعة أسرع.
reinforcement learning
تعليم الذكاء الاصطناعي من خلال نظام الحوافز والعقوبات، زي لما تعلمي طفل بالمكافأة والعقاب عشان يتعلم السلوك الصحيح. بنستخدمه عشان الآلة تتعلم تاخذ قرارات ذكية بنفسها من غير ما نحطّ كل إجابة جاهزة.
post-training quantization
post-training quantization هو تقليل دقة أوزان الموديل بعد ما تدرب، عشان نقلل حجمه وسرعة التنفيذ بدون ما نخسر كتير من الدقة.
Skill Usage
Skill Usage يعني كيف بنستعمل المهارات داخل نموذج الذكاء الاصطناعي، بنقيس إشي بنقدر نطبّق المعرفة بحالات مختلفة، عشان نفهم قدرته العملية.
Long-Context Reasoning
Long-Context Reasoning هو قدرة النموذج على التفكير وتحليل معلومات طولها كبير، يعني يقدر يربط إشي من بداية النص لنهايته، مش بس جمل قصيرة.
Docker
Docker أداة بنستعملها لتغليف التطبيقات داخل حاويات، يعني بنحط كل شي يحتاجه البرنامج بواحد الإطار، عشان نقدر نشغّله على أي جهاز بسهولة.
🤖 موديلز 1
Diffusion Transformers (DiTs)
Diffusion Transformers (DiTs) نموذج بدمج فكرة الـ diffusion مع الـ Transformers لتوليد صور أو بيانات بصورة تدريجية، بنستعمله عشان نحصل على توليد عالي الجودة.
📏 مقاييس 1
FAED
مقياس بيساعدنا نقيم جودة الفهم أو التوليد، اسمه اختصار لـ... بنستعمله عشان يطلع لنا رقم واضح يوضح الأداء ويقارن بين النماذج.
كل المصطلحات ←
العدد السابقشو في AI؟ | 10 يوليو — وكلاء ذكيين وتقييم شامل
📚 كل الأعداد