📡 أحدث عدد

شو في AI؟ | 19 يوليو — وكيل ذكي وتعاون متعدد

يومي 📅 2026-07-19
سلام 👋 في هذا العدد بنستعرض أحدث التطورات بالذكاء الاصطناعي، خاصةً الوكلاء الذكيين وتعاونهم عبر الوسائط المتعددة. بنركز على نماذج جديدة، تقييمات دقيقة، وإطارات عمل مبتكرة.
#1

Vinci2: مساعد ذكي استباقي للفيديوهات الذاتية المستمرة

Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
الفريق قدم نظام Vinci2 اللي بيحوّل المساعد الذكي من رد فعل بس إلى استباقية، يعني بيقرر إذا كان لازم يتدخل ولا لا بناءً على اللي صار قبل هيك بالفيديو. حطوا benchmark جديد اسمه EgoServe فيه أكتر من 3,000 حالة خدمة موزعة على أربع فترات زمنية، من تنبيهات أمان فورية لحد تدريب عادات على المدى الطويل. كمان صمموا وكيل بدون تدريب اسمه EgoMemo بيحافظ على ثلاث ذواكر: ملخصات زمنية متعددة المقاييس، رسم بياني معرفي، وأرشيف للتمثيلات البصرية، وبيستعمل استرجاع معزّز للتفكير قبل ما يعطي رد. التجارب أظهرت إن EgoMemo يحقق نتائج قوية على EgoServe وكمان يظل منافس على benchmarks تانية بالفيديو الذاتي.
ليش بتهمّك؟: هالورقة بتخلّي المساعدات الرقمية تكون أذكى وتدخل بوقت مناسب، مش بس يرد على أوامرنا، وهاد بيفتح باب لتطبيقات أمان وتدريب شخصية أدفن.
🌱 شو إلك منها؟
تخيل إنك عم تمشي بالشارع والموبايل يقدر يوعّيك إذا في خطر قريب أو إذا كنت ناسي تشرب ميّ. النظام بيشتغل مثل صديق بيلاحِظك طول الوقت وبيقرر إذا لازم يحكي معك أو يتركك لحالك. ممكن تشوف هالشيّ يطلع بأجهزة ذكية أو تطبيقات سلامة شخصية تستخدم هالتقنية.
egocentric proactive-assistance benchmark memory-augmented AI-assistant hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

UniVR: التفكير بالفضاء البصري للمنطق الموحد

UniVR: Thinking in Visual Space for Unified Visual Reasoning
الفريق قدم UniVR، أول نموذج بيفكّر ويخطط من خلال الصور بس، بدون ما يحتاج لتعليمات نصية أو قواعد خاصة لكل مهمة. بيستعمل طريقة جديدة اسمها VR‑GRPO فيها مكافآت عالمية ومكافآت خطوة بخطوة لتضمن إن التفكير يكون منطقي ومتسق مع الفيزياء. لتدريب وتقييمه بنوا مجموعة بيانات ضخمة اسمها VR‑X تجمع سيناريوهات من تحريك أشياء لفترات طويلة، أحجية مكانية، وتفكير فيزيائي. النتيجة إن UniVR حسّن الأداء لحد 25٪ على هالمجموعة وكمان رفع نتائجه على اختبارات فهم متعددة الوسائط.
ليش بتهمّك؟: هالورقة بتفرجي إنو ممكن نتعلم من الفيديوهات بس ونطوّر نماذج تفكّر وتخطط بذكاء، بدون ما نكتب تعليمات معقّدة لكل حالة.
🌱 شو إلك منها؟
تخيل إنك تقدر تعلم برنامج يشتغل على فيديوهات البيت ويعرف يرتّب الأغراض أو يحلّ puzzles من غير ما تعطيه أوامر مكتوبة. هالشي رح يخلّي الروبوتات أو التطبيقات اليومية أذكى وتقدر تساعدنا بأعمال البيت أو الألعاب. ممكن تشوف هالتقنية تصير موجودة بألعاب الفيديو أو تطبيقات المساعدة المنزلية قريباً.
visual reasoning reinforcement learning benchmark multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

تسجيلات بتقوّي Diffusion Transformers بالبيكسل

Registers Matter for Pixel-Space Diffusion Transformers
الفريق كشف إنو بالرغم من إنو Diffusion Transformers ما فيها outliers متل Vision Transformers، بس التسجيلات (register tokens) بتساعدها كتير، خصوصًا بالبيكسل‑سبيس. بتحليلهم للتمثيلات المتوسطة لقوا إنو هالتسجيلات بتنظف الفيتشر مابس لما الضوضاء عالية، وهاد بيقوي جودة الصورة المتولدة. كمان لاحظوا إنو بعض هياكل الـ DiT الحديثة بتدخل آلية شبه التسجيلات بشكل ضمني، وهاد ممكن يفسر الأداء القوي إلها. بناءً على هيك، اقترحوا طريقة Register Guidance لتقوّي دور التسجيلات وتزيد من وضوح البنية البصرية.
ليش بتهمّك؟: هالطريقة بتخلي نماذج توليد الصور بالبيكسل تعطي نتائج أنقى وأوضح، وبتقلل الأخطاء بالمراحل المتقدمة.
🌱 شو إلك منها؟
تخيل إنك عم ترسم صورة على ورقة وتبلش بخطوط مش واضحة، بس مع هالتقنية الخطوط بتصير أوضح حتى لو كان القلم عم يهزّ. يعني الصور اللي بتطلع من تطبيقات توليد الصور على الإنترنت رح تكون أنقى وتفاصيلها أوضح. ممكن تلاحظ الفرق إذا استعملت أدوات توليد صور على الويب وشفت تحسين الوضوح.
vision diffusion transformers registration generative-models hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

ShortOPD: استرجاع نماذج اللغة الكبيرة المقصَّاة

ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation
الفريق اكتشف إنو تقليم النماذج الكبيرة بيخلّيها تفشل بالكتابة الحرّة، بس بيضل في جمل مفيدة إذا بدنا نعيد توليدها أكتر من مرة. بناءً على هالملاحظة، حطوا طريقة On-Policy Distillation بتستعمل النموذج الأصلي كمعلم ثابت لتدريب النموذج المقصَّى على حالته الخاصة. بعدين طوّروا جدول Short-to-Long بيوصل للجزء المفيد من النص قبل ما يضيع الوقت على تكرار غير مهم. التجربة على الرياضيات والبرمجة والكتابة المفتوحة ورّجت إنو النموذج المسترجع صار أقوى بكتير من الطرق القديمة وبوقت تدريب أقل.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج المضغوطة تعطي جودة كتابة أقرب للنماذج الأصلية، يعني بنقدر ننشرها على الأجهزة القليلة الموارد بدون خسارة.
🌱 شو إلك منها؟
تخيل إنك عندك برنامج يكتب لك كود أو ردود سريعة، بس هو مبطّل يشتغل منيح على الموبايل لأن حجمه كبير. هالطريقة بتقصر حجم البرنامج وبنفس الوقت بيرجع يكتب كأنه أصله كبير. يعني ممكن تشوف تحسين بالأداء على تطبيقات الذكاء الاصطناعي اللي بتستعملها يوميًا مثل المساعدات الصوتية أو أدوات الكتابة.
pruning distillation LLM generation efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

PalmClaw: إطار عمل للـ Agents على الموبايل

PalmClaw: A Native On-Device Agent Framework for Mobile Phones
فريق الباحثين قدموا PalmClaw، إطار عمل مفتوح المصدر بيشتغل نَتِي على الموبايل. هالإطار بِصير الـ LLM agents يقدروا يستخدموا أدوات الجهاز كإنها وظائف بوسائط واضحة ونتايج منظمة، بدل ما يضطروا يتعاملوا مع الواجهة الرسومية الطويلة. التجارب أظهرت تحسين 11.5% بنجاح المهمات وتقليل وقت الإنجاز بأكثر من 94% مقارنةً بأقوى baseline.
ليش بتهمّك؟: هالشي بيسهّل تشغيل الـ agents على الموبايل بسرعة وأمان، وبيقلل الاعتماد على السرفرات.
🌱 شو إلك منها؟
تخيل إنو موبايلك يقدر ينجز طلباتك المعقّدة من غير ما تحتاج تفتح تطبيقات كتيرة أو تنتظر. مثلاً، بدلاً ما تفتح كل تطبيق لتسجيل موعد أو طلب توصيل، الـ agent يشتغل مباشرة على الجهاز ويكمل المهمة بأقل وقت. هالطريقة ممكن تشوفها قريباً بخدمات المساعدة الذكية على هواتفك.
agents mobile LLM framework on-device hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

GRASP: سياسة بحث دقيقة للـ Agentic RAG

GRASP: GRanularity-Aware Search Policy for Agentic RAG
الفريق قدم GRASP، إطار تعلّم معزّز بيدرب الوكلاء ليختاروا أداة البحث الأنسب خلال كل خطوة من التفكير. الوكيل يقدر يشتغل بثلاث إجراءات: بحث دلالي، بحث بالكلمات المفتاحية، وقراءة فقرات، فبالتالي يجيب دليل على مستوى الجملة ويزيد السياق بس لما يكون ضروري. التجارب على Benchmarks للـ multi‑hop reasoning ورّجت إنّو GRASP بيرفع استرجاع المعلومات ودقة الإجابة مقارنةً بالطرق السابقة.
ليش بتهمّك؟: GRASP بيسهّل على النماذج الكبيرة توصل للمعلومة الصح بسرعة، وبيقلل الأخطاء اللي بتصير من معلومات غير ذات صلة.
🌱 شو إلك منها؟
تخيل إنك عم تسأل سؤال معقّد على محرك بحث، والنظام يقدر يقرر إذا يفتّش بالكلمات أو يقرأ فقرات صغيرة حسب الحاجة، فبيعطيك جواب أدق وأسرع. هالطريقة ممكن تخلي تطبيقات المساعدة الصوتية أو الروبوتات تعطي إجابات أوضح وتفادِ التشتت بالمعلومات. رح تشوف هالتحسينات يوم تستخدم خدمات مثل المساعدين الذكيين أو أدوات البحث المتقدمة.
RAG reinforcement learning retrieval multi-hop QA agents hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

MM‑IssueLoc: معيار مُتحكَّم لتقييم الأدلة البصرية في توطين القضايا بالبرمجيات

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization
هالورقة قدمت benchmark جديد اسمه MM‑IssueLoc بيختبر كيف الصور داخل تقارير الأخطاء بتساعد نحدّد الملف أو الدالة اللي فيها المشكلة. فيه 652 حالة من 23 لغة، ومعاها تصنيفات للصور و4 مستويات صلة. الباحثين جربوا أنظمة LLM وأنظمة استرجاع، ولقوا إن أقوى نظام وصل بس 38.96% دقة على مستوى الملفات و22.45% على مستوى الدوال. النتيجة إننا لسا بعيدين عن توطين موثوق باستخدام الأدلة البصرية.
ليش بتهمّك؟: لأن كثير من الأخطاء اليوم بتيجي بصور، فهم كيف نستفيد منها بيحسّن أدوات تصحيح الكود.
🌱 شو إلك منها؟
تخيّل إنك بتشتكي من عطل ببرنامج وعطيت صورة للخطأ، هالتقنية بتخلّي البرنامج يلقا الملف اللي فيه العطل أسرع. يعني بدل ما تقعد تدور يدويًا، الأداة بتستند على الصورة لتحدد مكان المشكلة. ممكن تشوف هالشي يطلع بأدوات تصحيح الكود أو منصات الدعم التقنية اللي بتستعملها.
multimodal issue localization software engineering benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

Mask-Aware Policy Gradients لنماذج اللغة Diffusion

Mask-Aware Policy Gradients for Diffusion Language Models
الفريق قدم طريقة جديدة لتدريب نماذج اللغة Diffusion اللي بتشتغل بنظام الـ Masked Diffusion. الفكرة إنو كل خطوة توليد فيها قرارين: شو نحط من توكنات بالمكان الممسوح وشو نعيد نمسح. صرّفنا هالعملية على شكل MDP من مرحلتين، ولقينا إنو الـ policy gradient بيتقسم طبيعيًة لمصطلح توكن ومصطلح ماسك. الجمع بين تحسين المصطلحين وصلنا لأفضل أداء على اختبارات الرياضيات والبرمجة، يعني 87.1% على GSM8K و53.4% على MBPP.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة Diffusion تتعامل مع المسائل المعقّدة مثل الرياضيات والبرمجة بصورة أقوى وأدق.
🌱 شو إلك منها؟
تخيل إنو برنامج كتابة بيقدر يحل مسائل رياضية أو يكتب كود برمجي بطريقة أقرب للإنسان، مش بس يكمّل الجمل. هالتحسين بيخلي المساعدات الرقمية تفهم إشي بدك إياه وتساعدك بسرعة. رح تشوف هالشي يوميًا على تطبيقات مثل Copilot أو أدوات التعليم اللي بتعتمد على الذكاء الاصطناعي.
diffusion reinforcement learning language models reasoning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

من الضوضا للسبب الجذري: تحليل المسارات واستخراج السبب للـ Agent Optimization

From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization
الفريق قدم طريقة اسمها STRACE لتقليل الضوضا بالمسارات اللي بتولدها الوكلاء وتستخرج السبب الحقيقي للفشل. STRACE بتفلتر المسارات المتكررة على مستوى الدفعة وبتحدد الخطوات غير المسببة داخل كل مسار عبر رسم اعتماد نصي. بهالطريقة، النموذج يقدر يركز على الجذور الحقيقية ويطوّر سياسات الوكيل بشكل أدق. التجربة على VeruSAGE-Bench ورّجت تحسين نسبة النجاح من 42.5٪ لـ 58.5٪ مقارنة بالطرق التقليدية.
ليش بتهمّك؟: لأنها بتخلي تحسين الوكلاء أسرع وأدق، وبتقلل الأخطاء اللي ممكن تنسبب في تطبيقات حقيقية.
🌱 شو إلك منها؟
تخيّل إنو برنامج ذكي بيتعلم من أخطائه زي ما الطبيب بيحدد السبب الحقيقي للمرض، مش بس بيعالج الأعراض. هالطريقة بتخلي البرامج تصير أذكى وتساعدنا بحل مشاكل يومية، مثل تحسين المساعدات الصوتية أو الروبوتات المنزلية. يعني إذا بتستعمل تطبيقات ذكية، رح تلاقيها تصير أسرع وأدق بكتير.
agents optimization causal extraction trace analysis LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

SearchOS-V1: إطار عمل قوي لتعاون الوكلاء في البحث المفتوح

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
الفريق قدم SearchOS، نظام متعدد الوكلاء بيحوّل تقدم البحث الضبابي إلى حالة صريحة ومشتركة بين الوكلاء. بيعرّف مهمة البحث المفتوح كإكمال مخطط علاقاتي مع توثيق كل قيمة بمصدر موثوق، وبنظّم الحالة عبر Frontier Task، Evidence Graph، Coverage Map، وFailure Memory. كمان ضمّوا جدولة متوازية للمهام مع Search Tool Middleware Harness اللي بيسجّل الأدلة وبيمنع الوقوف أو استنفاد الميزانية، وبيوفروا نظام مهارات هرمي لتفادي تكرار الأخطاء. التجربة على WideSearch وGISA أظهرت إن SearchOS يتفوّق على كل البنى التحتية الأحادية والمتعددة الوكلاء على كل المقاييس.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء يتجنّبوا التكرار والهدر، وبتسرّع توصيل المعلومات بدقة أعلى للباحثين والمستخدمين.
🌱 شو إلك منها؟
تخيل إنك تطلب من صديق يدوّر لك معلومات على الإنترنت، وهو ما بينسى شو فحص قبل هيك، فبيضل يروح على نفس المواقع بلا فائدة. SearchOS بيخلي الوكلاء يكتبوا ملاحظات عن كل خطوة ويستفيدوا من هالملاحظات لتجنّب التكرار، يعني بتلاقي الإجابة أسرع وبأقل جهد. هالتقنية رح تظهر بأدوات المساعد الذكي اللي بتستعملها يوميًا، مثل التطبيقات اللي تجيب لك أخبار أو إجابات فورية.
search multi-agent information-retrieval tool-use collaboration arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

تقييم MLLMs للرسومات العلمية

Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy
الفريق اللي أسسه Patrick Phuoc Do وزملاؤه قيّم ست نماذج لغة متعددة الوسائط على اختبار فهامة الرسومات العلمية، اللي فيه 49 سؤال مبني على 18 رسم توضيحي. لقوا إن Gemini هو الأقوى، حتى تجاوز متوسط أداء البشر، بينما النماذج المفتوحة ما وصلوا للحد البشري. الأداء كان متقلب حسب التقنية ونوع المهمة، وكان أسوأ بكتير بالرسومات اللي فيها قياسات كمية أو اتجاهات تدفق.
ليش بتهمّك؟: النتائج بتبين إن نماذج اللغة المتعددة الوسائط لسا محتاجة تحسين لتفهم الرسومات العلمية بشكل موثوق.
🌱 شو إلك منها؟
إذاً، هالتقنية ممكن تساعدك تفهم رسومات البيانات المعقدة، متل اللي بتشوفها بتقارير الطقس أو الطب. تخيّل إنك تقدر تسأل النظام عن معنى مخطط حرارة وتاخد شرح واضح، بدل ما تحاول تفسره لحالك. هالشي رح يطلعلك بأدوات مثل التطبيقات الذكية أو المواقع اللي بتعتمد على هالنماذج لتبسيط البيانات.
multimodal visualization benchmark literacy AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

نموذج أساسي لتوسيع سلوك الروبوت البشري

Scaling Behavior Foundation Model for Humanoid Robots
الفريق اللي بيقود البحث، زينغ وزملاؤه، رجّعوا فكرة التحكم بالروبوتات البشرية لمستوى جديد عبر نموذج اسمه Humanoid Transformer. ركّزوا على ثلاث شغلات: طريقة تعلم بتسمي motion tracking، توازن بين كمية التجارب على‑policy وتنوع الحركات المرجعية، وبنية النموذج القابلة للتوسّع. التجارب على السيموليشن والواقع أظهرت إن الأخطاء انخفضت بأكثر من 10% بالوضع المحلي و82% بالوضع العالمي مقارنةً بالتحكمات القديمة.
ليش بتهمّك؟: هالنتيجة بتخلّي الروبوتات البشرية تتحكم بحركاتها بدقة أعلى وتشتغل بمرونة أكتر ببيئات مختلفة، يعني بنقرب خطوة من الروبوتات العامة المتعددة الاستخدامات.
🌱 شو إلك منها؟
تخيّل روبوت بشبه الإنسان يقدر يتحرك بطبيعية أكتر، كأنه عم يتعلم من تجارب كتيرة ويتقن كل حركة. هالتحسين بيخلّي الروبوتات تساعدنا بأعمال البيت أو بالمستشفيات بدون ما نضطر نعيد برمجة كل حركة. ممكن تشوف هالتقنية قريباً في تطبيقات الروبوتات المنزلية أو المساعدة الشخصية.
humanoid foundation model transformer robotics scaling arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

شو بتعرفه LLMs عن التوقعات وما بتحكيه: فحص التمثيلات الداخلية للمعايرة والصدق

What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
الفريق استكشف نماذج اللغة الكبيرة المدربة على التوقعات ولاحظ إنّها ممكن تكون دقيقة بس ما تكون معايرة بشكل جيد، وكمان طريقة التفكير المتسلسلة (CoT) ما بتعكس دايمًا الأدلة ورا التوقع. استخدموا probes على الطبقات الداخلية لنموذج Eternis-Forecaster 8B ولقوا إنها بتحسّن المعايرة بشكل واضح، وحتى نماذج GLM-4.7-Flash وGLM-4.5-Air استفادت. كمان بيّنوا إنّ الـ probes بتكشف لما النموذج يخبّي تأثير تعديل في السؤال، وتقدر تتنبأ باتجاه التغيير بـ84 % من الحالات. أخيرًا، لَقوا إنّ التوقعات تقريبًا ثابتة قبل ما يبدأ النموذج يشرح، وهالشي بيوفر 30‑47 % من الكلمات المتولدة بدون خسارة بالدقة.
ليش بتهمّك؟: هالطريقة بتخلينا نتحقق من موثوقية التوقعات قبل ما النموذج يبلّش يشرح، وبتقلل استهلاك الموارد.
🌱 شو إلك منها؟
تخيّل إنك تستعمل تطبيق لتوقع الطقس أو أسعار الأسهم، وبيطلع لك نتيجة وشرح طويل، بس ما بتعرف إذا الشرح فعلاً مبني على معلومات صحيحة. هالبحث بيظهر طريقة تقدر تتأكد إذا التوقع مبني على دليل حقيقي أو لا، وبتخلي التطبيق يرد أسرع لأنّه ما بحتاج يكتب شرح طويل إذا ما كان ضروري. يعني ممكن تحسِّن الثقة بالنتايج وتوفر وقتك ومصروفات البيانات.
LLM forecasting calibration probing interpretability hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

Hallo4D: تقليل الهلوسة المتعددة الوسائط لتوليد ثابت زمانياً ومكانياً

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation
فريق Wang وزملاؤه قدموا Hallo4D، إطار موحد وما بيتطلب تعديل على النماذج لتقليل الهلوسات بالمجالات الثلاثية والرابعة. الإطار بيشتغل بنظام توليد‑كشف‑تصحيح، وبيستعين بـ large multimodal language models لتحديد الأخطاء بالمناظر المتعددة وإعطاء ملخّص للخطأ. بعدين بيستخدموا تحسين بالـ image‑space بيقارن بين تصحيحات مقترحة عبر تصويت بين نماذج مختلفة. كمان ضيفوا عينات إطارات رئيسية واعتماد مبدئي من الـ LMM، وتعديل الإضاءة وتقليم الرؤية عشان يرفعوا الاستقرار بالمناظير الصعبة. التجارب بتظهر إنو Hallo4D بيتفوق على الطرق السابقة بوضوح بمجالات 3D و4D.
ليش بتهمّك؟: هالطريقة بتخلّي توليد المحتوى الثلاثي والرابع أكثر دقة وبدون تشوهات، فبنتطلع لتطبيقات AR/VR وألعاب أكثر واقعية.
🌱 شو إلك منها؟
تخيل إنك عم تشوف نموذج ثلاثي الأبعاد بيدور قدامك، ولا يطلع له هياكل مكررة ولا يشتت بالوقت. هالتحسين بيخلي الحركة سلسة وثابتة، متل ما بتشوف فيديوهات البالونات اللي ما بتتحرك فجأة. رح تلاقي هالشي بألعاب الواقع الافتراضي أو تطبيقات تجربة الملابس الافتراضية اللي بتظهر لك بصورة طبيعية.
3D generation hallucination mitigation multimodal consistency LMM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

MAGIC: توليد عوالم ألعاب متعددة المشاهد بوعي الانتقالات

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models
الفريق قدم MAGIC، نظام بيحوّل نص بسيط إلى مشروع لعبة متكامل يضم عدة مشاهد متصلة. النظام بيشتغل بأربع مراحل: بيخطط تمثيل وسط يراعي الانتقالات، بيولّد كل مشهد مع ضمان وصول البوّابات عبر فاحص flood‑fill، بيضيف سكريبتات الانتقال، وأخيرًا بيركب كل شي بمشروع واحد. على اختبار جديد فيه 100 حالة، MAGIC قدر يولّد مشروع شغال لكل حالة وبنسبة عالية من الدقة والاتساق مقارنةً بالطرق السابقة.
ليش بتهمّك؟: بتقليل الجهد اليدوي لتصميم مستويات ألعاب متصلة، MAGIC بيفتح الباب لتطوير ألعاب أسرع وأكتر إبداعًا.
🌱 شو إلك منها؟
تخيّل إنك بدك تلعب لعبة جديدة وكل الغرف فيها متصلة بس ما في شي يوقفك، هالنظام بيصنع هالغرف والبوابات أوتوماتيكياً، متل ما بنبني بيت جاهز للعيش من غير ما نضطر نرسم كل جدار بيدنا. هالشي ممكن يخلّي مطوري الألعاب يطلّعوا ألعاب جديدة بسرعة، وإنت بتستمتع بألعاب فيها عوالم واسعة ومترابطة من غير ما تحس إنو حدا عملها يدويًا.
LLM game generation multi-scene navigation benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

هل منأمن على IRT لتقييم الذكاء الاصطناعي؟

Can We Trust Item Response Theory for AI Evaluation?
الباحثين Jiang وزملاؤه فحصوا كيف ممكن نمّا نماذج إحصائية اسمها item response theory (IRT) تنقّح تقييم نماذج الذكاء الاصطناعي، خصوصًا على Benchmarks الكبيرة. لقوا إنو بيانات الـ benchmarks مختلفة عن بيانات الاختبارات البشرية: فيها نماذج أقل وعدد أسئلة أكتر، وتوزيع القدرات ممكن يكون غير طبيعي. سووا محاكاة على ستة Benchmarks للـ LLM وجربوا أربع طرق تقدير (marginal maximum likelihood، Markov chain Monte Carlo، variational inference، وneural pseudo‑Siamese estimator) وشافوا أيّها بيشتغل بسرعة ومتى بتصير النتائج غير موثوقة. النتيجة إنو الأدوات الكلاسيكية ممكن تصير غير عملية مع بيانات ضخمة، والأدوات السريعة أحيانًا بتعطي استنتاجات خاطئة إذا عدد النماذج قليل أو توزيع القدرات مش طبيعي.
ليش بتهمّك؟: هالنتائج بتساعدنا نعرف متى نقدر نستخدم IRT بثقة لتقييم نماذج الذكاء الاصطناعي وتفادي استنتاجات مضللة.
🌱 شو إلك منها؟
إذا بتستعمل تطبيقات تعتمد على تقييم أداء الذكاء الاصطناعي، لازم تكون متأكد إنو الطريقة اللي بتقيس فيها الأداء موثوقة. تخيّل إنك عم تقيس جودة امتحان، بس الأدوات ما بتقدر تتعامل مع عدد الأسئلة الكبير؛ النتيجة ممكن تكون غلط وتضيع فرص تحسين الخدمة. هالمعلومة بتظهر لك في أدوات تقييم النماذج على الإنترنت أو في تقارير الشركات اللي بتقارن بين نماذج الذكاء الاصطناعي.
evaluation IRT benchmarks LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

من البيكسل للحالة: إعادة التفكير في نماذج العوالم التفاعلية كـ Game Engine

From Pixels to States: Rethinking Interactive World Models as Game Engines
الفريق استعرض كيف ممكن نعيد بناء عوالم ألعاب تفاعلية عبر منظومة حلقة action‑state‑observation المتكررة، ووزع التحليل على أربع أبعاد: تحكم اللاعب، ديناميكيات الحالة، استمرارية الملاحظة، والتوليد في الوقت الحقيقي. جمعوا بيانات ضخمة من لعبة Black Myth: Wukong، أكثر من 90 ساعة لعب مع أفعال اللاعبين، حالات اللعبة الحقيقية، والمشاهد المرئية، مع تعليقات هيكلية ودلالية. هالتحليل يوضح مزايا وعيوب كل عائلة من الأساليب الحالية ويعطي خريطة واضحة للبحوث الجاية.
ليش بتهمّك؟: هالورقة بتساعد الباحثين وصانعي الألعاب يبنوا عوالم ألعاب أكثر واقعية وتفاعلية، وتقلل الفجوة بين الفيديوهات المولدة والقواعد الصارمة للعبة.
🌱 شو إلك منها؟
تخيّل لعبة فيديو بتتصرف كأنها لوحة شطرنج، كل حركة إلك بتأثر على الحالة وتظل باقية لفترة طويلة، مش بس لحظة. هالشي ممكن يخلّي الألعاب أحلى وأكتر تشويق، لأنك تحس إنك عم تتحكم بواقع افتراضي حقيقي. ممكن تشوف هالتقنية بالمستقبل بألعاب الواقع الافتراضي أو تطبيقات تفاعلية على موبايلك.
game-engine interactive-worlds video-generation dataset AI hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

MeanFlowNFT: تحسين توليد الصور والفيديو بـRL سريع

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
Yushi Huang وزملاؤه قدموا MeanFlowNFT، طريقة جديدة بتدمج تعلم التعزيز مع مولّدات MeanFlow اللي بتستعمل متوسط السرعات لتوليد الصور والفيديو بخطوات قليلة. الفكرة إنهم بنوا متنبئ للسرعة اللحظية بناءً على هوية MeanFlow، وبطبقوا هدف DiffusionNFT عليه، فبيصير تحسين المكافأة واضح للمتوسط. النتيجة إن النموذج بيحافظ على السرعة الفائقة للـMeanFlow وبنفس الوقت بيحسّن الجودة، متفوق على أحدث طرق RL في أغلب المقاييس على مجموعات اختبار الصور والفيديو.
ليش بتهمّك؟: بتخلّي توليد الصور والفيديو عالي الجودة يصير بأقل عدد خطوات، يعني أسرع وأكفأ للتطبيقات العملية.
🌱 شو إلك منها؟
بتقدر تولد صورة أو مقطع فيديو بجودة عالية خلال ثواني قليلة، متل ما بتاخد كاميرا هاتفك دقيقة لتلتقط صورة. هالفكرة ممكن تساعدك إذا بدك تصمم محتوى سريع للوسائط الاجتماعية أو تطلع فكرة بصرية بسرعة. هالخدمات ممكن تلاقيها قريباً ضمن تطبيقات تعديل الصور أو إنشاء الفيديوهات الأوتوماتيكية.
diffusion RL image generation video generation few-step sampling hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

تحسين الذات للأنظمة الوكيلة الحديثة

Self-Improvements in Modern Agentic Systems: A Survey
الفريق بيحكي كيف الوكلاء الذاتيين صايروا يطوّروا حالهم من غير تدخل بشري كتير. بيعرّفوا إطار نظام بيجمع foundation model مع مجموعة من الـ prompts والذاكرة والأدوات ومنطق التحكم، وبيوضحوا كيف هالعناصر بتتحدّث لتزيد القدرة. كمان بيصنّفون الأبحاث حسب شو بيتحدّثوا (معلمات النموذج أو المكوّنات) واللي بيحركوا هالتغيّر، وبيراجعوا التطبيقات وتقييم الأداء.
ليش بتهمّك؟: هالمسح بيفتح باب لتصميم وكلاء أذكى يقدروا يتعلموا ويتطوروا لحالهم، الشي اللي بيسهّل تطبيقاتهم بالمجالات الواقعية.
🌱 شو إلك منها؟
تخيّل برنامج يقدر يتعلم من شغله اليومي ويتحسّن بدون ما تحتاج تشرح له كل خطوة. هالشي ممكن يخلي المساعدين الرقميين أو الروبوتات يشتغلوا أذكى وأسرع، وتلاقيه يطلع بأداء أحسن على الأجهزة اللي بتستعملها كل يوم.
self-improving agents foundation models adaptive systems survey hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

تتبع فشل الوكلاء من خلال مسار النجاح

Tracing Agentic Failure from the Flow of Success
الفريق Yeh وزملاؤه قدموا OAT، نموذج يدرّب بس على مسارات نجاح قليلة ويتعامل مع فشل الوكلاء بدون أي إشارات خطوة بخطوة. النموذج بيستعمل one‑class learning مع neural controlled differential equations ليصوّر نمط النجاح بالفضاء الكامن، وبعدين بعطي كل خطوة فاشلة درجة شذوذ لتحديد الأخطاء. التجارب أظهرت إن OAT أسرع بـ200‑5000 مرة من الطرق اللي تعتمد على prompting، وكمان يرفع F1 بـ20% داخل المجال و7% خارج المجال.
ليش بتهمّك؟: لأنو بنقدر نحدد وين صار الخطأ بالأنظمة الذكية بسرعة وبأقل تكلفة، وهذا بيساعد على تحسينها وتجنّب الأعطال.
🌱 شو إلك منها؟
تخيّل إنك عم تستخدم تطبيق ذكي ينجز مهام، وبيصير فيه عطل فجأة. هالأداة بتعرف أي خطوة بالضبط خربت الشغل من غير ما تحتاج تعلّمها على كل الأخطاء. يعني رح تشوف تحسينات أسرع وتطبيقات أكثر استقرارًا بحياتك اليومية.
agentic failure attribution one-class learning anomaly detection OAT hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 7
retrieval-augmented reasoning
يعني النموذج بدو يبحث عن معلومات من مصادر خارجية أولاً، بعدين يستخدمها في التفكير والإجابة عشان تكون الإجابة أدق وأفضل.
memory-augmented
memory-augmented يعني إنو النموذج مرفوع بذاكرة إضافية، بنستفيد منه عشان يقدر يفتكر إشي من قبل مش بس يجاوب على أساس النص الحالي.
reinforcement learning
تعليم الذكاء الاصطناعي من خلال نظام الحوافز والعقوبات، زي لما تعلمي طفل بالمكافأة والعقاب عشان يتعلم السلوك الصحيح. بنستخدمه عشان الآلة تتعلم تاخذ قرارات ذكية بنفسها من غير ما نحطّ كل إجابة جاهزة.
visual reasoning
visual reasoning هو مفهوم بيعني إنو النموذج يقدر يستنتج معلومات من الصور ويحل أسئلة معتمدة على الفهم البصري، مش بس يقرأ النص.
register tokens
register tokens هي رموز خاصة بتخزين معلومات مؤقتة داخل النموذج، بنستعملها عشان نحتفظ ببيانات مؤقتة خلال المعالجة.
structured pruning
structured pruning يعني إزالة أجزاء من النموذج بشكل منظم لتقليل حجمها وتسريعها، بنعمله عشان ما يكون النموذج ثقيل ولا يستهلك موارد كتير.
On-Policy Distillation
هالطريقة بنقل فيها المعرفة من نموذج بيتعلم على نفس السياسة (on‑policy) إلى نموذج أصغر أو أبسط، يعني بنخلي الـteacher يعلّم الـstudent مباشرةً خلال التدريب. بنستعملها مش لتقليل حجم النموذج بس كمان لتسريع التعلم.
🤖 موديلز 4
EgoMemo
EgoMemo هو model بيستخدم الذاكرة لتذكر معلومات سابقة، بنشوفه عشان بيساعدنا نحل مشاكل بتحتاج تتبع سياق طويل.
VR-GRPO
VR-GRPO هو model متخصص بالتحليل البصري، بيشتغل على ربط الصور بالنصوص، بنسمعه عشان بدنا نمكن الحواسيب من الفهم البصري المتقدم.
Vision Transformers
نموذج ذكي بيقرأ الصور زي ما بنقرأ النصوص - بينقسم الصورة لقطع صغيرة ويتعامل معها، وهاد أحسن بكتير من الطرق القديمة.
Diffusion transformers
نموذج يجمع بين التحويلات وتقنية الانتشار لتوليد صور أو نصوص بجودة عالية
📏 مقاييس 1
pass@k
هو مقياس بنقيّم فيه النموذج، بنقوله احنا جرّب k مرة وإذا صحّت ولو مرة واحدة بنعتبرها نجاح. بنسمع عنه كتير في تقييم نماذج البرمجة عشان نشوف قديش النموذج قادر يحل مسائل صعبة لو أعطيناه أكثر من محاولة.
🗂️ بيانات 2
EgoServe
EgoServe هو dataset بيحتوي على أسئلة وإجابات لتدريب نماذج الذاكرة، بنستعمله عشان نعلّم النماذج كيف تسترجع معلومات من الذاكرة.
VR-X
VR-X هو dataset بيجمع صور وأسئلة بصرية لتدريب نماذج الفهم البصري، بنستعمله عشان نقيم قدرة الموديلات على reasoning بصري.
كل المصطلحات ←
العدد السابقشو في AI؟ | تجميع الأسبوع 18 يوليو — Benchmarks and Efficient RL
📚 كل الأعداد