📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 18 يوليو — Benchmarks and Efficient RL

أسبوعي مكثّف 📅 2026-07-18
سلام عليكم 👋

هالأسبوع كان مميّز — نشرت ١٧ مقالة جديدة بالنشرة، من «شو يعني ديب فيك» لـ«شو يعني MCP وSkills وEmbedding» — وكل وحدة بتفكّك مصطلح كنا بس نمرّ عليه ونكمّل.

وعالمستوى البحثي، الأسبوع تركيزه كان على قياس قدرات النماذج وتخفيف تكلفة تدريبها، وطلعت أدوات قياس جديدة أقرب للواقع — من فيديو بيساعد المكفوفين، لسيناريوهات القيادة الذاتية. اخترتلكم أهمها تحت 👇

ومقال الأسبوع عن إشي صار يهمنا كلنا: كيف تعرف إذا الفيديو اللي وصلك مفبرك.
#1

LongStraw: تدريب RL بسياق طويل تحت ميزانية GPU ثابتة

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
الفريق Zhou وزملاؤه قدموا LongStraw، نظام تنفيذ بيشتغل مع سياقات مليون توكن تحت ميزانية GPU ثابتة. الطريقة بتستغل Group Relative Policy Optimization وبتقليل الرسم البياني للتدريب عن طريق حذف autograd من الـprompt المشترك وتخزين الحالة الضرورية بس. جربوها على موديلات Qwen3.6-27B وGLM-5.2 وحققوا تدريب مجموعات توكنات بأكثر من 2 مليون على 8 أو 32 بطاقات H20 بدون ما يزودوا الذاكرة كتير.
ليش بتهمّك؟: هالطريقة بتخلّي تدريب نماذج كبيرة بسياق طويل يصير ممكن على أجهزة GPU محدودة، يعني بنقرب التقنية من التطبيقات الواقعية.
RL long-context efficiency GPU language-models hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

BadWAM: هجمات تخريبية على نماذج العالم‑الإجراء

BadWAM: When World-Action Models Dream Right but Act Wrong
الفريق اللي هو Qi Li وزملاؤه قدموا BadWAM، إطار موحد بيكشف نوع جديد من الهجمات على نماذج World‑Action Models. الهجمات بتستغل تشويش بصري بسيط لتخرب التوافق بين اللي النموذج يتخيله من مستقبل المشهد وبين الفعل اللي بينفذه. فيه نوعين: هجوم بيهدم الفعل بس، ونوع تاني بيحافظ على تخيل المستقبل بس بيخلي الفعل يختلف بشكل مخفي. التجارب أظهرت إن هالهجمات بتقلل نجاح المهام من 96.5% إلى 43.1% تقريباً.
ليش بتهمّك؟: هالهجمات بتبيّن إنو الاعتماد على تخيل النموذج للمستقبل مو دايمًا بيضمن أمان الروبوتات.
adversarial attacks world-action models robotics safety hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

فهم وتوليد الصور معاً: عمليات ماركوف القفزة الذاتية التصحيح

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes
الباحثين قدموا طريقة جديدة تخلي الفهم والتوليد للصور والنصوص يشتغلوا مع بعض بنفس الوقت، بدل ما يكونوا منفصلين. استغلوا Masked Diffusion Models وأضافوا آلية تسمح لكل وحدة (نص أو صورة) تشوف ثقة التانية وتصحح الأخطاء فوراً عبر SC-CMJP. كمان طوّروا سامبلر واحد‑مرّة اسمه CO_2Jump ما بيحتاج تدريب، يقدر يحدّث الصورة والنص سوا ويحلّ مشاكل التناقض. جربوا الطريقة على ثلاث مجموعات بيانات ضخمة ونشروا النتائج اللي بتظهر تحسّن واضح بالمقارنة مع الطرق القديمة.
ليش بتهمّك؟: هالطريقة بتخلّي الأنظمة الذكية تفهم وتولّد محتوى بصري نصي بدقة أعلى وبسرعة أكبر، وهاد مهم لتطبيقات مثل تعديل الصور بالمحادثة أو الفهم البصري للحوارات.
multimodal diffusion generation image-text sampling hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

فك شفرة On-Policy Distillation: الدور، المشكلات، والتنظيم

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
الورقة بتوضح إنو On-Policy Distillation (OPD) بيشتغل كمنشط للاستكشاف، يعني بيوجّه الطالب لطرق تفكير صحيحة عن طريق إرشاد تفصيلي على مستوى الرموز، بس ما بيزيد من قدرته القصوى. الباحثين لقوا إنو تنوّع الأسئلة أهم من عدد العينات لكل سؤال، وإنو نجاح OPD بيعتمد بالكامل على جودة الإشارة الإرشادية. هالشي بيكشف مشكلتين: فجوة بين المعلم والطالب (Student-Teacher Mismatch) و«استغلال الطول» اللي بيخلي الطالب يلعب على طول الرد بدل ما يفكّر. لتقليل هالمشكلات جربوا تنظيمات خفيفة مثل advantage clipping وlog-scale compression، ولقوا تحسين واضح على سبع benchmarks.
ليش بتهمّك؟: هالنتائج بتساعدنا نطوّر LLMs بصورة أأمن وأكفأ، لأنو بنعرف كيف نتحكم بالإشارات اللي بنعطيها للطالب ونتجنّب الأخطاء اللي بتقلّل من جودة النموذج.
distillation LLM exploration regulation benchmarks hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

VIABench: مجموعة قياس شاملة للفيديو لمساعدة المكفوفين

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
الفريق اللي قدم الورقة حطّوا VIABench، وهو benchmark بالفيديوهات المسجّلة من قبل الأشخاص المكفوفين، لتقييم الـ Multimodal Large Language Models بمهام المساعدة اليومية. فيه ثلاث مهام: Proactive Reminder اللي بيطلب من النموذج يتوقع الأحداث المهمة ويشرحها صوتيًا، وVisual Question Answering (VQA) للرد على أسئلة المستخدم عن المشهد، وVision‑Guided Interaction لتوجيه التفاعل مع البيئة. حطّوا طريقة تقييم صارمة تدعم الوضعين online (بوقت الحقيقي) وoffline. التجارب بينت إن النماذج الحالية لسا ما بتقدر تعطي دعم شامل، خصوصًا بمهمة Proactive Reminder اللي بتحتاج توقع دقيق وسرعة استجابة.
ليش بتهمّك؟: هالbenchmark بيفتح باب لتطوير نماذج ذكية تساعد المكفوفين يتنقلوا بأمان وتستفيدوا من الفيديوهات اليومية.
video benchmark multimodal accessibility LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

إعادة توصيل طيفي لتقوية التفكير ودمج النماذج (SAR)

Spectral Rewiring for Exploration, Purification, and Model Merging
الفريق قدم طريقة اسمها Subspace-Aligned Rewiring (SAR) بعد ما يخلصوا تدريب نموذج لغة كبير. الفكرة إنو الجزء اللي بيساهم بالمنطق بيتجمع بمكان اسمه الفضاء الطيفي، فـ SAR بيحافظ على هالجزء ويشيل المكوّنات اللي ما إلها فائدة أو بتسبب تشويش بين المجالات. الطريقة بتحتاج أقل من 0.6% من كل البارامترات، وبتخلي النموذج يحافظ على أكتر من 99% من الأداء بعد التدريب، وتزيد من قدرته على حل مسائل رياضية وتطبيقات البرمجة. كمان بتساعد بدمج نماذج متخصصة من غير ما يخسروا مهاراتهم، وبتعطي أداء أحسن من طرق الدمج القديمة.
ليش بتهمّك؟: لأنها بتخلّي نماذج اللغة الكبيرة تتطور وتدمج مهاراتها بدون ما يطيح الأداء، وبدون ما نحتاج نعيد تدريب كامل.
RL model merging spectral methods LLM fine-tuning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

PolicyShiftGuard: حارس الصور المتكيّف مع السياسات

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
الفريق قدم طريقة جديدة لتقييم صور الحماية حسب السياسة المتغيّرة، مش حسب صورة ثابتة. عملوا Benchmark اسمه PolicyShiftBench فيه 2,000 حالة فيها كل صورة مرتبطة بأكتر من 7 سياسات مختلفة، عشان يختبروا إذا الموديل بِظبط نفسه حسب السياسة الحالية. بعدين صمموا نموذج PolicyShiftGuard اللي بتدريبه وصفين: RP‑SFT لتعميم السياسات وBP‑Adapt لتعلم الفروقات بين سياسات الحجب والتمرير باستخدام مقارنة أزواجية. النتائج بتبيّن إنّ الموديل بيغلب باقي VLMs وموديلات الحماية القديمة بكتير، وبيوصل لأعلى أداء على Benchmark.
ليش بتهمّك؟: هالورقة مهمّة لأنّها بتخلّي أنظمة الفحص البصري تشتغل بدقّة حتى لو تغيّرت سياسات الأمان، يعني ما بيصير فيها فجوات أمان.
image safety policy adaptation benchmark VLM guardrails hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

Self in Space: بنشمارك للوعي الذاتي والإدراك المكاني للطائرات بدون طيار

Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence
الباحثين قدموا SIS‑Bench، بنشمارك جديد بيقيس الذكاء المكاني المتجسد للطائرات بدون طيار من خلال صيغة 'self‑in‑space'. البنشمارك بيغطي 13 مهمة على 4,856 سؤال‑جواب مأخوذة من 1,646 فيديو واقعي، وبيقسّم التقييم على بعدين: الفضاء والذات، وثلاث مستويات: الإدراك، الذاكرة، والاستنتاج. التجارب أظهرت إن الـ MLLMs الحالية عندها صعوبة بتعامل مع الحركات الديناميكية والوعي الذاتي، وبيقل الأداء كل ما ارتقينا بالمستوى المعرفي. إضافة تمثيل حساس للحركة باستخدام optical flow ودمج الخصائص البصرية حسّن الإدراك والذاكرة، وبيساعد على اتخاذ قرارات أفضل للطائرات.
ليش بتهمّك؟: لأن تحسين الوعي الذاتي للطائرات بدون طيار بيقود لتوجيه أدق وأمان أعلى بالمهمات الواقعية.
benchmark UAV multimodal spatial cognition self-awareness hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

RxBrain: نموذج أساس للمعرفة المتجسدة مع تخطيط لغوي‑بصري وتخيل

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
الفريق قدم RxBrain، نموذج أساس للمعرفة المتجسدة بيجمع بين اللغة والرؤية لتخيل الخطوات قبل تنفيذها. النموذج بيستعمل بنية Mixture-of-Transformers موحدة بتفهم النصوص، الصور والفيديوهات وبتولدهم كمان. من خلال خط أنابيب أوتوماتيكي حول الفيديوهات لتسلسل نص‑بصري، بنوا RxBrain‑Bench لتقويم قدرة النموذج على تمثيل الخطط المتجسدة. التجارب بينت إن RxBrain بيقدر يدمج التفكير اللغوي مع تخيل الحالة الفيزيائية، وحتى يولّد أوامر روبوتية مستمرة بدون تدريب مسبق كبير.
ليش بتهمّك؟: هالورقة بتفتح باب لتصميم أنظمة ذكية بتفهم وتخطط للمهام بشكل متكامل، وبتقربنا من روبوتات تتصرف بحكمة.
embodied cognition multimodal foundation model robotics planning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

Chat2Scenic: إطار RAG تفاعلي لتوليد سيناريوهات القيادة الذاتية

Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving
التحقق من أنظمة القيادة الذاتية بحاجة لتصاميم اختبار متنوعة وتلتزم بالقوانين. فريق Yuan Gao وزملاؤه قدموا Chat2Scenic، وهو إطار بيستعمل RAG مع واجهة شات بوت لتوليد سكريبتات DSL تفاعلية، يعني بنقدر نعدل السيناريو مع الوقت. الاختبار على 123 سيناريو من تنظيمات NHTSA والأمم المتحدة بيظهر إنو النموذج وصل لـ 76.42% نجاح في التجميع و58.17% دقة في الإطار، متفوق على الطرق السابقة. الكود مفتوح على GitHub لتسهيل المتابعة.
ليش بتهمّك؟: هالورقة بتقصر وقت اختبار سيارات القيادة الذاتية وبترفع من أمانها قبل ما تنزل على الطريق.
autonomous-driving scenario-generation RAG LLM simulation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

تطوير الروبريكس من سؤال واحد بالدلائل الصناعية

Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence
هالورقة بتقدّم طريقة جديدة لتوليد الروبريكس (قواعد التقييم) مباشرةً من سؤال بدون ما نحتاج أي بيانات بشرية أو تدريب إضافي. الفريق بيستخدم أزواج ردود مكوّنة صناعيًا لتوليد روبريكس، وبعدين بيتأكدوا من كل روبريك إذا كان بيفرق بين الأجوبة ولا لأ، وبيستبعدوا اللي ما بيفيد أو بيهتم بس بالستايل. التجارب على خمس مجموعات معيارية للـ preference أظهرت إن الطريقة وصلت لأعلى دقة وسط هالمجالات، وتصدّرت ٦ من ٧ مجموعات تقييم.
ليش بتهمّك؟: هالطريقة بتخلّي إنشاء روبريكس مخصص لكل سؤال أسهل وأسرع، وبتحسّن تقييم نماذج اللغة الكبيرة بدون ما نحتاج موارد بشرية كتيرة.
LLM rubric evaluation synthetic data arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

فهم هياكل صور الصحف بهرمية (Hierarchical Structure Understanding)

Towards Hierarchical Structure Understanding of Newspaper Images
هالورقة بتقدّم طريقتين لتفكيك هياكل الصحف المعقّدة. الأولى نظام بنائي من أسفل لفوق بيستعمل YOLO لتحديد التخطيط، LayoutReader لتوقع ترتيب القراءة، وخوارزمية مخصّصة لتقسيم المقالات. الثانية بتعرّف على Tiramisu، معمارية transformer جديدة بتشتغل بطبقات هرمية لتصنيف الأقسام وتحديد المواقع وتحديد الفئات الدلالية وترتيب القراءة. كمان الباحثين أطلقوا مجموعة بيانات جديدة اسمها Finlam La Liberté لتقييم هالمهام، والشفرة التدريبية متوفرة على GitHub.
ليش بتهمّك؟: هالطريقة بتسهل تحويل الصحف القديمة لمحتوى رقمي قابل للبحث وبتسرّع عملية الأرشفة.
document analysis hierarchical modeling transformer dataset OCR arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | 18 يوليو — RL بميزانية GPU ثابتة
📚 كل الأعداد