📡 أحدث عدد

شو في AI؟ | 18 يوليو — RL بميزانية GPU ثابتة

يومي 📅 2026-07-18
سلام 👋 هلقيت عددنا اليوم بيستعرض أحدث التطورات بالذكاء الاصطناعي، خصوصاً كيف بنقدر ندرب نماذج RL بسياق طويل بميزانية GPU ثابتة. بدنا نوضح كمان شوية ابتكارات بتعزز الأمان والقدرة على الفهم البصري واللغوي.
#1

LongStraw: تدريب RL بسياق طويل تحت ميزانية GPU ثابتة

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
الفريق Zhou وزملاؤه قدموا LongStraw، نظام تنفيذ بيشتغل مع سياقات مليون توكن تحت ميزانية GPU ثابتة. الطريقة بتستغل Group Relative Policy Optimization وبتقليل الرسم البياني للتدريب عن طريق حذف autograd من الـprompt المشترك وتخزين الحالة الضرورية بس. جربوها على موديلات Qwen3.6-27B وGLM-5.2 وحققوا تدريب مجموعات توكنات بأكثر من 2 مليون على 8 أو 32 بطاقات H20 بدون ما يزودوا الذاكرة كتير.
ليش بتهمّك؟: هالطريقة بتخلّي تدريب نماذج كبيرة بسياق طويل يصير ممكن على أجهزة GPU محدودة، يعني بنقرب التقنية من التطبيقات الواقعية.
🌱 شو إلك منها؟
تخيّل إنك بدك تقرأ كتاب مليون كلمة وتستفيد من كل تفاصيله بذكاء اصطناعي، هالنظام بيسمح للكمبيوتر يتعامل مع هالمعلومات بدون ما يحتاج كمبيوتر سوبر قوي. يعني ممكن تشوف تطبيقات مثل مساعد شخصي يقرأ كل محادثاتك وتوثيقاتك ويعطيك نصايح دقيقة، وكل هالشي على جهاز بيتك.
RL long-context efficiency GPU language-models hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

BadWAM: هجمات تخريبية على نماذج العالم‑الإجراء

BadWAM: When World-Action Models Dream Right but Act Wrong
الفريق اللي هو Qi Li وزملاؤه قدموا BadWAM، إطار موحد بيكشف نوع جديد من الهجمات على نماذج World‑Action Models. الهجمات بتستغل تشويش بصري بسيط لتخرب التوافق بين اللي النموذج يتخيله من مستقبل المشهد وبين الفعل اللي بينفذه. فيه نوعين: هجوم بيهدم الفعل بس، ونوع تاني بيحافظ على تخيل المستقبل بس بيخلي الفعل يختلف بشكل مخفي. التجارب أظهرت إن هالهجمات بتقلل نجاح المهام من 96.5% إلى 43.1% تقريباً.
ليش بتهمّك؟: هالهجمات بتبيّن إنو الاعتماد على تخيل النموذج للمستقبل مو دايمًا بيضمن أمان الروبوتات.
🌱 شو إلك منها؟
تخيل إنو الروبوت يشوف المستقبل قبل ما يتحرك، بس إذا حدا حط تشويش بسيط على الصورة، الروبوت ممكن يتصرف بطريقة غلط وهو يظن إنو كل شي تمام. هالشي ممكن يخلّي الروبوتات المنزلية أو السيارات الذاتية تتعرض لمشاكل إذا استغلّوا هالطريقة. لازم نطوّر طرق لتأكد إنو التخيل والفعلة متطابقين.
adversarial attacks world-action models robotics safety hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

فهم وتوليد الصور معاً: عمليات ماركوف القفزة الذاتية التصحيح

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes
الباحثين قدموا طريقة جديدة تخلي الفهم والتوليد للصور والنصوص يشتغلوا مع بعض بنفس الوقت، بدل ما يكونوا منفصلين. استغلوا Masked Diffusion Models وأضافوا آلية تسمح لكل وحدة (نص أو صورة) تشوف ثقة التانية وتصحح الأخطاء فوراً عبر SC-CMJP. كمان طوّروا سامبلر واحد‑مرّة اسمه CO_2Jump ما بيحتاج تدريب، يقدر يحدّث الصورة والنص سوا ويحلّ مشاكل التناقض. جربوا الطريقة على ثلاث مجموعات بيانات ضخمة ونشروا النتائج اللي بتظهر تحسّن واضح بالمقارنة مع الطرق القديمة.
ليش بتهمّك؟: هالطريقة بتخلّي الأنظمة الذكية تفهم وتولّد محتوى بصري نصي بدقة أعلى وبسرعة أكبر، وهاد مهم لتطبيقات مثل تعديل الصور بالمحادثة أو الفهم البصري للحوارات.
🌱 شو إلك منها؟
تخيّل إنك تحكي للكمبيوتر تصف صورة وتطلب تعديلها، وهو يقدر يرد عليك بصورة محدثة بنفس اللحظة. هالشي بيقربنا من تجربة تفاعل طبيعية، متل ما بنحكي مع بعض على السبورة. رح تشوف هالتقنية بأدوات تعديل الصور أو التطبيقات اللي بتساعدك تصمم محتوى بسرعة من غير ما تحتاج تتقن برامج معقّدة.
multimodal diffusion generation image-text sampling hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

فك شفرة On-Policy Distillation: الدور، المشكلات، والتنظيم

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
الورقة بتوضح إنو On-Policy Distillation (OPD) بيشتغل كمنشط للاستكشاف، يعني بيوجّه الطالب لطرق تفكير صحيحة عن طريق إرشاد تفصيلي على مستوى الرموز، بس ما بيزيد من قدرته القصوى. الباحثين لقوا إنو تنوّع الأسئلة أهم من عدد العينات لكل سؤال، وإنو نجاح OPD بيعتمد بالكامل على جودة الإشارة الإرشادية. هالشي بيكشف مشكلتين: فجوة بين المعلم والطالب (Student-Teacher Mismatch) و«استغلال الطول» اللي بيخلي الطالب يلعب على طول الرد بدل ما يفكّر. لتقليل هالمشكلات جربوا تنظيمات خفيفة مثل advantage clipping وlog-scale compression، ولقوا تحسين واضح على سبع benchmarks.
ليش بتهمّك؟: هالنتائج بتساعدنا نطوّر LLMs بصورة أأمن وأكفأ، لأنو بنعرف كيف نتحكم بالإشارات اللي بنعطيها للطالب ونتجنّب الأخطاء اللي بتقلّل من جودة النموذج.
🌱 شو إلك منها؟
تخيّل إنو الطالب يتعلم من معلم، بس إذا المعلم والطالب مختلفين كتير، ممكن النصايح تكون غريبة وتضلّ الطالب يروح بطريق غلط. كمان الطالب ممكن يختصر إجاباتوا عشان ياخد علامة بسهولة بدل ما يفكّر بعمق. مع تنظيم الإشارات، الطالب بيتعلم أحسن، وهاد الشي بنشوفه اليوم في تطبيقات الشات بوتس اللي بتعطي ردود أدق وأسرع.
distillation LLM exploration regulation benchmarks hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

VIABench: مجموعة قياس شاملة للفيديو لمساعدة المكفوفين

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
الفريق اللي قدم الورقة حطّوا VIABench، وهو benchmark بالفيديوهات المسجّلة من قبل الأشخاص المكفوفين، لتقييم الـ Multimodal Large Language Models بمهام المساعدة اليومية. فيه ثلاث مهام: Proactive Reminder اللي بيطلب من النموذج يتوقع الأحداث المهمة ويشرحها صوتيًا، وVisual Question Answering (VQA) للرد على أسئلة المستخدم عن المشهد، وVision‑Guided Interaction لتوجيه التفاعل مع البيئة. حطّوا طريقة تقييم صارمة تدعم الوضعين online (بوقت الحقيقي) وoffline. التجارب بينت إن النماذج الحالية لسا ما بتقدر تعطي دعم شامل، خصوصًا بمهمة Proactive Reminder اللي بتحتاج توقع دقيق وسرعة استجابة.
ليش بتهمّك؟: هالbenchmark بيفتح باب لتطوير نماذج ذكية تساعد المكفوفين يتنقلوا بأمان وتستفيدوا من الفيديوهات اليومية.
🌱 شو إلك منها؟
تخيل إنك مكفوف وتقدر تسمع وصف دقيق للّي بصير قدامك قبل ما يصير، متل ما يكون عندك دليل صوتي يذكّرك بالمخاطر أو الأشياء المهمة. هالشي بيسهّل عليك تمشي بشوارع المدينة أو تتعامل مع الأدوات بالبيت. مع الوقت، ممكن تشوف تطبيقات أو خدمات تعتمد على هالتقنية وتساعدك تتعامل مع العالم بسهولة أكبر.
video benchmark multimodal accessibility LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

إعادة توصيل طيفي لتقوية التفكير ودمج النماذج (SAR)

Spectral Rewiring for Exploration, Purification, and Model Merging
الفريق قدم طريقة اسمها Subspace-Aligned Rewiring (SAR) بعد ما يخلصوا تدريب نموذج لغة كبير. الفكرة إنو الجزء اللي بيساهم بالمنطق بيتجمع بمكان اسمه الفضاء الطيفي، فـ SAR بيحافظ على هالجزء ويشيل المكوّنات اللي ما إلها فائدة أو بتسبب تشويش بين المجالات. الطريقة بتحتاج أقل من 0.6% من كل البارامترات، وبتخلي النموذج يحافظ على أكتر من 99% من الأداء بعد التدريب، وتزيد من قدرته على حل مسائل رياضية وتطبيقات البرمجة. كمان بتساعد بدمج نماذج متخصصة من غير ما يخسروا مهاراتهم، وبتعطي أداء أحسن من طرق الدمج القديمة.
ليش بتهمّك؟: لأنها بتخلّي نماذج اللغة الكبيرة تتطور وتدمج مهاراتها بدون ما يطيح الأداء، وبدون ما نحتاج نعيد تدريب كامل.
🌱 شو إلك منها؟
تخيّل إنك عندك مساعد ذكي يقدر يحل مسائل رياضية ويكتب كود برمجي بنفس الوقت، بس بدون ما يخلط بين المهام أو يبطئ. الطريقة هاي بتنظف “الوصفة” اللي تعلمها المساعد، بتخلي النكهات الأساسية تبقى وتزيل اللي ما إلها طعم. يعني إذا استخدمت تطبيقات مثل شات بوت أو أدوات كتابة الكود، رح تلاقيها أسرع وأكثر دقة.
RL model merging spectral methods LLM fine-tuning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

PolicyShiftGuard: حارس الصور المتكيّف مع السياسات

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
الفريق قدم طريقة جديدة لتقييم صور الحماية حسب السياسة المتغيّرة، مش حسب صورة ثابتة. عملوا Benchmark اسمه PolicyShiftBench فيه 2,000 حالة فيها كل صورة مرتبطة بأكتر من 7 سياسات مختلفة، عشان يختبروا إذا الموديل بِظبط نفسه حسب السياسة الحالية. بعدين صمموا نموذج PolicyShiftGuard اللي بتدريبه وصفين: RP‑SFT لتعميم السياسات وBP‑Adapt لتعلم الفروقات بين سياسات الحجب والتمرير باستخدام مقارنة أزواجية. النتائج بتبيّن إنّ الموديل بيغلب باقي VLMs وموديلات الحماية القديمة بكتير، وبيوصل لأعلى أداء على Benchmark.
ليش بتهمّك؟: هالورقة مهمّة لأنّها بتخلّي أنظمة الفحص البصري تشتغل بدقّة حتى لو تغيّرت سياسات الأمان، يعني ما بيصير فيها فجوات أمان.
🌱 شو إلك منها؟
تخيل إنو عندك تطبيق بيحمي الصور من المحتوى الضار، ومع كل تحديث للسياسة، بيصير التطبيق يقدر يحدد إذا الصورة مسموح فيها ولا لا بدون ما يضل يخطأ. هالشي بيساعدك تحافظ على أمان العيلة أو المجتمع على الإنترنت. ممكن تلاقي هالتقنية ضمن أدوات الفحص اللي بتستعملها منصات التواصل أو الخدمات السحابية.
image safety policy adaptation benchmark VLM guardrails hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

Self in Space: بنشمارك للوعي الذاتي والإدراك المكاني للطائرات بدون طيار

Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence
الباحثين قدموا SIS‑Bench، بنشمارك جديد بيقيس الذكاء المكاني المتجسد للطائرات بدون طيار من خلال صيغة 'self‑in‑space'. البنشمارك بيغطي 13 مهمة على 4,856 سؤال‑جواب مأخوذة من 1,646 فيديو واقعي، وبيقسّم التقييم على بعدين: الفضاء والذات، وثلاث مستويات: الإدراك، الذاكرة، والاستنتاج. التجارب أظهرت إن الـ MLLMs الحالية عندها صعوبة بتعامل مع الحركات الديناميكية والوعي الذاتي، وبيقل الأداء كل ما ارتقينا بالمستوى المعرفي. إضافة تمثيل حساس للحركة باستخدام optical flow ودمج الخصائص البصرية حسّن الإدراك والذاكرة، وبيساعد على اتخاذ قرارات أفضل للطائرات.
ليش بتهمّك؟: لأن تحسين الوعي الذاتي للطائرات بدون طيار بيقود لتوجيه أدق وأمان أعلى بالمهمات الواقعية.
🌱 شو إلك منها؟
تخيل إنو الطيارة بدون طيار بتعرف موقعها بالضبط وبتفهم المكان اللي حوالينها، فبتقدر توصل الطرود للبيت بسرعة وأمان. هالتحسين بيخلي خدمات التوصيل أو تصوير المناظر الطبيعية تكون أقل أخطاء وتوفر وقتكم. ممكن تشوف هالفرق إذا استخدمت تطبيق توصيل يعتمد على طائرات بدون طيار قريباً.
benchmark UAV multimodal spatial cognition self-awareness hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

RxBrain: نموذج أساس للمعرفة المتجسدة مع تخطيط لغوي‑بصري وتخيل

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
الفريق قدم RxBrain، نموذج أساس للمعرفة المتجسدة بيجمع بين اللغة والرؤية لتخيل الخطوات قبل تنفيذها. النموذج بيستعمل بنية Mixture-of-Transformers موحدة بتفهم النصوص، الصور والفيديوهات وبتولدهم كمان. من خلال خط أنابيب أوتوماتيكي حول الفيديوهات لتسلسل نص‑بصري، بنوا RxBrain‑Bench لتقويم قدرة النموذج على تمثيل الخطط المتجسدة. التجارب بينت إن RxBrain بيقدر يدمج التفكير اللغوي مع تخيل الحالة الفيزيائية، وحتى يولّد أوامر روبوتية مستمرة بدون تدريب مسبق كبير.
ليش بتهمّك؟: هالورقة بتفتح باب لتصميم أنظمة ذكية بتفهم وتخطط للمهام بشكل متكامل، وبتقربنا من روبوتات تتصرف بحكمة.
🌱 شو إلك منها؟
تخيل إن عندك مساعد ذكي يقدر يقرأ شغلة ويشوف صورة ويخطط لك خطوة بخطوة قبل ما يشتغل، متل ما بنخطط للطبخة قبل ما نطبخ. هالنوع من الذكاء بيخلي الروبوتات تساعدنا بالبيت أو بالمصانع بطريقة أسهل وأدق. ممكن تشوفه قريبًا بخدمات التوصيل أو التنظيف اللي بتستعمل روبوتات ذكية.
embodied cognition multimodal foundation model robotics planning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

Chat2Scenic: إطار RAG تفاعلي لتوليد سيناريوهات القيادة الذاتية

Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving
التحقق من أنظمة القيادة الذاتية بحاجة لتصاميم اختبار متنوعة وتلتزم بالقوانين. فريق Yuan Gao وزملاؤه قدموا Chat2Scenic، وهو إطار بيستعمل RAG مع واجهة شات بوت لتوليد سكريبتات DSL تفاعلية، يعني بنقدر نعدل السيناريو مع الوقت. الاختبار على 123 سيناريو من تنظيمات NHTSA والأمم المتحدة بيظهر إنو النموذج وصل لـ 76.42% نجاح في التجميع و58.17% دقة في الإطار، متفوق على الطرق السابقة. الكود مفتوح على GitHub لتسهيل المتابعة.
ليش بتهمّك؟: هالورقة بتقصر وقت اختبار سيارات القيادة الذاتية وبترفع من أمانها قبل ما تنزل على الطريق.
🌱 شو إلك منها؟
مع هالتقنية، السيارات الذاتية رح تكون مختبرة أكثر وتشتغل بأمان أعلى، متل ما بنختبر سيارة قبل ما نسوقها بالشارع. الفكرة تشبه إنك تتأكد من كل خطوة في وصف الطريق قبل ما تمشي فيه. رح تشوف هالتحسينات في التطبيقات اللي بتستعمل سيارات ذاتية القيادة أو خدمات توصيل ذكية.
autonomous-driving scenario-generation RAG LLM simulation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

تطوير الروبريكس من سؤال واحد بالدلائل الصناعية

Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence
هالورقة بتقدّم طريقة جديدة لتوليد الروبريكس (قواعد التقييم) مباشرةً من سؤال بدون ما نحتاج أي بيانات بشرية أو تدريب إضافي. الفريق بيستخدم أزواج ردود مكوّنة صناعيًا لتوليد روبريكس، وبعدين بيتأكدوا من كل روبريك إذا كان بيفرق بين الأجوبة ولا لأ، وبيستبعدوا اللي ما بيفيد أو بيهتم بس بالستايل. التجارب على خمس مجموعات معيارية للـ preference أظهرت إن الطريقة وصلت لأعلى دقة وسط هالمجالات، وتصدّرت ٦ من ٧ مجموعات تقييم.
ليش بتهمّك؟: هالطريقة بتخلّي إنشاء روبريكس مخصص لكل سؤال أسهل وأسرع، وبتحسّن تقييم نماذج اللغة الكبيرة بدون ما نحتاج موارد بشرية كتيرة.
🌱 شو إلك منها؟
بتقدر تستعمل هالطريقة لتقييم ردود الروبوتات أو المساعدين الافتراضيين بسهولة، متل ما بنقيس إذا الجواب مفيد ولا لأ. فكر فيها كأنك عم تحط معايير لتقييم شغلة من غير ما تسأل حدا، بس الروبوت نفسه بيختبرها. ممكن تشوف هالتحسينات على تطبيقات المحادثة أو أدوات التعليم اللي بتعتمد على الذكاء الاصطناعي.
LLM rubric evaluation synthetic data arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

فهم هياكل صور الصحف بهرمية (Hierarchical Structure Understanding)

Towards Hierarchical Structure Understanding of Newspaper Images
هالورقة بتقدّم طريقتين لتفكيك هياكل الصحف المعقّدة. الأولى نظام بنائي من أسفل لفوق بيستعمل YOLO لتحديد التخطيط، LayoutReader لتوقع ترتيب القراءة، وخوارزمية مخصّصة لتقسيم المقالات. الثانية بتعرّف على Tiramisu، معمارية transformer جديدة بتشتغل بطبقات هرمية لتصنيف الأقسام وتحديد المواقع وتحديد الفئات الدلالية وترتيب القراءة. كمان الباحثين أطلقوا مجموعة بيانات جديدة اسمها Finlam La Liberté لتقييم هالمهام، والشفرة التدريبية متوفرة على GitHub.
ليش بتهمّك؟: هالطريقة بتسهل تحويل الصحف القديمة لمحتوى رقمي قابل للبحث وبتسرّع عملية الأرشفة.
🌱 شو إلك منها؟
تخيل إنك تدور بكلمة داخل جريدة من عشرينات أو ثلاثينات وتلاقي المقال اللي بدك ياه بسرعة. هالشي بيخلّي المكتبات والباحثين يلقوا معلومات تاريخية بسهولة، وكمان بيظهر الصحف القديمة على الإنترنت كأنها كتب إلكترونية.
document analysis hierarchical modeling transformer dataset OCR arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

HDR: تمثيل هرمي لتنقية الفيديو للمنطق المتسلسل

Hierarchical Denoising For Multi-Step Visual Reasoning
الفريق اللي قاده Zezhong Qian وزملاؤه قدموا HDR، إطار موحد يدمج تمثيلات هرمية داخل توليد الفيديو المتسلسل عشان يقدر يخطط خطوة بخطوة. النظام بيرتب تمثيلات الفيديو بشجرة هرمية، فبيبدأ بتنقية خشنّة بتحافظ على الفرضيات غير المؤكدة وبعدين بيصقلها بطبقات أدق لتوصل لحالة بصرية واضحة. كمان استخدموا نمط انتباه هرمي متفرق (SHAP) لتقليل تكلفة المعالجة الزمكانية، وبهالطريقة قدروا يرفعوا نسبة النجاح من 34.22٪ إلى 60.29٪ ويقللوا زمن الاستنتاج للثانية الواحدة للمتغيّر. التجربة على روبوتات حقيقية أكدت إنو الفكرة بتشتغل كمان في العالم الواقعي.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج الفيديو تفكر مثل الإنسان وتنجز مهام معقّدة بسرعة أعلى وباستقرار أكبر، وهذا بيفتح باب لتطبيقات تفاعلية أوسع.
🌱 شو إلك منها؟
تخيّل إنو برنامج يقدر يحلّ ألعاب مثل المتاهة أو برج هانوي خطوة بخطوة قبل ما يطبقها على الروبوت حقك. هالشي بيسهّل على الناس إنهم يخلّوا الروبوتات تتصرف بذكاء أكتر بالبيت أو بالمصنع. يعني رح تشوف تطبيقات مثل مساعدات منزلية أو أنظمة مراقبة بتتصرف بذكاء أكبر مع هالتقنية.
video diffusion reasoning benchmark hierarchical hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

لما الكلمات تكون آمنة لكن الأفعال تقتل: كشف الخطر الفيزيائي في LLMs

When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space
الفريق دراسة كيف إنو التعليمات اللي بتظهر بأمان بالنص ممكن تصير خطر إذا انطبقت على عالم مادي. لقوا إنو إشارة الخطر النصّي (CD) والخطر الفيزيائي (PD) بتكون منفصلة داخل تمثيلات LLMs، وبناءً على هالشي صمموا PRISM، بروب بسيط بطبقة وحدة يحدد الخطر من الحالة المخفية. PRISM وصل لدقة فوق 86٪ على SafeAgentBench ومع فشل منخفض، وكمان جاب 99.6٪ دقة على مجموعة الاختبار الجديدة PhysicalSafetyBench-1K. النتائج بتأكد إنو الفحص داخل النموذج بيساعد نكتشف مخاطر مادية غير معروفة من النصوص بس.
ليش بتهمّك؟: لأنو بنقدر نمنع تصرفات خطرية للروبوتات أو الأنظمة الذكية قبل ما تنفذها، مش بس بنراقب الكلام.
🌱 شو إلك منها؟
تخيل إنو برنامج يكتب لك تعليمات للمنزل، وإنت ما بتشوف إنو فيه خطر، بس الروبوت ممكن يسبب حادث إذا ما انتبه. هالطريقة بتخلي البرنامج يكتشف هالمخاطر قبل ما يصير شي. يعني إذا بتستعمل أي خدمة ذكية بتعتمد على تعليمات صوتية أو نصية، هالتحقق بيساعد تحافظ على سلامتك.
safety LLM probing benchmark hidden states arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

NIFA: معمارية FPGA غير خطية تعزز كفاءة استدلال الـML

NIFA: Nonlinear IMC enhanced FPGA for efficient ML inference
الفريق قدموا معمارية FPGA جديدة بتستبدل الـADC التقليدي بذاكرة ACAM تنفّذ العمليات غير الخطية داخل بلوك الـIMC. هالنهج بيقلل استهلاك الطاقة والمساحة، وبيسمح للمعالج يتعامل مع عمليات الـDIMM والـattention اللي بتظهر بالنماذج المتطورة مثل Transformers. كمان عملوا استكشاف مساحة التصميم لتحديد أبعاد الـcrossbar الأمثل مع مراعاة مساحة الـFPGA وأداء الـDL. النتائج على بنشماركات CNN وTransformer أظهرت تحسين حتى 40× في كفاءة الطاقة و4.1× في كفاءة المساحة.
ليش بتهمّك؟: هالمعمارية بتخلّي تشغيل نماذج الذكاء الاصطناعي على الـFPGA أسرع وأقل استهلاكًا للطاقة، خصوصًا للنماذج الكبيرة مثل Transformers.
🌱 شو إلك منها؟
تخيل إنو جهازك يقدر يشغّل تطبيقات الذكاء الاصطناعي بوقت أقصر وبطارية تدوم أطول، متل سيارة بتصرف بنزين أقل بس توصل أسرع. هالتقنية ممكن تظهر بأجهزة مثل الهواتف أو الكاميرات الذكية، بحيث ما تحتاج تنتظر وقت طويل لتعرف إذا الصورة فيها شيء مهم. كمان ممكن تخفّف الفاتورة الكهربائية للأنظمة اللي بتشتغل 24 ساعة مثل المراقبة أو الروبوتات المنزلية.
FPGA analog computing energy efficiency AI inference hardware arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

ضبط دقيق بسياق طويل بذاكرة VRAM محدودة

Long-Context Fine-Tuning with Limited VRAM
الفريق قدم طريقة جديدة اسمها Hierarchical Global Attention (HGA) مع backpropagation على أجزاء وتخزين KV على مستويات مختلفة. الفكرة إنّه بس الجزء النشط بيضل قابل للتفاضل بالـ VRAM، والبقية بتنقل للـ RAM أو NVMe، فبيقدروا يمدّوا طول السياق لحد 16,384 توكن على كرت شاشة 16 GB. جربوا الطريقة على نموذج Qwen3‑8B مع 4‑bit QLoRA على مجموعة PG19، ولاحظوا إنّها بتحافظ على جودة النص تقريباً وتسرّع التدريب مقارنةً بالـ dense attention التقليدي. كمان HGA ممكن تُستَخدم في الاسترجاع والتوليد، وهم شغالين على نسخة إنتاجية جاهزة.
ليش بتهمّك؟: هالطريقة بتخلّي تدريب نماذج اللغة الكبيرة بذاكرة بطاقات شاشة عادية يقدر يوصل لسياقات أطول، وهذا بيفتح باب لتطبيقات أكتر تعقيداً بدون ما نحتاج أجهزة غالية.
🌱 شو إلك منها؟
بتخيل إنو تطبيقات الذكاء الاصطناعي رح تصير تقدر تفتّح ملفات طويلة أو تحكي قصة طويلة من غير ما تنسى تفاصيل سابقة، متل ما بنقرا كتاب كامل على الموبايل. هالشي رح يساعدك إذا بدك تكتب مقالات طويلة أو تشوف ترجمة نصوص ضخمة من غير تقطيع. رح تلاقي هالتحسينات قريباً ببرامج الدردشة أو أدوات الكتابة اللي بتستعمل كرت الشاشة في بيتك.
long-context fine-tuning VRAM HGA QLoRA arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

MetaView: توليف مناظر جديدة من صورة وحدة مع إدراك مقاس ثلاثي الأبعاد

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
الفريق قدم MetaView، إطار توليد مناظر جديدة يعتمد على diffusion وبيشتغل من صورة وحدة. استعملوا شبكة إدراك هندسيّة feed‑forward لتولّد أوليات هندسية ضمنية، وبنفس الوقت استخدموا عمق متري لتثبيت المشهد على مقياس حقيقي. هالدمج بيسمح للمنهج ينتج صور من زوايا مختلفة حتى لو التغيير كبير، وبيحقق توازن بين التناسق الهندسي والتحكم الدقيق. التجارب أظهرت إن MetaView يتفوّق على الطرق السابقة خصوصاً تحت تغيّر كبير للمنظور.
ليش بتهمّك؟: لأنو بيخلّي توليد مناظر جديدة من صورة وحدة يكون أدق وأكتر تحكم، وبيفتح باب لتطبيقات AR/VR بأقل بيانات.
🌱 شو إلك منها؟
تخيل إنك بتصوّر غرفة مرة وحدة، وبعدين بتقدر تشوفها من كل زاوية كأنك عم تدور بالكاميرا. هالطريقة بتسهل على الناس تصمم ديكورات أو تشوف منتجات من كل جانب بدون ما يلتقطوا صور كتيرة. ممكن تشوف هالشيّ بتطبيقات الواقع المعزز على الموبايل أو على المواقع اللي بتبيع الأثاث.
novel view synthesis diffusion geometry computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

ChartCynics: إطار وكيل مزدوج لتفكيك المخططات المضللة

Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
الفريق قدم لنا ChartCynics، إطار وكيل بيشتغل بطريقتين: مسار بصري تشخيصي بيلقط التشوهات بالمخطط، ومسار مدفوع بالـ OCR بيوفر الأرقام الفعلية. بعدين بيجي الوكيل الملخص اللي بيستفيد من تدريبين: Oracle‑Informed SFT لتقوية التفكير وDeception‑Aware GRPO لتصحيح الأخطاء. هالإطار بيحسّن الدقة لتوصل 74.43% و64.55% على مجموعتين اختبارية، يعني زيادة تقريباً 29% عن النموذج الأساسي Qwen3‑VL‑8B.
ليش بتهمّك؟: الموضوع بيساعد الباحثين والمطورين يبنوا نماذج أصغر لكن أقوى بقدرتها على كشف المخططات المضللة.
🌱 شو إلك منها؟
بتخيل إنك عم تقرأ تقرير فيه رسومات ممكن تكون مخدِّعة، هالتقنية بتخليك تشوف إذا الأرقام حقيقية ولا مخدِّعة، متل ما بتشوف إذا الفاتورة فيها أخطاء قبل ما تدفع. يعني إذا استخدمت تطبيق بيستند على هالنظام، رح تكون أكتر ثقة بالبيانات اللي بتقراها يوميًا.
VLM chart QA agentic robustness benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

جسور الوثائق: ليش الفائدة الساكنة ما بتعكس الفائدة السببية في البحث الوكلي

Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search
الفريق Mukhopadhyay وزملاؤه بيقيسوا الفرق بين الفائدة الساكنة (Static Retrieval Utility) والفائدة السببية (Causal Utility) لما نموذج لغة بيشتغل كوكيل بحث يطرح أسئلة متعددة. بيستخدموا وكيل ReAct على مجموعة HotpotQA وبيعملوا تجربة حذف كل وثيقة قرأها الوكيل ويعيدوا تشغيل المسار، فبيحسبوا مقياس Counterfactual Trajectory Utility (CTU) من ثلاث فروق: جودة الجواب النهائي، جودة الاستعلام التالي، وعدد الأدوار. لقوا إن SRU وCTU تقريباً مستقلين إحصائياً، وإن حوالي ثلث الوثائق اللي يقرأها الوكيل هي وثائق جسر (bridge documents) ما بتبين فائدتها للقراء الساكنين لكنها حيوية لتوجيه البحث.
ليش بتهمّك؟: لأن تحسين الفائدة الساكنة ما بيكفل نجاح الوكلاء الذكيين، ولازم نعيد التفكير بطرق تقييم الاسترجاع لتشمل الفائدة السببية.
🌱 شو إلك منها؟
تخيّل إنك عم تدور على معلومة على الإنترنت، وفيه صفحات ما بتعطيك الجواب فوراً بس بتقودك للصفحة الصح بعدين. هالوثائق هي اللي بنسميها "جسور"، وبدونها ممكن يضلّوك الضياع. هالفكرة مهمة للروبوتات أو المساعدين الذكيين اللي بيبحثوا لك عن إجابات معقدة، لأنهم بحاجة لتعرف أي وثيقة ممكن تفتح باب للخطوة الجاية، مو بس اللي تعطيك الجواب حالياً.
retrieval agents causal evaluation RAG arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

إطار ذاتي‑تطوري لتوضيح تصنيف أعراض الاكتئاب باستخدام LLM

Self-Evolving Human-Centered Framework for Explainable Depression Symptom Annotation
الفريق اقترح إطار جديد لتصنيف أعراض الاكتئاب بيشتغل مع LLM وبمشاركة خبراء. الإطار عنده ثلاث مراحل: يختار دليل من النص، يحلل معايير DSM‑5‑TR، وبعدين يركّب النتيجة مع توضيح السبب. فيه ذاكرة مزدوجة (Example Memory وReflection Memory) بتخزّن ملاحظات الخبراء وبتحسّن التوسيمات بدون ما نعيد تدريب النموذج. التجربة الأولية بينت إنه الإطار بيزيد من اتساق التوسيم وبيقلل الشغل اليدوي.
ليش بتهمّك؟: هالطريقة بتخلّي بيانات الصحة النفسية أكثر شفافية وتساعد الباحثين يبنوا نماذج تفسّر قراراتها.
🌱 شو إلك منها؟
تخيل إنو عندك مريض مكتوب له أعراضه، هالإطار بيساعد الطبيب يحدد إذا هو مكتئب ولا لأ وبشرح واضح ليه. يعني بدل ما تكتب ملاحظات يدويًا وتضيع وقت، البرنامج بيجمع الأدلة من النص ويعطيك تقرير جاهز. ممكن تشوف هالتقنية بالمستقبل ببرامج استشارات نفسية على الإنترنت.
explainable AI mental health annotation LLM DSM-5 arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 9
Group Relative Policy Optimization
هالمفهوم يعني طريقة لتدريب السياسات بالمجموعات بحيث كل مجموعة بتحسّن نسبياً عن غيرها، احنا بنستعمله عشان نسرّع التعلم بالـRL ونقلل الفروقات بين الـagents.
World-Action Model
مفهوم بيقول إنو النموذج ما بيشتغل بس على النص، بل بيفهم الأفعال والعالم حوالينه عشان يقدر يتصرف بطريقة منطقية
adversarial attack
adversarial attack هو هجوم على نموذج الذكاء الاصطناعي بيخلّيه يخطئ بإدخال بيانات مِعدَّلة بعناية، بدنا نعرفه عشان نقدر نحسّن أمان النماذج ومش نخلّيها تنقلب ضدنا
closed-loop execution
فكرة إنو النموذج يطلع نتيجة، بنقيسها، وبنرجع المعلومة له لتصحيح نفسه، يعني حلقة مغلقة لتطوير الأداء مش بس خطوة وحدة
cross-modal attention
cross-modal attention يعني آلية تركّز على معلومات من أكتر من نمط (مثل صورة وصوت) بنفس الوقت، عشان النموذج يربط بين الإشارات ويستفيد من كل إشي
On-Policy Distillation
هالطريقة بنقل فيها المعرفة من نموذج بيتعلم على نفس السياسة (on‑policy) إلى نموذج أصغر أو أبسط، يعني بنخلي الـteacher يعلّم الـstudent مباشرةً خلال التدريب. بنستعملها مش لتقليل حجم النموذج بس كمان لتسريع التعلم.
advantage clipping
تقنية بتقليل القيم المتطرفة بخوارزمية التعلم التعزيزي، عشان التدريب ما يصير غير مستقر وبنحافظ على استقرار النموذج
log-scale compression
log-scale compression يعني إنو بنضغط البيانات بطريقة اللوغاريتم، يعني القيم الكبيرة بنقللها لتصير أصغر عشان ما تخلّينا نغرق بالمعلومات. بنسمع عنه عشان بساعدنا نتعامل مع أرقام كتيرة بسرعة.
Student-Teacher Mismatch
Student-Teacher Mismatch هو لما النموذج الطالب ما بيتطابق مع النموذج المعلم، يعني المعلم بيعطي تعليمات ما بيقدر الطالب يتبعها. بنسمع عنه عشان بنحاول نصلح التدريب ونحسن الأداء.
🤖 موديلز 5
Qwen3.6-27B
نموذج لغة كبير من Alibaba، بحجم 27 B بارامتر، احنا بنستعمله لتوليد نصوص دقيقة وعالية الجودة لأنو بيقدر يفهم إشي كتير معقّد
GLM-5.2
نموذج من Zhipu AI، 5.2 B بارامتر، بدنا نستخدمه للمهام العامة بالإنجليزي والصيني لأنه بيشتغل بسرعة وبكفاءة
Masked Diffusion Models
نماذج بتولد صور أو صوت عن طريق إزالة الضوضاء خطوة بخطوة، مع قناع بيحدد إشي لازم يتولد عشان تكون النتيجة أنقى
SC-CMJP
نموذج بيحاكي تفاعلات الجزيئات تحت ضغط عالي، بنستعمله للبحث العلمي عشان نفهم كيف المواد بتتصرف بالمستوى الميكروبي
CO_2Jump
نموذج بيحكي عن انبعاثات ثاني أكسيد الكربون وتغيّرها المفاجئ، بدنا نستخدمه لتوقعات المناخ لأنه بيوضح إشي ممكن يصير بسرعة
كل المصطلحات ←
العدد السابقشو في AI؟ | 17 يوليو — تطور الوكلاء المتعددين
📚 كل الأعداد