📡 أحدث عدد

شو في AI؟ | 9 يوليو — تحسين الوكيل الذكي غير متزامن

يومي 📅 2026-07-09
سلام 👋 هلقيت هالعدد فيه مجموعة من الابتكارات الحديثة بالذكاء الاصطناعي، من نماذج رباعية الأبعاد للروبوتات لحد تحسينات سريعة للـTransformer. بدنا نعرضلكم أهم العناوين بطريقة مختصرة ومفهومة، إشي كتير مهم للباحثين والمهتمين.
#1

RynnWorld-4D: نموذج عالم رباعي الأبعاد للروبوتات

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
الفريق قدم نموذج RynnWorld-4D اللي بيستغل تزامن RGB، depth، وoptical flow (RGB-DF) ليعطي تمثيل 4D للمنظر. النموذج بيولد إطارات RGB مستقبلية، خرائط العمق، وتدفقات بصرية من صورة RGB-D وحدة وتعليمات نصية عبر عملية diffusion موحدة. العمارة ثلاثية الفروع بتدمج cross‑modal attention مع 3D RoPE لتضمن توافق الشكل، الهندسة، والحركة. كمان أضافوا رأس inverse‑dynamics اسمه RynnWorld-4D-Policy يطلع أفعال الروبوت مباشرة من التمثيل الداخلي، بدون خطوات denoising المتعددة.
ليش بتهمّك؟: هالطريقة بتقرب الفجوة بين توقعات العالم وتعلم سياسات الروبوت، فبتعطي أداء أعلى بالمهام الدقيقة والمتزامنة.
🌱 شو إلك منها؟
تخيل روبوت بيتعامل مع أشياء بالبيت، يقدر يشوفها ويتخيل كيف رح تتحرك إذا لمستها، زي ما إحنا بنشوف كوب ونفهم إذا رح يطيح أو يظل ثابت. هالقدرة بتخلي الروبوتات تساعدنا بأعمال البيت بدقة أكبر، مثلاً بترتيب الأغراض أو تحضير القهوة. رح تشوف هالتحسينات في تطبيقات الروبوتات المنزلية أو الصناعية قريباً.
robotics diffusion world-model manipulation multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

SciReasoner: نموذج أساسي للسببية الهيكلية عبر البروتينات والجزيئات والبلورات

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning
الفريق قدم SciReasoner، نموذج أساسي متعدد الوسائط بيحوّل إحداثيات البنية والاتصالات إلى مفردات بنظام موحد، وبيستعمل هالمفردات كدليل قابل للفحص خلال عملية التنبؤ. النموذج حسّن توقع مكوّنات الخلية للبروتينات القليلة التشابه، ورفع دقة التخطيط العكسي للتركيب الكيميائي، وكمان فرّق بين المواد ذات الفجوة الطاقية العالية والمنخفضة. عبر 86 اختبار، SciReasoner وصل لأعلى مستوى بأكثر من نصف المهام، وتقييم الخبراء بيّن إن توضيحات النموذج تقريباً دايمًا بتتفوق أو بتساوي توضيحات أكبر نموذج لغة موجود.
ليش بتهمّك؟: لأنه بيخلّي التنبؤات العلمية مش بس دقيقة، بل كمان مفهومة ومرئية للباحثين.
🌱 شو إلك منها؟
تخيّل إنه في برنامج بيساعد العلماء يلقوا دواء جديد أو مادة أقوى بسرعة، لأنه بيوريهم شو اللي خلاه يوصل لهالنتيجة. هالشي بيقربنا من حلول أسرع لمشاكل صحية أو طاقة. ممكن تشوف أثره قريبًا بأدوات البحث على الإنترنت أو تطبيقات التصميم الكيميائي.
foundation model structural reasoning multimodal biology chemistry hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

تحطيم حجز قواعد البيانات: توليد قرّاء تخزين عالي الأداء بالـLLM

Breaking Database Lock-in: Agentic Regeneration of High Performance Storage Readers for Database Bypass
الفريق Giannakouris و Trummer قدموا Jailbreak، طريقة بتقرا ملفات التخزين ل PostgreSQL و MySQL مباشرةً وبتحوّلها لبوفرات عمودية بالذاكرة. الفكرة إن تنسيق ملفات القواعد معقد بس الكود والوثائق متوفرة، والـLLMs بتقدر تتعلمهم وتكتب كود القارئ بدون ما نكتب أي parser يدوياً. القارئ اللي تولدوا بيشتغل مع أنظمة استعلام مشهورة مثل DuckDB و Spark و cuDF، وبيحقق سرعات أعلى بكتير من الطرق التقليدية اللي بتمر عبر JDBC/ODBC. التجارب على معيار TPC‑H بيّنت إن الأداء وصل لحد 27 مرة أسرع.
ليش بتهمّك؟: هالطريقة بتخلّي التحليل الضخم للبيانات أسرع وأرخص، وبتقضي على الاعتماد الحصري على محركات القواعد.
🌱 شو إلك منها؟
تخيل إنك بدك تقرأ بيانات من قاعدة بيانات كبيرة لتعمل تقرير، بدل ما تنتظر ساعات، هالطريقة بتخليك تلاقي البيانات فوراً وتستفيد منها بسرعة. يعني إذا بتستعمل أدوات مثل Power BI أو Tableau، ممكن تلاحظ إن التقارير بتظهر أسرع بكتير. هيك، بتصير العملية اليومية للبيانات أخف وأسرع للكل.
LLM database storage performance code synthesis arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

تحسين غير متزامن بلفة واحدة للوكيل الذكي (SAO)

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
الفريق قدم طريقة جديدة اسمها Single-rollout Asynchronous Optimization (SAO) لتدريب نماذج اللغة الكبيرة على مهمات وكيلية طويلة. هيك، بدل ما يشتغلوا بنظام تجميع الدُفعات، بيستعملوا عينة وحدة لكل طلب، يعني كل rollout بيجي لحاله، وكمان ضافوا تقليم صارم على مستوى الرموز لتقوية استقرار التدريب. الطريقة صارت تثبت نفسها لحد ألف خطوة وتتفوق على GRPO على معايير مثل SWE‑Bench Verified وBeyondAIME. كمان جربوها ببيئة تعلم أون‑لاين متغيرة وشوفوا إنه بتتأقلم بسرعة.
ليش بتهمّك؟: هالورقة بتخلّي تدريب الوكلاء على مهام طويلة يصير أسرع وأكثر استقرار، وبتحسّن الأداء على تطبيقات البرمجة والتفكير.
🌱 شو إلك منها؟
مع هالتقنية، التطبيقات الذكية مثل المساعدات الرقمية رح تقدر تتعلم من كل سؤال بنفرده، زي ما بنتعلم من تجربة وحدة. يعني إذا استخدمت برنامج يكتب كود أو يحل مسألة، رح يطلعلك حل أدق وبسرعة. هالشي ممكن تشوفه قريبًا في أدوات برمجة أون‑لاين أو تطبيقات تعليمية.
RL LLM asynchronous agentic optimization arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

HunyuanOCR-1.5: نموذج OCR خفيف وسريع

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
هالورقة بتقدّم HunyuanOCR-1.5، نموذج OCR خفيف وزنّو قليل بيجمع كل شغلات تحليل المستندات من قراءة النصوص لحد ترجمتها وتعامل مع صور متعددة ضمن VLM واحد. استغلوا طريقة DFlash لتسريع فكّ الترميز، فصارت السرعة أسرع بـ6.37 مرة على الـTransformer و2.14 مرة تحت vLLM، مع الحفاظ على جودة المخرجات. كمان ضافوا Agentic Data Flow، نظام بيستغل الوكلاء لتوليد بيانات تدريب ذكية، وبيحسّن الأداء على نصوص نادرة مثل الخطوط القديمة، الجداول المعقّدة، وأسئلة على مستندات متعددة. النموذج تصنّف ضمن أعلى الترتيب على OmniDocBench v1.6 وبقوة على مهام OCR المتنوعة.
ليش بتهمّك؟: بسرعته وكفاءته، بيفتح باب تطبيق OCR عالي الجودة على الأجهزة الضعيفة أو الخدمات السحابية بدون ما يستهلك موارد كتير.
🌱 شو إلك منها؟
تخيّل إنك تلتقط صورة لفاتورة أو مستند قديم وتحتاج تقراه بسرعة على موبايلك. هالنموذج بيقدر يقرأ النصوص، الجداول، وحتى الرسومات بدقة وبسرعة، حتى لو الجهاز ضعيف أو الاتصال بطيء. يعني التطبيقات اللي بتترجم النصوص من الصور أو بتسحب معلومات من المستندات رح تكون أسرع وأسهل لاستعمالك اليومي.
OCR VLM efficiency multimodal document-understanding hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

DSpark: تسريع توليد النصوص بالتحقق المتجدّد

DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
الفريق قدم DSpark، إطار لتسريع استنتاج نماذج اللغة الكبيرة عبر دمج توليد موازٍ شبه‑تلقائي مع عملية تحقق ذكيّة. النموذج يضيف وحدة تسلسل خفيفة داخل الكتلة لتقليل تدهور الجودة بين الكلمات، ويضبط طول التحقق حسب ثقة النظام وسرعة المعالج. التجارب أظهرت تحسين طول القبول مقارنةً بأحدث أساليب التوليد، وزيادة سرعة الاستجابة للمستخدمين بين 60 و85٪ بنفس مستوى الإنتاجية.
ليش بتهمّك؟: هالطريقة بتخلّي خدمات الشات والبحث الذكي يردّوا أسرع حتى مع عدد كبير من المستخدمين.
🌱 شو إلك منها؟
بتصير الردود على الشات أو المساعد الذكي أقرب لللحظة، زي ما إذا كنت عم تطلب بيتزا وتوصل بسرعة. ما رح تنتظر وقت طويل لتظهر الإجابة، لأن النظام بيستغل الوقت بشكل أذكى. هالتحسين موجود فعلاً بخدمات مثل ChatGPT أو أدوات البحث اللي بتستعملها يوميًا.
speculative decoding semi-autoregressive inference optimization LLM throughput hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

SpaCellAgent: إطار عمل متعدد الوكلاء LLM لتحليل مسارات الخلايا

SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis
الفريق قدم SpaCellAgent، إطار عمل يعتمد على LLM ويشتغل كعدة وكلاء لتخطيط وتنفيذ تحليل الزمان المكاني للبيانات الخلوية. الوكلاء يختاروا الأدوات المناسبة بشكل تلقائي، ويولّدوا تقارير نصية من غير ما تحتاج تدخل يدوي كبير. كمان فيه وحدة self‑evolution بتقوّي الأداء من خلال ملاحظات مستمرة. التجربة على ست مجموعات بيانات أظهرت تحسين أكتر من 40٪ بالسرعة مع الحفاظ على جودة النتائج المتوافقة مع الخبراء.
ليش بتهمّك؟: الورقة بتخلّي تحليل مسارات الخلايا أسرع وأسهل للباحثين اللي ما عندهم خبرة بالأدوات المعقّدة.
🌱 شو إلك منها؟
تخيل إنك بدك تعرف كيف الخلايا بتتطور بوقت قصير، بس ما عندك خبرة بالبرمجة؛ هالتقنية بتسهل عليك العملية وتطلع لك تقرير واضح كأنك طلبت من صديق يشرحلك. ممكن تشوفها بالمنصات اللي بتعطيك تحليلات جينية جاهزة أو تطبيقات الصحة الشخصية اللي بتحلل بياناتك بسرعة.
LLM multi-agent trajectory inference spatial transcriptomics bioinformatics arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

تقطير الثقة المستقبلية للـ LLMs

Future Confidence Distillation in Large Language Models
الباحث ساهل كالي بيستكشف كيف الثقة بتتغيّر خلال عملية الإجابة. لقوا إنّ الثقة بعد ما يطلع الجواب (post‑solution) أضبط أكتر من الثقة قبل ما يكتب الجواب (pre‑solution). وبسوا طريقة اسمها future confidence distillation، بيعلّموا نموذج يقدر يتوقع الثقة من تمثيلات pre‑solution باستخدام إرشادات من نموذج تاني بيقيس الثقة بعد الجواب. النتيجة إنّو النموذج المتوقّع بيقرب كتير من دقة الثقة بعد الجواب، وبظل فعال على بيانات جديدة بنفس المجال.
ليش بتهمّك؟: هالطريقة بتخلّي تقدير الثقة أسرع وأدق، وبتقلل تكلفة تشغيل الـ LLMs بالأنظمة الحسّاسة.
🌱 شو إلك منها؟
تخيّل إنّو برنامج يجاوب على أسئلتك ويعرف إذا جوابه صحيح ولا لأ قبل ما يخلص الكلام. هالشي بيساعدك تتأكد من المعلومة بسرعة، زي ما بتستشير صديق موثوق قبل ما تاخد قرار. هالتقنية رح تظهر قريباً بأدوات البحث أو المساعدات الذكية اللي بتستعملها يومياً.
confidence calibration LLM distillation probing arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

سعة الوكيل في الـsearch agents الهرمية

Think Big, Search Small: Where Capacity Matters in Hierarchical Search Agents?
الفريق اللي قدّم الورقة جربوا يقسّموا دور الوكيل البحثي لثلاث أدوار: التفويض، التنفيذ، وتوليد الجواب. لقوا إن توزيع السعة على دور التفويض يرفع الدقة كثير، بينما زيادة سعة دور التنفيذ ما بتأثر كثير. كمان جابوا نموذج تنفيذ صغير بـ1.7B بارامتر يشتغل تقريبًا بنفس دقة النموذج الكبير، وبياخد توكنات أقل. النتايج بتقترح إنه نركز السعة على التفويض ونصغّر دور التنفيذ من غير ما نخسر الدقة.
ليش بتهمّك؟: هالنتيجة بتخلينا نبني أنظمة بحث أسرع وأرخص بدون ما نضيع جودة الإجابات.
🌱 شو إلك منها؟
تخيل إنك عم تسأل سؤال معقد على محرك بحث، والروبوت بيقسم السؤال لأجزاء أصغر ويستفسر عنها. إذا كان الروبوت يركز جهده على تقسيم السؤال صح، رح يلاقي لك إجابة أدق وبسرعة. هالطريقة ممكن تظهر بأدوات البحث اليومية أو المساعدات الذكية اللي بتستعملها كل يوم.
search hierarchical language model multi-agent QA arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

FourierQK: تحسين انتباه الـTransformer بمعالجة طيفية للـQuery‑Key

FourierQK: Spectral Preprocessing of Query-Key Projections Improves Transformer Attention
الفريق اللي بيقودها الباحث Athanasios Zeris قدم طريقة جديدة بتستعمل FFT لتسبق عملية تحويل الـquery‑key داخل الـTransformer. التجربة على مجموعة TinyShakespeare أظهرت إنه إضافة فلتر طيفي عشوائي أو تعلم ترددات محددة بيقلل الخطأ بشكل كبير مقارنةً بالانتباه التقليدي. الفلتر المتعدد الترددات وصل لأقل قيمة للخطأ بنسبة 79%، وهذا لأنه المعالجة الطيفية بتخلّي كل موقع يشتغل مع كل المواقع الثانية، مش بس اللي قبله. الفكرة ما بتأثر إذا استبدلنا الـQ/K بتقنيات عشوائية أو غير طيفية، يعني الفائدة من الدمج العالمي بالمجال الترددي مش من تشويه المسافة.
ليش بتهمّك؟: هالطريقة بتخلي نماذج اللغة تفهم النصوص على مستوى الحروف أسرع وأدق، خصوصاً للمهام اللي بدها تفاصيل دقيقة.
🌱 شو إلك منها؟
بتخيلوا إنه برنامج يكتب قصص أو يكمّل جملكم صار يقدر يتوقع الحرف الجاي بدقة أعلى، زي ما بنعرف نكمّل كلمة من غير ما نوقف. هالتحسين ممكن ينعكس على تطبيقات كتابة الرسائل أو الترجمة الآلية اللي بنستعملها كل يوم. يعني إذا استخدمنا هالتقنية، رح تشوفوا أدوات الكتابة الذكية بتقترح عليكم كلمات أو جمل أكتر تناسقاً وسرعة.
transformer attention spectral language-modeling FFT arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

SynthAVE: استخراج سمّيات المنتجات ببيانات صناعية موثوقة

SynthAVE: Scalable Synthetic Labeling for E-Commerce with LLM-Arena Validation
الفريق قدم طريقة لتوليد تسميات صناعية للسمّيات التجارية باستخدام LLMs، وعملوا benchmark كبير يضم أكتر من 12 ألف منتج من 229 نوع ب4 لغات. لتأكيد جودة هالتسميات، استخدموا إطار multi-LLM arena فيه 21 تكوين من 7 عائلات نموذجية مع 3 توجيهات لكل وحدة، والنتيجة بتحدد بالتصويت الأغلبية. التجمع هاد وصل لتطابق مع الخبراء البشريين بـ Cohen's κ=0.92، يعني جودة القواعد تقريبا نفس اللي بيعملها الإنسان، مع توافق جيد بين النماذج حسب Fleiss' κ=0.76.
ليش بتهمّك؟: هالطريقة بتقلل تكلفة جمع بيانات التدريب للـ LLMs بكتير، وبتعطي جودة قريبة من التدقيق البشري، فبتسهل تطوير أنظمة توصية وتسويق أونلاين.
🌱 شو إلك منها؟
تخيل إنه بدال ما يشتغلوا ناس يدوياً على تصنيف كل منتج، الكمبيوتر بيعمل هالشي بسرعة وبدقة تقريباً زي الإنسان، يعني المتاجر رح تقدر تعرض منتجاتها بطريقة أذكى وأسهل للزبائن. هالشي ممكن تشوفه بأوقات لاحقة في تطبيقات التسوق اللي بتقترح لك منتجات بناءً على وصفها الدقيق.
LLM synthetic data e-commerce attribute extraction benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

Gemma 4: نماذج لغة متعددة الوسائط بفعالية حسابية أعلى

Gemma 4 Technical Report
فريق Gemma قدموا Gemma 4، جيل جديد من نماذج اللغة المفتوحة الوزن اللي بتدعم النص والصورة والصوت بنفس الوقت. النموذج فيه إصدارات dense وMixture-of-Experts من 2.3 بليون لحد 31 بليون بارامتر، ومعاها مشفرات رؤية وصوت محسّنة، وكمان نسخة 12 بليون بتشتغل بدون مشفر (encoder‑free) وتقدر تاخد بيانات صوتية وصورية مباشرة. ضافوا كمان وضع "thinking mode" اللي بيخلي النموذج يولّد خطوات التفكير قبل ما يجاوب، وحسّنوا السرعة والذاكرة والقدرة على التعامل مع سياق طويل. الأداء ارتفع كثير على اختبارات STEM، والوسائط المتعددة، والسياق الطويل، وتنافسوا مع نماذج أكبر بحجمها في مهام تقييم البشر.
ليش بتهمّك؟: الورقة بتفتح باب لتطبيقات ذكية أسرع وأرخص وتقدر تفهم النصوص والصور والصوت مع بعض، وبتخلي التفكير واضح قبل الرد.
🌱 شو إلك منها؟
تخيّل عندك مساعد ذكي على الموبايل يقدر يشوف صورة، يسمع صوتك، ويفكّر بصوت عالي قبل ما يعطيك الجواب – كل هالشي بصير أسرع وباستهلاك طاقة أقل. هالتقنية ممكن تلاقيها قريباً في تطبيقات الترجمة الفورية، أو في أدوات التعليم اللي بتدمج شروحات مرئية وصوتية. يعني رح تستفيد من مساعد يفهم كل حواسك ويعطيك ردود مدققة بدون تأخير.
multimodal language-model efficiency MoE reasoning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

هل طبقة وحدة كافية؟ تدريب طبقة Transformer وحدة يساوي تدريب كامل RL

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
الباحثين اكتشفوا إنه تدريب طبقة وحدة من Transformer يقدر يجيب تقريبًا نفس التحسينات اللي بنحصل عليها لما ندرب كل المعلمات مع بعضها بالـ RL. هالنتيجة جات بعد ما جربوا أكتر من نموذج من عائلات Qwen2.5 وQwen3 وبمختلف خوارزميات RL مثل GRPO وGiGPO. لقوا إنه الطبقة اللي بتعطي أعلى مساهمة غالبًا بتقع بوسط الشبكة، بينما الطبقات القريبة من البداية أو النهاية ما إلها تأثير كبير. هالدراسة بتقترح إنه ممكن نوفر وقت وموارد التدريب إذا ركزنا على الطبقة أو الطبقات القليلة هاي.
ليش بتهمّك؟: هالنتيجة بتخلينا نختصر تكلفة التدريب ونسرّع تحسين النماذج الكبيرة بدون ما نضيع موارد كتيرة.
🌱 شو إلك منها؟
تخيّل إنك بتعلم سيارة ذكية تصير أحسن بس بس بتعدل على جزء صغير من دماغها، مش كل النظام. هالشي يعني ممكن نطور تطبيقات الذكاء الاصطناعي بسرعة وبأقل تكلفة، مثل تحسين المساعدات الصوتية أو برامج الترجمة. يعني إذا بتستعمل خدمة ترجمة أو محادثة، ممكن تشوفها تصير أدق وأسرع بدون ما يدفعوا لك تكاليف ضخمة.
reinforcement learning transformer LLM fine-tuning efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

MedPMC: إطار لتجميع بيانات طبية متعددة الوسائط عالية الدقة

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
الفريق قدم MedPMC، نظام أوتوماتيكي بيحوّل الأدبيات الطبية المفتوحة لمجموعة ضخمة من أزواج الصورة‑نص. النظام عالج ٦.١ مليون مقالة وجمع حوالي ١١ مليون زوج صورة‑نص، وبنتائج التقييم أظهر أداء قوي بالمقاييس مثل F1 وROUGE-L. النموذج المدرب على هالبيانات حسّن الأداء على ٢٦ benchmark طبي ورفع الدقة في أسئلة الصور الطبية مقارنةً بطرق سابقة. كمان قدر يرفع جودة استرجاع الصور الجلدية ويقرب الفجوة بين البحث الأكاديمي والتطبيق السريري.
ليش بتهمّك؟: هالورقة بتظهر كيف إن جمع بيانات طبية دقيقة من الأدبيات بيساعد نماذج الأساس المتعددة الوسائط تتعلم أسرع وتشتغل أحسن بالعيادات.
🌱 شو إلك منها؟
تخيل إنه في برنامج بيجمع كل الصور والنصوص الطبية من الأبحاث ويخليها جاهزة للذكاء الاصطناعي؛ هالشي بيسهّل على الأطباء يلاقوا معلومات دقيقة بسرعة. مثلاً، لو بدك تشوف صور جلدية مشابهة لحالة مريضك، هالنظام بيوفرلكها فوراً. هالتقنية رح تشوفها قريباً بأدوات التشخيص الرقمية وتطبيقات الصحة على الموبايل.
multimodal medical foundation models dataset CLIP arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

CARLA-GS: توليد حالات الزوايا للقيادة الذاتية بنظام منفصل

CARLA-GS: Decoupling Representation, Reasoning, and Physics Simulation for Autonomous Driving Corner-Case Synthesis
الفريق قدم نظام CARLA-GS لتوليد سيناريوهات خطرية للسيارات الذاتية بشكل منظم. النظام بيفصل بين تمثيل المشهد البصري، التفكير الدلالي، وتنفيذ الفيزياء، وبيستند على بيانات حقيقية من Waymo Open Dataset. بيستعمل LLM لتحديد التفاعلات الخطرة وتوليد مسارات نوايا، والـ PID controller لضمان تنفيذ الحركة بشكل واقعي داخل محاكي CARLA. النتائج بتظهر إنه النظام بيقدر يولد فيديوهات واقعية ومتسقة زمنيًا وتتماشى مع النوايا الدلالية.
ليش بتهمّك؟: هالطريقة بتساعد باحثي القيادة الذاتية يختبروا سياراتهم بحالات نادرة وصعبة قبل ما تنزل على الطريق.
🌱 شو إلك منها؟
بتخلي الشركات تتأكد إنه السيارات الذاتية ما بتتخربط إذا صادفت موقف غريب، زي طفل يطلع من بين الشجر أو سيارة فجأة تقطع الطريق. يعني كأنو بنحط السيارة على اختبار صعب قبل ما تسوقنا على الشوارع. هالشي بنشوفه بالـ apps أو الخدمات اللي بتعطي تقارير أمان للسيارات الذكية.
autonomous driving simulation corner-case CARLA Waymo arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

PALS: تقليم LLM بنسب طبقية حسب النسبة المئوية

PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning
فريق Yazdan Jamshidi و Alexey Shvets قدموا طريقة PALS لتقليل وزن النماذج الكبيرة مثل LLaMA-2-7B. الطريقة بتحدد نسبة الإزالة لكل طبقة حسب أعلى 99% من قيم التفعيل، وبحدود ±5% من النسبة المستهدفة، يعني ما بتقشر كل الطبقات بنفس الكمية. التجربة على LLaMA-2-7B بـ 50% تقليم جابت perplexity 10.96 على WikiText-2، أحسن بكتير من الطريقة الوحدانية Wanda اللي جابت 12.92. الفائدة بتختلف حسب الهندسة؛ LLaMA-3-8B تحسّن بسيط وMistral-7B ما فيه فرق.
ليش بتهمّك؟: هالطريقة بتخلي نماذج اللغة الكبيرة أسرع وأقل استهلاك للذاكرة بدون ما تحتاج تدريب إضافي.
🌱 شو إلك منها؟
تخيل إنك عم تستخدم تطبيق ترجمة أو محادثة ذكي، والبطارية تخلص بسرعة لأن النموذج تقيل. مع PALS النموذج يصير أخف، فالتطبيق يشتغل أسرع ويستهلك طاقة أقل. يعني ممكن تحس بتحسين بالأداء على موبايلك أو الكمبيوتر بدون ما تلاحظ أي تأخير.
pruning sparsity LLM LLaMA Mistral arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

قلل الشك، زد الفحص: بوابات حتمية تمنع أخطاء السياسات في وكلاء LLM

Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents
الفريق بقيادة Vikas Reddy اكتشف إنه الوكلاء اللي بيستعملوا أدوات ممكن يخلوا سياسات النظام تنكسر من غير ما يبينوا الخطأ، يعني بحالة حجز طيران بيتم إلغاء الحجز أو تعديل عدد الركاب بدون ما الأداة أو الوكيل يحكوا عنها. جربوا هالظاهرة على بيئة $τ^2$‑bench للخطوط الجوية ولاحظوا إنه 78% من الفشل كان صامت وما فيه أي إشارة من الأداة. بعدين حطوا مجموعة من أربع بوابات حتمية للقراءة فقط بتتفحص الطلب الحالي والحالة قبل ما تسمح بعملية كتابة، ولقوا إنه نسبة النجاح ارتفعت من 29.6% لـ 42.0% على نموذج gpt‑4o‑mini. النتيجة أثبتت إنه هالبوابات ممكن تمنع هالنوع من الأخطاء، حتى لو ما بتضمن نجاح المهمة بالكامل.
ليش بتهمّك؟: لأنه هالبوابات بتعطي أمان أكتر للوكلاء اللي بنستعملهم يوميًا، وبتقلل الأخطاء الصامتة اللي ممكن تضر المستخدمين.
🌱 شو إلك منها؟
تخيّل إنه عندك مساعد ذكي يحجز لك تذكرة طيران، بس بدون ما يخبرك إنه الحجز انلغى أو غير عدد الركاب. البوابة الحتمية بتشتغل مثل الحارس اللي يشيك كل خطوة قبل ما تصير، فبتضمن إنه ما يصير فيه تغييرات غير مقصودة. هالشي رح تشوفه أكتر بأدوات الذكاء الاصطناعي اللي بنستعملها للطلبات اليومية مثل حجز المواعيد أو طلبات الشراء.
LLM agents policy enforcement deterministic gates reliability benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

ذاكرة مخفية للروبوتات: LaMem-VLA

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
الفريق قدم LaMem-VLA، إطار يدمج الذاكرة داخل فضاء التمثيل الضمني لنماذج Vision-Language-Action. بيشتغل بأربع مكوّنات: الـcurator اللي بيرتب الخبرات القديمة بذاكرة قصيرة وطويلة المدى، والـseeker اللي بيدور على الأدلة المناسبة، والـcondenser اللي بيحوّل الأدلة لرموز ذاكرة مضغوطة، والـweaver اللي بيلحم هالرموز مع المشهد الحالي والتعليمات. هالطريقة بتخلي الذاكرة تشارك مباشرةً بالتفكير وتوليد الأفعال، وبتظهر فاعلية أكبر على بيئات SimplerEnv وLIBERO.
ليش بتهمّك؟: هالطريقة بتخلي الروبوتات تقدر تنفّذ مهام طويلة ومعقّدة بدون ما تنسى الخطوات السابقة، فبتقربنا من روبوتات أكثر فهماً وتعاوناً.
🌱 شو إلك منها؟
تخيّل روبوت بيتذكر كل خطوة سواك، مثل ما بتتذكر كيف ركبّيت الصندوق قبل ما يكمّل باقي الشغل. هالذكاء بيخلّيه ينجز شغلات مثل تجميع الأثاث أو ترتيب المطبخ بسهولة أكبر. رح تشوف هالتقنية تنطبق على التطبيقات المنزلية أو الخدماتية اللي بتحتاج دقة وتذكّر مستمر.
robotics vision-language memory manipulation AI hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

LingBot-Video: نموذج فيديو مختلط للذكاء المتجسد

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
الفريق قدم LingBot-Video، نموذج فيديو مبني على DiT ومعتمد على Mixture-of-Experts، بدنا يدمج الفيديو مع الفهم الفعلي للروبوتات. من ناحية البيانات، ضيفوا محرك بروفايل بيزيد الفيديوهات الإنترنتية بلقطات موجهة للروبوتات مثل التلاعب والتنقل من منظور أول. كمان صمموا نظام مكافآت متعدد الأبعاد ليضمن إن الفيديو ما بيهتم بس بالجمال أو التوافق مع النص، ولا إشي تاني، بل كمان بالمنطق الفيزيائي وإكمال المهمات. هيك التقييمات أثبتت إن النموذج بيشتغل بكفاءة أعلى وبيعطي أداء قوي كقاعدة فيديو أساسية.
ليش بتهمّك؟: هالورقة بتقربنا من نماذج فيديو تقدر تفهم وتنفذ الحركات الواقعية للروبوتات، فبتفتح فرص لتطبيقات ذكية أكتر.
🌱 شو إلك منها؟
تخيل إنه الفيديوهات على الإنترنت ما بس للترفيه، بل كمان بتساعد الروبوتات يتعلموا كيف يمسكوا الأشياء أو يتجولوا بالبيت. يعني إذا شفت برنامج ذكي يفتح باب أو يجهز قهوة، ورا هالشي نموذج فيديو مدرب على لقطات روبوتية. هالتقنية ممكن تصير جزء من الأجهزة المنزلية أو التطبيقات اللي بنستعملها كل يوم.
video foundation model Mixture-of-Experts robotics multimodal pretraining hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

من الضوضاء لأسباب الجذور: تحليل المسارات واستخراج السبب للAgents

From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization
الفريق اللي تحت قيادة Ying Chang قدم طريقة جديدة اسمها STRACE لتقليل الضوضاء بالمسارات التنفيذية للAgents. الطريقة بتشتغل بطريقتين: أولاً بتفلتر التجارب المتكررة وبتختار الفشل اللي بيمثلوا المشكلة، وثانياً داخل كل تجربة بتبني رسم اعتماد نصّي لتحدد الخطوة اللي فعلاً سببت الفشل. التجارب أظهرت إن STRACE رفع نسبة النجاح على اختبار VeruSAGE-Bench من 42.5% لـ58.5%، يعني تحسين واضح.
ليش بتهمّك؟: هالطريقة بتخلّي تحسين الـAgents أسرع وأدق، خصوصاً للمهام اللي بتحتاج تفكير طويل.
🌱 شو إلك منها؟
تخيل إنه برنامج مساعد ذكي يضل يخطئ بنفس الأخطاء، مع هالطريقة بيصير يقدر يتعلم من أخطائه بسرعة. زي ما بننظف الضوضا من صوت الميكروفون لتسمع الكلام واضح، STRACE بنظف الضوضا من سجلات البرنامج. هالتحسين ممكن تشوفه بأدوات مثل المساعدات الصوتية أو الروبوتات اللي بتشتغل بالبيت، لأنّها رح تصير أذكى وأقل غلطة.
agents optimization causal extraction LLM benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 9
RGB-DF
RGB-DF هو مفهوم بيمثل تمثيل الألوان مع عمق إضافي للبيانات، بنستعمله عشان نفهم الصور بشكل أعمق مش بس لون بس كمان تفاصيل إضافية
diffusion
diffusion هو مفهوم بنستخدمه بنماذج توليد الصور، بيبدأ بصورة عشوائية وبعدين يضيف خطوات تصحيح تدريجية عشان يوصل للصورة المطلوبة.
cross-modal attention
cross-modal attention يعني آلية تركّز على معلومات من أكتر من نمط (مثل صورة وصوت) بنفس الوقت، عشان النموذج يربط بين الإشارات ويستفيد من كل إشي
multimodal
النموذج بيقدر يتعامل مع أكتر من نوع بيانات، مثل النص والصورة مع بعض، هالشي بيسمح له يفهم إشي أكتر تعقيداً
retrosynthesis
retrosynthesis هو مفهوم كيميائي بنقسم فيه جزيء معقد إلى مركبات أبسط عشان نعرف كيف نعمله من البداية، بدنا نخطط لتصنيع الأدوية
Apache Arrow
Apache Arrow هو إطار بيانات عمودي بيسمح بنقل وتخزين البيانات بسرعة بين الأنظمة، عشان ما نضيع وقت في تحويل الصيغ
TPC-H
TPC-H هو معيار اختبار (benchmark) لقواعد البيانات بيقيس الأداء تحت حمل استعلامات تجارية، بنستعمله عشان نقارن السرعة والفعالية
asynchronous RL
الـ asynchronous RL هو طريقة تعلم تعزيزي بتخلّي الوكيل يتعلم ويحدّث سياساته بشكل غير متزامن مع البيئة، يعني ما بنستنى كل خطوة يخلص قبل ما نبدأ خطوة تانية. بنسمع عنه عشان بيساعد يسرّع التدريب على الأنظمة الكبيرة.
single-rollout sampling
الـ single-rollout sampling يعني إنّو بنجرب مسار واحد من البداية للنهاية لتقييم السياسات بدل ما نعمل كتير مسارات، فهالطريقة بتقليل تكلفة الحسابات.
🤖 موديلز 5
RynnWorld-4D
RynnWorld-4D هو نموذج بيحاكي عالم رباعي الأبعاد، بنستعمله لتوليد مشاهد أو بيانات مع تمثيل الوقت أو خصائص إضافية، بدنا نفهم تعقيدات أكتر من الأبعاد الثلاثية
SciReasoner
SciReasoner نموذج بيحلّل أسئلة علمية ويستنتج إجابات، بيساعدنا نفهم كيف نربط المفاهيم العلمية مع بعض، مش بس يجاوب بس يشرح
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
DuckDB
DuckDB هو محرك قاعدة بيانات خفيف بيشتغل داخل الذاكرة، بنستعمله للتحاليل السريعة على ملفات CSV أو Parquet، مش محتاج خادم كبير
GRPO
نموذج حديث بتقنية RL متطوّرة بتساعد النموذج يتعلّم بكفاءة أعلى وأسرع. هو بيركّز على الجودة في كل خطوة تدريب، عشان كذا بينتج إجابات أفضل بموارد أقل.
كل المصطلحات ←
العدد السابقشو في AI؟ | 8 يوليو — الوكيل بذاكرة طويلة
📚 كل الأعداد