📡 أحدث عدد

شو في AI؟ | 8 يوليو — الوكيل بذاكرة طويلة

يومي 📅 2026-07-08
سلام 👋 هلقيت هالعدد بيحكي عن تطورات الوكلاء مع ذاكرة طويلة وتقنيات ضغط الـ KV. بدنا نعرض أهم الأبحاث من الفهم البصري للـLLM للسلامة وتحليل البيانات الواقعي
#1

Light-Omni: فهم الفيديو بالوكيل بذاكرة طويلة

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
الفريق اللي أسس Light-Omni قدم إطار وكيل متعدد الوسائط بيشتغل بنظام رد فعل سريع. بيستعمل حالتين سياقية: حالة عالمية بتجمع الذاكرة المتقطعة بنص موجز، وحالة كامنة بتولد الأوامر وتخلق تمثيلات استرجاعية، كل هاد بتمرير واحد بس. هالتصميم بقلل من الحاجة للتفكير المتكرر، فبيصير أسرع بـ12.1 مرة وبيحافظ على الذاكرة أكتر بـ2.6 مرة مقارنةً بـM3-Agent، وكمان بيزيد الدقة بـ2.4٪ على مجموعات اختبار الفيديو.
ليش بتهمّك؟: هالطريقة بتخلّي أنظمة الفيديو تتصرف بذكاء وبسرعة أكبر، فبتقّص من استهلاك الوقت والموارد.
🌱 شو إلك منها؟
تخيل إنك عم تتفرج على مسلسل طويل والبرنامج يقدر يذكرلك أحداث الحلقة الأولى ويتفاعل معاك فوراً، بدون ما يبطّئ. هالنظام بيخلي تطبيقات الفيديو مثل الترجمة الفورية أو المساعدة الذكية أسرع وأدق. ممكن تشوف تأثيره بأدوات المشاهدة أو التطبيقات اللي بتتعلم من الفيديوهات لتقترحلك محتوى.
video-understanding agents long-term-memory efficiency benchmarks hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

نموذج Audex: ذكاء صوتي موحد بدون تراجع في الفهم النصي

Unified Audio Intelligence Without Regressing on Text Intelligence
فريق الباحثين قدموا Audex، وهو LLM موحد بقدرة صوت‑نص مبني على Nemotron‑Cascade‑2‑30B‑A3B. التصميم بسيط: محول واحد (Transformer) بيحوّل الصوت لمجال تمثيل النص، وبنفس الطريقة يتعامل مع رموز النص ورموز الصوت المُكمَّدة أثناء التوليد. درّبوه على مجموعات بيانات ضخمة فيها 157.4 مليار رمز صوت و320.5 مليار رمز نص، وبعدين استخدموا تدريب متعدد المراحل مع RL وتقطير على سياسات متعددة. النتيجة: Audex يحقق أرقى مستويات الفهم الصوتي، التعرف على الكلام والترجمة، تحويل النص إلى صوت وتوليد صوت جديد، مع الحفاظ على قدرات التفكير والمعرفة للنموذج النصي الأصلي.
ليش بتهمّك؟: هالورقة بتفتح باب لتطبيقات صوتية قوية بدون ما نخسر قدرات الفهم النصي، يعني بنقدر ندمج الذكاء الصوتي والنصّي بسلاسة أكبر.
🌱 شو إلك منها؟
تخيّل عندك مساعد صوتي يقدر ما بس يسمعك ويجاوب، بل كمان يولّد أصوات جديدة أو يترجم الكلام فورًا، وكل هالشي ما بيأثر على قدرته على الفهم العميق للنص. هالشي ممكن تشوفه قريبًا بتطبيقات مثل المساعدات الذكية أو أدوات تحويل النص إلى صوت على الموبايل. يعني رح تصير التكنولوجيا أذكى وتشتغل مع بعض بصورة طبيعية أكتر.
audio language model multimodal LLM open-source hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

PluraMath: توسيع تقييم التفكير الرياضي للغات الأقل تمثيلاً

PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages
الفريق قدموا PluraMath، مجموعة بيانات جديدة بتضيف 18 لغة من لغات منخفضة الموارد لعندها شغل رياضي، بعد ما كان PolyMath يقتصر على 18 لغة عالية الموارد بس. البيانات اتجمعت عبر فريق من المتحدثين الأصليين اللي تأكدوا من صحة الترجمات. بعدين جربوا 27 نموذج LLM بأحجام مختلفة على هالمجموعة، ولاحظوا إن الأداء بيضل أحسن باللغات اللي فيها موارد أكتر، خصوصاً إذا كان النموذج بيفهم التعليمات كويس. الباحثين فتحوا الكود والبيانات للجميع عشان يقللوا الحواجز أمام المجتمعات اللي ما عندها تمثيل كافي.
ليش بتهمّك؟: هالورقة بتبين قديش لازم نشتغل على تحسين قدرات النماذج الرياضية بكل اللغات، مش بس الإنجليزية أو الصينية.
🌱 شو إلك منها؟
مع هالبيانات، التطبيقات التعليمية ممكن تصير تفهم وتحل مسائل رياضية بالعربي أو بلغات تانية صعبة، زي ما الطالب بيستعمل تطبيق لتدريب حساباته باللغات اللي بيتكلمها مع أهله. يعني إذا إنت بتستعمل برنامج لتعليم الرياضيات، هالتحسين ممكن يخلي البرنامج يجاوب على أسئلتك بدقة أكتر حتى لو كنت بتحكي لغة ما بتنتشر كتير. هالشي بيصير واضح أكتر بخدمات التعليم عن بُعد أو التطبيقات اللي بتساعد الأطفال يدرسوا الرياضيات ببيئتهم اللغوية.
multilingual math reasoning benchmark LLM dataset hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

AlayaWorld: توليد عوالم فيديو تفاعلية طويلة الأمد

AlayaWorld: Long-Horizon and Playable Video World Generation
الفريق قدم AlayaWorld، إطار مفتوح المصدر بيخلّي توليد عوالم فيديو تفاعلية يكون على طول الوقت وبطريقة تلقائية. النموذج بيتعلم من تسجيلات ألعاب وفيديوهات من العالم الحقيقي، فبيقدر يولّد مشاهد بملمس بصري متنوع وحركة فيزيائية واقعية، وبيسمح للمستخدم يتنقل ويعمل إجراءات زي القتال أو سحر أو استدعاء وحوش. كل هالشي بيصير ضمن بنية modular وبيقدر يشتغل بسرعة لتطبيقات لحظية. كمان وفّروا أدوات تقييم ووثائق لتسهيل البحث والتطبيق.
ليش بتهمّك؟: هالورقة بتفتح الباب لتوليد عوالم ألعاب وتطبيقات تفاعلية بسرعة وبكلفة أقل، وبتقرب الفكرة من الواقع.
🌱 شو إلك منها؟
تخيّل لو في لعبة بتصمم مستوياتها لحالك وانت عم تلعب، ما تحتاج تنتظر مطورين يضيفوا كل شي. هالتقنية بتخلي اللعبة تتغير معاك كل مرة، زي ما بتصير القصة حسب اختيارك. ممكن نشوف هالشي قريباً بألعاب الهواتف أو تطبيقات الواقع المعزز.
video generation interactive worlds generative models open-source hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

DepthWeave‑KV: ضغط الـ KV Cache للـ Context الطويل

DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression
الفريق اللي بيقودها Anna Cordoba وزملاؤها قدموا إشي جديد لتقليل حجم الـ KV cache بالـ Transformers. الطريقة بتقسم الـ keys والـ values على طبقات متجاورة وبتستعمل قاعديات منخفضة الرتبة مشتركة، وبنفس الوقت بتضيف residual خفيف لكل توكن حسب أهميته. كمان فيه router بيحدد أي توكن بدو رتبة استرجاع أعلى، وبيتابع الخطأ مباشرةً من الـ attention بدون ما نحتاج نعيد تدريب النموذج. التجارب على LongBench وغيرها بيّنوا إنه بنقدر نضغط الذاكرة 8.3 مرة ونسرّع التوليد مع الحفاظ على جودة القراية.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج الكبيرة تشتغل على نصوص أطول بذاكرة أقل، يعني ممكن نستخدمها بأجهزة أقل قدرة.
🌱 شو إلك منها؟
تخيل إنك عم تقرأ كتاب كامل على تطبيق شات أو بتستعمل مساعد صوتي بيرد على أسئلة معقّدة، هالطريقة بتخلي التطبيق يشتغل أسرع وما يضطر يطلب منك تنزل برنامج أقوى. يعني رح تشوف استجابة أسرع واستهلاك بطارية أقل. هالشي موجود أصلاً بخدمات التلخيص أو البحث داخل محادثاتك الطويلة.
kv-cache compression long-context transformer CUDA arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

DT-Guard: حارس أمان للـLLM بدون تفكير مباشر

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail
الفريق قدم طريقة جديدة لتدريب حارس أمان للـLLM بيستعمل Reasoning-Active Training خلال التدريب، بس وقت الاستنتاج بيطلع بس تصنيفات أمان منظمة من غير ما يولّد أي تفكير واضح. النموذج بيقسم الحكم للسلامة لثلاث مراحل: Intent → Category → Safety، وبيستند على مجموعة بيانات مهيأة بإشارات النوايا والمسارات المنطقية. كمان طوّروا أسلوب اسمه RG-PHO لتحسين الأداء على الحالات الصعبة عن طريق تحليل استقرارية النتائج وتوجيه التدريب. التجارب أظهرت إنه النموذج بـ4B بيحقق F1 متوسط أعلى من نماذج بـ8B، وبيظل سريع للوقت الحقيقي.
ليش بتهمّك؟: هالطريقة بتخلّي حراس الأمان للـLLM أقوى بكتير وبنفس الوقت سريعة، فـمهم للمنصات اللي بتستقبل أسئلة من الناس كل دقيقة.
🌱 شو إلك منها؟
تخيّل إنه تطبيق الدردشة عندك بيقدر يكتشف الكلام الضار أو المزعج فوراً من غير ما يبطّئ. يعني إذا حدا حاول يخلّف رسالة فيها تهديد أو محتوى غير مناسب، الحارس رح يوقفها بسرعة. هالشي بيحافظ على سلامة المستخدمين ويقلل المخاطر على الإنترنت.
safety LLM guardrail inference training arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

FreqDepthKV: ضغط ذكي لذاكرة KV في نماذج اللغة طويلة السياق

FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference
الفريق قدم طريقة اسمها FreqDepthKV لتقليل حجم الذاكرة المؤقتة (KV cache) أثناء تشغيل نماذج اللغة الكبيرة مع سياق طويل. الفكرة إنه بيقسموا المعلومات بين مكوّنات عمق منخفضة التردد وإشي عالي التردد، وبعدين بيحددوا كل رأس انتباه إذا بدو يستخدم المكوّن المشترك أو المتبقي أو يظل على البيانات الأصلية حسب أهميته. هالطريقة بتشتغل وقت الاستنتاج بدون ما نحتاج نعيد تدريب النموذج، وبتحافظ على دقة المهام مثل الأسئلة الطويلة، التلخيص، وتوليد الكود مع تقليل الذاكرة المطلوبة بشكل كبير.
ليش بتهمّك؟: بتخلّي تشغيل نماذج اللغة الكبيرة بذاكرة أقل وأسرع، فبنوفر موارد حوسبة للباحثين والمهندسين.
🌱 شو إلك منها؟
تخيّل إنك بدك تستخدم برنامج ترجمة أو كتابة نصوص طويلة، وبدون ما يبطئ جهازك أو يستهلك كل الذاكرة. هيك التقنية بتقلل استهلاك الذاكرة وبتسرّع الاستجابة، فبتقدر تشتغل على نصوص أطول بدون ما يعلق البرنامج. ممكن تلاقي هالتحسينات في خدمات مثل ChatGPT أو أدوات كتابة الكود اللي بتحتاج تتعامل مع مستندات كبيرة.
LLM KV cache compression inference arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

DataGovBench: معيار لتحدّي نماذج اللغة الكبيرة في تحليل البيانات بالحياة الواقعية

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities
الفريق اللي قدم الورقة طلعوا benchmark جديد اسمه DataGovBench، مبني على بيانات حكومية مفتوحة. بيقيس قدرة نماذج اللغة الكبيرة على التعامل مع جداول كبيرة ومتعددة، وبيطلب منهم يجاوبوا أسئلة مركبة أو ينتجوا تصورات بصرية. كمان فيه مهمة اسمها Table Insight لتقييم إذا النموذج بيقدر يكتشف استنتاجات خبراء من خلال تحليل استكشافي للبيانات. التجارب أظهرت فجوة واضحة بين أداء النماذج الحالية واللي مطلوب بالواقع.
ليش بتهمّك؟: هالمعيار بيفتح الباب لتطوير نماذج قادرة على حل مشاكل تحليل البيانات الواقعية، مش بس استرجاع معلومات بسيطة.
🌱 شو إلك منها؟
تخيل إنك تشتري منتجات من سوبرماركت وتلاقي جدول أسعار معقد، هالنظام يقدر يفسّر لك الجدول ويعطيك نصائح بناءً على البيانات. يعني بدل ما تضيع وقتك تحاول تفهم جداول ضخمة، النموذج رح يطلع لك أهم النقاط بسرعة. ممكن تشوف هالتقنية تصير موجودة بأدوات تحليل البيانات أو حتى تطبيقات الهواتف اللي تساعدك تتخذ قرارات مستنيرة.
LLM benchmark data analysis table QA insight discovery arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

من التصويت لتعاون الوكلاء: خطوط أنابيب LLM حسب نوع السؤال لـ BioASQ 14b

From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b
الفريق قدم إطار عمل جديد يعتمد على نموذج لغة كبير (LLM) يختار طريقة استدلال مختلفة حسب نوع السؤال – نعم/لا، إجابة قصيرة، أو قائمة. للنوع نعم/لا استعملوا خلط الفقرات وتفكير ذاتي لتقليل حساسية الترتيب، وللنوع إجابة قصيرة دمجوا كل الفقرات مع طريقة chain-of-thought لتحديد الكيانات الطبية بدقة. وللنوع قائمة بنواوا بنية متعددة الوكلاء، كل وكيل يشتغل على استخراج الأدلة، توليد المرشحين، التحقق من الإجابة، وجمع النتيجة. التجربة على BioASQ 14b أظهرت أداء تنافسي ووصلوا للمركز الأول في مهمة الفاكيت للدفعة الرابعة.
ليش بتهمّك؟: هالطريقة بتخلي أنظمة الإجابة الطبية أكثر موثوقية وبتقلل الأخطاء اللي ممكن تصير بسبب ترتيب المعلومات أو عدم وضوح السؤال.
🌱 شو إلك منها؟
بتخيل إنك تسأل سؤال طبي على الإنترنت وتاخد جواب واضح ومثبت بالمصادر، مش بس تخمين. هالنظام بيشتغل زي صديق بيفحص كل دليل قبل ما يعطيك الجواب، فبتحس بالأمان أكتر. ممكن تشوف هالتحسينات في تطبيقات البحث الطبي أو المساعدين الذكيين اللي بتستعملها يوميًا.
LLM QA biomedical multi-agent BioASQ arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

استخدام وكلاء الكود لتأكيد صحة البرمجيات تلقائيًا

Harnessing Code Agents for Automatic Software Verification
الباحثين Kan و Ertel بيظهروا إنه ما لازم نلزق استراتيجية ثابتة لإثبات البرمجيات، بل فينا نعطي LLM code agent حرية اختيار الطريقة. بيستعملوا Claude Code ضمن إطار تحقّق بيضمن إنه كل برهان يطلع من Coq يكون صحيح ومكتمل وما بيضلّ أي هدف غير محقق. النتيجة إنه النظام، اللي سماوه Aria، بيبرهن كل 4,257 لمّا في Iris و217 لمّا في مكتبة Rust، وكمان كل 318 لمّا في reglang، يعني ما في فشل.
ليش بتهمّك؟: هالطريقة بتخلي التحقق الرسمي للبرمجيات عملي وسريع، بدون الحاجة لخبراء Coq.
🌱 شو إلك منها؟
تخيل إنه برنامجك بيتأكد من نفسه إنه ما فيه أخطاء قبل ما يشتغل، زي ما بنفحص السيارة قبل ما نطلعها على الطريق. هالشي بيقلل الوقت والجهد اللي بنقضيه على تصحيح الأخطاء. ممكن تلاقي هالتقنية ضمن أدوات تطوير البرمجيات اللي بتعتمد على الذكاء الاصطناعي اليوم.
verification LLM code agents formal methods Coq arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

MANCE: حذف المفاهيم من التمثيلات بوعي المنحنى

MANCE: Manifold Aware Concept Erasure
الفريق بقيادة Matan Avitan بيقدّم طريقة جديدة اسمها MANCE لحدّ المفاهيم من تمثيلات الذكاء الاصطناعي من غير ما يخلّب باقي المعلومات. الفكرة الأساسية إنه التمثيلات الطبيعية بتتركّز على منحنٍ منخفض‑الأبعاد، فبنقيد أي تعديل على هالمنحنى لنحافظ على المعلومات التانية. MANCE بتستخدم تحديثات تكرارية وإشارة من مصنّف بيتنبّأ بالمفهوم المستهدف، وبعد ما بنقدر نحدّد المنحنى من المدخلات الطبيعية بنسقط التحديث عليه. التجارب على 119 إعداد بتمثيلات نصية وبصرية بتظهر تحسين واضح بالمقارنة مع الطرق السابقة، وخاصةً النسخ MANCE+ وMANCE++ اللي بتعطي أفضل توازن بين حذف المفهوم والحفاظ على باقي المعلومات.
ليش بتهمّك؟: هالطريقة بتخلّي حذف المفاهيم من نماذج الذكاء الاصطناعي أكثر دقة وأمان، وبتقلل من تسريب المعلومات غير المرغوب فيها.
🌱 شو إلك منها؟
تخيّل إنه عندك برنامج بيقرا رسائلك وبيحافظ على خصوصيتك، بس فيه معلومات ما بدك يطلعها. الطريقة هادي بتنظّف دماغ البرنامج من هالمعلومات بدون ما يخلّب الفهم العام. يعني مثل ما بنمسح بقعة من صورة من غير ما نخرب الصورة كلها، كمان بنقدر نحذف معلومات حساسة من الذكاء الاصطناعي ونستفيد منو بأمان أكتر.
concept erasure representation learning manifold NLP computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

تقدير عدم اليقين من التفكير: دراسة ضخمة لأداء MCQA متعدد اللغات بالـLLM

Estimating Uncertainty from Reasoning: A Large-Scale Study of Multi- and Crosslingual MCQA Performance in LLMs
الفريق اللي بيقود البحث، Andrea Alfarano وزملاؤه، عملوا أول تقييم واسع لتقدير عدم اليقين (Uncertainty estimation) بـ22 لغة، من اللغات القليلة الموارد للغنيّة. استعملوا مجموعتين من أسئلة وإجابات من إعداد بشر، وقارنوا تسع طرق مختلفة لتقدير عدم اليقين، من طرق مفتوحة الصندوق لطرق مغلقة الصندوق، مع نماذج بأحجام وهياكل مختلفة. لقوا إنه إذا خلت النموذج يفكّر بالإنجليزي مع إن السؤال بلغة منخفضة الموارد، بيصير تقدير عدم اليقين أحسن بكتير، وبيقفل الفجوة بين اللغات. كمان، الطريقة الأنسب لتقدير عدم اليقين بتعتمد على حجم النموذج: الصغار بيفضلوا الطرق الاحتمالية المفتوحة، والكبار بيفضلوا الطريقة المغلقة اللي بتعبر عن عدم اليقين بالكلام.
ليش بتهمّك؟: هالنتايج بتساعدنا نطور أنظمة LLM تقدر تعرف إمتى تتوقف أو تقول "ما بعرف" بأكثر لغات، وهاد مهم لتقليل الأخطاء بالمستخدمين.
🌱 شو إلك منها؟
تخيل إنه عندك مساعد ذكي يجاوبك على أسئلة بلغتك، بس إذا ما كان متأكد من الجواب، بيقلك "ما عندي فكرة" بدل ما يعطيك إجابة خاطئة. هالطريقة بتخلي التجربة أأمن وأكتر موثوقية، وبتظهر أكتر لما تستعمل تطبيقات ترجمة أو استشارة على الإنترنت.
uncertainty multilingual LLM evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

Graph Convolutional Attention: نظرة طيفية على تنقية الجراف والانتشار

Graph Convolutional Attention: A Spectral Perspective on Graph Denoising and Diffusion
الفريق اللي بيقودها شرفين خالافي وزملاؤه بيظهروا إنه الانتباه الخطي ما بيكفي لإزالة الضوضاء من الجرافات، خصوصاً إذا كان الطيف متنوع. فطورو طريقة اسمها Spectral Attention بتستغل طيف الجراف مباشرة وبتعطي نتائج أحسن. وبعدين حولوا الفكرة لنموذج عملي اسمه Graph Convolutional Attention (GCA) بيشتغل بطريقة permutation‑equivariant وبيستغل استعلامات ومفاتيح مفلترة طيفياً. التجارب على بيانات صناعية وحقيقية بتأكد إنه GCA بيحسّن التنقية والانتشار، خصوصاً إذا كان الطيف متنوع، وبدون ما يحتاج حسابات مكلفة للخصائص الهيكلية.
ليش بتهمّك؟: هالورقة بتعطي طريقة أقوى وأسرع لتنقية الجرافات، وهاد مهم لتطبيقات النماذج اللي بتعتمد على انتشار المعلومات على الشبكات.
🌱 شو إلك منها؟
تخيل إنك عم تنظف شبكة كهربائية من الأخطاء؛ هالتقنية بتساعد الكمبيوتر يزيل الضوضاء من الشبكات الرقمية بطريقة أسرع وأدق. يعني إذا عم تستخدم تطبيقات توصية أو تحليل اجتماعي على شبكات، رح تشوف نتائج أنقى وأسرع. كمان بتخلي الخدمات اللي بتعتمد على رسومات بيانية، مثل خرائط النقل أو توصيات المحتوى، تشتغل بطمأنينة أكبر.
graph neural networks attention denoising diffusion spectral methods arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

انتباه هرمي متناثر: HiLS للنماذج اللغوية بطول غير محدود

Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
الفريق قدم HiLS‑Attention، آلية انتباه هرمي متناثر بتختار القطع (chunks) إشي بطريقة تعلمية خلال تدريب نموذج اللغة. كل استعلام بيشتغل على كل قطعة بشكل مستقل وبعدين بيجمع النتائج حسب درجة استرجاع القطعة. الطريقة بتوصل لأداء قريب من الانتباه الكامل، بل وأحياناً أحسن، وبتقدر تتعامل مع سياقات أطول بـ 64 مرة من طول التدريب مع دقة استرجاع 90٪. كمان فينا نحول النماذج الحالية إلى HiLS‑Attention بتدريب إضافي بسيط ونحافظ على الأداء الأصلي مع تحسين القدرة على القراءة الطويلة.
ليش بتهمّك؟: بدنا نمكن النماذج الكبيرة من معالجة نصوص طويلة بسرعة أكتر وبكفاءة أعلى، فبنوفر وقت وموارد للباحثين والمطورين.
🌱 شو إلك منها؟
بهالتقنية ممكن تقرأ مقالات أو كتب كاملة على جهازك من غير ما يبطئ البرنامج. زي ما إذا بدك تقرأ كتاب كامل وتستفيد من تلخيصه بسرعة، HiLS بيساعد الحاسوب يشتغل أسرع مع نصوص طويلة. هالشي ممكن تشوفه قريباً بخدمات الترجمة أو كتابة المحتوى اللي بتدعم نصوص طويلة.
attention sparse long-context LLM efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

MentalThink: تفكير بصري بالـ SVG

MentalThink: Shaping Thoughts in Mental SVG World
فريق Lin وزملاؤه قدموا MentalThink، طريقة جديدة بتخلّي الـ Multimodal LLMs يقدروا يتخيلوا ويصوّروا أفكارهم داخل عالم رسومات SVG. النموذج بيتعلم يولّد كود SVG، يرسمه، وبعدها يفسّره كخطوة وسط عملية التفكير المتعددة الجولات. التدريب صار على مرحلتين: أولاً سوّوا Fine‑Tuning عشان يتماشى الكود مع قواعد SVG، وبعدين استخدموا Reinforcement Learning ليخلّي النموذج يراجع ويعدّل الرسومات لحد ما توصل للنتيجة الصح. التجارب أظهرت إن الطريقة بتحسّن الفهم المكاني على معايير زي VSIBench وMindCube.
ليش بتهمّك؟: العلماء بيقدروا يستغلوا الرسومات المتجهية كمساحة بصرية ثابتة لتصحيح الأخطاء وتطوير التفكير المكاني للأنظمة الذكية.
🌱 شو إلك منها؟
تخيل إنه برنامج يقدر يرسم لك مخطط بسيط للغرفة قبل ما تشتري أثاث، وتقدر تشوف إذا الأثاث رح يركّب صح أو لا. الفكرة زي ما بنرسم مخطط على ورقة قبل ما نبني، بس البرنامج بيعمل هالشي بشكل آلي. هالطريقة ممكن تظهر بأدوات التصميم أو تطبيقات التخطيط الداخلي اللي بتستعملها يومياً.
multimodal SVG reasoning LLM spatial hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

RSF‑GLLM: جسر الفجوة الدلالية في أسئلة المعرفة المتعددة الخطوات

RSF-GLLM: Bridging the Semantic Gap in Multi-Hop Knowledge Graph QA via Recurrent Soft-Flow and Decoupled LLM Generation
الفريق قدم إطار اسمه RSF‑GLLM يفصل بين استدلال الرسم البياني القابل للتفريق وتوليد الإجابة. وحدة Recurrent Soft‑Flow (RSF) بتستعمل مُحدّث استعلام مدفوع بـ GRU لتوزيع درجات الصلة المستمرة، مع آلية gating ديناميكية بتعبر عن العقد الجسرية اللي ما فيها تشابه لفظي مع السؤال. كمان أضافوا flow sparsity regularization لتأكد إن الاحتمالات الناعمة بتتحول لمسارات استدلال واضحة. بعد ما بنستخرج هالمسارات، بنحوّلها لنص ونستخدمها لتدريب Large Language Model، وبهالطريقة بنحصل على إجابات دقيقة وبكفاءة استدلال أعلى على مجموعات WebQSP وCWQ.
ليش بتهمّك؟: هالطريقة بتخلي أنظمة الإجابة على الأسئلة تتعلم تربط المعلومات حتى لو ما كان فيها تشابه كلمات، فبتعطي إجابات أدق وأسرع.
🌱 شو إلك منها؟
تخيل إنك تسأل سؤال معقد يحتاج خطوات متعددة، مثل "من أي جامعة تخرج أول رائد فضاء عربي؟" النظام هاد بيفهم السؤال، يلفّ الداتا المطلوبة خطوة بخطوة، ويعطيك الجواب بسرعة. يعني المساعد الصوتي أو تطبيق البحث رح يصير أذكى ويقدر يساعدك بأشياء أكتر من مجرد كلمات مطابقة. كمان هالتحسين بيقلل وقت الانتظار، فبتستفيد من إجابات أسرع وأدق يوميًا.
knowledge graph QA LLM multi-hop reasoning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

تصميم تجريبي لتقييم اكتشاف النماذج الذاتية للـ Agentic AI

An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery
هالورقة بتقدّم إطار تصميم تجريبي لتقييم سلوك الوكلاء اللي بيكتشفوا نماذج بشكل مستقل. الباحثين بيعاملوا الوكلاء زي مشغّلات عشوائية بتحوّل بيانات مهمة وهدف تحسين لنموذج جاهز، وبيجرّبوا Codex وClaude Code تحت عوامل مختلفة مثل جهد التفكير والمهام ومقاييس التحسين. لكل تركيبة، بينعملوا نماذج انحدار لتقييم جودة المخرجات، التكلفة بالدولار، الوقت، وتعقيد العملية، وبعدين بيحللوا إذا كان جهد التفكير بيقود للاتجاه المفيد من ناحية الأداء والتكلفة.
ليش بتهمّك؟: هالإطار بيساعدنا نفهم ونقارن الوكلاء بطريقة علمية، مش بس على تجربة وحدة، فبنقدر نحدّد أي إعدادات بتعطي أفضل نتيجة بأقل تكلفة.
🌱 شو إلك منها؟
تخيل إنه عندك برنامج يكتب لك أكواد ويختار أفضل نموذج لتحليل بياناتك، هالإطار بيقيس إذا كان البرنامج بيصرف وقت وفلوس زيادة بلا فائدة. يعني إذا شغّلت هالنوع من الأدوات، رح تعرف أي إعداد بيعطيك شغل نظيف بسرعة وبأقل تكلفة، وبيخلّيك تتجنّب التجارب العشوائية اللي ما إلها نتيجة.
agents experimental design model discovery evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

SeKV: ذاكرة KV متكيّفة مع الذاكرة الدلالية لتقليل استهلاك الGPU

SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference
الفريق Abaskohi وزملاؤه قدموا طريقة جديدة اسمها SeKV لتقليل حجم الذاكرة المطلوبة عند تشغيل نماذج اللغة الكبيرة على سياقات طويلة. الفكرة إنهم يقسّموا النص إلى فواصل دلالية مبنية على الإنتروبيا، ويحفظوا ملخّص خفيف على الGPU وبنقطة منخفضة الرتبة على الCPU. وقت التوليد، آلية zoom‑in بتفتح الفواصل اللي بيحتاجها الاستعلام بدقة، وبتعيد بناء تفاصيل الرموز من الCPU بس لما يلزم. الطريقة بتضيف أقل من 0.05% من المعاملات القابلة للتدريب وبتقلل استهلاك الGPU بأكثر من نصف بدون ما تخلّي النموذج يغيّر شي.
ليش بتهمّك؟: SeKV بيفتح الباب لتشغيل نماذج لغة ضخمة على أجهزة بذاكرة GPU محدودة، يعني ممكن نستفيد من قدرات أكبر بموارد أقل.
🌱 شو إلك منها؟
تخيّل إنك عم تقرأ قصة طويلة على الموبايل وبتقفل التطبيق فجأة بسبب ضعف الذاكرة؛ SeKV بيخلّي التطبيقات الكبيرة تظل شغّالة بدون ما يعلقوا. يعني إذا بتستعمل برنامج ترجمة أو كتابة نصوص طويلة، رح تلاحظ إنّو ما رح يوقف فجأة. هالطريقة ممكن تظهر قريباً في خدمات الدردشة أو المساعدين الذكيين اللي بنستعملها يومياً.
LLM KV cache memory compression inference hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

KVpop: ضغط ذاكرة الـ KV مع تقليم توقعاتي

KVpop -- Key-Value Cache Compression with Predictive Online Pruning
الباحثين قدموا KVpop، طريقة جديدة لتقليص حجم ذاكرة الـ KV أثناء توليد النصوص. الطريقة بتعلم سياسة إخلاء الـ KV مباشرةً عن طريق إشراف على قرار الاحتفاظ أو الحذف، باستخدام إشارة future-attention اللي بتحسب بدون ما تحتاج خريطة انتباه كثيفة. كمان حطوا scorer بيأجل التقييم لعدة خطوات ليستفيد من السياق القريب. التجارب على نماذج Qwen3 أظهرت إن KVpop يحقق تقريبًا نفس جودة الأداء مع ضغط 75‑88% للذاكرة.
ليش بتهمّك؟: هالطريقة بتقلل استهلاك الذاكرة وبتسرّع عملية توليد النصوص بدون ما ينعكس على الجودة.
🌱 شو إلك منها؟
تخيل إنك عم تقرأ قصة طويلة على موبايل، والبرنامج لازم يضل يذكر كل كلمة سابقة ليكمل الحكي. KVpop بيخلي البرنامج يذكر أقل بس يظل يكتب بنفس الجودة، فبيقلل استهلاك البطارية وبيسرّع التحميل. هالتحسين ممكن تشوفه بأدوات الدردشة أو الترجمة اللي بتشتغل أسرع وتستهلك أقل طاقة.
cache compression language models inference optimization KVpop hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

RynnWorld‑Teleop: نموذج عالمي مشروط بالعمل للقيادة الرقمية

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
الفريق قدم فكرة جديدة اسمها digital teleoperation، اللي بِصير فيها جمع بيانات الروبوت ما له علاقة بأي جهاز مادي. المتحكم بيمسك إيماءة إيده، والنظام بيولّد فيديوهات من منظور الروبوت باستخدام world model مدرب على صورة مرجعية وحدة. البيانات اللي بتنتج من هالعملية بتتحول لأي روبوت تاني وبنفس الوقت بيصير التدريب أسرع، لأن النموذج يشتغل بأكثر من 40 FPS على GPU H100. التجارب وضحت إن السياسات المتدربة على هالبيانات تقدر تنقل المعرفة من المحاكاة للواقع بدون تعديل.
ليش بتهمّك؟: هالطريقة بتفتح باب لتجميع بيانات روبوتية بكمية وتنوع أكبر، وبتقلل الاعتماد على وقت المشغل وأجهزة الروبوت الفعلية.
🌱 شو إلك منها؟
تخيل إنك تقدر تعلم روبوت يشتغل بالبيت أو بالمصنع من غير ما تحتاج تشوفه أو تمسكه بيدك، بس بس تحرك إيدك قدام كاميرا. هالشي بيخلي التدريب أسرع وأرخص، وبيساعد الشركات توصل منتجاتها للناس أسرع. ممكن تشوف هالتقنية يومًا ما في تطبيقات مثل الروبوتات المنزلية أو المساعدة الطبية اللي بتتعلم من حركاتنا بدون ما نحتاج نشتري روبوتات كثيرة لتدريبها.
robotics teleoperation world-model data-generation simulation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 6
global state
global state هو الحالة العامة للبيئة أو النظام كله، بنستعمله لنفهم كيف كل المكوّنات بتتفاعل مع بعض، بنسمع عنه عشان بيساعدنا نتحكم بالموديلات الكبيرة
latent state
latent state هو تمثيل مخفي للبيانات داخل النموذج، يعني معلومات ما بنشوفها مباشرة لكن النموذج بيستغلها لتوقعات أدق، بنسمع عنه عشان بيقوي قدرة الموديل على التعلم
RL
RL يعني Reinforcement Learning، وهو مفهوم بنعلم فيه الموديل يتعلم من خلال التجربة والعقاب عشان يحقق هدف معين، بنسمع عنه لأنه أساس لتدريب الروبوتات والأنظمة الذكية.
instruction-following
instruction-following هو قدرة النموذج يتبع التعليمات اللي بنعطيه ياها، يعني يشتغل حسب المطلوب بالضبط، بنركز عليه عشان الموديلات تصير أكثر فائدة وتستجيب لطلبات المستخدمين
video world models
video world models هي نماذج بتتعلم من فيديوهات لتفهم العالم المتحرك، يعني بتقدر تتوقع الحركة وتولّد مشاهد جديدة، بنسمع عنها عشان بتفتح باب لتطبيقات الواقع الافتراضي والروبوتات
autoregressive
يعني النموذج بيتنبأ بالكلمة الجاية بناءً على الكلمات اللي جاية قبلها، خطوة بخطوة. إشي زي لما تكتب رسالة والهاتف بيقترح عليك الكلمة الجاية.
🤖 موديلز 6
M3-Agent
M3-Agent هو نموذج ذكاء اصطناعي بيشتغل كوكيل متعدد المهام، يعني يقدر يتعامل مع أكتر من هدف أو بيئة بنفس الوقت، بنستخدمه عشان نحتاج حل مرن وسريع لمشاكل معقّدة
transformer
هو البنية الأساسية اللي قايم عليها الذكاء الاصطناعي الحديث كله، بيشتغل على مبدأ الانتباه يعني بيحدد شو الأهم في البيانات وبيركز عليه. بنسمع عنه لأنه الأساس اللي اتبنى عليه ChatGPT وكل النماذج الكبيرة.
MoE
اختصار لـ Mixture of Experts، يعني نموذج فيه مجموعات من الخبراء المتخصصين كل واحد بيشتغل على جزء معين من المهمة.
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
AlayaWorld
AlayaWorld هو نموذج بيحاكي بيئات افتراضية معقدة، بيستخدم لتدريب وكلاء ذكيين على التفاعل مع عالم ثلاثي الأبعاد، بنستفيد منه عشان نختبر السيناريوهات قبل ما ننفذها بالحقيقة
DepthWeave-KV
DepthWeave-KV هو نموذج بيستخدم ذاكرة مفتاحية (Key-Value) لتخزين معلومات عمقية عن المشاهد، بيساعد على استرجاع تفاصيل دقيقة بسرعة، بنسمع عنه عشان بيحسّن أداء الأنظمة اللي تحتاج فهماً عميقاً للمكان
📏 مقاييس 1
benchmark
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
🗂️ بيانات 1
PolyMath
PolyMath هو مجموعة بيانات ضخمة فيها أسئلة وإجابات من مجالات مختلفة، بنستعملها لتدريب الموديلات على فهم وتوليد محتوى متنوع، بنسمع عنها عشان بتغطي إشي كتير من المعرفة العامة
كل المصطلحات ←
العدد السابقشو في AI؟ | 7 يوليو — تقطير ذاتي وتطور الوكلاء
📚 كل الأعداد