📡 أحدث عدد

شو في AI؟ | 20 يوليو — نموذج متعدد الوكلاء 20

يومي 📅 2026-07-20
مرحبا 👋 هلقيت هالعدد فيه 20 ورقة عن LLMs، Transformers، والوكالات المتعددة، بنركز على التطورات العملية والبحثية الحديثة. بدنا نوضح كيف هالتقنيات عم تتطور لتفيد الشغل والبحث.
#1

RecGPT-V3: نظام توصية بحالة الذاكرة

RecGPT-V3 Technical Report
الباحثين قدموا RecGPT-V3، نسخة جديدة من أنظمة التوصية اللي بتستغل LLM لتفهم نوايا المستخدم بدل ما تكتفي بالأنماط القديمة. النموذج بيستخدم Memory Hub لتخزين ذاكرة المستخدم بصورة مستمرة، فبيقلل حساب السلوك التاريخي بنسبة 55.8٪. كمان بيجمع بين النصوص والـSemantic IDs (SIDs) عبر Hybrid‑modal Foundation Model، وبيحوّل السلاسل الطويلة من التفكير إلى رموز مخفية صغيرة بتقلل عدد الكلمات المطلوبة 200 مرة. التجربة على منصة "Guess What You Like" في Taobao أظهرت تحسينات واضحة في المؤشرات التجارية وتخفيض كبير في استهلاك الموارد.
ليش بتهمّك؟: هالتحسين بيخلّي أنظمة التوصية أسرع وأكفأ، وبيزيد من رضا المستخدمين وأرباح الشركات.
🌱 شو إلك منها؟
تخيل إنو التطبيق اللي تستخدمه يقدر يتذكر ذوقك من قبل ويقترحلك منتجات بسرعة أكبر، متل ما إذا كان عندك صديق بيفهمك من غير ما تحتاج تحكي كل شي كل مرة. هالشي بيساعدك توصل للشي اللي بدك ياه بلا ما تضيّع وقتك، وبيظهر أكتر في خدمات التسوق اللي بتستعملها كل يوم.
recommendation LLM hybrid-modal memory Taobao hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

xHC: توسيع الروابط الفائقة للـ Transformers

xHC: Expanded Hyper-Connections
الفريق قدم طريقة xHC لتوسيع الـ residual stream بالـ Transformers لأكتر من أربع مسارات متوازية، يعني ما بنوقف عند N=4. استخدموا تعزيز ميزات زمنية لتقوية الـ write‑back، وعملوا بنية متفرقة بتحدّث بس 4 مسارات من أصل 16 مع الحفاظ على وصول كامل للـ residual state. التجارب على نماذج MoE بحجم 18B و28B بيّنت تحسن واضح بالنتائج مع زيادة بسيطة في الـ FLOPs، وكمان طوّروا xHC‑Flash لتقليل حركة الذاكرة. هالنتائج بتأكد إن توسيع الـ residual stream ممكن يكون محور جديد لتقليل تكلفة التدريب وتحسين الأداء.
ليش بتهمّك؟: هالطريقة بتخلّي تدريب نماذج اللغة الكبيرة يكون أكتر كفاءة، يعني بنحصل على أداء أعلى بدون ما نضطر نزيد استهلاك الحوسبة بشكل كبير.
🌱 شو إلك منها؟
تخيل إنو عندك مكتبة كبيرة، وبدك تضيف رفوف جديدة لتخزين كتب أكتر، بس ما بتستغل كل الرفوف كل مرة؛ هالطريقة بتخلي النموذج يضيف ذاكرة أكبر بس يستخدم جزء منها بذكاء. بهالطريقة، التطبيقات اللي بتستعمل الذكاء الاصطناعي مثل المساعدات الصوتية أو الترجمة رح تكون أسرع وأدق. يعني رح تحسّ بالفرق لما تستعمل شات بوت أو خدمة ترجمة وتلاقيها بتفهم أكتر وتجاوب أسرع.
language models transformers scaling efficiency MoE hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

Xiaomi‑Robotics‑1: نموذج رؤية‑لغة‑عمل للروبوتات

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
الفريق قدم نموذج أساسي اسمه Xiaomi‑Robotics‑1 بيقدر يتبع تعليمات لغوية متنوعة ويشتغل على مهام مناولة الأشياء بالموبايل في بيئات ما شافها قبل، وبنفس الوقت بيقدر يتأقلم مع مهام جديدة بأقل بيانات تدريب. النموذج تدرب على أكتر من 100 ألف ساعة من مسارات من العالم الحقيقي عبر جهاز UMI، واستخدموا خط أنابيب تلقائي يضيف أوصاف نصية لحالات المشهد. بعد التدريب الأساسي، عملوا مرحلة تانية لتوافق النموذج مع شكل الروبوتات وتعليمات البشر، ولقوا إنه كل ما زادوا البيانات وحجم النموذج، زادت الأداء بالروبوتات الحقيقية. التجارب أظهرت إنه يحقق أرقام قياسية جديدة على Benchmarks مثل RoboCasa365 وRoboDojo.
ليش بتهمّك؟: هالورقة بتعطي طريقة scalable لتدريب روبوتات تقدر تفهم وتنفذ أوامر كلامية بفعالية أعلى، وبتقلل الحاجة لبيانات تدريب ضخمة لكل مهمة جديدة.
🌱 شو إلك منها؟
تخيل إنو الروبوت بالبيت يقدر يسمع منك ويشتغل على طلباتك، مثل ما تقول له يجيب لك كوب شاي أو يرتب الغرفة، من غير ما تحتاج تعلّمه كل مرة. الفكرة بتعتمد على تعليم الروبوت من تجارب حقيقية، متل ما بنتعلم إحنا من شغلنا اليومي. هالشي ممكن يطلع قريباً في تطبيقات ذكية للمنزل أو المستودعات.
robotics vision-language foundation-model scaling manipulation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

RAGU: محرك GraphRAG متعدد الخطوات مع LLM مدمج صغّر

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM
الفريق قدم RAGU، محرك GraphRAG مفتوح المصدر بيفصل بين استخراج الكيانات والعلاقات وتوحيدها. العملية بتشتغل على مرحلتين: استخراج من نوعين، ثم تنقية بالـ DBSCAN، تلخيص بالـ LLM، واكتشاف مجتمعات بالـ Leiden. كمان درّبوا نموذج Meno-Lite-0.1 بحجم 7B يركز على مهارات اللغة، وقدر يتفوق على Qwen2.5-32B ببناء مخططات المعرفة، ويعطي نفس الأداء على مهام GraphRAG الإنجليزية. RAGU يشتغل على GPU وحدة، يثبت بـ pip install graph_ragu، ومتوفر تحت رخصة MIT.
ليش بتهمّك؟: هالورقة بتخلّي بناء واستخدام مخططات المعرفة أصغر، أسرع، وأدق، وبيفتح الباب لتطبيقات AI أقوى على أجهزة شخصية.
🌱 شو إلك منها؟
مع RAGU، التطبيقات الذكية تقدر تفهم وتستخرج معلومات من نصوص معقدة وتلخّصها بدقة، متل ما بنحتاج نلخّص مقال أو تقرير طويل. الفكرة بتشبه إنك عندك مساعد شخصي يقدر يفرّق بين التفاصيل المهمة ويجمعها بطريقة منظمة، وبيشتغل حتى على حاسوبك العادي. هالشي رح يخلّي الخدمات اللي بنستعملها يوميًا، مثل البحث أو المساعدة الرقمية، تعطي إجابات أدق وتفصيلية أكثر.
GraphRAG LLM retrieval-augmented generation knowledge graph open-source hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

Cura 1T: نموذج متخصص في الرعاية الصحية

Cura 1T: Specialized Model for Agentic Healthcare
الفريق قدم Cura 1T، نموذج لغة كبير مخصص للقطاع الصحي. النموذج تدرب بحلقة تطور ذاتية بحدود بشرية: كل دورة بيخطط وكيل تدريب هدف جديد، يدرب النموذج، يقيم الأداء على مجموعة من الـ benchmarks، وبعدين يضبط خليط البيانات حسب الأخطاء. هالطريقة بتعطيه قدرة على استشارة المرضى، التفكير السريري بالنصوص والصور، تشخيص تفاعلي، واستخدام أدوات السجلات الصحية، بدون ما يضعف قدرات تانية.
ليش بتهمّك؟: هالورقة بتظهر كيف ممكن نطور نماذج طبية قوية ومتوازنة بدون ما نخسر أداء مهمات ثانية.
🌱 شو إلك منها؟
تخيل لو عندك تطبيق يقدر يجاوب على أسئلتك الطبية، يفسر صور الأشعة، ويساعد الطبيب يكتب تقارير بسرعة. Cura 1T بيقرب هالشي من واقعنا، لأنه يقدر يتعامل مع استشارات المرضى وأدوات السجلات الإلكترونية بنفس الوقت. ممكن تشوف تأثيره قريبًا في تطبيقات الصحة الرقمية أو المواقع اللي بتقدم نصائح طبية.
LLM healthcare self-evolution benchmark agentic hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

نماذج اللغة الحدودية ومشكلة النسخ: النص أحسن بنظرة 2D

Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D
الفريق اللي بيضم Haodong Wen وزملاؤه بيظهروا إنو حتى أكبر نماذج اللغة ما بتقدر تنسخ نص حرفيًا على طول داخل نافذة السياق. السبب بيرجع لتصميم positional encodings بالـTransformer اللي بيفضل يطابق السياقات المحلية بدل ما يحدد موقع كل كلمة بدقة. اقترحوا طريقة جديدة اسمها 2D-RoPE بتنظم النص بجدول 2‑بعدي وتعطي كل كلمة row ID وcolumn ID، فتصير عملية النسخ مجرد سحب كلمة من عمود ثابت. التجارب على نسخ نصوص صناعية بتبيّن إنو الـTransformers الخفيفة مع 2D-RoPE بتنسخ بدقة حتى لطول نصوص أكبر بكتير من اللي تدربت عليها، والنتيجة نفسها انطبقت على نماذج ما قبل التدريب الكبيرة لحد 1.4 B باراميتر.
ليش بتهمّك؟: هالطريقة بتحل مشكلة أساسية بالنسخ الدقيق، وبتفتح باب لتحسين موثوقية النماذج في مهام تعتمد على استرجاع النصوص بدقة.
🌱 شو إلك منها؟
تخيل إنك بتكتب رسالة طويلة وبدك البرنامج يكررها لك بالضبط، بس أحيانًا بيصير فيه تشويش. الطريقة الجديدة بتعامل الكلام متل جدول، فبيصير سهل على البرنامج يطلع كل كلمة بمكانها. رح تشوف هالتحسينات بأدوات الإكمال التلقائي أو تحويل الكلام لنص، إللي بتستعملها يوميًا.
language models positional encoding transformers 2D representation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

تقنية تقطير دلتا على سياسات التدريب (On-Policy Delta Distillation)

On-Policy Delta Distillation
الباحثين قدموا طريقة جديدة لتقليد النماذج الكبيرة بعد التدريب، سموها delta signal. الإشارة دي بتقيس الفرق بين النموذج المعلم بعد ضبط قدرات التفكير والنموذج الأصلي قبل الضبط، وبتعطي إشارة أوضح لنقل مهارات التفكير. التجارب على اختبارات الرياضيات والعلوم والبرمجة بيّنت إن الطريقة هاد بتحسّن الأداء مقارنةً بالتقليد التقليدي، وبتخلي النماذج توصل لأداء عالي خلال فترة تدريب قصيرة.
ليش بتهمّك؟: هالطريقة بتقلل الوقت والموارد المطلوبة لتقوية قدرات التفكير بالنماذج الكبيرة، فبيصير في تحسين أسرع وأرخص للذكاء الاصطناعي.
🌱 شو إلك منها؟
تخيّل إنك تعلّمت درس إضافي وتستفيد من الفروق بين ما كنت تعرفه قبل الدرس وبعده؛ هالطريقة بتعمل نفس الشي مع الذكاء الاصطناعي لتخليه يفهم أسئلة الرياضيات أو البرمجة أسرع. يعني ممكن تشوف تطبيقات مثل المساعدات الذكية تعطيك حلول أدق بعد تحديث بسيط، بدون ما تحتاج تنتظر تدريب طويل.
distillation reinforcement learning LLM reasoning OPD2 hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

فهم الاستدلال من Pretraining إلى Post‑Training

Understanding Reasoning from Pretraining to Post-Training
الفريق استعمل الشطرنج كمنصة مراقبة لتفحص كيف بيأثر التدريب الأولي على تحسين النماذج بالـ RL. درّبوا نماذج لغة من 5M لحد 1B بارامتر على ألعاب شطرنج بشرية، بعدين سووا fine‑tuning على تتبعات استدلال صناعية، وأخيرًا شغّلو RL على ألغاز شطرنج فيها مكافآت واضحة. لقوا إنّو أداء الـ RL بيتنبأ فيه من خسارة الـ pretraining، وإنّو كل ما زادت توكنات الـ pretraining، المنحنى بتاع مكافأة الـ RL بصير أدفَع تقريبًا خطيًا. كمان شافوا إنّو الـ RL ما بيقوّي بس السياسة اللي تعلّمتها الـ SFT، بل بيظهر حركات صحيحة ما كانت موجودة بالـ SFT على الألغاز الصعبة، وده تأكّدوا منه كمان بمجال الرياضيات.
ليش بتهمّك؟: هالنتايج بتعطينا دليل واضح على كيف نختار حجم الداتا والـ compute قبل ما ندخل مرحلة الـ RL، وبتساعدنا نطوّر نماذج تفكّر أسرع وأدق.
🌱 شو إلك منها؟
تخيّل إنك عم تتعلم لعبة شطرنج أو رياضيات، وكل ما تتدرب أكتر قبل ما تلعب بمستوى احترافي، بتصير فرصك بالفوز أعلى. هالدراسة بتوضح إنّو التدريب المسبق القوي بيخلي أي تحسين لاحق (زي التدريب بالخبرة) يشتغل أسرع وأحسن. يعني إذا استخدمنا هالطريقة، التطبيقات اليومية مثل المساعدين الذكيين أو أدوات حل المسائل رح تكون أسرع وتساعدنا بأقل جهد.
RL LLM reasoning scaling chess hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

Loopie: أقوى Transformer متكرّر لحدّ الآن

Loop the Loopies!
الفريق قدم Loopie، أقوى Transformer متكرّر لحدّ اليوم. السلسلة فيها نموذجين MoE: واحد 20 بليون باراميتر مع 2 بليون باراميتر نشط، والثاني 6 بليون مع 0.6 بليون باراميتر نشط. Loopie بيكسر التحدي التقليدي إنو زيادة N‑مرة بحساب التدريب عادةً بتحتاج زيادة N‑مرة بالباراميترات؛ هو بيستغل التكرار ليعطي أداء أعلى من نموذج 30 بليون باراميتر بنفس الميزانية. كمان بعد التدريب، بيضيف قدرات استدلال قوية، وحقق أداء ذهبية بالمسابقة الدولية للرياضيات والفيزياء 2025 بدون أدوات مساعدة.
ليش بتهمّك؟: الورقة بتظهر إنه في طريقة أذكى لاستغلال موارد الحوسبة، يعني بنقدر نحصل على نماذج أقوى بدون ما نضطر نبني شبكات أكبر بكتير.
🌱 شو إلك منها؟
تخيّل إنك تستعمل نفس المخّ الذكي أكتر من مرة بدل ما تصنع مخّ جديد كل مرة؛ هالطريقة بتخلي التطبيقات الذكية، مثل المساعدات الصوتية، تردّ أسرع وأدق بدون ما تحتاج حواسيب ضخمة. ممكن تشوف هالتحسينات قريباً في تطبيقات الدردشة أو الترجمة اللي بتستعملها كل يوم.
transformer MoE language model efficiency reasoning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

اختبار ActiveVision للمراقبين النشطين

An Exam for Active Observers
المؤلفين قدموا ActiveVision، benchmark فيه 17 مهمة موزعة على 3 فئات، هدفه يقيس قدرة نماذج اللغة الكبيرة المتعددة الوسائط على المراقبة النشطة للصور. الصراحة، حتى أقوى نموذج جربوه، GPT‑5.5، حلّ بس 10.6٪ من الأسئلة وفشل تماماً في 11 مهمة، وClaude Fable 5 حلّ 3.5٪ بس، بينما البشر وصلوا لـ96.1٪. كمان لما خلو النماذج تكتب كود لتفسير الصور، الكود كان غير موثوق ولا يقدر يكتشف أخطاؤه، يعني ما في مراقبة نشطة كافية.
ليش بتهمّك؟: لأن بدون مراقبة نشطة، نماذج الذكاء الاصطناعي ما بتقدر تفهم المشاهد البصرية المعقّدة، وهذا بيحد من تطبيقاتها العملية.
🌱 شو إلك منها؟
تخيل إنك بتشوف صورة مرة وحدة بس، وما بتدور عالشي اللي بدك ياه، هالذكاء الاصطناعي بيعمل هيك حالياً. هالشي بيخليها تعجز عن مهام بسيطة مثل قراءة لوحة إرشادية أو التعرف على تفاصيل مشهد متحرك. إذا صارت المراقبة النشطة، رح تشوف تطبيقات أذكى مثل مساعدات بصرية تساعدك بالمشي بالشارع أو الفحص السريع للمنتجات.
active-vision multimodal benchmark LLM perception arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

أداء Frontier AI في شغل الأعمال: قياس عبر BusinessCaseBench

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning
الباحثين قدموا BusinessCaseBench، مجموعة أسئلة من حالات أعمال حقيقية تغطي 18 تخصص، وكل سؤال إلو دليل تقييم من حلول الخبراء. جربوا نماذج LLM المتقدمة وشافوا إنها بتحقق درجات عالية حسب هالدليل، وحتى التحسن واضح خلال سنتين. النتيجة إنّ الذكاء الاصطناعي صار يقدر يحلّ إشي معقّد زي التحليل الاستراتيجي واتخاذ القرار في بيئات تجارية.
ليش بتهمّك؟: هالنتائج بتبين إنو الـ LLMs صارت جاهزة تساعد الشركات والطلاب بحلّ مشاكل تحليلية واقعية بسرعة.
🌱 شو إلك منها؟
تخيل إنك تقدر تحط سؤال معقّد عن مشروع تجاري وتلقى إجابة منظمة ومقنعة، متل ما بيعمل المستشارين. هالشي بيسهّل على أصحاب الشركات اتخاذ قرارات أسرع وأدق. ممكن تشوف هالتقنية اليوم ببرامج استشارية أو أدوات كتابة تقارير تلقائية.
LLM benchmark business analytical reasoning case study arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

من الشكلي للعملي: نظرة على توضيحات LLM الذاتية

From Plausible to Actionable: A Position on LLM Self-Explanations
الباحثين Herrewijnen وزملاؤه بيحكوا إنو الـ LLMs بتقدر تولّد شروحات نصية بتفسّر قراراتها، وهاي الشروحات صارت اتجاه واعد ضمن XAI لتفسير سلوك الموديلات. مع إنو الشروحات بتبين كتير معقولة، ما في ضمان إنو هي فعلاً بتعكس طريقة تفكير الموديل بالضبط. الورقة بتنتقد طرق التقييم التقليدية وبتقترح إرشادات لتقويم المعقولية والصدق، وبتضيف معيار جديد اسمه القابلية للتطبيق (actionability) لتقييم كيف ممكن نستفيد من هالشروحات بقرارات واقعية.
ليش بتهمّك؟: لأنو إذا قدرنا نقيّم شروحات الـ LLM بدقة، بنقدر نستخدمها لاتخاذ قرارات أدق ومبنية على فهم أعمق لسلوك الذكاء الاصطناعي.
🌱 شو إلك منها؟
تخيل إنو برنامج ذكي يشرح لك ليش اختار خيار معين، مش بس يرد عليك. هالشرح ممكن يساعدك تتأكد إنو القرار مناسب قبل ما تتصرف، متل ما بنستشير صديق موثوق قبل ما نقرر. هالنوع من الشروحات رح يطلع بأدوات مثل المساعدات الرقمية أو التطبيقات اللي بتعطي نصائح مبنية على تفسير واضح للخيارات.
LLM XAI self-explanation interpretability AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

من مراجعة الكود البشرية للوكيلية: تأثير أجيال الذكاء الاصطناعي على جودة المراجعة

From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality
الفريق اللي بيضم Suzhen Zhong وزملاؤه درسوا أكتر من مليون طلب سحب (pull request) من 207 مشروع على GitHub، وشافوا كيف انتقلوا من مرحلة المراجعة البشرية للمرحلة اللي فيها LLMs والـ AI agents. حددوا ثلاث طرق لتبني المراجعة بالذكاء الاصطناعي: تبني تدريجي، تبني سريع للـ LLM، وتبني سريع للوكيل الذكي. النتائج بتوضح إن وجود الوكلاء بيسرّع اتخاذ القرار بالمراجعة، بس هالسرعة ما بتترجم لجودة أعلى بالمراجعة.
ليش بتهمّك؟: العلماء بيظهروا إن إدخال الوكلاء الذكيين ممكن يخفّف الحمل عن المبرمجين بسرعة، بس لازم ننتبه إن السرعة ما تعني تحسين الجودة.
🌱 شو إلك منها؟
لو إنت مطوّر أو حتى مستخدم لتطبيقات برمجية، ممكن تشوف أدوات مراجعة الكود تصير أسرع وتقلل وقت الانتظار لتحديثات البرنامج. يعني متل ما بنستنى القهوة تصير جاهزة، هالأدوات بتخلّي الكود يخلص أسرع. هالشي ممكن تصادفه في خدمات مثل GitHub Copilot أو أدوات CI/CD اللي بتستخدم الذكاء الاصطناعي.
code review LLM AI agents software engineering hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

ذكاء وكيل LLM لشبكات 5G/6G

LLM-Powered Agentic AI for 5G/6G Networks: A Tutorial and Survey on Architectures, Protocols, and Standardization
فريق Mazene Ameur وزملاؤه قدموا دليل‑مسح من جزئين عن كيف ممكن نستخدم Large Language Models لتصير الشبكات الجيل الخامس والسادس وكيلية، يعني تشتغل بحكم نفسها وتحقق أهدافها. الجزء الأول بيفصل طبقات التحكم والإدارة بالـ NGN وبيشرح أسس الأنظمة الوكيلة: التفكير، التخطيط، استخدام الأدوات، تنسيق الوكلاء، والتقييم. الجزء الثاني بيربط هالقدرات بسطوح التحكم في 5G/6G، ومعايير التوحيد، ومبادرات 6G الكبيرة، وبنهاية بيسلط الضوء على التحديات المفتوحة.
ليش بتهمّك؟: المسح بيوضح كيف ممكن ندمج الذكاء الوكيل مع شبكات الجيل القادم لتقليل التدخل البشري وزيادة الكفاءة.
🌱 شو إلك منها؟
تخيل إنو الشبكة بتشتغل متل المساعد الذكي اللي بيفتح لك الباب أو يضبط التكييف، بس هالمرة هي نفسها بتدير الإنترنت وتوزّع السرعة حسب احتياج كل جهاز. هالشي بيسهّل علينا نتصفح بلا تقطعات، خصوصًا إذا كنا عم نشتغل من البيت أو نتفرج على فيديوهات عالية الجودة. رح تشوف هالتقنية أولًا في تطبيقات الجيل الخامس والسادس اللي بتعتمد على خدمات الإنترنت السريعة والموثوقة.
agentic AI 5G 6G networks survey arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

BayesPO: تحسين البرايمبت بطريقة بايزية

BayesPO: Bayesian Prompt Optimization via Parallel-Tempered Gradient-Guided Discrete MCMC
هالورقة بتقدّم طريقة جديدة لتوليف البرايمبت للـ LLMs من غير ما نغيّر وزن النموذج. الباحثين Zhou و Ou بيعرّفوا توزيع بايزي بدمج احتمالية المهمة مع prior من اللّغة، وبعدين بيستعملوا MCMC مع اقتراحات موجهة بالgradient وparallel tempering لاستكشاف مساحة البرايمبت. التجارب على نماذج Qwen2.5 بتظهر إن الطريقة بتلقى برايمبتات ذات معنى وبترفع الدقة من 60.04% لـ 63.23% على مجموعة مهام. كمان بيكشفوا إنو فيه تحديات مثل الإفراط بالتدريب وتكلفة الحوسبة.
ليش بتهمّك؟: هالطريقة بتخلّي تعديل تعليمات الـ LLMs أكثر دقة وموثوقية بدون ما نحتاج نعيد تدريب النموذج.
🌱 شو إلك منها؟
تخيّل إنك عم تستخدم مساعد ذكي وتعطيه أوامر دقيقة، هالطريقة بتساعده يفهم تعليماتك أحسن ويعطيك إجابات أقرب للي بدك ياه. متل ما بنضبط توابل أكلة لتطلع طعمها أطيب، بنضبط البرايمبت لتطلع مخرجات الذكاء الاصطناعي أذق. ممكن تشوف أثرها بأدوات مثل ChatGPT أو أي تطبيق بيستعمل LLMs، لأنو بتحسّن دقة الردود.
prompt optimization Bayesian MCMC LLM energy-based arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

الفلامينغو السمعي‑بصري: نموذج مفتوح للفيديوهات الطويلة والمعقّدة

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
الفريق قدم AV-Flamingo، نموذج لغة كبير يدمج السمع والبصر ويقدر يفهم ويستنتج من فيديوهات طويلة ومعقّدة. جمعوا مجموعة Audio-Visual-Skills فيها حوالي 7 مليون مثال من الشروحات والأسئلة لتدريب النموذج على التفكير الزمني والتركيبي عبر الصوت والصورة. بعدين استخدموا منهجية ثلاثية المراحل لتدريب النموذج من الفهم القصير للمناظر لحد التفكير في أحداث طويلة. كمان أضافوا طريقة Temporal Audio-Visual Interleaved Chain-of-Thought اللي بتربط خطوات التفكير بأوقات محددة داخل الفيديو، لتقوية التوافق الزمني وتسهيل الفهم.
ليش بتهمّك؟: هالورقة بتخلّي النماذج المفتوحة تقدر تتعامل مع فيديوهات طويلة وتستفيد من الصوت والصورة مع بعض، وهذا بيفتح باب لتطبيقات واقعية أقوى.
🌱 شو إلك منها؟
تخيل إنك تحط فيديو طويل على يوتيوب وتقدر المساعدة الذكية تفهم محتواه وتجاوب على أسئلتك عن تفاصيله، مثل ما إذا كان في مشهد معين أو صوت مهم. هالطريقة بتسهل عليك تلقي معلومات دقيقة من فيديوهات طويلة بدون ما تقعد تتفرج كل مرة. ممكن تشوف هالتقنية تنطبق على تطبيقات مثل المساعدات الصوتية أو أدوات التلخيص الذكي للفيديوهات.
audio-visual LLM multimodal long-video open-source hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

S1-Omni: نموذج موحد للذكاء الاصطناعي العلمي المتعدد الوسائط

S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation
الفريق بقيادة Zhao وزملاؤه قدموا S1-Omni، نموذج موحد بيفهم ويولّد علميًا من خلال ربط النصوص والتعليمات مع أشياء علمية مثل CIF وSMILES وسلاسل البروتين والصور العلمية. النموذج بيحط كل هالبيانات بمساحة تمثيل مشتركة وبيدمج القوانين العلمية والمعرفة الخبرائية لتقدر تستنتج من الأدلة. بعدين بيستعمل فك تشفير خاص لكل مهمة، من توقع الخصائص إلى توليد جزيئات من الطيف وتعديل الصور العلمية. تم تدريب S1-Omni على S1-Omni-Corpus اللي فيه مئات المهام وملايين العينات، وتقييمه على أكتر من 60 benchmark علمي وطلع يتفوق على GPT-5.5 وGemini-3.1-Pro ومع بعض النماذج المتخصصة.
ليش بتهمّك؟: هالورقة بتفتح باب لتطبيقات علمية أوسع وأسرع لأننا صرنا نقدر نستخدم نموذج واحد يحل كتير من المشاكل بدل ما نحتاج نماذج مختلفة لكل مجال.
🌱 شو إلك منها؟
تخيّل إنو عندك برنامج يقدر يتوقع خصائص مادة كيميائية أو يولد جزيء جديد من طيف قياس، كلّه من خلال واجهة وحدة. هالشي بيسهّل على الباحثين والمهندسين يشتغلوا أسرع ويقللوا الحاجة لتجارب مكلفة. ممكن تشوف هالتقنية يومًا ما داخل أدوات تحليل البيانات أو تطبيقات البحث العلمي على الإنترنت.
multimodal scientific AI reasoning benchmark unified model hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

CRAFT: تشخيص ضعف قدرات LLM وتوليد بيانات Fine‑Tuning مستهدفة

CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data
الفريق قدم طريقة اسمها CRAFT بتحول أي مجموعة تقييم مبنية على rubric لتشخيص قدرات الـ LLM الضعيفة. كل معيار تقييم بيتعامل كـ capability probe، وبستخرجوا وصف للقدرة من كل prompt‑rubric وبعدين بيجمعوا الأوصاف بشجرة قدرات هرمية. بعدين بيحسبوا أداء النموذج على كل عقدة بالشجرة وبيختاروا العقد الضعيفة لتوليد بيانات Fine‑Tuning موجهة. التجربة على نماذج مفتوحة بالمجالين المالي والقانوني أظهرت إنو CRAFT بتحسن الدقة بالمقارنة مع طرق التقييم العشوائية أو clustering التقليدي.
ليش بتهمّك؟: هالطريقة بتعطيك صورة أوضح عن وين النموذج عم يضعف وبتساعدك تحسّنوا ببيانات دقيقة، فبالتالي بتحصل على نماذج أقوى بأقل جهد.
🌱 شو إلك منها؟
تخيل إنك عم تتعلم سواقة وتحتاج تعرف بالضبط إيش النقاط اللي بتقع فيها لتصححها؛ CRAFT بيعمل نفس الشي للذكاء الاصطناعي، بيوضحلك شو ما بيعرف يشتغل. يعني إذا كان عندك برنامج ترجمة أو مساعد كتابة، هالطريقة بتخليه يصير أذكى ويقلل الأخطاء اللي بتزعجك. ممكن تشوف التحسينات هادي في التطبيقات اللي بتستعمل الذكاء الاصطناعي اليوم، مثل أدوات كتابة النصوص أو التحليل المالي.
LLM evaluation fine-tuning diagnostics finance arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

VideoRAE: ضبط تمثيلات الفيديو لتوليد محتوى

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders
الفريق اللي بيقودوا Zhihao Xie وزملاؤه قدموا VideoRAE، وهو مشفر تمثيلات بيستغل ميزات متعددة المستويات من مشفر فيديو ثابت ويضغطها بـ 1D self‑attention خفيف. بيقدر يولّد تمثيلات مستمرة للـ Diffusion Transformers أو رموز منفصلة للنماذج التلقائية عبر تشفير متعدد‑الكودات. خلال فك الضغط، بيستخدم هدف محاذاة تمثيل محلي وعالمي مع المعلم VFM الثابت، فبهيك ما بيحتاج تنظيم KL وبيحافظ على المعنى الزمني‑المكاني. التجارب على UCF‑101 أظهرت جودة إعادة بناء قوية وسرعة تدريب أعلى بخمس مرات مقارنةً بالمشفرات التقليدية.
ليش بتهمّك؟: هالطريقة بتخلّي توليد الفيديو أسرع وأدق، وبتفتح باب لاستعمال تمثيلات الفيديو الثابتة بأشكال توليدية جديدة.
🌱 شو إلك منها؟
تخيل إنك تقدر تصوّر فيديو من نص أو من فكرة بسرعة أكبر، متل ما بتستعمل تطبيقات تعديل الصور لكن للفيديو. التقنية هادي بتخلي الموديل يتعلم يحفظ تفاصيل الحركة والموضوع بدون ما يضيع وقت طويل بالتدريب. ممكن نشوف هالتحسينات قريبا بأدوات تحرير الفيديو على الإنترنت أو تطبيقات الذكاء الاصطناعي اللي بتولّد محتوى مرئي.
video generation autoencoder diffusion foundation models representation learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

متى بتفيد الأنظمة المتعددة الوكلاء؟ منظور Information Bottleneck

When Do Multi-Agent Systems Help? An Information Bottleneck Perspective
الباحثين بيستكشفوا ليش الأنظمة المتعددة الوكلاء المدعومة بـLLM أحياناً بتتفوق على الأنظمة الفردية. لقوا إن الفرق الأساسي إن النظام الفردي بيخزن كل خطوات التفكير بسياق واحد، بينما النظام المتعدد بيقسم السياق على رسائل محدودة بين الوكلاء. إذا كانت الرسائل ما فيها قيود، النظام المتعدد يقدر يقلد النظام الفردي، بس لما تكون الرسائل محدودة بيصير في موازنة بين تقليل الزحمة وفقدان معلومات مهمة. الدراسة جربت 18 تجربة على خمس مجموعات اختبار بثلاث أحجام نماذج لتأكد الفكرة، ولاحظوا إن الفائدة بتظهر أكتر لما تكون الرسائل تقريباً كافية، خصوصاً للنماذج الأضعف.
ليش بتهمّك؟: هالنتيجة بتساعدنا نقرر متى نستخدم تصميمات متعددة الوكلاء لتقليل تكلفة الحساب بدون ما نضيع جودة الأداء.
🌱 شو إلك منها؟
تخيل إنك عم تحكي مع صديقك وتبعثله رسائل قصيرة بدل ما تكتب كل التفاصيل؛ إذا الرسائل قصيرة كفاية، بتوفر وقت ومجهود، بس إذا نقصت كثير ممكن يضيع الفكرة. هالمفهوم بينطبق على برامج الذكاء الاصطناعي اللي بتشتغل مع بعضها، وبيخلينا نختار أحسن طريقة لتقليل استهلاك الطاقة أو الإنترنت. ممكن تشوف هالتقنية بتظهر بأدوات الدردشة أو المساعدات الذكية اللي بتشتغل على هواتفك.
multi-agent information bottleneck LLM communication efficiency arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 8
Memory Hub
الميموري هاب هو مخزن بنحط فيه المعلومات اللي النموذج احتاج يفتكرها بسرعة، بنستعمله عشان النموذج يقدر يرجع لإشي تعلمه قبل كده ويستفيد منه
Latent Intent Reasoning
لاتنت إنتنت ريزننغ هو طريقة بنستنتج فيها النوايا المخفية ورا الكلام أو الفعل، مش واضح على السطح، وبنستعمله عشان نفهم إشي أكتر من مجرد الكلمات
Hyper-Connections
هايبر-كونكشنز يعني روابط قوية ومتشابكة بين مكونات النموذج أو البيانات، بدنا هيك روابط عشان النموذج يقدر يربط بين أفكار مختلفة بسرعة
pre-training
هي العملية الأولى اللي بنعلم فيها النموذج على كمية ضخمة من الكلام من الإنترنت عشان يتعلم يفهم اللغة والمفاهيم بشكل عام قبل ما نخصصه لمهام معينة.
fine-tuning
تدريب إضافي لنموذج موجود بالفعل على بيانات جديدة وخاصة عشان يكون أفضل في مجال معين. يعني بدل ما نبني نموذج من الصفر، بنأخذ واحد موجود ونحسّنه. بنسمع عنه عشان بيوفر وقت وموارد كتير.
GraphRAG
GraphRAG طريقة بتدمج استرجاع المعلومات مع شبكات المعرفة، عشان النماذج تقدر تجيب معلومات دقيقة من قاعدة بيانات ضخمة
DBSCAN
DBSCAN خوارزمية تجميع بتحدد مجموعات البيانات بناءً على الكثافة، مش محتاجة نحدد عدد المجموعات مسبقاً
Leiden
Leiden خوارزمية لتقسيم المجتمعات في الشبكات، أحسن من خوارزمية Louvain وبتعطي تجزئة أدق
🤖 موديلز 5
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
Hybrid-modal Foundation Model
الهايبرِد-مودال فاونديشن موديل هو نموذج بيفهم أكتر من نوع بيانات، متل النص والصورة مع بعض، عشان يقدر يحل مشاكل أكتر تعقيد لأن احنا بدنا حلول شاملة
xHC
إكس إتش سي هو موديل بيستخدم هيك روابط هايبر-كونكشنز لتوليد مخرجات أسرع وأدق، بنستفيد منه عشان نحل مشاكل معقدة مش ممكن نمشي فيها خطوة بخطوة
MoE
اختصار لـ Mixture of Experts، يعني نموذج فيه مجموعات من الخبراء المتخصصين كل واحد بيشتغل على جزء معين من المهمة.
Meno-Lite-0.1
Meno-Lite-0.1 نموذج خفيف الوزن للغة، بنستعمله لما بدنا سرعة ومعالجة على أجهزة محدودة
🗂️ بيانات 1
RoboCasa365
روبو كاسا 365 هو مجموعة بيانات بتجمع معلومات عن بيوت ذكية وحركات الروبوتات فيها على مدار السنة، بنستخدمها عشان ندرب نماذج تتعامل مع بيئات منزلية حقيقية
كل المصطلحات ←
العدد السابقشو في AI؟ | 19 يوليو — وكيل ذكي وتعاون متعدد
📚 كل الأعداد