📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 25 يوليو — Hybrid Attention Powers AI

أسبوعي مكثّف 📅 2026-07-25
سلام عليكم 👋

هالأسبوع كان استثنائي — نشرت ٢٤ مقالة جديدة! من «شو يعني GPT» و«Transformer» لـ«كيف أتعلّم الذكاء الاصطناعي من الصفر». صار عنا مكتبة عربية مبسّطة بتغطي أساسيات الـ AI من الألف للياء.

ومقال الأسبوع اخترته لأنه بيلخّص الرحلة كلها: خريطة عملية لأي حدا حابب يفهم أو يستخدم الذكاء الاصطناعي — بلا رياضيات ولا رعب. اختار مسارك وابدأ 👇

وتحت شوية مقالات مختارة من الأسبوع، ولمسة من عالم الأبحاث.
#1

SANA-Video 2.0: توليد فيديو عالي الدقة بانتباه هجين

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
فريق Chen وزملاؤه قدموا SANA-Video 2.0، نموذج تحويلة انتشار بحجم 5B و14B بيشتغل على GPU وحدة لتوليد فيديوهات لحد 720p. النموذج بيستعمل Hybrid Linear-Softmax Attention اللي بخلط انتباه خطي مع Softmax بنسب 3:1، وBlock Attention Residuals لتقوية التمثيلات عبر الطبقات، فبيوصل جودة قريبة من النماذج اللي بتستعمل Softmax بالكامل وبسرعة أعلى. التدريب من الصفر بيضمن إن النموذج ما بيعتمد على نماذج مسبقة، ومع 40 خطوة توليد بيحقق درجة VBench 84.30 خلال 13.2 ثانية على 480p باستخدام H100. الورقة انتشرت على Hugging Face Daily Papers وجمعت 18 upvote، وأصلها preprint على arXiv.
ليش بتهمّك؟: هالطريقة بتخلّي توليد فيديو عالي الجودة أسرع وأرخص، فبتفتح باب تطبيقات واقعية على أجهزة مو باهظة.
video generation diffusion transformer attention efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

نمذجة الحركية الهيكلية من الفيديو (SDM)

Self-Supervised Learning of Structured Dynamics from Videos
الباحثين قدموا Structured Dynamics Model (SDM) اللي بتفصل بين حركة الكاميرا وحركة الأشياء بالفيديو عبر توقع ميزات المستقبل، وكل هالشي من ميزات ثابتة لvision transformer مدرب مسبقاً. التدريب بيجمع تعلم ذاتي على فيديوهات حقيقية وإشراف ضعيف على بيانات صناعية من Kubric. اختبروا النموذج على مجموعة ProbeMotion اللي فيها سيناريوهات مختلفة، ولقوا إنه بيتفوق على النماذج التقليدية ويقارن بصورة إيجابية مع تمثيلات مُشرفة بقوة. النتائج بتبين إنو فينا نعيد توظيف نماذج الصور لتوليد تمثيلات حركة أكثر تنظيماً بالفيديو.
ليش بتهمّك؟: الورقة بتفتح باب لإستغلال نماذج الصور الموجودة لتفهم الحركية بالفيديو بشكل أدق، وبدون الحاجة لتدريب مكلف.
video self-supervised vision-transformer dynamics representation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

LLMs وضايعين بنية المستخدم المتغيّرة

LLMs Get Lost in Evolving User Intent
الفريق بقيادة Jihoon Tack بيقدّموا إطار بيحوّل المهام الثابتة لتصير محادثات متعددة الأدوار، بحيث نية المستخدم بتتغيّر مع كل رد. الإطار بيخلي كل مهمة تظل تتقَيّم بنفس الطريقة القديمة، بس بيضيف تغيّر النية كإشي جديد. النتايج بتبين إنّ الأداء القوي بالمواقف الثابتة ما بينتقل للمحادثات المتغيرة، وبيظهر انخفاض واضح عبر عائلات النماذج. هالنتيجة بتوضح إنّ LLMs لسا ما بتتبع نية المستخدم بدقة لما بتتغيّر خلال الحوار.
ليش بتهمّك؟: الورقة بتبيّن إنّ تقييم النماذج بالمواقف الثابتة ما بيكشف ضعفهم بتتبع نية المستخدم المتغيّرة، وهذا مهم لتطوير مساعدين ذكيين فعّالين.
LLM intent tracking multi-turn evaluation benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

WorldWeaver: نموذج انتشار فيديو متعدد‑وكيل مع سجلات حالة العالم

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
الفريق بقيادة Sicheng Mo قدم WorldWeaver، نموذج انتشار فيديو بيشتغل على توليد مشاهد Minecraft لعدة وكلاء بنفس الوقت. النموذج بيضيف سجلات حالة عالمية، وهي توكنات قابلة للتعلم بتخزن معلومات مشتركة وبتتحدّث بعد كل قطعة فيديو. كمان استُخدم تصميم Mixture-of-Transformers ليقسم الوزن بين تمثيل الحالة العالمية وإنتاج الإطارات البصرية، وبيّنوا إن هالطريقة بتحسّن التناسق المنطقي وجودة الفيديو.
ليش بتهمّك؟: هالطريقة بتخلي الفيديوهات المتولدة أكثر منطقية وتعبّر عن حالة العالم بشكل ثابت، يعني بيقلل الأخطاء اللي بتصير لما الوكلاء يتفاعلوا.
video diffusion multi-agent world modeling Minecraft hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

OpenForgeRL: إطار لتدريب الوكلاء على أي بيئة

OpenForgeRL: Train Harness-native Agents in Any Environment
الفريق قدم OpenForgeRL، إطار مفتوح المصدر بيسمح بتدريب الوكلاء اللي بيشتغلوا على هارنسات مثل Claude Code أو Codex بطريقة end‑to‑end، حتى لو البيئة معقّدة. الإطار بيستعمل بروكسي خفيف بيسجّل نداءات الموديل كبيانات تدريب، وKubernetes Orchestrator بيشغّل كل rollout بحاوية منفصلة، فبصير فينا ندرب الوكلاء على أي هارنس بأي بيئة وبمقياس كبير. التجارب أظهرت إنّ OpenForgeRL يحقق نتائج أعلى على Benchmarks مثل ClawEval وOSWorld‑Verified مقارنةً بال baselines.
ليش بتهمّك؟: بِصير هالإطار يسهّل على الباحثين تدريب وتحسين الوكلاء مباشرةً على الأنظمة اللي بيستعملوها بالواقع، فبنعطيهم أدوات أسرع وأقوى لتطوير تطبيقات ذكية.
agents RL harness benchmarking open-source hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

نماذج Diffusion المكسية للغة: عالم نصّي قوي وقابل للتوجيه للـ RL الوكيل

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
الفريق بقيادة Darshan Deshpande قدموا طريقة جديدة تستخدم نماذج Diffusion المكسية للغة لتكون عالم نصّي يقدر يتوجه ويتحكم فيه للـ RL. بالمقارنة مع النماذج التلقائية التقليدية، هالنموذج بيقدر يدمج معلومات من كل الاتجاهات، فبيطلع نصوص أكتر تماسك وتثبيت على الواقع. كمان حطوا إطار تدريب اسمه GRPO يشتغل بلا تعديل خاص على البيئة، وحققوا تحسينات كبيرة لحد 47% على بيئات جديدة بدون تدريب إضافي.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء يتعلموا ويخططوا بأمان أكتر وبسرعة، حتى لو البيئة ما كانت معروفة قبل.
language models diffusion reinforcement learning world models agents hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

تعلم فعال من خبرة الوكيل

Sample-Efficient Learning from Agent Experience
الفريق بيقترح طريقة جديدة اسمها Experience Distillation لتقليل الاعتماد على تفاعل البيئة المكلف. الفكرة إنو الوكيل بيستفيد من in‑context learning على تاريخ تفاعلاته، وبعدين هالمعلومات بتنتقل للوزنات الداخلية للنموذج بدون ما يحتاج يجرّب البيئة مرة تانية. التجارب على 749 مهمة برمجية وست ألعاب نصية بتظهر إنه الطريقة بتحافظ على أكتر من 64.8% من الفوايد مقارنةً بالتدريب التقليدي اللي بيرجع لـ 3.8% بس. كمان، مقارنةً بطرق reinforcement learning الكلاسيكية، الطريقة بتوصل لنفس الأداء مع تقليل العينات البيئية بأكثر من 9.6 مرة.
ليش بتهمّك؟: هالطريقة بتخلّي تدريب الوكلاء أسرع وأرخص، خصوصًا لما تكون التجارب بالبيئة مكلفة أو بطيئة.
agent in-context learning experience distillation reinforcement learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

FVAttn: انتباه متفرق متكيّف لتوليد الفيديو بسرعة

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation
الفريق قدم نظام اسمه FVAttn بيستغل الـ sparse attention بدون تدريب، وبيوازن الحمل بين البطاقات الرسومية وقت تشغيل الفيديو. بيستخدم Top‑p routing مع طبقة أمان Top‑k وتنظيم بلوكات خاص بالفيديو، وبعدين بيصحح القناع وقت التشغيل. كمان بيهجر رؤوس التحميل الثقيلة عبر P2P لتقليل الوقت الضائع، ويضيف بلوكات قيمة لتعبّي الفجوات. النتيجة إنو وصلوا لتسريع 4.41× على FlashAttention وتسريع 2‑2.1× على DiT مع جودة فيديو مقبولة.
ليش بتهمّك؟: هالطريقة بتقلل زمن توليد الفيديو عالي الدقة وبتخلي الشغل على عدة بطاقات أسرع وأرخص.
video generation sparse attention transformer GPU efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

تقنية ReOPD لتقليد الوكلاء عبر استرجاع البادئات

Multi-Turn On-Policy Distillation with Prefix Replay
الفريق قدم طريقة اسمها ReOPD، بتخلّي الطالب يتعلم من معلم موجود بس بسجلات سابقة بدل ما يروح كل مرة للبيئة. الفكرة إنو الطالب يشتغل على خطوات مختارة، والمعلم يعطي إشراف تفصيلي لكل خطوة من غير ما يطلب تفاعل جديد مع الأدوات. هالطريقة بتقلل من التحوّلات بين ما يتوقع الطالب وما يقدر المعلم يجاوب عليه، وبتعطي وزن أكبر للبدايات اللي فيها التغيّر أقل. التجارب بينت إنو ReOPD أسرع بأربع مرات تقريباً وبنفس الدقة أو أحسن من الطرق التقليدية.
ليش بتهمّك؟: بتخلي تدريب وكلاء LLM يكون أسرع وأرخص، فبنوصل لتقنيات أقوى بموارد أقل.
distillation on-policy LLM agent efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

هندسة الفضاء الدلالي للـ Transformer

The Geometry of Semantic Space: A Continuous Geometric Framework for the Transformer Architecture
الفريق (الباحث Zhihua Liang) قدم إطار هندسي مستمر بيترجم العمليات الجبرية للـ Transformer إلى معادلة تكاملية‑تفاضلية على فضاء دلالي. من خلال فرضية إن تسلسل الرموز هو 1‑من manifold، حوّلوا كل مكوّن أساسي بالـ Transformer مثل RMSNorm وRoPE وSoftmax Attention وFFN إلى مصطلحات من الهندسة التفاضلية ونظرية القياس. التجارب على خمس نماذج (Qwen3, LLaMA‑3.1, Gemma‑3, GPT‑2, Mistral) أظهرت توافق كمي بين التوقعات الهندسية والنتائج الفعلية، مثل مقياس Lipschitz بدقة عالية وتحولات حرارية غير توازنية. هالإطار بيفتح باب لتوقع حدود الاستقرار والسياق وتفاعلات التحسين للـ Large Language Models.
ليش بتهمّك؟: لأنه بيوفر طريقة رياضية دقيقة لتوقع سلوك الـ LLMs، بنقدر نتحكم بأداءهم واستقرارهم بشكل أفضل.
transformer geometry language models differential equations AI hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

AutoIndex: تعلم برامج تمثيل للبحث

AutoIndex: Learning Representation Programs for Retrieval
فريق O'Nuallain وزملاؤه قدموا AutoIndex، إطار يعلّم برامج تمثيل تنفيذية بتحوّل المستندات قبل ما تنفهرس. بدل ما نضبط الـretrievers أو الـrerankers، AutoIndex بيبحث عن برامج تقص، تغني، توحد أو تعيد وزن الوثائق، وكل خطوة بتتأكد من تحسين جودة الاسترجاع. جربوا الإطار على benchmark اسمه CRUMB مع BM25 ثابت، ولقوا تحسين متوسط +8.4% بالـRecall@100 و+8.3% بالـnDCG@10، وأكبر تحسين وصل لـ+30.5% بالـRecall@100. البحث ظهر على Hugging Face Daily Papers وجمع 9 upvote، وهو preprint على arXiv.
ليش بتهمّك؟: بيخلي أنظمة البحث تسترجع معلومات أدق بدون ما نغيّر النموذج الأساسي، فبنستفيد من تحسين بسيط في تمثيل الوثائق.
retrieval indexing representation learning benchmark program synthesis hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

H^2SD: طريقة هجينة لتدريس الذات للـ LLMs

H^2SD: Hybrid Hindsight Self-Distillation
الفريق قدم H^{2}SD، إطار جديد بيستغل فكرة الـ self-distillation بعد ما النموذج ينتج حل صحيح أو فاشل. للنتائج الصح، المعلم ياخد استجابة الطالب المؤكدة مع تعليمات إعادة الصياغة ويستخدم احتمالاتها لتعديل حجم التحديث، بس ما يغيّر اتجاه المكافأة. للنتائج الغلط، المعلم يتغذّى على إشارة مرجعية فيها خطوات التفكير الأساسية وإجابة موثقة، وبنقّل الـ KL العكسي من الطالب للمعلم لحد ما يتحسن الأداء.
ليش بتهمّك؟: هالطريقة بتقوّي قدرة النماذج الكبيرة على التفكير المنطقي وتقلل الأخطاء بالمهام المعقّدة مثل الرياضيات والبرمجة.
self-distillation reinforcement learning reasoning language models hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | 22 يوليو — وكيل AI يتعلم من التجربة
📚 كل الأعداد