📡 أحدث عدد

شو في AI؟ | 28 يونيو — تحسين الفهرسة وتوليد فيديو متعدد المشاهد

يومي 📅 2026-06-28
سلام 👋 هلقيت العدد الجديد من نشرتنا عن الذكاء الاصطناعي، فيه عشرين بحث مهم بنركز على التطورات الأخيرة. بدنا نعرضلكم أهم العناوين من RL-Index لحد ReNIO ونوضح كيف هالتقنيات بتأثر على شغلنا اليومي.
#1

RL-Index: تحسين الفهرسة بالتعلّم المعزز

RL-Index: Reinforcement Learning for Retrieval Index Reasoning
الفريق اللي بيضم Yongjia Lei وزملاؤه قدموا طريقة جديدة لتقوية الفهرس اللي بنستعمله بالبحث. بدل ما ننتظر وقت الاستعلام لنفكّ الشغلة، بيضيفوا توضيحات (rationales) مولدة من LLM على الوثائق وقت الفهرسة، وبيستغلوا تعلّم معزّز (reinforcement learning) لتدريب هالتوضيحات. باستخدام خوارزمية GRPO كمكافأة، بيقيسوا جودة الفهرسة عبر تشابه الاسترجاع، فبيصير البحث أسرع وأدق. التجارب على benchmark BRIGHT ورّيت إن الطريقة بتحسّن الاسترجاع وإجابات الأسئلة بدون ما تأخر وقت الاستعلام.
ليش بتهمّك؟: هالطريقة بتقلل زمن الانتظار بالمواقع اللي بتعتمد على البحث وتخلّي النتائج أدق، فبتفيد كل التطبيقات اللي بدنا نلاقي معلومة بسرعة.
🌱 شو إلك منها؟
تخيّل إنك عم تدور على حل مسألة رياضية أو كود، وبالطريقة التقليدية ممكن تاخد وقت لتلاقي الجواب. مع هالتقنية، النظام يجهّز المعلومات مسبقًا ويعطيك الجواب فورًا، زي ما تكون عندك مكتبة جاهزة بكتب توضح كل فكرة. هالشي رح تلاحظه بخدمات البحث أو المساعدين الذكيين اللي بتستعملها يوميًا.
retrieval reinforcement-learning indexing LLM efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

UnityShots: توليد فيديوهات متعددة المشاهد بالذاكرة

UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating
الفريق قدم UnityShots، نظام لتوليد فيديوهات صوت‑صورة متعددة المشاهد يعتمد على ذاكرة منظمة. النظام يحافظ على مكوّنات ثابتة مثل مظهر الشخصيات والسياق المشهدي وهوية المتحدث عبر مشهدين ثابتين: ذاكرة طويلة الأمد (LTM) وذاكرة قصيرة الأمد (STM). كل ما يجي قطع جديد، بوابة حساسة للحدود تدمج احتمالية القطع البصري وإشارات إيقاع الموسيقى لتحديث الذاكرة. كمان يضيفوا توكن المتحدث لكل مشهد ليحافظوا على صوت ثابت بدون بنك صوت متحرك، ويستخدموا AdaLN لتعلم prior للنوع القطعي كعنصر تحكم أثناء الاستنتاج.
ليش بتهمّك؟: هالطريقة بتخلي الفيديوهات المتعددة المشاهد تكون أكثر تماسكًا وواقعية، خصوصًا للمنتجين اللي بدهم يحافظوا على استمرارية الشخصيات والصوت عبر القصص.
🌱 شو إلك منها؟
بتخيلوا تطبيق يقدر يخلق لكم مقاطع فيديو متسلسلة كأنها مشاهد فيلم، بس بدون ما يضيعوا تفاصيل الوجه أو الصوت بين كل مشهد والتاني. يعني إذا حبيتوا تعملوا فيديوهات عائلية أو إعلانات قصيرة، النظام بيحافظ على نفس المظهر والصوت عبر كل جزء. هالشي ممكن تلاقوه قريبًا بأدوات تحرير الفيديو على الإنترنت أو تطبيقات الهواتف اللي بتساعدكم تصمموا محتوى بسرعة.
video-generation multimodal memory benchmark open-source hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

نظرة خفيفة، تفكير ثقيل: شو يقدر الـ Multimodal Chain-of-Thought يعمل

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
الباحثين جربوا الـ Multimodal Chain-of-Thought على 12 مهمة فيها رؤية وتفكير، واستخدموا 14 نموذج غير مخصص للتفكير و8 نماذج مخصصة للتفكير. لقوا إنه الـ CoT ما بيشتغل كلّ الوقت؛ بالمهمات البصرية بيقلل من الدقة، خصوصًا بالـ visual grounding وعدّ الأشياء، لكن بالمهمات اللي فيها حسابات رياضية أو علمية أو ربط بين صور متعددة بيكون فعال. كمان النموذج المفتوح المصدر للـ multimodal reasoning ما بيضيف تحسين كبير، لأنه بيركّز كثير على الرياضيات وبيغفل عن باقي القدرات. وأخيرًا، بيظهر إنه النماذج بتفكّر بصوت عالي لكن بتفقد التركيز البصري خلال العملية، يعني "Look Light, Think Heavy".
ليش بتهمّك؟: هالنتائج بتفيدنا نعرف إمتى نستخدم الـ CoT بالأنظمة المتعددة الوسائط ونحسن من قدرات النموذج على الفهم البصري المستمر.
🌱 شو إلك منها؟
تخيل إنه برنامج يقدر يحل مسائل رياضية باستخدام الصور، بس مع الوقت ينسى يطلع على الصورة مرة ثانية، هيك بيصير مع هالأنظمة. هالشي بيعني إنه التطبيقات اللي بتعتمد على الصور – مثل المساعدات الذكية أو أدوات التعليم – ممكن تستفيد من تحسينات جديدة لتظل تركز على الصورة طول ما تحل المشكلة. إذا شفت تطبيق يشرح لك خطوة بخطوة صورة معقدة، هالتحسينات رح تخلي الشرح أدق وأقرب للواقع اليومي.
multimodal chain-of-thought reasoning evaluation AI hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

AGORA: معيار للبحث في ملفات العمل المدعومة بالوثائق

AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning
الفريق الباحث قدم معيار جديد اسمه AGORA بيختبر قدرة نماذج اللغة الكبيرة إنها تتصرف كوكيل وتستكشف ملفات عمل ضخمة لتلاقي الأدلة وتجاوب على أسئلة. المعيار فيه 362 سؤال مع 8 مجموعات وثائق أصلية بتوصل لـ 9,664 ملف و372 مليون توكن، يعني أكبر بكتير من حجم السياق اللي تقدر أي نموذج تحطه. لحتى يجاوبوا، الوكلاء لازم يختاروا وين يدوروا بدل ما يقروا كل شي، وهذا بيختبر استكشافهم الفعّال. التجربة بينت إن أقوى نموذج وصل بس لـ 59.4% دقة، يعني لسه في كتير شغل.
ليش بتهمّك؟: المعيار بيفتح باب لتطوير وكلاء ذكيين يقدروا يتعاملوا مع ملفات واقعية بفعالية، مش بس يجاوبوا من الذاكرة.
🌱 شو إلك منها؟
تخيل إنك بدك تلاقي معلومة معينة بملف شغل مليان أوراق، هالورقة بتساعد الباحثين يصمموا برامج تقدر تدور بسرعة وتلاقي الجواب بدون ما تقرأ كل شي. يعني ممكن تستفيد من تطبيقات بتساعدك تلاقي مستنداتك بسرعة بالمكتب أو حتى ببيتك. هالشي رح يخلّي الشغل أسرع وأقل تعب.
benchmark agents document reasoning LLM workplace hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

التعلم المشترك للقواعد التجريبية والسياسات للـ LLM Agents

Joint Learning of Experiential Rules and Policies for Large Language Model Agents
الفريق Ye و Yu قدموا طريقة جديدة اسمها JERP لتقوية سلوك الـ LLM Agents اللي بيشتغلوا ببيئات تفاعلية متعددة الخطوات. الفكرة إنّه بنجمع القواعد التجريبية من التجارب السابقة وبنحدّثها مع السياسة (policy) بنفس الوقت، بحيث لما الوكيل يقرر بيستدعي القواعد المناسبة ويضيفها لتاريخه. بعد كل حلقة، بنستغل المسارات اللي جمعناها لتدريب السياسة وتعديل مجموعة القواعد عبر مقارنة النتائج بالمسارات الناجحة. التجارب على AlfWorld وWebShop ورّجت إنّ JERP يرفع الأداء بشكل ثابت.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء يتعلموا أسرع ويقعدوا ثابتين مع تغيّر المهام.
🌱 شو إلك منها؟
تخيّل إنك عم تتعلم شغلة جديدة، وكل مرة بتجرب فيها بتكتب ملاحظات تساعدك بالمرة الجاية. هالنظام بيعمل هيك للبرامج اللي بتساعدك على الإنترنت، يعني كل مرة بتتعلم من أخطائها وتضيف ملاحظات لتكون أذكى. ممكن تشوف التحسين هاد بأدوات التسوق أونلاين أو ألعاب التدريب.
LLM agents reinforcement learning rule learning multi-step interaction arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

BioMatrix: نموذج أساسي حيوي متعدد الوسائط

BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language
الفريق اللي بيضم Qizhi Pei وزملاؤه قدموا BioMatrix، أول نموذج أساس حيوي بيدمج السلاسل، البُنى، واللغة الطبيعية للمولكولات والبروتينات بكل بساطة داخل معماريّة decoder‑only وحدة. بيحوّل كل هالوسائط لمساحة رموز مشتركة عبر نظام tokenization موحد، فبدون مشغلات خارجية أو رؤوس مخرجات خاصّة. النموذج مبني على Qwen3 (1.7B و4B) وتدرب على 304.4 مليار رمز من نصوص، سلاسل، وبُنى، وكمان بيانات تفاعلية بين المولكولات والبروتينات. بعد ما ضبطوه على 80 مهمة، وصل لأداء state‑of‑the‑art أو تنافسي بـ77 مهمة، يعني نموذج واحد بيقدر ينافس الطرق المتخصصة.
ليش بتهمّك؟: BioMatrix بيخلّي الباحثين يشتغلوا على كل مهام البيولوجيا بحلّ واحد، بيوفر وقت وجهد كبيرين لتطوير أدوية وفهم البروتينات.
🌱 شو إلك منها؟
تخيّل إنك عم تحكي مع برنامج يقدر يكتب لك وصفة دواء أو يتوقع شكل بروتين من غير ما تحتاج تدخل برامج مختلفة. هالبرنامج بيستعمل نفس الطريقة اللي بنستعملها لكتابة رسائلنا، فبيسهل على الأطباء والباحثين يلاقوا حلول أسرع. ممكن تشوف تأثيره قريباً في تطبيقات صحية على الموبايل أو المواقع اللي بتساعدك تفهم أدويةك بشكل أبسط.
multimodal foundation model bioinformatics protein molecules hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

نموذج اللغة المتدرج (TLM) بوزن مفتوح

Toward Open Weight Models Without Risks: Separating Public and Private Capabilities in LLMs
الباحثين قدموا فكرة نماذج اللغة المتدرجة (Tiered Language Models) اللي بتخلّي وزن واحد للـLLM يشتغل بأكثر من مستوى قدرة. بالوضع العام النموذج بيشتغل زي أي LLM تقليدي، وبإضافة مفتاح سري صغير بيغيّر جزء بسيط من المعاملات وبيفتح قدرات إضافية مثل لغة جديدة أو معرفة خاصة. هم درّبوا نماذج 180M و650M من هالنوع، وأظهروا إن المفتاح بيسمح للنسخة الخاصة تتعلّم تعليمات أو تحفظ معلومات خاصة بدون ما يبين هالشي للنسخة العامة. الطريقة كمان بتصعب استخراج القدرات عبر تعديل النموذج أو سرقة المفتاح الجزئي.
ليش بتهمّك؟: هالطريقة بتعطي الباحثين والشركات فرصة يطلقوا نماذج وزنها مفتوح مع التحكم بالقدرات الحساسة، فبتقلل مخاطر الاستغلال.
🌱 شو إلك منها؟
تخيّل عندك برنامج ترجمة أو مساعدة ذكية، بس الشركة بدها تخلي بعض الخصائص مثل معرفة معلومات سرية متوفرة بس للمشتركين المدفوعين. بهالطريقة، المفتاح السري بيشتغل كأنه مفتاح بيت يفتح باب خاص داخل البرنامج، وما حدا غير المشترك عنده القدرة يفتح هالباب. فلو شفت تطبيقات جديدة بتعطي خدمات إضافية للمشتركين من غير ما يخلوا الكود كله مفتوح، هالشي ممكن يكون نتيجة لهالفكرة.
LLM open-weight safety tiered key-based hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

جدولة البيانات الشمولية لتدريب LLM عبر التعلم المعزز المتعدد الأهداف

Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning
الفريق اللي بيقوده Chenhao Dang وزملاؤه بيقدّموا طريقة جديدة اسمها Holistic Data Scheduler (HDS) لتعديل مزيج البيانات أثناء تدريب نماذج اللغة الكبيرة. الطريقة بتحوّل اختيار البيانات لمشكلة تعلم معزز وبتستعمل خوارزمية Soft Actor-Critic لتستكشف سياسات التحكم المستمر بثبات. المكافأة فيها ثلاث وجهات: جودة البيانات، تأثير الخسارة بين المجالات، ومعايير وزن النموذج. التجارب على The Pile أظهرت إن HDS يوصّل لنفس الدقة بعدد تدريبي أقل بـ44% ويقّدم تحسين 7.2% على اختبار MMLU بدون شوت.
ليش بتهمّك؟: هالطريقة بتقلل وقت وتكلفة تدريب نماذج اللغة الكبيرة وتخلّي النماذج أقوى بنفس الجهد.
🌱 شو إلك منها؟
تخيّل إنك عم تتعلم لغة جديدة، بس مع كل درس تختار المواد اللي بتفيدك أكتر حسب مستواك. هالطريقة بتعمل نفس الشي مع الذكاء الاصطناعي، يعني بتختار البيانات اللي تحسّن النموذج أسرع. النتيجة إن التطبيقات اللي بنستعملها يوميًا، مثل المساعدات الصوتية أو الترجمة، ممكن تصير أسرع وأدق بوقت أقصر.
LLM reinforcement learning data scheduling multi-objective hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

ChartWalker: معيار لتحدي الـ RAG عبر المخططات

ChartWalker: Benchmarking the Cross-Chart RAG Task
الفريق قدم ChartWalker، إطار جديد بيبني مهام RAG عبر المخططات. إشي بيستعمل طريقة بناء knowledge graph هرمية بتنظم الكيانات والعلاقات حسب الدقة، وبعدين عينة بنظام structure‑aware لتوليد أسئلة من خطوات متعددة مع تحكم بصعوبة السؤال. النتيجة مجموعة ChartWalker‑Bench اللي فيها أسئلة من مجالات علمية، تجارية وسياسية، وبتبين إن الأنظمة الحالية ما بتقدر تتعامل مع هالتحديات.
ليش بتهمّك؟: هالمعيار بيسمح للباحثين يبنوا نماذج أكتر فهماً للرسوم البيانية المعقدة.
🌱 شو إلك منها؟
تخيل إنك عم تحلل تقرير فيه رسومات بيانية كتيرة، هالتقنية بتخلي الكمبيوتر يربط بين الرسوم ويعطيك إجابة واضحة من غير ما تحتاج تقرأ كل شي. يعني إذا بدك تشوف كيف مبيعات شركة تغيرت عبر فترات مختلفة، ممكن تستفيد من أدوات بتستعمل ChartWalker لتفهم العلاقات بين المخططات بسهولة.
RAG benchmark knowledge graph multi-modal QA hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

لما الجمع بين نماذج اللغة بيكون مفيد؟ حدّ أقصى للنجاح المشترك

When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models
الفريق بقيادة Josef Chen درس كيف إنه أنظمة الـLLM المتعددة مثل routing, voting, cascades, fusion و mixture-of-agents ما بتعطي تحسين غير محدود. لقوا إنه الدقة ما بتتعدّى 1‑beta، وين beta هو نسبة إنه كل النماذج بتغلط على نفس السؤال. هالحد ما بيظهر بالمعايير التقليدية مثل متوسط الارتباط الزوجي rho، وبيحتاجوا لتقنية Clopper‑Pearson لتقدير beta بثقة. من خلال تحليل 67 نموذج من 21 مزوّد، اكتشفوا إنه الجمع بين النماذج نادراً ما بيتفوق على أحسن نموذج لحاله إلا إذا كان فيه إشارة توجيه قوية على مستوى السؤال.
ليش بتهمّك؟: هالنتيجة بتوضح إنه إضافة نماذج أكتر ما رح يضمن تحسين إذا ما كان في تنوع حقيقي بالأخطاء.
🌱 شو إلك منها؟
يعني إذا عم تستخدم تطبيق بيجمع إجابات من عدة نماذج، ما رح تشوف فرق كبير إلا إذا كل نموذج بيغلط بأشياء مختلفة. زي ما لو عندك مجموعة أصدقاء كلهم بيغلطوا بنفس الخطأ، ما رح يساعدك إنك تسألهم كلهم. هالشي ممكن يبين لك ليه بعض الخدمات الذكية ما تحسّن الأداء بس لأنّها بتستند على أكثر من نموذج بنفس الأخطاء.
LLM ensemble routing evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

متى تكون الإجابات المتوقعة صحيحة؟ دراسة احتمال السلسلة وصحتها في LLMs

When are likely answers right? On Sequence Probability and Correctness in LLMs
الفريق Zenn و Geiping فحصوا العلاقة بين احتمال السلسلة وصحة الإجابة عبر طرق فكّ الشيفرة، الإعدادات، وأزواج السؤال‑الإجابة بالمجموعات. لقوا إن احتمال السلسلة العالي غالبًا بيدل على صحة الجواب داخل مجموعة ثابتة، بس هالعلاقة ما بتستمر إذا غيرنا طريقة فكّ الشيفرة أو إعداداتها. كمان، احتمال السلسلة ما بيكون مؤشر موثوق لجودة الردود المتكررة لنفس السؤال. النتائج بتوضح إمتى فكّ الشيفرة ممكن يحسّن الدقة وإمتى ما بيستاهل.
ليش بتهمّك؟: هالنتائج بتساعدنا نختار طرق فكّ الشيفرة الصح لتقليل الأخطاء في التطبيقات العملية للـLLMs.
🌱 شو إلك منها؟
يعني لو عندك برنامج يكتب لك إجابات، ما يعني إنه الجملة اللي بتظهر أكتر مرات أو بتكون أكثر احتمالية هي دايمًا الصح. زي ما بنقّلب على سؤال بإنستغرام، مرات اللي بيطلع أكتر تعليق ما بيكون هو الصح. لازم ننتبه ونستعمل طرق تانية للتأكد من صحة الجواب، مش بس نعتمد على “الأكثر شيوعًا”.
language models decoding correctness probability arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

Ask, Don't Judge: تقييم LLM بأسئلة ثنائية

Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement
الباحثين قدموا BINEVAL، إطار بيقسم معايير تقييم الـ LLM لسلسلة أسئلة ثنائية بسيطة وبعدين يجمع الإجابات لدرجات متعددة الأبعاد. كل سؤال بيتولد بواسطة meta‑prompt والـ LLM بيجاوب عليه لحاله، فبنحصل على ملاحظات شفافة على مستوى كل سؤال مع درجات calibrated للنتيجة الكلية. التجربة على مجموعات SummEval، Topical‑Chat وQAGS ورّيت إن BINEVAL يساوي أو يتفوق على UniEval وG‑Eval، خصوصاً بموضوع التناسق الواقعي.
ليش بتهمّك؟: BINEVAL بيسهّل علينا نفهم ليش الـ LLM عم يطلع نتيجة معينة وبيخلينا نطور الـ prompts بسرعة أكبر.
🌱 شو إلك منها؟
تخيل إنك عم تكتب ملخص أو رد على سؤال، وبدل ما تنتظر تقييم بشري ياخد وقت، البرنامج يعطيك ملاحظات واضحة على كل نقطة. هالطريقة بتشبه لما تسأل صديق كل سؤال لحالو لتعرف رأيه بالتفصيل. هالشي ممكن تشوفه بأدوات كتابة المحتوى أو تطبيقات المساعدين الذكيين اللي بتستخدم تقييمات تلقائية لتحسين جودة النص.
LLM evaluation interpretability prompting benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

InvestPhilBench: بنشمارك جديد لتقييم تفكير المستثمرين بالـ LLM

InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy
المؤلفين Mingguang Chen و Bo Qu قدموا InvestPhilBench، بنشمارك متعدد الطبقات بيقيس كيف النماذج الكبيرة بتفهم وتطبق خطوات اتخاذ القرار عند المستثمرين الخبراء. البنشمارك فيه ٨ مستويات من تحديد المبادئ لحد استنتاج أطر جديدة، مع 118 بطاقة مبدئية، 25 بطاقة أطر قرار، و243 سؤال. عشان يقيموا الأداء، حطوا نظام تقييم آلي BASP فيه خمس مقاييس، وبروتوكول كشف الأخطاء FMDP، وكمان مقياس GRA لتدقيق خطوات التفكير. التجربة الأولية أظهرت إن النماذج الكبيرة بتكتب نصوص بطلاقة لكن بتضلّ عندها فجوة بإتقان الإجراءات.
ليش بتهمّك؟: هالبنشمارك بيساعدنا نعرف إذا الـ LLM فعلاً بيقدر يتبع خطوات استثمارية دقيقة ولا بس بيكتب كلام حلو.
🌱 شو إلك منها؟
تخيل إنك عم تستشير برنامج ذكي لتختار أسهم، هالبنشمارك بيأكد إن البرنامج ما بيغلط بخطوات التحليل، زي ما تتأكد إن الشيف بيتبع الوصفة خطوة بخطوة. إذا البرنامج بيشتغل صح، رح يقدملك نصائح استثمارية موثوقة. يعني ممكن تشوف تحسين بخدمات الاستشارة المالية اللي بتستخدم الذكاء الاصطناعي.
benchmark procedural reasoning investment LLM evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

آلية Process Harness لرفع الأنظمة القديمة إلى Agentic BPM

A Process Harness for Uplifting Legacy Workflows to Agentic BPM: Design and Realization in CUGA FLO
الفريق تبع Fabiana Fournier و Lior Limonad قدموا آلية جديدة اسمها Process Harness، بتخلي الأنظمة القديمة تشتغل مع طبقة ذكية من الوكلاء بدون ما نبدل محرك سير العمل الأصلي. الآلية بتضيف ثلاث وكلاء – TaskAgent، DecisionAgent، و FlowAgent – كل واحد بيشتغل بنقطة تحكم معينة وبيستند لسياسة موحدة اسمها FRAME. النموذج اسمه Task-Decision-Flow (TDF) بيحدد كيف توزع التفكير على الوكلاء وتنفذ التعديلات أثناء تشغيل العملية. جربوا الفكرة على مثال موافقة قرض، وبيّنوا كيف الوكلاء يقدروا يضيفوا تفكير وتكيّف مع الحفاظ على قواعد العملية.
ليش بتهمّك؟: هالطريقة بتخلينا نطوّر الأنظمة القديمة بذكاء بدون ما نعيد بناء كل شي من الصفر.
🌱 شو إلك منها؟
تخيّل إنه برنامجك القديم يقدر يطلب نصايح من ذكاء اصطناعي ويعدل قراراته لحظة بلحظة، زي ما بنستشير صديق قبل ما نقرر. هالشي بيساعد الشركات تسرّع إجراءات مثل طلب قرض أو موافقة على طلبات، وبتشوفه أكتر بالأنظمة البنكية أو الخدمات اللي بتعتمد على نماذج قديمة.
agentic BPM workflow LLM process harness TDF arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

ReNIO: وزن جديد للخطأ لتحسين تقطير نماذج اللغة الكبيرة

ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation
الفريق Chen Lin وزملاؤه قدموا طريقة ReNIO لتقوية عملية التقطير اللي بيشتغل على نماذج اللغة الكبيرة. الفكرة إنهم بيعطوا وزن أكبر للنتايج اللي فيها أخطاء، لأن الأخطاء بتظهر نقاط التفكير اللي النموذج ما عرف يوصل لها. الطريقة بتعتمد على نسبة احتمال الطالب للمعلم، وما بتحتاج تشوف الجواب النهائي، فبتحافظ على ميزة التدريب بالبادئة. التجارب على مسائل رياضية وتوليد كود ورّيت تحسينات وصلت لـ 8.9% و10% على نماذج Qwen3-1.7B وR1‑Distill‑Qwen‑7B.
ليش بتهمّك؟: هالطريقة بتخلي نماذج الذكاء الاصطناعي تتعلم من أخطائها وتطلع بأداء أحسن في حل المسائل.
🌱 شو إلك منها؟
تخيل إن برنامج الذكاء الاصطناعي بيغلط بحل مسألة، بدل ما يتجاهل الخطأ، هو بيتعلم منه ويصير أحسن. هالشي يعني إن التطبيقات اللي بتعتمد على الذكاء، مثل المساعدات الرقمية، رح تعطي إجابات أدق وأقرب للإنسان. ممكن تشوف التحسينات هادي في أدوات كتابة الكود أو حل الواجبات.
distillation LLM reasoning OPD code generation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

Counsel: مجموعة بيانات لتقييم الوكلاء

Counsel: A Meta-Evaluation Dataset for Agentic Tasks
الفريق قدموا Counsel، أول مجموعة بيانات عامة لتقييم كيف الوكلاء بيتعاملوا مع مهام معقّدة. المجموعة فيها نقد من LLM-as-a-judge على خطوات الوكلاء في benchmarkين: tau-bench لوكلاء دعم العملاء وDA-Code لوكلاء البرمجة، وكمان تقييمات بشرية للنقد. الباحثين صنّفوا النقد حسب إذا كان على المكان الصح أو إذا كان reasoning ضعيف، ولقوا إنه judges أقوى بيفهموا أحسن. هالبيانات مفتوحة ومسموح فيها للكل يشتغل عليها لتقوية تقييم الوكلاء.
ليش بتهمّك؟: المجموعة بتساعدنا نطوّر judges ذكيين يقيّموا الوكلاء بدقة بدون ما نضطر ننتظر ساعات من التعليقات البشرية.
🌱 شو إلك منها؟
تخيل إنه عندك برنامج بيساعدك بحل مشاكل الزباين أو يكتب كود، هالمجموعة بتخلّي التقييم يكون أسرع وأدق، يعني رح تشوف خدمات ذكية بتشتغل بلا أخطاء كثير. هالتحسين ممكن يطلع على تطبيقات الدعم الفوري أو أدوات البرمجة اللي بتستعملها يوميًا.
evaluation agents dataset LLM meta-evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

AOHP: نظام تشغيل يخلّي الوكلاء أبطال

AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction
شوفوا كيف فريق الباحثين قدم AOHP، نظام تشغيل مبني على Android Open Source Project، بيخلي الوكلاء يتصرفوا كأنهم جزء أساسي من النظام. النظام بيسمح بواجهة مخصصة، تكاليف تنفيذ أقل بكتير، وبيحافظ على أمان المعلومات. التجارب الأولية أظهرت تحسين بنسبة 21.12% في إكمال المهام وتخفيض 51.55% بتكلفة الـ token. هالشي بيفتح باب لتطبيقات أكثر أمان وسرعة للذكاء الاصطناعي على الموبايل.
ليش بتهمّك؟: لأنه بيقلل استهلاك الموارد وبيعطي أمان أعلى لتطبيقات الذكاء الاصطناعي، بيسمح للمطورين يطلقوا خدمات أكثر فاعلية.
🌱 شو إلك منها؟
تخيل إنه عندك مساعد ذكي على الموبايل يقدر يفتح التطبيقات، يجمع معلومات، ويعمل كل هالشي بسرعة وبأمان، بدون ما يستهلك بطارية ولا يعرّض بياناتك للخطر. هالمساعد بيشتغل داخل نظام التشغيل مباشرةً، يعني كل شيء بيصير أسرع وأسهل، وبيخليك تستفيد من الذكاء الاصطناعي بحياتك اليومية.
agents OS security efficiency open-source hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

QG-MIL: مجمع Transformer gated لتعلم متعدد الأمثلة في التصوير الطبي

QG-MIL: A Gated Transformer Aggregator for Domain-Agnostic Multiple Instance Learning in Medical Imaging
هالورقة قدمت QG-MIL، مجمع مبني على Transformer gated بيحافظ على توازن الانتباه بين العينات الطبية. استخدموا أربع مكوّنات: RMSNorm pre‑normalization، per‑head QK normalization، gating للـ attention output، ووحدات feed‑forward بنمط SwiGLU. التجارب على ستة benchmarks من صور الشرائح المرضية وخلايا الدم ورّيت إنه QG‑MIL حسّن المتوسط الماكرو F1 بـ 6.1 نقطة مقارنة بأفضل الطرق. كمان بيّنوا إنه الانتباه صار موزّع أكتر بدون أي خسائر إضافية أو تنظيمات معقّدة.
ليش بتهمّك؟: بتقليل تركّز الانتباه، النموذج بيعطي تشخيصات أكثر استقرار وثقة للطبّيين.
🌱 شو إلك منها؟
بساعد برامج تحليل صور الأشعة تعطي نتائج أدق وما بتغلط كتير. زي ما بنوزّع الضوء عالصورة بدل ما نركزه بنقطة وحدة، بيصير الفحص أشمل. ممكن تلاقي هالتحسين بالمواقع اللي بتستعمل تحليل صور المرضى لتحديد الأمراض بسرعة.
MIL transformer medical imaging attention benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

LISA: توافق درجة الاحتمال لتوليد بصري قابل للتحكم

LISA: Likelihood Score Alignment for Visual-condition Controllable Generation
الفريق قدم طريقة جديدة اسمها LISA لتقوية الشبكة الجانبية اللي بتتحكم بالصور والفيديوهات حسب شرط بصري. الفكرة إنه بيتم ربط مميزات هالشبكة بدرجة احتمالية تقريبية عبر ديكودر خفيف، وبنضيف خسارة تنظيمية للـ training. التجربة أظهرت إنه التدريب بيصير أسرع والنتائج النهائية أحسن، وكل هاد بدون ما يضيف عبء على وقت الاستنتاج.
ليش بتهمّك؟: هالطريقة بتسرّع تدريب نماذج التوليد البصري وبتحسّن جودة المخرجات بدون تكلفة إضافية وقت الاستخدام.
🌱 شو إلك منها؟
مع LISA، التطبيقات اللي بتولد صور أو فيديوهات حسب طلبك رح تصير أسرع وتطلع بنتائج أوضح. يعني لو حابب تعمل صورة مخصصة بسرعة، هالتقنية رح تخلي العملية أسهل وأقرب للوقت الحقيقي. ممكن تلاقي أثرها بأدوات تعديل الصور أو إنشاء محتوى للوسائط الاجتماعية.
diffusion controllable generation visual generation training efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

تحسين LLMات عبر التعلم المعزز بدون حلول أرضية

Reinforcement Learning without Ground-Truth Solutions can Improve LLMs
الفريق قدم إطار اسمه RiVER بيخلّي تدريب نماذج اللغة الكبيرة على مهام تحسين بالنتيجة (score) يشتغل حتى لو ما في حلول صحيحة معروفة. الطريقة بتستعمل ملاحظات تنفيذ حتمية كإشراف مستمر، وبتعالج مشكلتين مهمتين: سيطرة حجم المكافآت غير المتناسقة وتكرار حلول ضعيفة بتغلب حلول أقوى نادرة. عن طريق تعديل المكافآت بطريقة مقارنة بين العينات والتركيز على أعلى المتصدرين، RiVER قدر يرفع أداء موديلات Qwen3-8B وGLM-Z1-9B-0414 على اختبارات ALE‑Bench وLiveCodeBench وUSACO.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج الكود تتعلم من مسابقات البرمجة حتى لو ما في مفاتيح الحل، فبتصير أقوى وأدق بكتير.
🌱 شو إلك منها؟
تخيل إنه برنامج كتابة الكود عندك يقدر يتطور من غير ما يحتاج لقاعدة حلول جاهزة، يعني كل ما تشوف كود يشتغل صح، هو بيتعلم من هالتجربة. هالشي بيساعد المطورين يلاقوا حلول أسرع وأدق، وممكن تلاقيه قريباً بأدوات كتابة الكود أو المساعدات الذكية على الإنترنت.
reinforcement-learning code-generation ranking reward-calibration LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 7
reinforcement learning
تعليم الذكاء الاصطناعي من خلال نظام الحوافز والعقوبات، زي لما تعلمي طفل بالمكافأة والعقاب عشان يتعلم السلوك الصحيح. بنستخدمه عشان الآلة تتعلم تاخذ قرارات ذكية بنفسها من غير ما نحطّ كل إجابة جاهزة.
LTM
الذاكرة طويلة المدى، يعني معلومات بتضل مخزنة لفترة طويلة، احنا بنحتاجها عشان النموذج يقدر يتذكر سياق طويل
STM
الذاكرة قصيرة المدى، بتخزن معلومات لفترة قصيرة، بتساعد النموذج يركز على النص الحالي مش كل شي
chain-of-thought
chain-of-thought يعني بنطلب من الموديل يفكر بصوت عالي ويحكيلنا خطواته قبل ما يعطي الجواب، وهاد إشي بيحسّن دقة الإجابات كتير خصوصاً في المسائل اللي بدها تفكير.
multimodal
النموذج بيقدر يتعامل مع أكتر من نوع بيانات، مثل النص والصورة مع بعض، هالشي بيسمح له يفهم إشي أكتر تعقيداً
visual grounding
ربط الكلمات والمصطلحات بالأشياء الفعليّة في الصور، يعني النموذج بيقول 'الجسم الأزرق ده هو الكرسي'. بنسمع عنها عشان بتساعد النموذج يفهم إشي فعلاً وين موجود في الصورة.
agentic
مفهوم بيوصف نظام أو نموذج بيقدر يتصرف بشكل مستقل ويخطط للخطوات، مش بس يتبع أوامر
🤖 موديلز 4
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
GRPO
نموذج حديث بتقنية RL متطوّرة بتساعد النموذج يتعلّم بكفاءة أعلى وأسرع. هو بيركّز على الجودة في كل خطوة تدريب، عشان كذا بينتج إجابات أفضل بموارد أقل.
AdaLN
طبقة Adaptive Layer Normalization، بتعدل طريقة تطبيع الطبقات حسب السياق، عشان تحسين الأداء
reasoning models
نماذج بتشتغل على الاستدلال، يعني بتفكر وتستنتج حلول من المعلومات المعطاة، بدنا نستخدمها لتطبيقات بحاجات منطقية
📏 مقاييس 2
benchmark
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
accuracy
مقياس بيقيس نسبة الإجابات الصحيحة من إجمالي الأسئلة، عشان نعرف قديش النموذج دقيق
🗂️ بيانات 1
BRIGHT benchmark
مجموعة بيانات بنستعملها عشان نقيم النماذج، بتختبر قدرة النموذج على حل أسئلة معقدة وإشي بنقيس فيه الأداء
كل المصطلحات ←
العدد السابقشو في AI؟ | تجميع الأسبوع 27 يونيو — نمذجة عالم داخل السياق وتحكم روبوتي
📚 كل الأعداد