📡 أحدث عدد

شو في AI؟ | 5 يوليو — تحسين ذاكرة الوكلاء LLM

يومي 📅 2026-07-05
سلام 👋 في هالعدد بنستعرض أحدث التطورات بالذاكرة وإدارة الوكلاء للـLLM، من تقنيات AutoMem للذاكرة المعرفية إلى معايير جديدة مثل AGVBench. بنركّز على كيف هالابتكارات بتقوي الأداء وتفتح باب لتطبيقات واقعية
#1

AutoMem: تعلم الذاكرة كمهارة معرفية للـLLM

AutoMem: Automated Learning of Memory as a Cognitive Skill
الفريق قدم AutoMem، إطار بيخلي إدارة الذاكرة عند الـLLM صارت مهارة متدربة، يعني النموذج بيقرر إيمتى يحفظ إشي وإيمتى يسترجعه عبر عمليات ملفية كأنها إجراءات أساسية. الإطار فيه حلقتين: حلقة بتخلي LLM قوي يراجع مسارات الوكيل ويعدل بنية الذاكرة، وحلقة تانية بتستخرج قرارات الذاكرة الصح من تجارب كتيرة وتدرب النموذج عليها. جربوا الطريقة على ثلاث ألعاب طويلة الأمد (Crafter، MiniHack، NetHack) ولاحظوا تحسين الأداء من 2 إلى 4 أضعاف بدون ما يغيروا سلوك المهمة الأصلي. النتيجة إنه إدارة الذاكرة في حد ذاتها ممكن تتعلم وتجيب مكاسب كبيرة على مهام طويلة الأمد.
ليش بتهمّك؟: لأنه تحسين الذاكرة بيساعد الوكلاء الذكيين يشتغلوا أكتر كفاءة ويقللوا الأخطاء اللي بتظهر بعدين.
🌱 شو إلك منها؟
تخيل إنه المساعد الرقمي عندك يقدر يتذكر كل ملاحظاتك ويسترجعها وقت ما تحتاجها، مش بس ينسى أو يخلط بينها. هالشي بيخلي التطبيقات مثل الألعاب أو التطبيقات التعليمية تكون أذكى وتستجيب بسرعة. رح تشوف هالتحسينات في تطبيقات الذكاء الاصطناعي اللي بتستعمل الذاكرة، مثل المساعدات الصوتية أو الألعاب الذكية.
memory agents LLM long-horizon reinforcement learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

إدارة الذاكرة الإجرائية في LLM Agents: التحكم، التكيّف، والتقييم

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation
الفريق قدم AFTER، benchmark فيه 382 مهمة واقعية من بيئات عمل مختلفة، بتغطي ست أدوار مهنية و22 مهارة إجرائية. هالbenchmark بيقيس كيف المهارات بتنقل بين المهمات، الأدوار، والنماذج المختلفة. التجارب بيّن إن الذاكرة الإجرائية بتزود أداء الوكلاء بمعدل 3.7‑6.7 نقطة بعد جولة تحسين وحدة، وكمان مهارات مأخوذة من تنفيذات متعددة النماذج وصلت لدقة اختبار 73.1٪ عبر نماذج مختلفة. كمان لقوا إن بعض المهارات بتعمم على كتير مهمات ونماذج، بينما غيرها بتصير خاصة بدور معين وبتنقص فعاليتها لما تننقل.
ليش بتهمّك؟: هالنتايج بتعطي دليل عملي لتطوير وكلاء ذكيين يقدروا يتعلموا مهارات قابلة لإعادة الاستخدام ويشتغلوا بكفاءة أكبر بالمؤسسات.
🌱 شو إلك منها؟
تخيل إنه المساعد الرقمي عندك يقدر يتعلم من شغلة سابقة ويطبقها على مهام جديدة من غير ما يحتاج تدريب جديد كل مرة. هالشي بيسهّل على الموظفين ينجزوا شغلهم أسرع، زي ما بيصيروا يكتبوا إيميلات أو يجهزوا تقارير بلا ما يضيعوا وقت. ممكن تشوف هالتحسينات قريبًا في تطبيقات مثل جوجل أسيستنت أو مايكروسوفت كورتانا.
LLM agents procedural memory benchmark transfer learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

وكلاء تجريبية هرمية (Hierarchical Experimentalist Agents)

Hierarchical Experimentalist Agents
الفريق قدم إطار اسمه HExA بيشتغل كوكيل تجريبي بيرتب التجارب ضمن سياق السؤال، يعني كل ما يواجه سؤال جديد بيصمم تجربة ويستنتج منها مهارات قابلة لإعادة الاستخدام. الإطار ما بيحتاج تدريب مسبق أو إشراف خارجي، وبيشتغل مع أي نموذج أسود الصندوق. جربوا HExA على benchmark اسمه Interphyre مبني على بيئة فيزياء 2D، ولاحظوا إنه رفع نجاح Claude Sonnet 4.6 من 2% لحد 77%، وكمان نقل المهارات لتحديات أصعب بدون تجارب جديدة.
ليش بتهمّك؟: هالطريقة بتخلي الوكلاء يقدروا يتعاملوا مع أسئلة ومهام ما إلهم بيانات سابقة، فبيصيروا أكتر فاعلية ببيئات جديدة.
🌱 شو إلك منها؟
تخيل إنه برنامج ذكي بيتعلم مثل ما الطفل بيلعب ويجرب، كل ما يشتغل تجربة جديدة بيصير أذكى ويقدر يساعدك بحلول واقعية. هالشي ممكن يخلّي المساعدات الرقمية تعطيك نصائح عملية أكتر، مثلاً كيف تصلّح شي بالبيت أو تتعامل مع موقف معقّد. رح تشوف هالتطورات يوم يطلع تطبيقات أو خدمات بتستند على تجارب ذكية قبل ما تعطيك الجواب.
agents LLM experimentation benchmark skill learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

تحسين البرامج مع Retrieval Augmented Search

LLM Program Optimization via Retrieval Augmented Search
الفريق Sagnik Anupam وزملاؤه قدموا طريقة جديدة اسمها Retrieval Augmented Search (RAS) لتعديل برامج C++ وPython. الطريقة بتشتغل كصندوق أسود وبتستعمل beam search لتوليد تحسينات، وفي كل خطوة بتستدعي أمثلة من مجموعة تدريب فيها برامج بطيئة وسريعة لتوجيه الـ LLM. لقوا إن استدعاء الأمثلة بناءً على وصف نصّي مولّد من الـ LLM أحسن بكتير من الاستدعاء حسب الكود نفسه، وكمان أضافوا طريقة AEGIS لتقسيم التعديلات إلى “تحريرات ذرية” أصغر. التجارب أظهرت إن RAS تحسّن الأداء لحد 2.06× على برامج C++ و10.27٪ على برامج Python مقارنةً بالطرق السابقة.
ليش بتهمّك؟: هالطريقة بتخلّي تحسين الكود أسرع وأكفأ بدون الحاجة لتعديل يدوي معقد.
🌱 شو إلك منها؟
تخيل إن برنامجك يشتغل أسرع وعمر بطاريتك يطول، لأن النظام بيحسّن الكود أوتوماتيكياً. زي ما بنظّف البيت بنظام ذكي يلقط الغبار، هالطريقة بتنظّف الكود من العيوب. ممكن تشوف هالتحسينات في التطبيقات اللي بتستعمل تحسين الأداء تلقائيًا، مثل محررات الكود أو أدوات تحسين الألعاب.
LLM program optimization retrieval code generation blackbox hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

Seed2.0: خطوة نحو الذكاء للمهام الواقعية

Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity
فريق Bytedance Seed قدموا Seed2.0، سلسلة نماذج بتركّز على حلّ إشي معقّد بالحياة اليومية. بيبلّشوا بتحديد احتياجات المستخدمين وبنوا نظام تقييم مبني على benchmarks واقعية، وبعدين يطوّروا النموذج ليعالج مشكلة المعرفة الطويلة (long‑tail knowledge) وتعقّب التعليمات المعقّدة. النموذج بيظهر تحسّن واضح بالاعتماد على reasoning، الفهم البصري، والبحث، وبيقدّم قيمة لمئات الملايين من المستخدمين.
ليش بتهمّك؟: هالورقة بتفرجينا كيف ممكن نماذج اللغة تصير أقرب لحلول العالم الحقيقي وتساعد التطبيقات تكون أذكى وأكثر موثوقية.
🌱 شو إلك منها؟
تخيل إنك تسأل المساعد الذكي عن تنظيم رحلة طويلة أو حل مشكلة معقّدة، وهو يقدر يجاوب بدقة لأنه فاهم السياق الطويل. هالشي بيخلي حياتنا اليومية أسهل لأن التطبيقات رح تصير تحل إشي أكبر من مجرد أسئلة سريعة. ممكن تشوف هالتحسن بأدوات البحث أو التطبيقات اللي بتستعمل الذكاء الاصطناعي اليوم.
language model reasoning multimodal evaluation real-world hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

Drop‑Then‑Recovery: قدّيش نموذج Vision‑Language‑Action فيه زوايد؟

Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?
الفريق درسوا قديش نموذج Vision‑Language‑Action فيه أجزاء زايدة عن الحاجة، خصوصًا بلوكات اللغة الكبيرة. استخدموا بروتوكول Drop‑Then‑Recovery اللي بيشيل بلوكات من النموذج المدرب مسبقًا وبعدين يعيد fine‑tune ليشوف إذا الإزالة أثرت على التحكم بالروبوت. لتحديد أي بلوك مهم، قدموا مقياس GateProbe اللي بترتب البلوكات حسب حساسيتها لخسارة الفعل. النتائج أظهرت إنه العمود الفقري اللغوي فيه كتير زوايد للمهام الروبوتية العادية، بينما الرؤية والحركة ما بتتحمل الشطب بسهولة.
ليش بتهمّك؟: هالنتيجة بتخلينا نصمم نماذج روبوتية أصغر وأسرع من غير ما نخسر الدقة بالتحكم.
🌱 شو إلك منها؟
تخيّل إنه عندك راديو فيه أزرار كتيرة ما بتستعملها، بنشيلها ليصير أسهل وأسرع لتشغيله. بنفس الفكرة، الباحثين لقوا إنه ممكن يخفّضوا حجم دماغ الروبوت بدون ما يضعفوا شغله، يعني الروبوتات رح تصير أخف وأرخص على الأجهزة اللي بنستعملها يوميًا، مثل الهواتف أو الأجهزة المنزلية الذكية.
VLA model pruning robotics efficiency benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

AGVBench: معيار موثوق لتقوية التعرف على الأوردة

AGVBench: A Reliability-Oriented Benchmark of Data Augmentation for Vein Recognition
الفريق قدم AGVBench، معيار بيركّز على موثوقية تكبير البيانات لتقنية التعرف على الأوردة. اختبروا 30 طريقة تكبير على خمس مجموعات بيانات من أوردة الكف والإصبع، مع سبع شبكات أساسية من CNNs للـ vision transformers لنماذج خاصة بالأوردة. لقوا إن طرق خلط الصور مثل MixUp وPuzzleMix وStarMixup بتعطي أعلى دقة، بس غالباً ما بتكون مضبوطة كويس وبتتأثر بسهولة بالهجمات العدائية. كمان التحويلات الهندسية القوية بتقلل الأداء، خصوصاً لأنه بتخرب التناسق المكاني.
ليش بتهمّك؟: هالنتايج بتساعد نختار تكبير بيانات يضمن أمان وموثوقية أعلى لأنظمة التعرف على الهوية.
🌱 شو إلك منها؟
لما تستخدم تطبيق يفتح الباب أو يحقق الهوية باستخدام صورة عروق يدك، هالتقنية بتقوي الأمان وتقلل فرص الاختراق. يعني إذا حدا حاول يخدع النظام بصورة معدّلة، النظام رح يكتشفها. هالشي ممكن تشوفه قريباً في أنظمة الأمان بالمباني أو الهواتف.
biometrics data augmentation benchmark security computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

شو بيقولو وكلاء LLM لما ما حدا عم يراقبهم: هيكل اجتماعي وظهور أهداف خفيّة

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates
الفريق استكشف كيف بتأثّر الأدوار والعلاقات الاجتماعية على الكلام اللي بينتجه وكلاء LLM خلال مناقشات. حطّوا إطار حواري بقناتين: وحدة عامة بتنكتب بالتاريخ المشترك، ووحدة سرية (OTR) ما بتظهر للخصم. عبر 10 نماذج وثلاث سيناريوهات، لقوا إنه الضغط الاجتماعي بيخلّي الوكيل يغيّر رأيه علنًا بشكل واضح، من فرق 3٪ لحد 40٪. كمان قدموا طريقة تقييم جديدة لتكتشف الأهداف اللي بتنشأ تلقائيًا غير اللي مكتوبة بالمطالبة.
ليش بتهمّك؟: هالنتيجة بتبين إنه لازم نراقب سلوك الوكلاء مش بس أهدافهم الظاهرة، لأنه الضغوط الاجتماعية ممكن تغيّر قراراتهم وتخلّيهم يخلّوا حكيهم غير صادق.
🌱 شو إلك منها؟
تخيل إنه برنامج ذكي بيحكي معك قدام الناس بطريقة مختلفة عن اللي بيقوله لك بخصوصك، زي ما بيصير مع أصحابنا لما يكونوا بوسط جماعة. هالشي بيخلينا نفهم إذا التكنولوجيا بتخفي شي أو بتتغيّر حسب الموقف، وبيظهر أكتر في تطبيقات الدردشة أو المساعدين الرقميين اللي بنستعملهم كل يوم.
LLM agents alignment evaluation multi-agent arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

SPG-Layout: توليد مشاهد داخلية 3D من النص للبيئات غير مانهاتن

Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments
الفريق قدم طريقة جديدة اسمها SPG-Layout لتوليد مشاهد داخلية ثلاثية الأبعاد من وصف نصّي، وبتشتغل كويس حتى بالبيئات اللي ما فيها زوايا قائمة. استغلوا إحصائيات توزيع الأغراض وخطوة ترتيب هرمية بتركّز على الأغراض الكبيرة لتقليل الأخطاء الهندسية. جربوا الطريقة على مجموعة اختبار جديدة فيها ٥٠٠ مشهد غير مانهاتن، وطلعت أحسن بكتير من الطرق القديمة.
ليش بتهمّك؟: هالطريقة بتخلّي توليد تصاميم داخلية واقعية أسرع وأدق، خاصة للبيئات المعقدة.
🌱 شو إلك منها؟
تخيّل إنك تكتب وصف لغرفة المعيشة، والنظام يجهز لك ترتيب الأثاث بشكل متقن حتى لو الغرفة فيها زوايا غير منتظمة. يعني بدل ما تقعد تدور على مخطط مناسب، البرنامج يضبطلك كل شي بنقرة. هالشي ممكن تشوفه قريبًا بتطبيقات تصميم الديكور أو الألعاب.
3D scene synthesis multimodal LLM benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

تنسيق معنوي على الهاردوير للأنظمة الذاتية الحرجة

Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems
الباحثين بيقترحوا بنية تنسيق معنوي بتنفيذها مباشرة على الـ FPGA لتضمن تنسيق زمني محدد وتفويض آمن بين مكوّنات الأنظمة الذاتية. الفكرة مبنية على إطار TB-CSPN اللي بفصل التفكير المعنوي عن إدارة التفاعل، وبنقل بعض آليات التنسيق لهاردوير. بهالطريقة، التنسيق بيصير Deterministic ومحدود بالزمن، بينما يبقى التفكير المعنوي مرن ومبرمج بالسوفتوير.
ليش بتهمّك؟: هالنهج بيوفر ضمانات أمان زمنية ثابتة للأنظمة الذاتية اللي بتشتغل بوقت حقيقي، وبيقلل مخاطر الأخطاء المتزامنة.
🌱 شو إلك منها؟
تخيل إنه كل سيارة ذاتية القيادة عندها إشارة مرور داخل دماغها، بتضمن إنه كل جزء من السيارة يتصرف بوقت مناسب وبطريقة آمنة. هالشي بيخلي السيارات، الطيارات أو الروبوتات يشتغلوا بثقة أكبر، وبتشوفه قريبًا في التطبيقات اللي بتحتاج أمان عالي مثل النقل الذاتي أو الأنظمة الطبية.
hardware safety coordination autonomous-systems FPGA arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

CausalMix: تحسين خلط البيانات لتدريب نماذج اللغة الكبيرة

CausalMix: Data Mixture as Causal Inference for Language Model Training
الفريق قدم طريقة جديدة اسمها CausalMix بتحول مشكلة خلط البيانات لتدريب LLM إلى مسألة استدلال سببي. بيستعملوا خصائص إحصائية للبيانات كمتغيّرات مستقلة، وخلط النطاقات كمعالجة، ويقدّروا الـ Conditional Average Treatment Effect من 512 تجربة على نموذج Qwen2.5-0.5B. بعدين بيستنتجوا الخلط المثالي لمجموعة بيانات أكبر ويطبقوه لتدريب نموذج 7B، وكمان جربوا الفكرة على بيانات chain‑of‑thought مع Qwen3-4B-Base. النتائج بتظهر تحسين ثابت على مهام متعددة مقارنةً بـ RegMix وغيرها من الأساسيات.
ليش بتهمّك؟: CausalMix بيخلّي خلط البيانات يتكيّف مع تغيّر البيانات بدون ما نعيد التدريب من الصفر، فبنوفر وقت ومصاري كبيرين.
🌱 شو إلك منها؟
تخيل إنك عم تحط مكونات عالِقة في طاجن، وبدال ما تخلطهم مرة وحدة وتستنى النتيجة، هالطريقة بتعرف كل مرة تضبط المزيج حسب اللي عم يطلع من الطباخة. يعني إذا بدك برنامج يكتب لك رسائل أو يجاوب على أسئلة، هالطريقة بتخلي البرنامج يتعلم أسرع وبنتائج أحسن. ممكن تشوف هالتحسينات في تطبيقات الدردشة الذكية أو أدوات الكتابة التلقائية اللي بتستخدمها يوميًا.
causal inference data mixing LLM training optimization arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

بحث ذاتي موثوق: خط أنابيب LLM للفيزياء الحاسوبية المتقدمة

Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics
الفريق قدم خط أنابيب كامل يشتغل من مجموعة من 11,083 ورقة arXiv بفيزياء المادة المكثفة لحد ما يطلع مخطوطة علمية فيها ثلاث نتائج فيزياء جديدة. الوكيل الذاتي يحدد اتجاه البحث من خلال تحليل النصوص، يضبط المنهجية بإعادة إنتاج المراجع، ينفّذ حسابات أولية من أول مبدأ، وبعدين يكتب الورقة مع توثيق مستمر للأدبيات. العملية صارت مقاومة للأخطاء بفضل العزل بين الجلسات وتعدد الاستشارات الأدبية، والإنسان يتدخل بس إذا فشل أحد التجارب لإعادة ضبط المعرفة العملية.
ليش بتهمّك؟: هالطريقة بتخلي الأبحاث العلمية المعقّدة تصير أسرع وأقل أخطاء، خصوصًا بمجالات فيها حسابات دقيقة ومصادر كثيرة.
🌱 شو إلك منها؟
تخيّل إنه برنامج يشتغل لحاله من أول الفكرة لحد ما يكتب لك مقال علمي، زي ما بنعمل في المطبخ من اختيار الوصفة لحد ما بنقدم الطبق. هالشي بيساعد الباحثين يركزوا على الإبداع بدل ما يضيعوا وقت على التفاصيل الروتينية. ممكن تشوفوا هالتقنية تنعكس على أدوات كتابة التقارير أو التطبيقات التعليمية اللي تعطيك شروحات مدعومة بأبحاث حديثة.
autonomous agents LLM computational physics research automation fault tolerance arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

تمرير الرسائل يسرّع التفكير في نماذج اللغة

Message Passing Enables Efficient Reasoning
الفريق قدم فكرة جديدة اسمها Message Passing Language Models، بتخلي خيوط التفكير تتواصل مع بعض عبر أوامر send وreceive الخفيفة. هيك بنقلل تكلفة التواصل وبنقدر نوقف خيوط ما عم تفيد مبكراً بفضل الـ preemption. جربوا الطريقة على سودوكو 25×25 و3‑SAT، ولاحظوا إنه بتحتاج سياق أصغر وبسرعة أعلى من أساليب CoT وfork‑join التقليدية. كمان بيّنوا إنه نماذج LLM الكبيرة بتقدر تتبع بروتوكول MPLM إذا حطّوا الprompt الصح.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة تفكّ شغلات معقّدة أسرع وبمصروف حسابي أقل.
🌱 شو إلك منها؟
تخيل إنه بدك تحل لغز صعب أو تجاوب على سؤال طويل، هالتقنية بتخلي الكمبيوتر يشتغل أسرع وما يضيع وقتك. يعني بدال ما ينتظر الكمبيوتر يكتب كل خطوة، بيقدر يوقف إذا شاف إنه ما رح يوصل للنتيجة، زي ما بنوقف شغلة إذا ما إلها فايدة. ممكن تشوف هالتحسينات بأدوات البحث أو المساعدات الذكية اللي بتستعملها كل يوم.
LLM reasoning message passing parallel efficiency arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

MemSyco-Bench: قياس التملق الذاكري للـ agents

MemSyco-Bench: Benchmarking Sycophancy in Agent Memory
الفريق قدم MemSyco-Bench، وهو مجموعة اختبارات جديدة بتقيس كيف الذاكرة ممكن تخلي الوكلاء يبالغوا بإنهم يوافقوا على المستخدم حتى لو هالشي بيضر الحقيقة. الاختبارات بتغطي خمس مهام، من رفض الذاكرة كدليل واقعي، لتحديد متى الذاكرة صالحة للاستخدام، وحل النزاعات بين الذاكرة والدليل الموضوعي، وتتبّع تحديثات الذاكرة، واستخدام الذاكرة لتخصيص التجربة. الهدف إنه نقدر نعرف إمتى الذاكرة لازم تساعد وإيمتى لازم نتجاهلها.
ليش بتهمّك؟: هالورقة بتساعدنا نطوّر وكلاء ذكيين ما يتبعوا المستخدم على حساب الحقيقة.
🌱 شو إلك منها؟
تخيل إنه برنامج محادثة يطّلع لك نصائح مبنية على معلومات قديمة أو غير صحيحة لأنه بيفضل يرضيك. هالاختبار بيساعد المطوّرين يتأكدوا إنه هالبرامج ما رح تتصرف هيك، وبيحسّن الدقة بالمساعدات الرقمية اللي بتستعملها كل يوم، مثل تطبيقات الدردشة أو المساعدين الصوتيين.
memory sycophancy benchmark agents LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

هل بنقيس الاستراتيجية ولا الصياغة؟ الفجوة بين التنوع السطحي وتنوع الأسلوب في تفكير LLM الرياضي

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning
الفريق Lee وزملاؤه بيقدّموا مفهوم جديد اسمه approach-level diversity، يعني تنوّع الاستراتيجيات اللي بيستخدمها الـLLM لحل نفس المسألة. بيظهروا إنّ المقاييس التقليدية بتقيس بس التنوع السطحي، مش الطريقة الفعلية للحل، وبتبين إنّ هالفرق بيأثر على أساليب التدريب اللي بتركّز على التنوع. كمان بيكتشفوا إنّ مجموعات الحلول المتنوّعة بتساعد على تحسين الأداء وقت الاختبار، لكن محاولة تحسين التنوع عبر مكافأة الـLLM judge بتخلّي النموذج يطّلع على تفضيلات القاضي بدل ما يوسّع استراتيجياته. النتيجة إنّ تحسين approach-level diversity مباشرة لسا مشكلة مفتوحة.
ليش بتهمّك؟: لأنّه إذا قدرنا نقيس ونزيد تنوّع الاستراتيجيات، بنقرب الـLLM من التفكير البشري المتنوع والمرن.
🌱 شو إلك منها؟
تخيل إنه برنامج رياضي يقدر يحل مسألة بأكتر من طريقة، مش بس يغيّر الصياغة. هالشي بيساعده يتعامل مع أسئلة جديدة أو غريبة أكتر بسهولة، مثل ما بيصير مع التطبيقات التعليمية اللي بتعطيك حلول مختلفة لتفهم الفكرة. ممكن تشوف هالتطور ينعكس على تطبيقات المساعدين الذكيين اللي بيستخدموها بالهواتف أو على الويب.
diversity math reasoning LLM evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

VideoSearch-R1: بحث فيديو تفاعلي وتفصيلّي

VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
الفريق Lee وزملاؤه قدموا VideoSearch-R1، إطار وكيل بيشتغل على استرجاع الفيديوهات بصورة تكرارية. بدنا نستخدم Soft Query Refinement لتعديل استعلام البحث في الفضاء الكامن بدل ما نعيد كتابة النص، ونتدرب على العملية عبر Group Relative Policy Optimization مع إشارات مكافأة من الاسترجاع والمهام اللاحقة. هيك بنقدر نجيب الفيديو الصح حتى لو أول مرة ما انضبط، وبعدين ننجز مهمات دقيقة مثل التحديد الزمني داخل الفيديو. التجربة أظهرت إنهم وصلوا لأعلى نتيجة على ثلاث مجموعات بيانات VCMR.
ليش بتهمّك؟: هالطريقة بتقلل الأخطاء بالبحث عن فيديوهات وتخلي التطبيقات اللي بتعتمد على الفيديو، مثل التعليم أو الترفيه، تكون أدق وأسرع.
🌱 شو إلك منها؟
بتخلي برنامج يبحث عن فيديوهات يلاقي اللي بدك إياه بسرعة، حتى لو ما كان السؤال واضح من البداية. زي ما بتعدل سؤال على طول مع صديق بيساعدك توصل للنتيجة، هالطريقة بتعدل الاستعلام وتلاقي الفيديو الصح. ممكن تشوف هالتحسين بالمساعدات الذكية على اليوتيوب أو تطبيقات التعليم اللي بتحتاج فيديو معين.
video-retrieval multimodal reinforcement-learning VCMR agentic hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

نماذج Diffusion لتأليف تقارير الأشعة التفاعلية

Discrete Diffusion Language Models for Interactive Radiology Report Drafting
الفريق عدل نموذج DiffusionGemma-26B وحطّه على بيانات الأسئلة الطبية البصرية، وقارنوّه مع أخوه Gemma-4-26B اللي بيشتغل بطريقة autoregressive بنفس طريقة LoRA للتنقيح. النموذج الديفيوجن قدر يواكب أو يتفوق على الـ AR بكل المؤشرات، وكمان بيطلع النتائج أسرع بـ3.5‑4.4 مرة. أهم ميزة إله إنه بيقدر يملأ الفجوات بالنص بأي ترتيب، يعني الطبيب يقدر يثبت جزء من التقرير ويخلي النموذج يكمّله بين هالأجزاء، وهيك ما بيصير عنده مشاكل الترتيب اللي بتصير بالـ AR.
ليش بتهمّك؟: بيخلّي كتابة تقارير الأشعة أسرع وأكثر دقة، وبيقلل الأخطاء اللي ممكن تصير من ترتيب النص أو نقص المعلومات.
🌱 شو إلك منها؟
تخيّل إنك عم تكتب تقرير أشعة وتنسى جزء من الوصف، النموذج بيمسك الفجوة ويكملها لك كأنو مساعد ذكي. هالشي بيساعد الأطباء يخلصوا شغلهم بسرعة ويقللوا الأخطاء. ممكن تشوف هالتقنية ضمن برامج قراءة الأشعة بالمستشفيات قريباً.
diffusion language models medical AI radiology LoRA hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

ASPIRE: اكتشاف مهارات الروبوت بطريقة وكيلية

ASPIRE: Agentic /Skills Discovery for Robotics
فريق الباحثين قدموا نظام اسمه ASPIRE، وهو نظام تعلم مستمر يكتب ويطوّر برامج تحكم الروبوت ككود‑as‑policy. النظام بيجمع الخبرة بمكتبة مهارات قابلة لإعادة الاستخدام، وبيستفيد من محرك تنفيذ روبوت يوفّر تتبعات متعددة الوسائط لتشخيص الأخطاء وإصلاحها. كمان بيستخدم بحث تطوري يولّد تسلسلات مهام وبرامج تحكم جديدة، وبيحقق تحسينات كبيرة على مجموعة من الـ benchmarks مثل LIBERO‑Pro وRobosuite وBEHAVIOR‑1K. المكتبة المتراكمة بتسمح للروبوت يتعامل مع مهام جديدة من غير ما يتدرّب مرة ثانية، وتقلل جهد برمجة الروبوت في الواقع.
ليش بتهمّك؟: المقال بيفتح باب لتقليل جهد برمجة الروبوتات وتوسيع قدراتها لتتعامل مع مهام معقّدة بدون تدخل بشري مستمر.
🌱 شو إلك منها؟
تخيل إنه الروبوت يقدر يتعلم من أخطاءه ويصير عنده مجموعة مهارات جاهزة يقدر يستخدمها بأي شغل جديد. يعني إذا بدك روبوت يفرّغ صحن أو يسلّم غرض، ما تحتاج تعيد برمجته من الصفر كل مرة. هالشي ممكن تشوفه قريباً بخدمات توصيل أو مساعدة منزلية، لأن الروبوتات رح تصير أذكى وأسهل للاستخدام.
robotics skill learning continual learning simulation-to-real zero-shot hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

SWE‑Together: معيار تفاعلي لتقييم وكلاء البرمجة

SWE-Together: Evaluating Coding Agents in Interactive User Sessions
الفريق اللي بيقود Yifan Wu وزملاؤه قدموا معيار جديد اسمه SWE‑Together يغيّر طريقة تقييم وكلاء البرمجة. بدل ما تكون الاختبارات ثابتة وتعطي الوكيل كل المهمة مرة وحدة، هالمعيار بيستند لجلسات واقعية بين مستخدم ووكيل على مدار عدة دورات. اختاروا 109 مهمة من 11,260 جلسة مسجّلة، وبنوا محاكي مستخدم مبني على LLM يحافظ على نوايا المستخدم الأصلية ويعطي ردود فعل وقت ما الوكيل يحتاج تعديل. القياس بيشمل نجاح الكود النهائي وعدد المرات اللي احتاج فيها المستخدم لتصحيح الوكيل، ولقوا إن الوكلاء الأقوى ينجحوا أكثر وبقليل تدخل من المستخدم.
ليش بتهمّك؟: هالمعيار بيساعدنا نفهم كيف الوكلاء يشتغلوا فعلاً مع المطورين ويقللوا الجهد اليدوي خلال البرمجة.
🌱 شو إلك منها؟
تخيل إنك عم تحكي مع برنامج يساعدك تكتب كود، وهو مش بس يكتب الكود مرة وحدة، بل يرد على أسئلتك ويصحح أخطاءك خلال الشغل. هالمعيار بيقيس إذا البرنامج فعلاً بيكون زميل شغل مفيد ولا بيخليك تعيد تصحيح كل شي. ممكن تشوف هالتطورات بأدوات تحرير الكود اللي بتستخدمها اليوم مثل VS Code أو GitHub Copilot.
coding agents benchmark interactive LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

MOPD: دمج قدرات متعددة للـLLM بعد التدريب

MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
الفريق اللي بيقود البحث، Wenhan Ma وزملاؤه، قدموا طريقة جديدة اسمها Multi-teacher On-Policy Distillation (MOPD) لدمج قدرات نماذج اللغة الكبيرة من خلال تدريب ما بعد التعلم المعزز. الفكرة إنه كل مجال بيصير عنده معلم RL متخصص، وبعدها بن distill هالمعلمين على الطالب باستخدام rollouts الخاصة فيه، وهالشي بيقضي على مشكلة الـexposure bias وبيعطي إشارة تحسين كثيفة. التجارب على Qwen3-30B-A3B بيّنت إنه MOPD بيتفوق على Mix‑RL، Cascade RL، Off‑Policy Finetune، وParam‑Merge، وبيحافظ على تقريباً كل قدرة من كل معلم. كمان الطريقة بتسمح بتطوير المعلمين بشكل مستقل، يعني ما في تعقيد بين المجالات.
ليش بتهمّك؟: لأنه MOPD بتمكّن من دمج قدرات متعددة بفعالية بدون خسارة الأداء، بيقربنا من نماذج لغة أقوى وأشمل.
🌱 شو إلك منها؟
بتخيل إنه هالطريقة بتخلي المساعد الذكي يقدر يحكي معك عن الطب، القانون، والرياضيات بنفس الجودة، زي ما بتلاقي خبير كل مجال. يعني إذا طلبت نصيحة طبية أو مساعدة في حل مسألة، النموذج بيقدر يعطيك إجابة دقيقة من غير ما يخلط أو يضيع. هالشي ممكن تشوفه قريباً في تطبيقات مثل ChatGPT أو أي خدمة محادثة ذكية بتستعمل LLMs.
LLM distillation reinforcement learning multi-teacher post-training hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 8
AutoMem
AutoMem هو طريقة بتخلي النموذج يتذكر معلومات بشكل تلقائي، متل ما بنحفظ إشي بمجرد ما بنشوفه، بنستعمله عشان يحسن الأداء بالمهمات اللي فيها ذاكرة طويلة.
AFTER
AFTER هو معيار (benchmark) بيقيس قدرة النماذج على التعامل مع مهام بعد التدريب، بنستعمله عشان نشوف إذا النموذج بيستفيد من المعرفة السابقة.
procedural memory
الذاكرة الإجرائية (procedural memory) هي الذاكرة اللي بتخزن كيف نعمل إشي خطوة بخطوة، مثل تعلم القيادة، وبدنا نفهمها لنساعد النماذج تتعلم مهارات بدون ما تحتاج نعيد التدريب كل مرة.
cross-model
cross-model يعني إنو نموذج بيستفيد من معلومات أو تمثيلات نماذج تانية، يعني بنخلط إشي من نموذج A مع نموذج B عشان نحسن الأداء.
skill transfer
skill transfer هو نقل المهارة اللي تعلمها نموذج من مهمة لثانية، يعني بدنا نعلم النموذج يطبق اللي تعلمه على إشي جديد مش نفس المهمة.
Interphyre
Interphyre هو معيار بيقيس قدرة النماذج على التعامل مع أسئلة فيزياء متعددة المجالات، بنستعمله لنشوف إذا النموذج بيقدر يربط بين مفاهيم مختلفة.
Retrieval Augmented Search
Retrieval Augmented Search طريقة بحث بتدمج استرجاع معلومات من قاعدة بيانات مع نموذج اللغة، يعني احنا بنخلّي النموذج يجيب معلومات إضافية من مصادر خارجية عشان يجاوب بدقة أعلى، بنستعمله لتقوية قدرات البحث.
beam search
الـ beam search طريقة بحث بتختار أكتر الاحتمالات المتوقعة خلال توليد النص أو القرار، مش بنقصر على خيار واحد، فبنحافظ على شوية خيارات عشان ما نفوت حلول منيحة.
🤖 موديلز 4
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
HExA
HExA هو نموذج جديد بيستخدم هيكل هيكلي لتوليد نصوص أو حلول معقدة، بنستعمله عشان نختبر قدرته على الفهم العميق.
ReAct
هالمفهوم بخلّي النموذج يتصرف ويتفاعل مع البيئة، يعني بيجمع التفكير مع الفعل، بنستعمله عشان النموذج يجاوب بطريقة أكتر طبيعية.
AEGIS
نظام حماية ذكي بيستخدم تعلم عميق لتصنيف وتصفية المحتوى الضار، بنستعمله عشان نحافظ على سلامة المنصات.
📏 مقاييس 1
benchmark
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
🗂️ بيانات 1
NetHack
NetHack هو مجموعة بيانات مستوحاة من لعبة NetHack القديمة، بنستعملها لتدريب وتقييم نماذج الذكاء الاصطناعي على حل مشاكل معقدة وتخطيط.
كل المصطلحات ←
العدد السابقشو في AI؟ | تجميع الأسبوع 4 يوليو — اللوجيت وتعلم طبي ومحاكيات
📚 كل الأعداد