📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 15 أغسطس — نظام متعدد الوكلاء

أسبوعي مكثّف 📅 2026-08-15
هذا الأسبوع شفنا تركيز واضح على الأنظمة المتعددة الوكلاء وتحديث طرق تعلم الـLLMs. الباحثين قدموا Hybrid-Policy Self-Editing ليخلي الموديل يحدّث معرفته من داخل نفسه، وFull‑bandwidth Transformer زاد قناة التغذية الراجعة لتوليد أكثر سلاسة. كمان ظهر OmniScientist وMARC وBusiness Arena كأطر توظّف عدة وكلاء لتوليد، تفكير، وتقييم النتائج عبر وسائط مختلفة. بالإضافة، LongEarth‑R1 وMMOOC بيظهروا طلب المجتمع على تقييم النماذج على مهام زمنية أو خارج السياق. كل هالإشارات بتدل إنو المجال ماشي باتجاه تكامل الوكلاء والبيانات المتعددة.
#1

تحرير المعرفة للـ LLMs بطريقة Hybrid-Policy Self-Editing

Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing
الفريق بيحكي إنو الـ LLMs عم تتعلم من بيانات ثابتة، فالمعرفة فيها بتصير قديمة بسرعة. هالمرة الباحثين قدموا طريقة جديدة اسمها HPSE، بتخلّي الموديل يعلّم حاله من داخل نفسه عبر "self-distillation" وبيضيف معلومات جديدة بطريقة "hybrid rollout" لتغطي الفجوات. النتيجة إنو الموديل ما بس بيحفظ الفقرة الجديدة، بل بيقدر يجاوب أسئلة بسيطة ويجمع المعلومات لتفكير متعدد الخطوات، يعني بيصير أكتر تركيبة وفاعلية.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج الكبيرة تظل محدثة وتجاوب بدقة على أسئلة جديدة بدون ما نعيد تدريبها من الصفر.
knowledge editing LLM self-distillation composability hybrid rollout hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

كيف بتخدع البلاغة مراجعي الذكاء الاصطناعي؟ تحليل الحساسية البلاغية

How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review
الفريق بنى مجموعة من 4,200 ورقة كاملة مستخلصة من 120 مشاركة مجهّية بـ ICLR 2026، واستخدم ستة أبعاد بلاغية غيرت النص باتجاهين مختلفين عن طريق LLM rewriters. بعدين خلى خمسة LLM reviewers يقيموا هالمقالات تحت بروتوكولات قياسية وصارمة. لقوا إنّ إطار الأدلة وموقف الجدة بيأثروا أقوى على التقييم، بينما باقي الأبعاد إله تأثير أقل أو غير مستقر. كمان اكتشفوا إنّ تأثير البلاغة بيختلف حسب النقطة الأصلية للمراجع، والكتابة المشتركة أو المتكررة ما بتعطي مكاسب ثابتة.
ليش بتهمّك؟: هالنتائج بتورجيكم كيف ممكن تعديل الصياغة يغيّر تقييم الذكاء الاصطناعي، وبتنبهنا لتصميم أنظمة مراجعة أقوى ضد هالتحايلات.
LLM peer review rhetoric AI evaluation language models hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

Intern-S2-Preview: نموذج أساسي للوكيل العلمي

Intern-S2-Preview: Scientific Agentic Foundation Model
الفريق قدم مجموعة من النماذج العلمية الوكيلية اللي بتدعم الفهم المتعدد الوسائط، الاستدلال، والتوليد على مهام طويلة المدى. التدريب بلّش بpre‑training على مستندات علمية مصوّرة وبيانات نص‑صورة، وبعدها استعملوا pipeline موحد للـ fine‑tuning، reinforcement learning متعدد المهام، وdistillation على‑policy. بالمستوى المعماري، Intern‑S2‑Preview‑397B ضاف موديل لتوقع السلاسل الزمنية، وMemory Decoder اتعمل كمسار مذكّرة لتخصيص سريع للبيولوجيا من غير ما يغيّر ال‑backbone. التجارب على benchmarks علمية ومتعددة الوسائط أظهرت نتائج تنافسية أو متصدرة.
ليش بتهمّك؟: هالورقة بتفتح باب لتطبيقات AI علمية قادرة على حل مشاكل معقّدة وتستمر عبر فترات زمنية طويلة، وهذا مهم للباحثين والمؤسسات.
agentic multimodal foundation model reinforcement learning scientific AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

LongEarth-R1: اختبار وتوجيه نماذج الرؤية‑اللغة لتفسير الأرض على المدى الطويل

LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning
الورقة بتوضح إنّ تفسير المشاهد الأرضية على فترات طويلة بيحتاج نماذج تنظم تطور جغرافي متعدد المراحل وتحدد تغيّر الأماكن وتكتشف شذوذات زمنية وتستنتج المستقبل من سلاسل صور طويلة. الباحثين قدموا LongEarth-Bench، benchmark فيه حوالي 120 000 سؤال‑جواب مأخوذة من 117 000 صورة، وسلسلتها متوسطها 15.14 إطار وبتوصل لـ30 إطار، وبيغطي 12 مهمة من تلخيص التطور لتنبؤ منطقي. بعدين سووا LongEarth بالتدريب المراقب مع معرفات السلسلة وسلسلة تفكير منطقية، وطبقوا LongEarth-R1 مع group relative policy optimization باستخدام مكافآت صيغية وزمنية ومكانية، وحققوا أفضل أداء على كل المهمات الطويلة مع الحفاظ على تنافسية على benchmarkات الاستشعار عن بُعد التقليدية.
ليش بتهمّك؟: هالنتيجة بتخلّي نماذج الرؤية‑اللغة تفهم وتتابع تغيّر الأرض على فترات طويلة، الشي اللي بيفتح باب لتطبيقات مراقبة بيئية أدق وأسرع.
vision-language earth observation benchmark long-horizon remote sensing arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

المحوّل كامل النطاق (Full-bandwidth transformer)

Full-bandwidth transformer
الفريق قدم full-bandwidth transformer، وهو محوّل autoregressive بيضيف قناة تغذية راجعة أوسع بين خطوات التوليد. بدال ما يروح حالة الطبقة العليا بعد كل توكن، بيخلط الحالة العليا السابقة مع تمثيل التوكن اللي انولد عبر gated linear unit وبيرجعها كمدخل للخطوة الجاية. التدريب بيستخدم هدف multi-pass مجدول بيضيف هالتغذية المتأخرة بعد ما يبدأ التدريب، وبيخلط نسبة صغيرة من خطوات التغذية العميقة لاستقرار. التجارب على نموذج ب١ مليار بارامتر لحد ٤٠٠ مليار توكن أظهرت تحسين في خسارة التحقق وتقييم 5-shot وتوليد الرياضيات والبرمجة وأداء التعليمات، مع تكلفة حسابية تقريباً ما تتغير.
ليش بتهمّك؟: هالطريقة بتخلي الموديلات تكتب نصوص أدق وأسرع بدون ما نحتاج ندرّبها على بيانات أكتر بكتير.
transformer language modeling feedback efficiency pretraining hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

RAIL: نظام تلقائي لتصنيف مستوى جاهزية الذكاء الاصطناعي

RAIL: An Automatic Classifier of the Artificial Intelligence Readiness Level
الورقة بتجمع ثلاث أطر جاهزية موجودة وبتنشئ مقياس موحد اسمه Unified AI Readiness Level (AIRL) بيضم تسعة مستويات ومعايير للبيانات، الخبرة، والنموذج. بعدين بيقدّموا RAIL، وهو مصنّف بيستند على مجموعة من الـLLM‑agents كل واحد مختص بجانب من الجوانب، وبيلتقط verdict من كل واحد وبعدين يجمعهم بقاعدة حتمية. فيه كمان خبير رئيسي بيراجع التوصية وما بيزيدها فوق الحدود المحددة. الاختبار على عدة أبحاث بيظهر إن الطريقة بتعطي تقييم ثابت وبتتفادى التقدير الزايد اللي ممكن يحصل مع مصنّفات LLM موحدة.
ليش بتهمّك؟: لأنو تقييم جاهزية تقنيات الذكاء الاصطناعي بدقة بيساعد المستثمرين وصانعي القرار يتجنّبوا مخاطر الاستثمار الزايد أو الفشل بالمشروع.
AI readiness LLM classification assessment AI governance arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

توليد فيديو لغة الإشارة بـ Multi‑Expert GAN

Sign Language Video Synthesis via Loss-Guided Multi-Expert GANs
الفريق Dingzhan Nong وزملاؤه قدموا إطار جديد لتوليد فيديوهات لغة الإشارة باستخدام GAN متعدد الخبرات. النموذج فيه ثلاث discriminators متخصصة – عالمية، يد، ورأس – كل وحدة بتوجه فرع خاص بالمولد لتوليد تفاصيل المنطقة المعنية. بدنا نولّد إشي واقعي، عشان يثبت التدريب استعملوا آلية United Loss بتخلي كل discriminator يلتزم بمتوسط المجموعة بوزن 10٪، وكمان دمجوا convolution مع transformer عبر AdaptiveFeatureFusion. التجربة على مجموعة بيانات 156 GB أظهرت إن النسخة الصغيرة (0.2 B باراميتر) وصلت PSNR 29.8 والنسخة الكبيرة (1.3 B باراميتر) وصلت 30.7، ومع استهلاك VRAM قليل ممكن نشغلها على كمبيوتر شخصي.
ليش بتهمّك؟: هالطريقة بتقرب تواصل لغة الإشارة للناس اللي ما بيسمعوا، وبتخلي الفيديوهات أكتر واقعية وبسرعة على أجهزة عادية.
sign language video synthesis GAN computer vision multimodal arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

MatrAIx: محاكاة العالم بـ 8.3 مليار وكيل شخصي

MatrAIx: Simulating the World with 8.3 Billion Persona Agents
الفريق قدم MatrAIx، بنية تحتية لتقييم الأنظمة الرقمية عن طريق محاكاة ملايين المستخدمين المتنوعين. بيحتوي على Persona 8B اللي فيه 8.3 مليار سجل شخصي موزّع على 1,290 صفة، ومنه أطلقوا نسخة مُصفّاة فيها حوالي مليون شخصية. كمان في MatrAIx Playground فيه أربع بيئات (Survey، AI Chatbot، Web، App) و1,010 مهمة تطبيقية عبر 25 مجال. الوكلاء بيشتغلوا على LLMs مثل Claude Opus 4.8 وGPT 5.5 وClaude Haiku 4.5 لتوليد ردود تعكس سلوك وتفضيلات شخصيات مختلفة.
ليش بتهمّك؟: المقال بيسمح للباحثين والشركات يختبروا منتجاتهم بسرعة وبمستوى تنوّع بشري ما كان ممكن قبل هيك.
agents evaluation LLM simulation persona hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

OmniScientist: عالم آلي متعدد الوسائط

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
فريق Bobo Li وزملاؤه قدموا OmniScientist، نظام AI بيشتغل من أول الفكرة لحد كتابة الورقة، وبيستقبل أدلة من صور، صوت، فيديو، جداول وغيرهم. النظام فيه طبقة perception و3 agents مستقلين للتفكير، التجربة، والكتابة، وكل خطوة بتتحدد من الملاحظات اللي بيشوفها. جربوه على 36 حالة من خمس مجالات علمية، وقدروا يكمّلوا كل دورة بحث من البيانات الخام للمنشور بنجاح، وسجلوا متوسط تقييم 6.3. المقارنة مع نسخة ما بتشوف إلا ميزات مسبقة أظهرت إن الفهم المباشر للبيانات بيحسّن كل الجوانب البحثية بنسبة 85%.
ليش بتهمّك؟: المهمة لأنّها بتظهر إن الفهم المباشر للبيانات المتنوعة ممكن يخلّي AI يشارك بفعالية أكبر بالبحث العلمي الحقيقي.
multimodal AI scientist agents research automation foundation models hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

MARC: إطار متعدد الوكلاء للذكاء الاصطناعي السريري

MARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning and Coordination
الفريق قدم MARC، إطار مفتوح المصدر بيستبدل استدعاء LLM الأحادي بتنسيق متعدد الوكلاء للقرارات السريرية. MARC بيرتب وكلاء متخصصين بمهام استخراج، تفكير، توليد إجابة وتقييم، وبيمرّر السياق بيناتهم بهيك طريقة كل خطوة بتصير واضحة وبتسمح نعرف وين صار العطل. كمان أضافوا وحدة Decomposer اللي بتولّد توجيهات الوكلاء من وصف نصّي بسيط، فبدّنا ما نضيع وقت بالـ prompt engineering. الإطار بيشتغل على API أو على جهاز CPU المحلي، وممكن نضبطه كله بملف YAML من غير ما نكتب كود.
ليش بتهمّك؟: بيخلّي الأطباء يقدروا يتبعوا خطوات التحليل السريرى ويشوفوا وين الخطأ صاير، بدون ما يحتاجوا يبرمجوا كل شي.
multi-agent clinical AI open-source framework LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

ساحة الأعمال: اختبار وكيل LLM في سوق واقعي

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace
الفريق قدم Business Arena، بيئة محاكاة فيها وكيل LLM يدير محل عابر للحدود يشتري من الموردين ويبيع للمشترين على مدار وقت طويل. البيئة مبنية على بيانات Alibaba.com الحقيقية وشروط السوق من مصادر موثوقة، والنتيجة تُقاس بالربح الصافي. الباحثين قارنوا 15 نموذج متقدم مع استراتيجيات صممتها بشر، ولاحظوا فرق تسعة أضعاف بالثروة النهائية، وأظهروا إن حتى أقوى نموذج لسا ما بيقدر ينافس الإنسان. كمان حطوا مقاييس مستوى المهارة لتفصيل أساليب الوكلاء وتحديد أي قرارات بتخلق أو بتدمّر القيمة.
ليش بتهمّك؟: هالورقة بتبين قديش الوكلاء الذكيين لسا بحاجة لتطوير قبل ما يقدروا يديروا أعمال حقيقية.
LLM agents benchmark business simulation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

MMOOC: معيار شامل لتقييم الموديلات الكبيرة المتعددة الوسائط خارج السياق

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models
الورقة بتقدّم benchmark جديد اسمه MMOOC لتقييم قدرة الموديلات الكبيرة المتعددة الوسائط (MLLMs) على رفض الأسئلة اللي بتكون خارج السياق (OOC) والإجابة على أسئلة shifted in-context (Shifted IC). البنشمارك فيه أكتر من 41 ألف صورة-سؤال، وبيغطي تلات صيغ سؤال، تمانة أنواع تحويل، وستة سيناريوهات بصرية، مع تصفية آلية من MLLM وتحقق بشري. الباحثين استخدموا مقاييس Accuracy وRefusal Rate، وكمان جابوا metric جديد اسمه LLM-as-a-Judge لتقييم صحة التفكير. التجارب بينت إن الموديلات الحالية لسا بتعاني من موازنة بين الرد والإجابة تحت تغيّر السياق، لكن التدريب الإضافي ممكن يحسّن الصلابة.
ليش بتهمّك؟: لأنو هالمعيار بيساعدنا نفهم ونقوّي قدرة الموديلات على تصرف بذكاء بالمواقف الواقعية اللي بيصير فيها تغيّر أو نقص بالمعلومات.
multimodal benchmark robustness evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | تجميع الأسبوع 8 أغسطس — Benchmarks & Efficiency
📚 كل الأعداد