📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 1 أغسطس — تقييمات AI المتعددة

أسبوعي مكثّف 📅 2026-08-01
هالأسبوع شفنا تركيز متزايد على تقييم قدرات النماذج المتعددة الوسائط والوكيلية. فريق See2Think قدم إطار موحد بيجمع بين See2ThinkBench وVAoT لتقويم التفكير البصري. MPII‑Bench وOmegaUse‑OfficeVal زادوا من عدد البنشماركات اللي بتقيس تفاعل الأشخاص وتطبيقات المكتب على المدى الطويل. كمان ظهرت طرق جديدة مثل SpatialCLI لتقوية نماذج الرؤية‑اللغة وβ‑OPSD لتعديل التقطير الذاتي. هالتحركات بتظهر إنو المجتمع عايز أدوات دقيقة عشان نقيس الأداء مش بس ننتج صور أو نصوص.
#1

See2Think: هل الموديلات المتعددة الوسائط فعلاً بتستعمل الحالات البصرية المتوسطة؟

See2Think: Do Multimodal Models Really Use Intermediate Visual States?
الفريق قدم See2Think، إطار تقييم موحد بيجمع بين See2ThinkBench ومكوّن Visual Action-of-Thought (VAoT). See2ThinkBench فيه 1200 سؤال مفتوح بيعتمد على الصورة، موزعين على 12 فئة من مهام التفكير الهيكلي ثنائي الأبعاد، المشاهد ثلاثية الأبعاد، والتفكير بالعالم الحقيقي. VAoT بيسجّل الأفكار النصية، الإجراءات البصرية، الحالات المرسومة، والتفكير اللاحق تحت أربع إعدادات استدلال متحكم فيها. النتائج بتوضح إن الأداء البصري بيعتمد كتير على النموذج والبيئة، وإن توليد الصور الدقيقة هو أضعف نقطة بالعملية.
ليش بتهمّك؟: هالورقة بتفرجينا إذا النماذج فعلاً بتستفيد من الصور الوسيطة ولا لا، وبتساعدنا نطور أدوات تقييم أدق.
multimodal benchmark visual reasoning evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

MPII‑Bench: تقييم تحرير تفاعلات الأشخاص المتعددين بصورة واقعية

MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing
النماذج الحالية لتوليد الصور من نصّ بتقدر تنتج صور عالية الجودة لشخص واحد، بس بتقع بعثرات كبيرة لما نحاول نحط أكتر من شخص يتفاعل مع بعض، مثل العناق أو الحمل. الباحثين قدموا MPII‑Bench، benchmark فيه 2,500 عينة من مقاطع فيديو تغطي 405 مشهد و14 نوع تفاعل بأربع كثافات اتصال. كمان طوّروا MPII‑Eval اللي بيقيس جودة التفاعل من زاويتين: التشريح (إذا كل جسم مفصل بالكامل) والتفاعل (إذا المسافات بين الأجسام مطابقة للتعليمات). النتائج بينت إن أي محرّر ما بيقدر يضبط الاتنين معاً، بينما تقييمات VLM بتعطي درجات عالية غير واقعية.
ليش بتهمّك؟: المراجعة هيدي بتكشف الفجوة الكبيرة بين جودة الصور اللي بنشوفها بالإنسان وبين اللي بتقوله الأنظمة، وبتساعدنا نطور أدوات تحرير صور أكتر دقة للمناظر المتعددة الأشخاص.
benchmark multi-person image editing computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

SpatialCLI: كيف نعلّم نماذج الرؤية‑اللغة تستعمل أدوات الفضاء وتستغنِ عنها

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them
الفريق قدم إطار اسمه SpatialCLI لتقوية نماذج الرؤية‑اللغة بإنها تستعمل أدوات متخصصة مثل التحديد والتقسيم، وبعدين تتعلم من هالاستخدام عبر تدريب خاص وتعلم معزز، وأخيراً بتحول هالمهارات لتكون داخل النموذج نفسه. الإطار يشتغل على ثلاث مراحل: Call يفتح الأدوات المتخصصة، Learn يطوّر استخدامها، وInternalize يخلّي النموذج ي internalize القدرات بدون أدوات. التجربة على benchmark اسمه SpatialCLI‑Bench أظهرت رفع الدقة من 29.3٪ إلى 84.6٪ لما يستخدم الأدوات، وبعدين يبقى عند 73.8٪ حتى بدونها.
ليش بتهمّك؟: هالطريقة بتخلي نماذج الرؤية‑اللغة تفهم تفاصيل المشهد بدقة وتقرر بشكل أفضل، وهاد مهم لتطبيقات الروبوتات والأنظمة المدمجة.
vision-language spatial reasoning tool-use benchmark reinforcement learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

MANTA: تعديل شبكة التواصل للأنظمة المتعددة الوكلاء

MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems
الفريق قدم MANTA، إطار بيسمح لشبكة التواصل بين الوكلاء تتغيّر لحالها وقت التنفيذ. قبل ما يشتغل النظام، بيجهّز هيكلية مبدئية مبنية على خبرات سابقة، وبعدين خلال الشغل بيراقب مسارات التعاون وبيعمل تحديثات محدودة إذا لزم الأمر. هالتحديثات ممكن تغيّر أدوار الوكلاء، روابط التواصل، ترتيب التنفيذ، وشو اللي بيظهر للكل، وكل هالشي بيصير بدون ما يتغيّر واجهة المهمة أو ميزانية الوكلاء. النتايج على خمس تجارب مختلفة أظهرت إن MANTA جاب أعلى متوسط نقاط، وتفوّق على أقوى نظام موجود ب5.8 نقطة.
ليش بتهمّك؟: لأنو بيخلّي الأنظمة المتعددة الوكلاء تتحسّن لحالها وقت الاستخدام، فبيصيروا أقوى وأكفأ بحل المشكلات المعقّدة.
multi-agent topology adaptation LLM benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

OmegaUse-OfficeVal: اختبار وكلاء LLM على شغل مكتبي طويل الأمد مع تكلفة اقتصادية

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
الفريق قدم benchmark جديد اسمه OmegaUse-OfficeVal لتقييم وكلاء LLM على مهام مكتبية طويلة، كل مهمة فيها إشارة اقتصادية للوقت البشري وسعر تقريبي. المجموعة فيها 100 مهمة مستوحاة من طلبات حقيقية للمكتب، ومتوسط كل مهمة بيستغرق 2.32 ساعة من شغل الإنسان. هالمؤشر بيسمح نقارن مباشرة بين تكلفة تشغيل الوكيل وتكلفة شغل الإنسان، وكمان بنقيس الجودة بوزن القيمة. النتايج بتظهر إن الوكلاء أسرع وأرخص من البشر، بس لسا ما وصلوا لجودة تسليم البشر.
ليش بتهمّك؟: المقارنة الاقتصادية بتخلينا نعرف إذا الوكلاء فعلاً بيوفروا وقت وفلوس بالمقارنة مع الشغل اليدوي.
LLM benchmark office tasks economic evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

RefCaptioner: شروحات فيديو مربوطة بصور متعددة

RefCaptioner: Multi-Reference Image-Grounded Video Captioning
الفريق قدم مهمة جديدة اسمها multi-reference image‑grounded video captioning، بتطلب من النموذج يكتب وصف دقيق للفيديو ويربط كل جملة بصورة مرجعية. صمموا RefCaptioner كإطار تدريب من مرحلتين، بيجمع بين mixed-data SFT وHierarchical Coverage‑Discounted GRPO ليحسّن اختيار الصورة، ربط العبارات، رفض المشتتات، وتناسق بين المراجع، وبنفس الوقت يضل يقدر يكتب شروحات فيديو عادية. جمعوا 20,000 فيديو مع 171,354 صورة مرجعية وصنعوا benchmark اسمه MRVBench لتقييم الدقة والربط. التجارب أظهرت إن RefCaptioner يطيّق أفضل من النماذج المفتوحة المصدر، وكمان يظل منافس على benchmarks التقليدية لتوليد شروحات الفيديو.
ليش بتهمّك؟: هالورقة بتخلّي توليد شروحات الفيديو أكتر دقة وموثوقية، خصوصاً إذا بدنا نربط المحتوى بصور معينة لتوثيق أو مراجعة المحتوى.
video captioning multi-reference grounding benchmark multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

β-OPSD: تحسين التقطير الذاتي عبر ضبط السياسة

β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
هالورقة بتقدّم طريقة جديدة اسمها β-OPSD لتقوية نماذج اللغة اللي بتستعمل التقطير الذاتي. الفكرة إنو بنحوّل الـβ من قيمة ثابتة (١) إلى معامل تنظيم ممكن نضبطه، وبهالطريقة بنخلّي الطالب يقترب من سياسة مرجعية أو من معلم مميز حسب الحاجة. بنستعمل مزيج من لوغيتات التوكنات للمعلم والمرجع كهدف للتقطير، وبهالطريقة بنحاكي حلّ تحسين السياسة بدون ما نحتاج لتقوية تعلم تعزيزي مكلفة. التجارب على بنشماركات رياضية بتبيّن إنو β-OPSD يرفع استقرار التدريب وأداء الاستدلال بالمقارنة مع التقطير الذاتي التقليدي.
ليش بتهمّك؟: هالطريقة بتعطي استقرار أعلى وأداء أفضل للنماذج اللغوية في حلّ المسائل الرياضية بدون ما نحتاج لتعديلات هندسية معقّدة.
self-distillation policy optimization language models reasoning reinforcement learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

الذاكرة للـ Large Language Models

Memory for Large Language Models
بهالاستعراض الباحثين بيشرحوا كيف صارت الذاكرة بعد ما كانت مجرد نتيجة فرعية للمعالجة، صارت إشي واضح ومتحكم فيه بنماذج اللغة الكبيرة. حطوا تصنيف بيقيس الذاكرة على ثلاث محاور: تمثيلها (implicit أو explicit)، طريقة تحديثها (offline أو online)، ومدة بقاءها (short-term أو long-term). كمان فصّلوا الآليات اللي بتكتب الذاكرة، توزعها، وتدمجها، وبيّنوا الفرق بين الذاكرة المرتبطة بالحساب والذاكرة اللي بتشتغل لحالها. وأخيراً، حللوا مزايا وعيوب الأنظمة المختلطة من ناحية الكفاءة وتقييم الأداء.
ليش بتهمّك؟: الورقة بتعطي نظرة موحدة تساعد الباحثين يبنوا نماذج لغة أكتر قدرة على التذكر والتكيف مع المعلومات الجديدة.
memory LLM survey architecture evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

هل تمشي للغسيل؟ كشف تحيّز السالينس عند LLMs في التفكير السليم

Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
الفريق اكتشف إنّ نماذج اللغة الكبيرة، رغم قوتها، بتصير مدفوعة بسهولة بالمعلومات الظاهرة بالمهمة، مثل الأرقام، وبتتجاهل المتطلبات الفيزيائية أو المعرفية الضمنية. بنوا مجموعة اختبار اسمها SaliTrap Benchmark فيها أسئلة فيها إلهاءات صريحة، ولما جربوا 12 نموذجًا حديثًا لقوا إنهم كلهم يطيحوا بهالتحيّز، وكل ما زادت الإلهاءات زاد الفشل. بعد ما شالوا صياغة المهمة اللي فيها الإلهاءات، النموذج رجع يجاوب صح، يعني المشكلة مو نقص معرفة، بل إنّ الإلهاءات بتقمع المعرفة. كمان جربوا طريقة بسيطة بالـ prompting وقت الاستنتاج وقدروا يقللوا الفشل بدون ما يعيدوا تدريب النموذج.
ليش بتهمّك؟: هالملاحظة بتخلينا نعيد التفكير بكيفية توجيه الأسئلة للـ LLMs لتفادي الأخطاء اللي بتصير بسبب الإلهاءات الظاهرة.
commonsense bias prompting benchmark LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

LLMs بتنفيذ أوامر التداول الكبيرة

Can Large Language Models Execute Parent Orders?
الفريق قدم أول دراسة منهجية لاستعمال الـ LLMs بتنفيذ أوامر الوالد (parent orders) بالأسواق. استحدثوا إطار اسمه PACE (Plan-Ahead Controlled Execution) بيقسم المهمة لتخطيط طويل المدى وتنفيذ قصير المدى، وما بيحتاجوا أي افتراضات سوقية مسبقة ولا تدريب خاص بالمهمة. التجارب على بيانات بورصة شينزين أظهرت إن PACE يتفوق على استراتيجيات TWAP وAlmgren‑Chriss وغيرها، بفرق 0.65 نقطة أساس. التحليل السلوكي كمان بيكشف إن الثقة العالية للنموذج بتقود لأداء أفضل، والنموذج بيفضل يشتري مبكراً بدل ما ينتظر آخر لحظة.
ليش بتهمّك؟: هالنتيجة بتفتح باب لاستخدام الذكاء الاصطناعي كزميل ذكي للمتداولين لتقليل تكاليف التنفيذ وتحسين الأداء بالمستقبل.
LLM finance trading execution PACE hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

تقليم العدالة: كشف التحيّز الديموغرافي في طبقات GLU-MLP

Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations
الفريق قدم طريقة اسمها Fairness Pruning، وهي تدخل هيكلي خفيف لتحديد وإدارة التحيّز الديموغرافي داخل نماذج اللغة الكبيرة. باستخدام أزواج من الـ prompts المتقابلة وتسجيل الـ activations وقت الاستدلال، حددوا الخلايا العصبية اللي بتستجيب بشكل مختلف للسمات الديموغرافية داخل بنية GLU، خصوصاً عند الـ down_proj input. جربوا الطريقة على نماذج Llama-3.2 وعائلة Salamandra-2B اللي حجمها لحد 3 مليار باراميتر، ولقوا إنو حذف ما فوق 40 خلية (أقل من 0.031% من عرض الـ MLP) بيخلّي النموذج يحافظ على 99.49% من قدراته على التفكير والمعرفة العامة، مع تعديل واضح لسلوك التحيّز.
ليش بتهمّك؟: هالطريقة بتخلّي الباحثين يقدروا يحددوا وين التحيّز داخل النموذج ويقضوا عليه بدقة، من غير ما يضيعوا قدرات النموذج الأساسية.
fairness pruning bias LLM GLU hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

إصلاح المستندات التاريخية بالمعرفة الخارجية وRAG‑LLM

Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models
الفريق Kim وKang قدموا طريقة جديدة لتصليح المستندات التاريخية اللي صارت مشقوقة أو غير مقروءة. النظام اسمه ARI وبستعمل large language models مع retrieval‑augmented generation (RAG) ليضيف معلومات من مصادر خارجية. هالدمج بيساعد النموذج يحدد الأسماء الخاصة اللي ما بيقدر يستنتجها من النص لوحده. التجارب على مستندات كورية تاريخية ورّيت إنو الطريقة بتتفوق على الطرق القديمة بكتير، خصوصاً بترميم الحروف والأسماء.
ليش بتهمّك؟: هالطريقة بتخلّي الباحثين يطلعوا معلومات أدق من وثائق تاريخية مهترئة، وبتسرّع دراسة الماضي.
RAG LLM historical documents restoration Korean hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | تجميع الأسبوع 25 يوليو — Hybrid Attention Powers AI
📚 كل الأعداد