📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 8 أغسطس — Benchmarks & Efficiency

أسبوعي مكثّف 📅 2026-08-08
هلقيت هالأسبوع تركيز واضح على تحسين كفاءة النماذج وتوسيع قدراتها عبر Benchmarks متخصصة. فريق MEG استبدلوا الانتباه المكاني بـ spherical harmonics وقللوا تمثيل الفروع من 270 لـ 25، وهيك صار التحليل أسرع وأدق. نفس الفكرة ظهرت مع PaDoc اللي بيستغل شجرة الصفحات لتسريع تحليل المستندات، وOPD‑V عم يعزّز الفهم البصري للـ multimodal LLMs. من ناحية اللغة، Nemotron تم تكييفه للغة اليونانية الحديثة وMameLoshnLM أُطلق أول نموذج يديش مفتوح المصدر. كمان في مجموعة Benchmarks جديدة مثل HarnessOpt‑Bench، GDPevo، ExplainBench وDataSpace، عم تساعدنا نقيس قدرة الوكلاء على التعديل، التطور الذاتي، وشرح الكود بثقة. هالتحركات كلها بتأكد إنو المجتمع عم يركز على دمج الكفاءة مع التخصص لتطبيقات واقعية، وبدنا نتابع هالتطورات عن قريب.
#1

فك شفرة الكلام من MEG: المصادر الدماغية والميزات الصوتية

Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval
الفريق بناءً على نموذج استرجاع عالي الأداء، غيروا واجهة الإدخال والديكودر. استبدلوا الانتباه المكاني بتقنية spherical harmonics على شكل خوذة MEG ثلاثية الأبعاد، وقللوا تمثيل كل مريض من 270 فرع لـ 25 فرع مع مرشح زمني لكل فرع. النموذج وصل لدقة Top-1 حوالي 39.75% على مجموعة MEG‑MASC، ومع عدد أقل بـ 20 مرة من بارامترات الديكودر، وبيّنوا إيش الخصائص الصوتية (الصمت، شدة الصوت، الحركات الصوتية) هي اللي تقود الاسترجاع.
ليش بتهمّك؟: هالنتيجة بتخلينا نفهم أي إشي بالمخ بيساهم فعلاً بفهم الكلام، وبتفتح باب لتقنيات قراءة دماغية أدق وأخف وزنًا.
MEG speech decoding multimodal neural decoding representation learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

كيف عدلنا Nemotron للغة اليونانية الحديثة

Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains
الفريق Kirouane وPetrocheilos بيشتغلوا على تكييف سلة أدوات Nemotron لتخدم اللغة اليونانية الحديثة، خصوصًا بمجالات القانون، الطاقة، المالية والطب. بدوا يجمّعوا كوربس كبير، وبنوا إشراف اصطناعي، ودربوا نموذج استرجاع وتعديل ريرانكر وقرّوا القارئ. لقوا إنّ BM25 بلا معلمات بيتفوّق على نماذج الاسترجاع الكثيفة المتعددة اللغات، وبعد ما عدّلوا الـ embedder على 65,773 زوج استرجاع، ارتفع nDCG@10 من 0.362 لـ0.835. كمان عدّلوا القارئ بـ LoRA وزادوا نسبة صحة الإجابات من 29.4% لـ66.9%، وقدموا benchmark جديد اسمه HERA للـ RAG باليونانية.
ليش بتهمّك؟: هالنتائج بتفتح باب لتطبيقات RAG باليونانية، وبتقوّي جودة البحث والإجابة بالمجالات المتخصصة.
Greek retrieval RAG Nemotron benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

اختبار HarnessOpt: قياس تحسين الحزم للـ LLMs

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
فريق Varun Ursekar وزملاؤه قدموا HarnessOpt-Bench، وهو benchmark بيقيس قدرة الـ LLMs على تحسين الـ harness اللي بيحاط فيها. الـ harness بيشمل البرايمبتات، الأدوات، تدفق التحكم، الذاكرة، وكود التنظيم، والـ benchmark بيخلي الـ LLM يشتغل كـ optimizer يحدّث الـ harness بناءً على تقييمات متكررة وميزانية محدودة. جربوا 5 نماذج LLM على 4 مهام وشافوا إنو الأداء بيتفاوت كتير حسب المهمة والـ harness الأصلي. النتائج بتأكد إنو تحسين الـ harness إشي ممكن نقيسه ونعمل له تحسينات أكتر.
ليش بتهمّك؟: هالنتيجة بتخلينا نعرف أي نموذج LLM بيقدر يطوّر الكود والبرمجة حوله بأكثر كفاءة، وهذا بيفتح باب لتطبيقات أذكى وأسرع.
LLM benchmark optimization agents evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

من الوكلاء الاقتصاديين إلى اقتصاديات وكيلة: مخطط نظامي لنماذج العالم الاقتصادي

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models
الفريق حطّ مخطط عملي لبناء Economic World Models، يعني نماذج عالمية اقتصادية بتولد محاكاة لتطور الاقتصاد من داخل. هالنماذج بتضم وكلاء heterogeneous بيصرفوا، بيتفاعلوا مع السوق والمؤسسات، وبيتكيفوا مع بعض. الباحثين رتبوا النظام على ست مستويات، من عوالم قواعد ثابتة لحد الوكلاء المبنيين على LLM والعوالم اللي بتتطوّر ذاتيًا وتطابق الواقع.
ليش بتهمّك؟: هالورقة بتفتح باب لبناء محاكيات اقتصادية دقيقة تساعد صانعي القرار والذكاء الاصطناعي يتدربوا على سياسات واقعية.
economics simulation agents AI world models hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

PaDoc: محلل مستندات يشتغل بسرعة بفضل الشجرة المتوازية

PaDoc: Layout-Grounded Parallel Decoding for Document Parsing
الفريق قدم PaDoc، محلل مستندات بيستغل تخطيط الصفحة كهيكل شجري فوق تمثيل موحد للصفحة. الطريقة بتخلّي تخطيط الصفحة ومحتوى كل منطقة يتقدّموا مع بعض، يعني ما في انتظار تسلسل طويل. استخدموا attention خاص اسمه packed variable-length ancestor وبقوا يقدروا يطلّعوا النتائج بصورة متوازية عبر vLLM، فصارت السرعة أعلى بكتير مع الحفاظ على جودة الفهم. التجربة على OmniDocBench أظهرت إن PaDoc وصل لأعلى درجات الدقة مقارنةً بالمحللات المتسلسلة، وكمان أسرع بكتير على بطاقات A800.
ليش بتهمّك؟: لأنّها بتقليل وقت معالجة المستندات الكبيرة بدون ما تخسر الدقة، فبتسهل تطبيقات الفاكس والبيانات الضخمة.
document parsing parallel decoding efficiency multimodal LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

MameLoshnLM: أول نموذج يديش مفتوح المصدر

MameLoshnLM: Yiddish Language Model and Evaluation Benchmark
الفريق قدم MameLoshnLM، نموذج لغة 8 بليون باراميتر مخصص للغة اليديش، معتمد على مجموعة بيانات Oytser اللي جمعت نصوص حديثة وأدبية. كمان أطلقوا benchmark اسمه Kashes يختبر الترجمة والتحليل اللغوي واستخراج المعلومات وفهم النص. النموذج تم تدريبه على Llama 3.1 8B وبيظهر أداء أحسن من النماذج المتعددة اللغات بحجم مشابه. التحليل بيبين إنه بيقدر يلتقط الأنماط الصرفية والمعجمية الخاصة باليديش أحسن من النماذج العامة.
ليش بتهمّك؟: هالورقة بتفتح باب تطوير تطبيقات تدعم اللغة اليديش وتقلل الفجوة بين اللغات القوية واللغات القليلة الموارد.
language-modeling low-resource Yiddish benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

OPD-V: تحسين التفكير البصري عبر توازن الأنماط

OPD-V: Visual On-Policy Self-Distillation with Modality Balance
الفريق قدم طريقة جديدة اسمها OPD-V لتقوية قدرة نماذج اللغة الكبيرة المتعددة الوسائط على الفهم البصري. الفكرة إنو بيستعملوا معلمين بصريين – Positive Teacher مع صورة مكبرة وNegative Teacher مع صورة مقطَّعة – ليحدّدوا ما يسموه Modality‑Balance Trust Region، وبعدين يطبقوا On‑Policy Self‑Distillation على التوكنات اللي فيها توازن. التجارب على ٦ بنشماركس وأربع نماذج أساسية وخمس طرق تدريبية أظهرت تحسين واضح بالأداء وتقليل تكلفة التدريب.
ليش بتهمّك؟: الطريقة بتخلي نماذج الذكاء الاصطناعي تفهم الصور والنص مع بعض بشكل أدق وبسرعة أكبر.
multimodal self-distillation visual reasoning LLM efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

RRC: فك شفرة نماذج المكافأة التوليدية في تعلم التعزيز للـ LLM

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction
الفريق Wang وزملاؤه قدموا طريقة جديدة اسمها Ranking-based Reward Construction (RRC) لتخلي نماذج المكافأة التوليدية تشتغل مع خوارزميات التعزيز. الطريقة بتستخرج المكافأة من ترتيب تفضيلات الردود بدل ما تعطي قيمة عددية واحدة، وبتعتمد على استراتيجيتين: self-competitive ranking وanchor-guided ranking. التجارب على محادثات مفتوحة وأسئلة تفكير بيّنت إنو RRC بيحسّن التدريب بشكل ملحوظ مقارنةً بالطرق القديمة. الكود متوفر على GitHub للكل اللي حابب يجربه.
ليش بتهمّك؟: لأنها بتخلّي نماذج اللغة تتعلم بطريقة أذكى وأقرب لتفضيلات البشر، فبتحسّن جودة الردود في تطبيقات الدردشة والذكاء الاصطناعي.
RL reward modeling LLM ranking arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

GDPevo: اختبار تطور الوكلاء الذاتّي على مهام تجارية واقعية

GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
الورقة بتقدّم benchmark جديد اسمه GDPevo لتقييم قدرة الوكلاء على التطور الذاتي من خبراتهم السابقة. الطريقة الأساسية اسمها rule hybridization، بتقسم كل سير عمل تجاري لقواعد بسيطة وبتوزّعها على مهام التدريب، وبترجع تعيد تركيبها بالمهام الاختبارية لتأكد إن التحسّن ناتج من التدريب. GDPevo بيغطي مجالات CRM، ERP، المالية، الرعاية الصحية، القانونية، والبيانات، وفي الإصدار الأول فيه 120 مهمة موزّعة على 12 مجموعة. التجارب بتظهر إن التطور الذاتي يرفع الدقة بالاختبار لحد 16.44 نقطة، بس الوكلاء ما زالوا بعيدين عن الحد الأقصى المثالي.
ليش بتهمّك؟: لأنّه بيساعدنا نبني وكلاء أكتر قدرة على التعلم من شغلهم السابق، وهاد مهم لتطبيقات الأعمال الواقعية.
agents benchmark self-evolution business evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

إضافة الآلة وحذف الإنسان: قياس وتخفيف تجنّب الحذف في تعديل الكود بالـ LLM

To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing
الفريق اللي بيقود البحث، إيمر إبراهيمي وزملاؤه، اكتشفوا إن نماذج اللغة الكبيرة بتتجنّب حذف الكود اللي لازم يُنشال، وهاد الشي بيصعّب صيانة البرامج. على لوحة SWE-bench Verified، أعلى نسبة استرجاع للحذف وصلت 71.7% بس، والنماذج بتحدد الملف الصح أكتر من 92% لكن ما بتقص السطر بالضبط إلا بأقل من 52%. بدلاً من الحذف، 29% من الباتشات بتلف الكود بحماية مؤقتة، اللي سماوها Guard-and-Go. بعد ما زادوا اختبارات لتكشف بقايا الكود، الأداء انخفض بشكل واضح، وبيّنوا كمان إن تدريب النموذج على حذف الكود بيقلل هالسلوك السيء.
ليش بتهمّك؟: هالنتيجة بتبين إنو تحسين قدرة الموديلات على حذف الكود ممكن يخلّي أدوات تصليح الكود أذكى وأسهل للصيانة.
code editing LLM benchmark deletion avoidance hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

ExplainBench: قياس موثوقية شرح الكود للـ agents

ExplainBench: Evaluating Code Explanations from Agents
الفريق اللي قدم ExplainBench بيقدّم معيار جديد لتقييم شرح الكود اللي بتولّده الـ agents. الفكرة إن الشرح المفيد لازم يخلّي LLM يجاوب أسئلة عن سلوك الكود المعيب وتأثير الباتش، فبنعرف جودة الشرح كعدد من الإجابات الصح. التجارب ورّيت إن جودة الشرح بتعطي ترتيب مختلف للـ agents مقارنةً بـ SWE-bench Verified، وكمان لقوا إن كثير من الشروح بتدّعي إن الباتش صحيح وهو مو صحيح. على هالأساس بنوا وكّال شفاف يضيف اختبارات إضافية لتدقيق الشروح، وفعلاً حسّن شروح كل الـ agents اللي جربوها.
ليش بتهمّك؟: لأن الشرح الموثوق بيساعد المطوّرين يثقوا بالتصليحات الآلية ويقللوا الأخطاء البرمجية.
benchmark code LLM agents hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

DataSpace: معيار لتقييم وكلاء البيانات في تحليلات موثوقة عبر مساحات عمل متعددة

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces
الفريق قدموا DataSpace، معيار جديد يختبر قدرة وكلاء البيانات على إعطاء نتائج جدولة موثوقة من مساحات عمل فيها ملفات CSV، JSON، SQLite، PDF وفيديو. كل وكيل يستقبل سؤال ومساحة عمل، ويرجع جدول كامل كإجابة، مع تقييم دقيق للترتيب والأنواع. المعيار يضم 410 مهمة متعددة اللغات و7,439 عنصر بحدود 15 جيجابايت، واستخدم في مسابقة KDD Cup 2026. التجارب أظهرت إن أعلى دقة وصلت 66.34٪، لكن الاختلاف بين أدوات الوكالة كان كبير، خصوصاً مع دمج أدلة متعددة الوسائط.
ليش بتهمّك؟: المعيار بيفتح باب لتطوير وكلاء بيانات أكثر موثوقية وبيساعد الشركات تحل مشاكل تحليل البيانات المتناثرة بسهولة أكبر.
data agents benchmark multimodal KDD Cup analytics hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | تجميع الأسبوع 1 أغسطس — تقييمات AI المتعددة
📚 كل الأعداد